<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE article PUBLIC "-//NLM//DTD Journal Publishing with OASIS Tables v3.0 20080202//EN" "https://jats.nlm.nih.gov/nlm-dtd/publishing/3.0/journalpub-oasis3.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:oasis="http://docs.oasis-open.org/ns/oasis-exchange/table" xml:lang="en" dtd-version="3.0" article-type="research-article">
  <front>
    <journal-meta><journal-id journal-id-type="publisher">NPG</journal-id><journal-title-group>
    <journal-title>Nonlinear Processes in Geophysics</journal-title>
    <abbrev-journal-title abbrev-type="publisher">NPG</abbrev-journal-title><abbrev-journal-title abbrev-type="nlm-ta">Nonlin. Processes Geophys.</abbrev-journal-title>
  </journal-title-group><issn pub-type="epub">1607-7946</issn><publisher>
    <publisher-name>Copernicus Publications</publisher-name>
    <publisher-loc>Göttingen, Germany</publisher-loc>
  </publisher></journal-meta>
    <article-meta>
      <article-id pub-id-type="doi">10.5194/npg-33-401-2026</article-id><title-group><article-title>Elucidating the performance of data assimilation  neural networks for chaotic dynamics</article-title><alt-title>Elucidating data assimilation networks</alt-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author" corresp="yes" rid="aff1">
          <name><surname>Bocquet</surname><given-names>Marc</given-names></name>
          <email>marc.bocquet@enpc.fr</email>
        <ext-link>https://orcid.org/0000-0003-2675-0347</ext-link></contrib>
        <contrib contrib-type="author" corresp="no" rid="aff1">
          <name><surname>Finn</surname><given-names>Tobias Sebastian</given-names></name>
          
        <ext-link>https://orcid.org/0000-0001-9585-8349</ext-link></contrib>
        <contrib contrib-type="author" corresp="no" rid="aff1">
          <name><surname>Cheng</surname><given-names>Sibo</given-names></name>
          
        </contrib>
        <contrib contrib-type="author" corresp="no" rid="aff2">
          <name><surname>Farchi</surname><given-names>Alban</given-names></name>
          
        <ext-link>https://orcid.org/0000-0002-4162-8289</ext-link></contrib>
        <aff id="aff1"><label>1</label><institution>CEREA, ENPC, EDF R&amp;D, Institut Polytechnique de Paris, Île-de-France, France</institution>
        </aff>
        <aff id="aff2"><label>2</label><institution>ECMWF, Shinfield Park, Reading, UK</institution>
        </aff>
      </contrib-group>
      <author-notes><corresp id="corr1">Marc Bocquet (marc.bocquet@enpc.fr)</corresp></author-notes><pub-date><day>11</day><month>August</month><year>2026</year></pub-date>
      
      <volume>33</volume>
      <issue>3</issue>
      <fpage>401</fpage><lpage>424</lpage>
      <history>
        <date date-type="received"><day>19</day><month>January</month><year>2026</year></date>
           <date date-type="rev-request"><day>29</day><month>January</month><year>2026</year></date>
           <date date-type="rev-recd"><day>12</day><month>June</month><year>2026</year></date>
           <date date-type="accepted"><day>7</day><month>July</month><year>2026</year></date>
      </history>
      <permissions>
        <copyright-statement>Copyright: © 2026 Marc Bocquet et al.</copyright-statement>
        <copyright-year>2026</copyright-year>
      <license license-type="open-access"><license-p>This work is licensed under the Creative Commons Attribution 4.0 International License. To view a copy of this licence, visit <ext-link ext-link-type="uri" xlink:href="https://creativecommons.org/licenses/by/4.0/">https://creativecommons.org/licenses/by/4.0/</ext-link></license-p></license></permissions><self-uri xlink:href="https://npg.copernicus.org/articles/33/401/2026/npg-33-401-2026.html">This article is available from https://npg.copernicus.org/articles/33/401/2026/npg-33-401-2026.html</self-uri><self-uri xlink:href="https://npg.copernicus.org/articles/33/401/2026/npg-33-401-2026.pdf">The full text article is available as a PDF file from https://npg.copernicus.org/articles/33/401/2026/npg-33-401-2026.pdf</self-uri>
      <abstract><title>Abstract</title>

      <p id="d2e116">In supervised data assimilation machine learning emulation, the training data contain targets produced by an existing data assimilation scheme, such as analysis increments. By contrast, <italic>data assimilation networks</italic> were recently proposed to learn the analysis operator while they are embedded in the forecast–analysis cycle: their only targets are the true trajectory and the observations thereof. They are therefore trained to produce a stable and accurate sequential estimator, rather than to reproduce the output of a prescribed data assimilation algorithm. Conceptually more fundamental, yet computationally more challenging, such learned data assimilation scheme was shown to achieve accuracy comparable to that of the ensemble Kalman filter when applied to low-order chaotic dynamics. Strikingly, the same accuracy can be reached with a single state forecast instead of an ensemble, hence bypassing the need to explicitly represent forecast uncertainty.</p>

      <p id="d2e122">In this study, we extend the investigation of such learned analysis operators beyond the preliminary experiments reported so far. First, we analyse the emergence of local patterns encoded in the operator, which accounts for the remarkable scalability of the approach to high-dimensional state spaces. Second, we assess the performance of the learned operators in stronger nonlinear regimes of the chaotic dynamics. We show that they can match the efficiency of the iterative ensemble Kalman filter, the baseline in this context, while avoiding the need for nonlinear iterative optimisation. Throughout the paper, we seek underlying reasons for the efficiency of the approach, drawing on insights from both machine learning and nonlinear data assimilation.</p>
  </abstract>
    
<funding-group>
<award-group id="gs1">
<funding-source>Agence Nationale de la Recherche</funding-source>
<award-id>ANR-24-EXMA-0002</award-id>
<award-id>ANR-24-EXMA-0001</award-id>
<award-id>ANR-22-CPJ2-0143-01</award-id>
</award-group>
</funding-group>
</article-meta>
  </front>
<body>
      

<sec id="Ch1.S1" sec-type="intro">
  <label>1</label><title>Introduction</title>
      <p id="d2e134">Accurate prediction of geophysical flows relies on the continual correction of model trajectories using observations. This sequential data assimilation (DA) process is essential in high-dimensional chaotic systems, where errors amplify rapidly and model imperfections accumulate over time <xref ref-type="bibr" rid="bib1.bibx37 bib1.bibx4 bib1.bibx21" id="paren.1"/>. In operational meteorology and oceanography, ensemble-based Kalman filters and ensemble variational methods provide reliable and well-understood frameworks for these updates, but they remain computationally demanding and rely on explicit representations of flow-dependent forecast error covariances.</p>
      <p id="d2e140">Recent developments have suggested that part of this complexity can be replaced by learned analysis operators. In supervised DA machine learning emulation, the training dataset contains targets produced by an existing DA scheme, such as analysis increments <xref ref-type="bibr" rid="bib1.bibx35 bib1.bibx25 bib1.bibx47" id="paren.2"><named-content content-type="pre">e.g.,</named-content></xref>. By contrast, one could learn the analysis operator while it is embedded in the forecast–analysis cycle: its only targets are the true trajectory and the observations thereof <xref ref-type="bibr" rid="bib1.bibx48" id="paren.3"/>. Such analysis operator is therefore trained to produce a stable and accurate sequential estimator, rather than to reproduce the output of a prescribed DA algorithm. Within this latter approach, termed <italic>data assimilation networks</italic> <xref ref-type="bibr" rid="bib1.bibx18" id="paren.4"><named-content content-type="pre">DANs,</named-content></xref>, a surprising result has emerged: as demonstrated by <xref ref-type="bibr" rid="bib1.bibx16" id="text.5"/>, a learned analysis operator can match the accuracy of a well-tuned ensemble Kalman filter (EnKF) even when it uses only single forecast trajectories, without any ensemble. This result challenges the long-standing assumption that explicit ensemble representations are indispensable to estimate flow-dependent uncertainties in chaotic systems.</p>
      <p id="d2e162">Explaining this phenomenon is a central question for DA methodology. Initial investigations suggest that the learned operator implicitly reconstructs aspects of the analysis error covariances normally diagnosed from an ensemble, effectively uncovering key uncertainty directions from the forecast state alone <xref ref-type="bibr" rid="bib1.bibx16" id="paren.6"/>. This behaviour is consistent with viewing the full DA cycle as a random dynamical system, for which generalised forms of the multiplicative ergodic theorem <xref ref-type="bibr" rid="bib1.bibx50" id="paren.7"/> offer a state-dependent structure linking model trajectories to dominant error-growth directions. At the same time, numerical experiments show that the neural network is likely to identify local patterns rather than memorising global states, which explains why its performance scales to larger systems and remains robust across different model dimensions.</p>
      <p id="d2e171">This paper deepens the investigation of these mechanisms. In Sect. <xref ref-type="sec" rid="Ch1.S2"/>, we dive into the methodology of DANs, and recall the main results and questions raised in <xref ref-type="bibr" rid="bib1.bibx16" id="text.8"/>. In Sect. <xref ref-type="sec" rid="Ch1.S3"/>, building on a more thorough analysis of the performance dependence on the batch size, dataset length, and the number of assimilation cycles used during backpropagation, we study how the operator behaves when interpreted as a diagnostic of uncertainty, and we propose methods to expose and interpret the local structures it extracts. In Sect. <xref ref-type="sec" rid="Ch1.S4"/>, we test the limits of the approach in more strongly nonlinear regimes, where the iterative ensemble Kalman filter <xref ref-type="bibr" rid="bib1.bibx59" id="paren.9"/> and its generalisations often serve as the most accurate baselines. We show that the learned operator can reach comparable performance without requiring an ensemble or a nonlinear optimisation, and we offer a data assimilation-based interpretation for this ability. Section <xref ref-type="sec" rid="Ch1.S5"/> presents our conclusions. Supporting numerical and mathematical results are collated in the appendices of this paper.</p>
      <p id="d2e190">Throughout the paper, we will illustrate our results with the Lorenz-96 model <xref ref-type="bibr" rid="bib1.bibx45" id="paren.10"><named-content content-type="pre">L96,</named-content></xref>. More broadly, our goal is not only to document the performance of the learned analysis operators but also to clarify the mechanisms that underlie them, thereby contributing to the growing theoretical understanding of how deep learning and sequential data assimilation interact in chaotic geophysical systems <xref ref-type="bibr" rid="bib1.bibx24" id="paren.11"/>.</p>
</sec>
<sec id="Ch1.S2">
  <label>2</label><title>Theory and methods</title>
      <p id="d2e209">In this section, we provide a deeper description of the problem, its context, and its mathematical formulation.</p>
<sec id="Ch1.S2.SS1">
  <label>2.1</label><title>Sequential data assimilation for chaotic dynamics</title>
      <p id="d2e219">Mathematically, data assimilation (DA), and in particular filtering algorithms, are meant to accurately estimate the state vector <inline-formula><mml:math id="M1" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>∈</mml:mo><mml:msub><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:msup><mml:mi mathvariant="double-struck">R</mml:mi><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula> of a physical system, where “t” stands for truth, at times <inline-formula><mml:math id="M2" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> for <inline-formula><mml:math id="M3" display="inline"><mml:mrow><mml:mi>k</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn><mml:mo>,</mml:mo><mml:mi mathvariant="normal">…</mml:mi><mml:mo>,</mml:mo><mml:mi>K</mml:mi></mml:mrow></mml:math></inline-formula> along a trajectory of the dynamical system. These states are evolved according to
          

            <disp-formula id="Ch1.E1.2" content-type="subnumberedon"><label>1a</label><mml:math id="M4" display="block"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mrow><mml:mi>k</mml:mi><mml:mo>+</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>=</mml:mo><mml:mi mathvariant="script">M</mml:mi><mml:mfenced close=")" open="("><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup></mml:mrow></mml:mfenced><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

          where <inline-formula><mml:math id="M5" display="inline"><mml:mi mathvariant="script">M</mml:mi></mml:math></inline-formula> is the integrated model over <inline-formula><mml:math id="M6" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mrow><mml:mi>k</mml:mi><mml:mo>+</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msub><mml:mo>-</mml:mo><mml:msub><mml:mi>t</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. The dynamical system <inline-formula><mml:math id="M7" display="inline"><mml:mi mathvariant="script">M</mml:mi></mml:math></inline-formula> is assumed to be chaotic, such as for most geofluids, which is a prime incentive for frequently updating our knowledge of the system. It is furthermore assumed ergodic and autonomous, i.e. does not explicitly depend on time. Furthermore, the physical system is observed through

            <disp-formula id="Ch1.E1.3" content-type="subnumberedoff"><label>1b</label><mml:math id="M8" display="block"><mml:mrow><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo mathsize="1.1em">(</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>+</mml:mo><mml:msub><mml:mi mathvariant="bold-italic">ε</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold-italic">ε</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>∼</mml:mo><mml:mi mathvariant="script">N</mml:mi><mml:mo>(</mml:mo><mml:mn mathvariant="bold">0</mml:mn><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

          where <inline-formula><mml:math id="M9" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>∈</mml:mo><mml:msubsup><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">y</mml:mi><mml:mi>k</mml:mi></mml:msubsup><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:msup><mml:mi mathvariant="double-struck">R</mml:mi><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mrow><mml:mi mathvariant="normal">y</mml:mi><mml:mo>,</mml:mo><mml:mi>k</mml:mi></mml:mrow></mml:msub></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula> is the observation vector at <inline-formula><mml:math id="M10" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> obtained from the hidden state <inline-formula><mml:math id="M11" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula> via an observation operator <inline-formula><mml:math id="M12" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, and perturbed by a white-in-time Gaussian noise <inline-formula><mml:math id="M13" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold-italic">ε</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> of mean <inline-formula><mml:math id="M14" display="inline"><mml:mn mathvariant="bold">0</mml:mn></mml:math></inline-formula> and covariance matrix <inline-formula><mml:math id="M15" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. This very common but simplified formulation of the filtering problem with additive Gaussian noise is sufficient for the goals of this paper.</p>
      <p id="d2e535">A filtering DA scheme estimates the hidden state <inline-formula><mml:math id="M16" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula> at <inline-formula><mml:math id="M17" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> from the observations available up to that time. The analysis <inline-formula><mml:math id="M18" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula> is a point estimator, such as the posterior mean or maximum a posteriori estimate, of the conditional probability density function <inline-formula><mml:math id="M19" display="inline"><mml:mrow><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>|</mml:mo><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mrow><mml:mi>k</mml:mi><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msub><mml:mo>,</mml:mo><mml:mi mathvariant="normal">…</mml:mi><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mn mathvariant="normal">1</mml:mn></mml:msub><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>. A <italic>sequential</italic> filtering DA scheme infers <inline-formula><mml:math id="M20" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula> from <inline-formula><mml:math id="M21" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> and from background information about the state at <inline-formula><mml:math id="M22" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mrow><mml:mi>k</mml:mi><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msub></mml:mrow></mml:math></inline-formula> (possibly brought forward to <inline-formula><mml:math id="M23" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> using <inline-formula><mml:math id="M24" display="inline"><mml:mi mathvariant="script">M</mml:mi></mml:math></inline-formula>).</p>
</sec>
<sec id="Ch1.S2.SS2">
  <label>2.2</label><title>Learning the data assimilation analysis</title>
<sec id="Ch1.S2.SS2.SSS1">
  <label>2.2.1</label><title>Training scheme</title>
      <p id="d2e702">The approach developed in <xref ref-type="bibr" rid="bib1.bibx16" id="text.12"/>, subsequently referred to as Boc24, in the wake of <xref ref-type="bibr" rid="bib1.bibx48" id="text.13"/> and <xref ref-type="bibr" rid="bib1.bibx18" id="text.14"/> is summarised in the following since it is the foundation of the present paper. The analysis step of the DA scheme is assumed to be given by the (incremental) analysis operator <inline-formula><mml:math id="M25" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, typically a (deep) neural network, which depends on a set of weights and biases, stacked in the <inline-formula><mml:math id="M26" display="inline"><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:math></inline-formula> vector, and which is defined, at time <inline-formula><mml:math id="M27" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, through
            

                  <disp-formula id="Ch1.E4" specific-use="align" content-type="subnumberedon"><mml:math id="M28" display="block"><mml:mtable displaystyle="true"><mml:mlabeledtr id="Ch1.E4.5"><mml:mtd><mml:mtext>2a</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo>+</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo mathsize="1.1em">(</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo>,</mml:mo><mml:msubsup><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup><mml:msubsup><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:msub><mml:mi mathvariant="bold-italic">δ</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="Ch1.E4.6"><mml:mtd><mml:mtext>2b</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:msub><mml:mi mathvariant="bold-italic">δ</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>-</mml:mo><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo mathsize="1.1em">(</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

            where <inline-formula><mml:math id="M29" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold-italic">δ</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is the innovation, <inline-formula><mml:math id="M30" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula> is the analysis state mentioned previously, and <inline-formula><mml:math id="M31" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula> is the forecast state, to be defined shortly. <inline-formula><mml:math id="M32" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is the tangent linear operator of <inline-formula><mml:math id="M33" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. Should <inline-formula><mml:math id="M34" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> be a function of <inline-formula><mml:math id="M35" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold-italic">δ</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> rather than <inline-formula><mml:math id="M36" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup><mml:msubsup><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:msub><mml:mi mathvariant="bold-italic">δ</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, it could only handle static observation configurations, and would require to be retrained whenever that configuration changes. Although not the focus of this paper, this important issue is circumvented here by using the mapping from observation to state space <inline-formula><mml:math id="M37" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup><mml:msubsup><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup></mml:mrow></mml:math></inline-formula>, such that both inputs of <inline-formula><mml:math id="M38" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> are in the same static state space <inline-formula><mml:math id="M39" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. For compactness, we define the projected innovation

              <disp-formula id="Ch1.E4.7" content-type="subnumberedoff"><label>2c</label><mml:math id="M40" display="block"><mml:mrow><mml:msub><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:msubsup><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup><mml:msubsup><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:msub><mml:mi mathvariant="bold-italic">δ</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msubsup><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup><mml:msubsup><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:mo mathsize="1.1em">(</mml:mo><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>-</mml:mo><mml:msub><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo mathsize="1.1em">(</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo mathsize="1.1em">)</mml:mo><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula>

            The DAN analysis operator thus receives two fields in state space, <inline-formula><mml:math id="M41" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula> and <inline-formula><mml:math id="M42" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>.</p>
      <p id="d2e1135">In the DA forecast step, the analysis state is propagated to the subsequent date through

              <disp-formula id="Ch1.E8" content-type="numbered"><label>3</label><mml:math id="M43" display="block"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mrow><mml:mi>k</mml:mi><mml:mo>+</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo>=</mml:mo><mml:mi mathvariant="script">M</mml:mi><mml:mfenced close=")" open="("><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup></mml:mrow></mml:mfenced><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula></p>
      <p id="d2e1170">The operator <inline-formula><mml:math id="M44" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is trained by comparing the analysis states to the true states, through the loss

              <disp-formula id="Ch1.E9" content-type="numbered"><label>4</label><mml:math id="M45" display="block"><mml:mrow><mml:mi mathvariant="script">L</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">θ</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>r</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub></mml:mrow></mml:munderover><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>k</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">c</mml:mi></mml:msub></mml:mrow></mml:munderover><mml:msup><mml:mfenced close="∥" open="∥"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mrow><mml:mi mathvariant="normal">t</mml:mi><mml:mo>,</mml:mo><mml:mi>r</mml:mi></mml:mrow></mml:msubsup><mml:mo>-</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mrow><mml:mi mathvariant="normal">a</mml:mi><mml:mo>,</mml:mo><mml:mi>r</mml:mi></mml:mrow></mml:msubsup><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">θ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mn mathvariant="normal">2</mml:mn></mml:msup><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

            where <inline-formula><mml:math id="M46" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mrow><mml:mi mathvariant="normal">t</mml:mi><mml:mo>,</mml:mo><mml:mi>r</mml:mi></mml:mrow></mml:msubsup></mml:mrow></mml:math></inline-formula> are the state vectors of the true trajectory, indexed by the time index <inline-formula><mml:math id="M47" display="inline"><mml:mi>k</mml:mi></mml:math></inline-formula> and a trajectory index  <inline-formula><mml:math id="M48" display="inline"><mml:mi>r</mml:mi></mml:math></inline-formula> as <inline-formula><mml:math id="M49" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> of them are processed concurrently in the training of <inline-formula><mml:math id="M50" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>.</p>
      <p id="d2e1326">The <inline-formula><mml:math id="M51" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">c</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> parameter counts the number of cycles of each DA run. It can potentially be infinite since trajectories can be generated online as the training progresses. The implementation of similar losses is detailed in <xref ref-type="bibr" rid="bib1.bibx48" id="text.15"/>, <xref ref-type="bibr" rid="bib1.bibx18" id="text.16"/>, and Sect. II of Boc24. This notably requires to truncate backpropagation in time <xref ref-type="bibr" rid="bib1.bibx63" id="paren.17"/> which restricts the dependence on <inline-formula><mml:math id="M52" display="inline"><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:math></inline-formula> over <inline-formula><mml:math id="M53" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub><mml:mo>≪</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">c</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> cycles only so as to reduce the computational cost and the excessive GPU memory (VRAM) requirement. Alternative losses based on probability density functions (pdf) diagnostics are possible and discussed in, e.g., <xref ref-type="bibr" rid="bib1.bibx18" id="text.18"/>. We have shown that a semi-supervised loss where the training dataset reduces to the sparse and noisy observations is also possible by generalising a proposal of <xref ref-type="bibr" rid="bib1.bibx48" id="text.19"/>, but is out of the scope of this paper.</p>
</sec>
<sec id="Ch1.S2.SS2.SSS2">
  <label>2.2.2</label><title>Accuracy of the discovered data assimilation scheme</title>
      <p id="d2e1389">Note that an ensemble variant of the update Eq. (2) was first considered in <xref ref-type="bibr" rid="bib1.bibx48" id="text.20"/>, <xref ref-type="bibr" rid="bib1.bibx18" id="text.21"/>, and later by Boc24. Experimenting with the same low-order chaotic model, they found an accuracy of the learned DA scheme close to that of a well-tuned EnKF, which is per se very promising. In those experiments, DAN is built on an ensemble of analyses and forecasts. However, Boc24 demonstrated that this accuracy remains unchanged when these ensembles are reduced to a single state. This is a very surprising result since it is expected (and verified in the L96 context) that the EnKF-like methods critically relying on an ensemble representing the <italic>errors of the day</italic>, have a significant edge over other sequential DA methods that leverage a single forecast state such as 3D-Var and 4D-Var <xref ref-type="bibr" rid="bib1.bibx12" id="paren.22"><named-content content-type="pre">see</named-content><named-content content-type="post">for a quantitative comparison with the same model</named-content></xref>. This explains why numerical weather prediction (NWP) centres operating 4D-Var actually rely on an ensemble of such 4D-Var, a technique called EDA <xref ref-type="bibr" rid="bib1.bibx4 bib1.bibx5" id="paren.23"><named-content content-type="pre">see, e.g., Chap. 7 in</named-content><named-content content-type="post">and references within</named-content></xref>, or use information from a concurrent EnKF <xref ref-type="bibr" rid="bib1.bibx19" id="paren.24"/>. That is why achieving the accuracy of a well-tuned EnKF with a single forecast state should have far-reaching implications on the mechanisms and designs of DA algorithms for chaotic dynamics, and warrants investigating the reason for such feat.</p>
</sec>
</sec>
<sec id="Ch1.S2.SS3">
  <label>2.3</label><title>Investigating the reason for this efficiency</title>
      <p id="d2e1428">To unveil the mechanisms leveraged by the learned analysis operator to achieve this accuracy, Boc24 performed a linearisation of the operator <inline-formula><mml:math id="M54" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> in the projected innovation <inline-formula><mml:math id="M55" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>:

            <disp-formula id="Ch1.E10" content-type="numbered"><label>5</label><mml:math id="M56" display="block"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>≈</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

          where <inline-formula><mml:math id="M57" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> is the resulting linear operator that acts on <inline-formula><mml:math id="M58" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>. Comparing with the linearisation of the classical Kalman update, it must coincide with the analysis error covariance matrix which could be associated by formal analogy to the learned analysis operator <inline-formula><mml:math id="M59" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, hence the notation. This covariance matrix was numerically obtained in Boc24 through a linear regression in between a large ensemble of <inline-formula><mml:math id="M60" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> samples (corresponding to the projected innovations <inline-formula><mml:math id="M61" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">H</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:msup><mml:mi mathvariant="bold">R</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mi mathvariant="bold-italic">δ</mml:mi></mml:mrow></mml:math></inline-formula>) and <inline-formula><mml:math id="M62" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> outputs. It was found that this error covariance matrix is remarkably close to that of a well-tuned EnKF, especially for its dominant eigenvectors (which carry most of the uncertainty in the analysis).</p>
      <p id="d2e1573">Hence, the performance of DAN, as reported in Boc24, must be to a large extent due to its ability to infer flow-dependent effective analysis error covariances from the forecast state, as revealed by the local dependence of <inline-formula><mml:math id="M63" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> on the projected innovation <inline-formula><mml:math id="M64" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>. Such an ability is pivotal for maintaining the accuracy of sequential DA over time. In the present paper, we will sometimes reason in terms of the forecast error covariance matrix <inline-formula><mml:math id="M65" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> in place of <inline-formula><mml:math id="M66" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula>, since the flow dependence is more naturally encoded in <inline-formula><mml:math id="M67" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula>, while <inline-formula><mml:math id="M68" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> is obtained after conditioning on the observations. Moreover, in the linear/Gaussian case, these two covariance matrices are straightforwardly related by

            <disp-formula id="Ch1.E11" content-type="numbered"><label>6</label><mml:math id="M69" display="block"><mml:mrow><mml:msup><mml:mfenced close=")" open="("><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup></mml:mrow></mml:mfenced><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mo>=</mml:mo><mml:mo mathsize="1.1em">(</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:msup><mml:mo mathsize="1.1em">)</mml:mo><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mo>+</mml:mo><mml:msup><mml:mi mathvariant="bold">H</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:msup><mml:mi mathvariant="bold">R</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mi mathvariant="bold">H</mml:mi><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

          assuming invertibility of the error covariance matrices. Beyond the linear/Gaussian case, perturbing the innovations and applying DAN can generate an empirical analysis ensemble; propagating this ensemble with the model <inline-formula><mml:math id="M70" display="inline"><mml:mi mathvariant="script">M</mml:mi></mml:math></inline-formula> then provides a way to diagnose the corresponding forecast error covariances.</p>
      <p id="d2e1714">Other alternatives to ensemble forecasting to estimate the flow-dependent error statistics, such as deriving the dynamics of the statistical moments of the errors <xref ref-type="bibr" rid="bib1.bibx53 bib1.bibx54" id="paren.25"/>, or estimating these dynamics through machine learning <xref ref-type="bibr" rid="bib1.bibx52 bib1.bibx57 bib1.bibx46" id="paren.26"/> are either numerically very costly or in their infancy.</p>
      <p id="d2e1723">Boc24 conjectured that DAN's ability to assess the flow-dependent error statistics can be fundamentally explained by the existence of an ad-hoc <italic>multiplicative ergodic theorem</italic> (MET). From the seminal MET result by <xref ref-type="bibr" rid="bib1.bibx50" id="text.27"/>, we know that, for an autonomous ergodic dynamical system such as <inline-formula><mml:math id="M71" display="inline"><mml:mi mathvariant="script">M</mml:mi></mml:math></inline-formula>, there exists, for almost every state on the attractor, a measurable mapping from the state to the corresponding Oseledets subspaces.  Generalising, one can consider the whole sequential DA process as a dynamical system on its own <xref ref-type="bibr" rid="bib1.bibx20" id="paren.28"/>. Such DA process is not autonomous because it indirectly depends on the truth trajectory and the time-dependent observation operators. Moreover, it is a random process, since stochasticity is injected via the noisy observations. It turns out that generalised variants of the MET for non-autonomous random dynamics are possible <xref ref-type="bibr" rid="bib1.bibx3 bib1.bibx23 bib1.bibx32 bib1.bibx34" id="paren.29"/> and are potentially applicable to such sequential DA process. Hence, Boc24 conjectured that <inline-formula><mml:math id="M72" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> can exploit such state-dependent information to infer an effective analysis error covariance matrix, together with how to process this information and combine it with the innovation.</p>
      <p id="d2e1758">To explain the efficiency of <inline-formula><mml:math id="M73" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, one may suggest that the neural network memorises global configurations of the forecast state, with very limited ability to generalise. On the contrary, Boc24 showed via indirect scaling experiments that <inline-formula><mml:math id="M74" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> learns to identify local patterns (i.e. with a limited range in space), which was made easier by the architecture of <inline-formula><mml:math id="M75" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> being a residual convolutional neural network. Indeed, when the dimension <inline-formula><mml:math id="M76" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> of the L96 state space is increased, and new <inline-formula><mml:math id="M77" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> operators are learned but with a fixed number of weights and biases of the backbone architecture, the accuracy remains that of a well tuned EnKF of matching dimension. Yet, in the large <inline-formula><mml:math id="M78" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> limit, <inline-formula><mml:math id="M79" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> with the same number of degrees of freedom should not be able to memorise increasingly numerous global patterns. Hence, <inline-formula><mml:math id="M80" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> must extract local patterns, and a limited number of them. This is further supported by learning <inline-formula><mml:math id="M81" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> with the original L96 dimension, <inline-formula><mml:math id="M82" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">40</mml:mn></mml:mrow></mml:math></inline-formula>, but applying it to L96 with significantly different <inline-formula><mml:math id="M83" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> in successful DA runs (this is allowed by the convolutional architecture which does not explicitly depend on <inline-formula><mml:math id="M84" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>), performing on par with a well tuned EnKF. Hence, any local pattern learned in the case <inline-formula><mml:math id="M85" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">40</mml:mn></mml:mrow></mml:math></inline-formula>, must still be spotted by <inline-formula><mml:math id="M86" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> where <inline-formula><mml:math id="M87" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>≠</mml:mo><mml:mn mathvariant="normal">40</mml:mn></mml:mrow></mml:math></inline-formula>. This outcome is consistent with the existence of such local patterns, since L96 is an extensive model when <inline-formula><mml:math id="M88" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is increased, with the number of nonlinear interacting waves in the model being proportional to <inline-formula><mml:math id="M89" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. This neat scalability has limitations. If increasing the dimension changed the local statistics or local dynamical balances of the model, for example through a substantial change of spectral slope or local instability mechanisms, a DAN trained at the smaller dimension should not be expected to generalise without fine-tuning, additional training, or architectural adaptation.</p>
</sec>
</sec>
<sec id="Ch1.S3">
  <label>3</label><title>Exploration of data assimilation networks</title>
      <p id="d2e1971">With the previously established context in mind, we now explore what DANs (<inline-formula><mml:math id="M90" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>) learn in mildly nonlinear regimes. The neural network associated to <inline-formula><mml:math id="M91" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> implements Eq. (2). The architecture for <inline-formula><mml:math id="M92" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> we choose in the present paper is the same as the one reported in Boc24, i.e. a simple residual convolutional neural network that accounts well for the spatial homogeneity of L96 (and hence its statistical stationarity). For the sake of self-sufficiency, Appendix <xref ref-type="sec" rid="App1.Ch1.S1"/> describes this architecture. All the training tasks are carried out over a training dataset with a minimisation of the loss controlled by computing the loss over a validation dataset.</p>
<sec id="Ch1.S3.SS1">
  <label>3.1</label><title>Numerical setup</title>
      <p id="d2e2016">The numerical experiments of the present paper are performed on L96, a chaotic model abundantly used for benchmarking new sequential data assimilation algorithms. As a reminder, L96 represents a mid-latitude zonal circle of the global atmosphere. It is governed by <inline-formula><mml:math id="M93" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">40</mml:mn></mml:mrow></mml:math></inline-formula> ordinary differential equations:

            <disp-formula id="Ch1.E12" content-type="numbered"><label>7</label><mml:math id="M94" display="block"><mml:mrow><mml:mstyle displaystyle="true"><mml:mfrac style="display"><mml:mrow><mml:mi mathvariant="normal">d</mml:mi><mml:msub><mml:mi>x</mml:mi><mml:mi>n</mml:mi></mml:msub></mml:mrow><mml:mrow><mml:mi mathvariant="normal">d</mml:mi><mml:mi>t</mml:mi></mml:mrow></mml:mfrac></mml:mstyle><mml:mo>=</mml:mo><mml:mo>(</mml:mo><mml:msub><mml:mi>x</mml:mi><mml:mrow><mml:mi>n</mml:mi><mml:mo>+</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msub><mml:mo>-</mml:mo><mml:msub><mml:mi>x</mml:mi><mml:mrow><mml:mi>n</mml:mi><mml:mo>-</mml:mo><mml:mn mathvariant="normal">2</mml:mn></mml:mrow></mml:msub><mml:mo>)</mml:mo><mml:msub><mml:mi>x</mml:mi><mml:mrow><mml:mi>n</mml:mi><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msub><mml:mo>-</mml:mo><mml:msub><mml:mi>x</mml:mi><mml:mi>n</mml:mi></mml:msub><mml:mo>+</mml:mo><mml:mi>F</mml:mi><mml:mspace linebreak="nobreak" width="0.125em"/><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

          where <inline-formula><mml:math id="M95" display="inline"><mml:mrow><mml:mi>F</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">8</mml:mn></mml:mrow></mml:math></inline-formula>, and with cyclic boundary conditions. The resulting model is chaotic with <inline-formula><mml:math id="M96" display="inline"><mml:mn mathvariant="normal">13</mml:mn></mml:math></inline-formula> positive and <inline-formula><mml:math id="M97" display="inline"><mml:mn mathvariant="normal">1</mml:mn></mml:math></inline-formula> neutral Lyapunov exponents. Its Lyapunov time, defined as the inverse of the first Lyapunov exponent, is about <inline-formula><mml:math id="M98" display="inline"><mml:mn mathvariant="normal">0.60</mml:mn></mml:math></inline-formula>, which corresponds to <inline-formula><mml:math id="M99" display="inline"><mml:mn mathvariant="normal">3</mml:mn></mml:math></inline-formula> d of a typical weather forecasting model <xref ref-type="bibr" rid="bib1.bibx45" id="paren.30"/>.</p>
      <p id="d2e2152">Although the results are generalisable to sparse observations, the observation operator will mostly be chosen to be the identity <inline-formula><mml:math id="M100" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:msub><mml:mi mathvariant="bold">I</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. The observations are read off the true state and perturbed with an unbiased white-in-time Gaussian additive noise of covariance matrix <inline-formula><mml:math id="M101" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:msub><mml:mi mathvariant="bold">I</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> following Eq. (<xref ref-type="disp-formula" rid="Ch1.E1.3"/>). The time-step between observation batches and updates is set to <inline-formula><mml:math id="M102" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mi>t</mml:mi><mml:mrow><mml:mi>k</mml:mi><mml:mo>+</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msub><mml:mo>-</mml:mo><mml:msub><mml:mi>t</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">0.05</mml:mn></mml:mrow></mml:math></inline-formula> for all experiments with the exception of Sect. <xref ref-type="sec" rid="Ch1.S4.SS1"/>. This will be our reference DA setup. Examples of alternative sparseness and noise levels are given in Boc24, but here as well when relevant.</p>
      <p id="d2e2235">All the <inline-formula><mml:math id="M103" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> operators learned in this configuration are subsequently evaluated with a time-averaged analysis root mean square error (RMSE) whose mean square is averaged over the <inline-formula><mml:math id="M104" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> variables. This RMSE is assessed over a dataset of independent test trajectories, similarly to traditional DA twin experiments. For brevity, this score computed for each trained DAN scheme will simply be called <italic>test RMSE</italic> of the DAN scheme in the rest of this paper.</p>
      <p id="d2e2263">In this configuration, running a well-tuned EnKF in a twin experiment and comparing its analysis to the truth yield a test RMSE between <inline-formula><mml:math id="M105" display="inline"><mml:mn mathvariant="normal">0.18</mml:mn></mml:math></inline-formula> and <inline-formula><mml:math id="M106" display="inline"><mml:mn mathvariant="normal">0.20</mml:mn></mml:math></inline-formula> depending on the ensemble size <inline-formula><mml:math id="M107" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">e</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> and whether localisation is used or not. By contrast, a basic but well-tuned 3D-Var or a reasonably short window basic but well tuned 4D-Var yields a test RMSE of about <inline-formula><mml:math id="M108" display="inline"><mml:mn mathvariant="normal">0.40</mml:mn></mml:math></inline-formula>. They largely underperform the EnKF because they fail to capture the errors of day <xref ref-type="bibr" rid="bib1.bibx12 bib1.bibx29" id="paren.31"/>.</p>
      <p id="d2e2302">In order to be able to perform a large number of training experiments on a limited number of GPUs and limited VRAM, we carried out a sensitivity study on the batch size, the size of the datasets, and the backpropagation truncation, beyond the restricted set of experiments reported in Boc24. Since the results are technical and mostly of practical interest, they are reported in Appendix <xref ref-type="sec" rid="App1.Ch1.S2"/>. They were nonetheless instrumental in obtaining the main numerical results of this paper.</p>
</sec>
<sec id="Ch1.S3.SS2">
  <label>3.2</label><title>Linearisation in the innovations</title>
      <p id="d2e2315">In this section, we discuss the relevance of expanding <inline-formula><mml:math id="M109" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> linearly in the innovations, as in Eq. (<xref ref-type="disp-formula" rid="Ch1.E10"/>). We recall that the focus is on the analysis step of the DAN process, where <inline-formula><mml:math id="M110" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">e</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:math></inline-formula>, i.e. a single forecast state is propagated in between updates. Under the additional Gaussian and quasi-linear assumptions used in this subsection, a <italic>close to optimal</italic> analysis associated with the Kalman update is the posterior mean which coincides with the maximum a posteriori of the conditional pdf, hence by the minimum of the cost function associated to the analysis. In the following, the observation operator is assumed linear (or linearised) for simplicity, i.e. <inline-formula><mml:math id="M111" display="inline"><mml:mrow><mml:mi mathvariant="script">H</mml:mi><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:mi mathvariant="bold">H</mml:mi></mml:mrow></mml:math></inline-formula>.</p>
<sec id="Ch1.S3.SS2.SSS1">
  <label>3.2.1</label><title>A Gaussian standpoint on the analysis</title>
      <p id="d2e2371">Here, we further assume that the background errors are Gaussian. Nonetheless, as opposed to a basic 3D-Var, the background error covariance matrix depends on the forecast state. Hence, the typical analysis cost function associated to the analysis at any given time step has the form:

              <disp-formula id="Ch1.E13" content-type="numbered"><label>8</label><mml:math id="M112" display="block"><mml:mrow><mml:mi mathvariant="script">J</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:mstyle displaystyle="true"><mml:mfrac style="display"><mml:mn mathvariant="normal">1</mml:mn><mml:mn mathvariant="normal">2</mml:mn></mml:mfrac></mml:mstyle><mml:msubsup><mml:mfenced close="∥" open="∥"><mml:mrow><mml:mi mathvariant="bold">y</mml:mi><mml:mo>-</mml:mo><mml:mi mathvariant="bold">Hx</mml:mi></mml:mrow></mml:mfenced><mml:mrow><mml:msup><mml:mi mathvariant="bold">R</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup></mml:mrow><mml:mn mathvariant="normal">2</mml:mn></mml:msubsup><mml:mo>+</mml:mo><mml:mstyle displaystyle="true"><mml:mfrac style="display"><mml:mn mathvariant="normal">1</mml:mn><mml:mn mathvariant="normal">2</mml:mn></mml:mfrac></mml:mstyle><mml:mo mathsize="1.1em">‖</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>-</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:msubsup><mml:mo mathsize="1.1em">‖</mml:mo><mml:mrow><mml:msup><mml:mfenced open="(" close=")"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup></mml:mrow><mml:mn mathvariant="normal">2</mml:mn></mml:msubsup><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula>

            As a consequence, <inline-formula><mml:math id="M113" display="inline"><mml:mi mathvariant="script">J</mml:mi></mml:math></inline-formula> is quadratic in <inline-formula><mml:math id="M114" display="inline"><mml:mi mathvariant="bold">x</mml:mi></mml:math></inline-formula>, strictly convex, and its minimum argument is <xref ref-type="bibr" rid="bib1.bibx26" id="paren.32"/>

                  <disp-formula specific-use="align" content-type="numbered"><mml:math id="M115" display="block"><mml:mtable displaystyle="true"><mml:mtr><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>+</mml:mo><mml:mo mathsize="1.5em">[</mml:mo><mml:msup><mml:mi mathvariant="bold">H</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:msup><mml:mi mathvariant="bold">R</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mi mathvariant="bold">H</mml:mi><mml:mo>+</mml:mo><mml:mo mathsize="1.1em">(</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:msup><mml:mo mathsize="1.1em">)</mml:mo><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:msup><mml:mo mathsize="1.5em">]</mml:mo><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:msup><mml:mi mathvariant="bold">H</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:msup><mml:mi mathvariant="bold">R</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mo mathsize="1.1em">(</mml:mo><mml:mi mathvariant="bold">y</mml:mi><mml:mo>-</mml:mo><mml:msup><mml:mi mathvariant="bold">Hx</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo mathsize="1.1em">)</mml:mo></mml:mrow></mml:mtd></mml:mtr><mml:mlabeledtr id="Ch1.E14"><mml:mtd><mml:mtext>9</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>+</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

            where the projected innovation <inline-formula><mml:math id="M116" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> has been defined by Eq. (<xref ref-type="disp-formula" rid="Ch1.E4.7"/>). Equation (<xref ref-type="disp-formula" rid="Ch1.E14"/>) matches the linearisation Eq. (<xref ref-type="disp-formula" rid="Ch1.E10"/>). The purpose of this derivation is to show that, under Gaussian/quasi-linear assumptions, DAN is likely to solve the optimisation problem Eq. (<xref ref-type="disp-formula" rid="Ch1.E13"/>), that its update follows Eq. (<xref ref-type="disp-formula" rid="Ch1.E14"/>), and that its Jacobian with respect to <inline-formula><mml:math id="M117" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> plays the role of an effective analysis error covariance matrix <inline-formula><mml:math id="M118" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>. Whether this local interpretation is sufficient is then tested numerically.</p>
</sec>
<sec id="Ch1.S3.SS2.SSS2">
  <label>3.2.2</label><title>Numerical evidence</title>
      <p id="d2e2679">To numerically test whether such a linearisation is a good approximation for <inline-formula><mml:math id="M119" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, we created a modified DAN which explicitly learns an effective map <inline-formula><mml:math id="M120" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>↦</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> and linearly combines it with the projected innovations, with the goal to strictly follow the update equation Eq. (<xref ref-type="disp-formula" rid="Ch1.E14"/>). Details on our scalable implementation of Eq. (<xref ref-type="disp-formula" rid="Ch1.E14"/>), for such a DAN linear in the projected innovations (from now on called linear-in-<inline-formula><mml:math id="M121" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> DAN), can be found in Appendix <xref ref-type="sec" rid="App1.Ch1.S3"/>. One must keep in mind that this linear-in-<inline-formula><mml:math id="M122" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> DAN is numerically inefficient since it requires to build a representation of the covariance matrix <inline-formula><mml:math id="M123" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> before being applied to the projected innovations, an operation which is likely to be achieved with our standard DAN without ever computing <inline-formula><mml:math id="M124" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> explicitly.</p>
      <p id="d2e2763">This <italic>deconstruction</italic> of <inline-formula><mml:math id="M125" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> directly connects with the heuristic developed by <xref ref-type="bibr" rid="bib1.bibx57" id="text.33"/> and <xref ref-type="bibr" rid="bib1.bibx58" id="text.34"/>, where the mapping <inline-formula><mml:math id="M126" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>↦</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> is learned and then successfully used within a classical EnKF. Numerically, the linear-in-<inline-formula><mml:math id="M127" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> DAN scheme turns out to be as accurate as a well-tuned EnKF with <inline-formula><mml:math id="M128" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">e</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">40</mml:mn></mml:mrow></mml:math></inline-formula> in the reference setup (<inline-formula><mml:math id="M129" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">0.05</mml:mn></mml:mrow></mml:math></inline-formula> in particular), with a test RMSE of <inline-formula><mml:math id="M130" display="inline"><mml:mrow><mml:mo>∼</mml:mo><mml:mn mathvariant="normal">0.19</mml:mn></mml:mrow></mml:math></inline-formula>, which is in line with the results by <xref ref-type="bibr" rid="bib1.bibx57" id="text.35"/> and <xref ref-type="bibr" rid="bib1.bibx58" id="text.36"/>. Hence, we can claim that the good performance of DAN <italic>in this mildly nonlinear regime</italic> importantly relies on the (implicit) estimation of the mapping <inline-formula><mml:math id="M131" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>↦</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>, and subsequently <inline-formula><mml:math id="M132" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>↦</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>.</p>
</sec>
<sec id="Ch1.S3.SS2.SSS3">
  <label>3.2.3</label><title>On the importance of the <inline-formula><mml:math id="M133" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>↦</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> map</title>
      <p id="d2e2961">Let us focus on <xref ref-type="bibr" rid="bib1.bibx58" id="text.37"/>, whose algorithmic constructions targeted at estimating <inline-formula><mml:math id="M134" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> are especially transparent and whose numerical tests were carried out in the reference setup described in Sect. <xref ref-type="sec" rid="Ch1.S3.SS1"/>. Their Algorithm A1 proceeds as follows: (i) the state <inline-formula><mml:math id="M135" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> is backtracked by <inline-formula><mml:math id="M136" display="inline"><mml:mi>T</mml:mi></mml:math></inline-formula> time steps; (ii) the tangent linear model, evaluated along the resulting state trajectory from <inline-formula><mml:math id="M137" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mi>T</mml:mi></mml:mrow></mml:msub></mml:mrow></mml:math></inline-formula> to <inline-formula><mml:math id="M138" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mn mathvariant="normal">0</mml:mn></mml:msub></mml:mrow></mml:math></inline-formula>, is applied to a matrix of state perturbations <inline-formula><mml:math id="M139" display="inline"><mml:mrow><mml:mi mathvariant="italic">ε</mml:mi><mml:msub><mml:mi mathvariant="bold">I</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>; and (iii) the resulting perturbations at time <inline-formula><mml:math id="M140" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mn mathvariant="normal">0</mml:mn></mml:msub></mml:mrow></mml:math></inline-formula> are used to estimate <inline-formula><mml:math id="M141" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>. This procedure is closely related to the Assimilation in the Unstable Space (AUS) methods <xref ref-type="bibr" rid="bib1.bibx51 bib1.bibx22" id="paren.38"/>, since for sufficiently large <inline-formula><mml:math id="M142" display="inline"><mml:mi>T</mml:mi></mml:math></inline-formula> the output of the tangent linear model at <inline-formula><mml:math id="M143" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mn mathvariant="normal">0</mml:mn></mml:msub></mml:mrow></mml:math></inline-formula> provides a square-root factor of the backward Lyapunov vectors. But it is already sufficient to yield a competitive analysis relying on the errors of the day estimated through <inline-formula><mml:math id="M144" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> which notably relies on a single state.</p>
      <p id="d2e3119">Algorithm A2 of <xref ref-type="bibr" rid="bib1.bibx58" id="text.39"/> also backtracks the state <inline-formula><mml:math id="M145" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> by <inline-formula><mml:math id="M146" display="inline"><mml:mi>T</mml:mi></mml:math></inline-formula> time steps but differs in the subsequent step: instead of propagating perturbations, it applies a (square-root) Kalman filter to an initial covariance matrix <inline-formula><mml:math id="M147" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="italic">ε</mml:mi><mml:mn mathvariant="normal">2</mml:mn></mml:msup><mml:msub><mml:mi mathvariant="bold">I</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> from <inline-formula><mml:math id="M148" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mi>T</mml:mi></mml:mrow></mml:msub></mml:mrow></mml:math></inline-formula> to <inline-formula><mml:math id="M149" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mn mathvariant="normal">0</mml:mn></mml:msub></mml:mrow></mml:math></inline-formula>, yielding a more refined estimate of <inline-formula><mml:math id="M150" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> at <inline-formula><mml:math id="M151" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mn mathvariant="normal">0</mml:mn></mml:msub></mml:mrow></mml:math></inline-formula>. This yields an even more accurate DA algorithm on par with a well tuned EnKF, again relying on <inline-formula><mml:math id="M152" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> assessed from a single state.</p>
      <p id="d2e3236"><xref ref-type="bibr" rid="bib1.bibx15" id="text.40"/> and <xref ref-type="bibr" rid="bib1.bibx9" id="text.41"/> have laid the theoretical grounds to understand why these principled demonstrations are successful. <xref ref-type="bibr" rid="bib1.bibx15" id="text.42"/> focused on a degenerate Kalman filter, equivalent to an EnKF in Gaussian and quasi-linear conditions. In this setting, the covariance evolution is formally decoupled from the state update, with the important caveat that the forecast error covariance <inline-formula><mml:math id="M153" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> depends on the state <inline-formula><mml:math id="M154" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> at time <inline-formula><mml:math id="M155" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mn mathvariant="normal">0</mml:mn></mml:msub></mml:mrow></mml:math></inline-formula>. Indeed, <xref ref-type="bibr" rid="bib1.bibx15" id="text.43"/> showed that, asymptotically (i.e. for large <inline-formula><mml:math id="M156" display="inline"><mml:mi>T</mml:mi></mml:math></inline-formula>), <inline-formula><mml:math id="M157" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> depends on the system dynamics only through the Lyapunov vectors. By the MET, the corresponding Oseledets subspaces are measurable functions of the state <inline-formula><mml:math id="M158" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> at <inline-formula><mml:math id="M159" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mn mathvariant="normal">0</mml:mn></mml:msub></mml:mrow></mml:math></inline-formula> (for almost every state on the attractor). Hence, following <xref ref-type="bibr" rid="bib1.bibx15" id="text.44"/>, Algorithm A2 by <xref ref-type="bibr" rid="bib1.bibx58" id="text.45"/> can be directly interpreted as the single state-dependent covariance propagation of a degenerate Kalman filter. In the case of nonlinear dynamics, enforcing the dependence of the error covariance <inline-formula><mml:math id="M160" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> on <inline-formula><mml:math id="M161" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> is even more beneficial since the covariance evolution now explicitly depends on <inline-formula><mml:math id="M162" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula>.</p>
      <p id="d2e3365">These theoretical results and proof experiments provide a rationale for the existence of a map <inline-formula><mml:math id="M163" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>↦</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> and its importance in estimating the errors-of-the-day in DA schemes based on a single forecast state <inline-formula><mml:math id="M164" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">e</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:math></inline-formula>.</p>
</sec>
</sec>
<sec id="Ch1.S3.SS3">
  <label>3.3</label><title>Patterns</title>
      <p id="d2e3419">In this section, we visualise a footprint of the local patterns leveraged by DAN to make its inferences. To that end,  we study the dependence of <inline-formula><mml:math id="M165" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:msub><mml:mo>)</mml:mo><mml:mrow><mml:mo>|</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="bold">0</mml:mn></mml:mrow></mml:msub><mml:mo>≈</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> on <inline-formula><mml:math id="M166" display="inline"><mml:mi mathvariant="bold">x</mml:mi></mml:math></inline-formula>, i.e. the forecast state. This can be seen as a linear-in-<inline-formula><mml:math id="M167" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> sensitivity analysis of <inline-formula><mml:math id="M168" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> with respect to its inputs.</p>
<sec id="Ch1.S3.SS3.SSS1">
  <label>3.3.1</label><title>Mean marginal gain tensor</title>
      <p id="d2e3504">Specifically, the sensitivity analysis will focus on Jacobians of the analysis operator with respect to <inline-formula><mml:math id="M169" display="inline"><mml:mi mathvariant="bold">x</mml:mi></mml:math></inline-formula>:
            

                  <disp-formula id="Ch1.E15" specific-use="align" content-type="subnumberedsingle"><mml:math id="M170" display="block"><mml:mtable displaystyle="true"><mml:mlabeledtr id="Ch1.E15.16"><mml:mtd><mml:mtext>10a</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="Ch1.E15.17"><mml:mtd><mml:mtext>10b</mml:mtext></mml:mtd><mml:mtd><mml:mstyle class="stylechange" displaystyle="true"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mn mathvariant="bold">0</mml:mn><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:msub><mml:mo>)</mml:mo><mml:mrow><mml:mo>|</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="bold">0</mml:mn></mml:mrow></mml:msub><mml:mo>.</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula></p>
      <p id="d2e3649">Since <inline-formula><mml:math id="M171" display="inline"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> is a proxy to <inline-formula><mml:math id="M172" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> as per Eq. (<xref ref-type="disp-formula" rid="Ch1.E10"/>), <inline-formula><mml:math id="M173" display="inline"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> can be interpreted as the <italic>marginal</italic> variation of <inline-formula><mml:math id="M174" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> when the forecast state <inline-formula><mml:math id="M175" display="inline"><mml:mi mathvariant="bold">x</mml:mi></mml:math></inline-formula> is perturbed. Under Gaussianity and linearity and assuming <inline-formula><mml:math id="M176" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">H</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:msup><mml:mi mathvariant="bold">R</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="bold">I</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, <inline-formula><mml:math id="M177" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> coincides with the Kalman gain. That is why we will call <inline-formula><mml:math id="M178" display="inline"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> the <italic>marginal gain tensor</italic>, or simply <italic>marginal gain</italic>. Mathematically, this is a <italic>3-tensor field</italic>, i.e. a map from the state space <inline-formula><mml:math id="M179" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> to <inline-formula><mml:math id="M180" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi><mml:mn mathvariant="normal">3</mml:mn></mml:msubsup></mml:mrow></mml:math></inline-formula>. Component-wise, using a conventional placement of indices, its definition reads

              <disp-formula id="Ch1.E18" content-type="numbered"><label>11</label><mml:math id="M181" display="block"><mml:mrow><mml:mo>[</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:msub><mml:mo>]</mml:mo><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi><mml:mi>l</mml:mi></mml:mrow></mml:msub><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:msub><mml:mfenced open="(" close=")"><mml:mrow><mml:msub><mml:mo>∂</mml:mo><mml:mrow><mml:msub><mml:mi>x</mml:mi><mml:mi>l</mml:mi></mml:msub></mml:mrow></mml:msub><mml:msub><mml:mo>∂</mml:mo><mml:mrow><mml:msub><mml:mi mathvariant="italic">ζ</mml:mi><mml:mi>j</mml:mi></mml:msub></mml:mrow></mml:msub><mml:msub><mml:mi>a</mml:mi><mml:mrow><mml:mi mathvariant="bold-italic">θ</mml:mi><mml:mo>,</mml:mo><mml:mi>i</mml:mi></mml:mrow></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mrow><mml:mo>|</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="bold">0</mml:mn></mml:mrow></mml:msub><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula></p>
      <p id="d2e3905">To mitigate the complexity in studying the map <inline-formula><mml:math id="M182" display="inline"><mml:mrow><mml:mi mathvariant="bold">x</mml:mi><mml:mo>↦</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>, we introduce the <italic>mean marginal gain</italic>, <inline-formula><mml:math id="M183" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover></mml:math></inline-formula>. This 3-tensor is defined as the average of <inline-formula><mml:math id="M184" display="inline"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> over the <inline-formula><mml:math id="M185" display="inline"><mml:mi>K</mml:mi></mml:math></inline-formula> states of a long trajectory <inline-formula><mml:math id="M186" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="script">T</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mfenced close="}" open="{"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup></mml:mrow></mml:mfenced><mml:mrow><mml:mi>k</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn><mml:mo>,</mml:mo><mml:mi mathvariant="normal">…</mml:mi><mml:mo>,</mml:mo><mml:mi>K</mml:mi></mml:mrow></mml:msub><mml:mo>∈</mml:mo><mml:msubsup><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi><mml:mi>K</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula> of the <inline-formula><mml:math id="M187" display="inline"><mml:mi mathvariant="script">M</mml:mi></mml:math></inline-formula>–based  ergodic chaotic dynamics:

              <disp-formula id="Ch1.E19" content-type="numbered"><label>12</label><mml:math id="M188" display="block"><mml:mrow><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:mo>〈</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:msub><mml:mo>〉</mml:mo><mml:mrow><mml:mi mathvariant="bold">x</mml:mi><mml:mo>∈</mml:mo><mml:msub><mml:mi mathvariant="script">T</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub></mml:mrow></mml:msub><mml:munder><mml:mo>=</mml:mo><mml:mrow><mml:mi>K</mml:mi><mml:mo>→</mml:mo><mml:mi mathvariant="normal">∞</mml:mi></mml:mrow></mml:munder><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold">x</mml:mi><mml:mspace width="0.125em" linebreak="nobreak"/><mml:mi mathvariant="italic">π</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold">x</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">π</mml:mi></mml:mrow></mml:msub><mml:mfenced open="[" close="]"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

            where <inline-formula><mml:math id="M189" display="inline"><mml:mi mathvariant="italic">π</mml:mi></mml:math></inline-formula> is the invariant distribution of the ergodic chaotic dynamics.</p>
      <p id="d2e4121">As recalled in Sect. <xref ref-type="sec" rid="Ch1.S2.SS3"/>, <inline-formula><mml:math id="M190" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:msub><mml:mo>)</mml:mo><mml:mrow><mml:mo>|</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="bold">0</mml:mn></mml:mrow></mml:msub><mml:mo>≈</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> was heuristically estimated in Boc24 using samples of <inline-formula><mml:math id="M191" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> followed by a linear regression. This estimation through a regression can be formally justified using the following argument. We wish to average <inline-formula><mml:math id="M192" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> over the pdf <inline-formula><mml:math id="M193" display="inline"><mml:mrow><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> of the projected innovations <inline-formula><mml:math id="M194" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>, which is assumed to be a Gaussian with a positive-definite covariance matrix <inline-formula><mml:math id="M195" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. Then it can be shown that
            

                  <disp-formula id="Ch1.E20" specific-use="align" content-type="subnumberedsingle"><mml:math id="M196" display="block"><mml:mtable displaystyle="true"><mml:mlabeledtr id="Ch1.E20.21"><mml:mtd><mml:mtext>13a</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced close="]" open="["><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mspace width="0.125em" linebreak="nobreak"/><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="Ch1.E20.22"><mml:mtd><mml:mtext>13b</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:msubsup><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:msub><mml:mtext>Cov</mml:mtext><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced close="]" open="["><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

            where <inline-formula><mml:math id="M197" display="inline"><mml:mrow><mml:mtext>Cov</mml:mtext><mml:mfenced close="]" open="["><mml:mrow><mml:mo>⋅</mml:mo><mml:mo>,</mml:mo><mml:mo>⋅</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:math></inline-formula> is the covariance operator, and <inline-formula><mml:math id="M198" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup></mml:mrow></mml:math></inline-formula> operates on the first tensor factor. A proof is given in Appendix <xref ref-type="sec" rid="App1.Ch1.S4"/>, along with a generalisation to the case where <inline-formula><mml:math id="M199" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is only semi positive-definite, which is made necessary because the set <inline-formula><mml:math id="M200" display="inline"><mml:mrow><mml:mo mathsize="1.1em" mathvariant="italic">{</mml:mo><mml:msub><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msubsup><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup><mml:msubsup><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:msub><mml:mi mathvariant="bold-italic">δ</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:msub><mml:mo mathvariant="italic" mathsize="1.1em">}</mml:mo><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> may only span a subspace of <inline-formula><mml:math id="M201" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> if <inline-formula><mml:math id="M202" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is not injective. This result is none other than Stein's lemma <xref ref-type="bibr" rid="bib1.bibx44" id="paren.46"/> applied to the Gaussian approximation of <inline-formula><mml:math id="M203" display="inline"><mml:mi mathvariant="italic">ρ</mml:mi></mml:math></inline-formula> and <inline-formula><mml:math id="M204" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mo>⋅</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>. It aligns with its original use in ensemble DA <xref ref-type="bibr" rid="bib1.bibx62 bib1.bibx55 bib1.bibx30" id="paren.47"/> and with the connection established by Lemma 2 of <xref ref-type="bibr" rid="bib1.bibx1" id="text.48"/> between <inline-formula><mml:math id="M205" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:msub><mml:mtext>Cov</mml:mtext><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced close="]" open="["><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:math></inline-formula>, which is a perturbations-based estimator <xref ref-type="bibr" rid="bib1.bibx56" id="paren.49"/>, and a SmoothGrad estimator <xref ref-type="bibr" rid="bib1.bibx61" id="paren.50"/>. In the limit where <inline-formula><mml:math id="M206" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>, as a random vector, is concentrated around <inline-formula><mml:math id="M207" display="inline"><mml:mn mathvariant="bold">0</mml:mn></mml:math></inline-formula> and <inline-formula><mml:math id="M208" display="inline"><mml:mi mathvariant="italic">ρ</mml:mi></mml:math></inline-formula> can be approximated as Gaussian, which corresponds to the most common <italic>weak assimilation</italic> regime where the information content of the innovation is small compared to that of the background, we have
            

                  <disp-formula id="Ch1.E23" specific-use="align" content-type="subnumberedsingle"><mml:math id="M209" display="block"><mml:mtable displaystyle="true"><mml:mlabeledtr id="Ch1.E23.24"><mml:mtd><mml:mtext>14a</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:msubsup><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:msub><mml:mtext>Cov</mml:mtext><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced open="[" close="]"><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace linebreak="nobreak" width="-0.125em"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mspace linebreak="nobreak" width="0.125em"/><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="Ch1.E23.25"><mml:mtd><mml:mtext>14b</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>≈</mml:mo><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:msub><mml:mo>)</mml:mo><mml:mrow><mml:mo>|</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="bold">0</mml:mn></mml:mrow></mml:msub><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

            which, with Eq. (<xref ref-type="disp-formula" rid="Ch1.E20.21"/>), relates the integral form <inline-formula><mml:math id="M210" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mo>[</mml:mo><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>]</mml:mo></mml:mrow></mml:math></inline-formula> to the gradient form <inline-formula><mml:math id="M211" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:msub><mml:mo>)</mml:mo><mml:mrow><mml:mo>|</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="bold">0</mml:mn></mml:mrow></mml:msub></mml:mrow></mml:math></inline-formula> of the sensitivity of <inline-formula><mml:math id="M212" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> with respect to <inline-formula><mml:math id="M213" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>.</p>
      <p id="d2e4860">Building on this correspondance, we can connect the following mean marginal gain

              <disp-formula id="Ch1.E26" content-type="numbered"><label>15</label><mml:math id="M214" display="block"><mml:mrow><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo stretchy="true" mathvariant="normal">̃</mml:mo></mml:mover><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold">x</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">π</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mo>[</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>]</mml:mo><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace linebreak="nobreak" width="-0.125em"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mspace width="0.125em" linebreak="nobreak"/><mml:mi mathvariant="italic">π</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

            defined from Eq. (<xref ref-type="disp-formula" rid="Ch1.E15.16"/>) and more closely related to the DA process, to the mean marginal gain <inline-formula><mml:math id="M215" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover></mml:math></inline-formula> as defined in Eq. (<xref ref-type="disp-formula" rid="Ch1.E19"/>):
            

                  <disp-formula id="Ch1.E27" specific-use="align" content-type="subnumberedsingle"><mml:math id="M216" display="block"><mml:mtable displaystyle="true"><mml:mlabeledtr id="Ch1.E27.28"><mml:mtd><mml:mtext>16a</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal" stretchy="true">̃</mml:mo></mml:mover></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold">x</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">π</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced open="[" close="]"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="Ch1.E27.29"><mml:mtd><mml:mtext>16b</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold">x</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">π</mml:mi></mml:mrow></mml:msub><mml:mfenced open="[" close="]"><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced close="]" open="["><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:mfenced></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="Ch1.E27.30"><mml:mtd><mml:mtext>16c</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>≈</mml:mo><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold">x</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">π</mml:mi></mml:mrow></mml:msub><mml:mfenced close="]" open="["><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:msub><mml:mo>)</mml:mo><mml:mrow><mml:mo>|</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="bold">0</mml:mn></mml:mrow></mml:msub></mml:mrow></mml:mfenced></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="Ch1.E27.31"><mml:mtd><mml:mtext>16d</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold">x</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">π</mml:mi></mml:mrow></mml:msub><mml:mfenced open="[" close="]"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="Ch1.E27.32"><mml:mtd><mml:mtext>16e</mml:mtext></mml:mtd><mml:mtd><mml:mstyle class="stylechange" displaystyle="true"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mo>.</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

            However, the <italic>empirical mean</italic> of <inline-formula><mml:math id="M217" display="inline"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> from which to evaluate <inline-formula><mml:math id="M218" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal" stretchy="true">̃</mml:mo></mml:mover></mml:math></inline-formula>, and denoted <inline-formula><mml:math id="M219" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal" stretchy="true">^</mml:mo></mml:mover></mml:math></inline-formula>, and which is the numerical estimation of the sensitivity out of a long enough DA run, may differ from both theoretical means <inline-formula><mml:math id="M220" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo stretchy="true" mathvariant="normal">̃</mml:mo></mml:mover></mml:math></inline-formula> and <inline-formula><mml:math id="M221" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover></mml:math></inline-formula>. That is why we show in Appendix <xref ref-type="sec" rid="App1.Ch1.S5"/> how <inline-formula><mml:math id="M222" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal" stretchy="true">^</mml:mo></mml:mover></mml:math></inline-formula> approximates <inline-formula><mml:math id="M223" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo stretchy="true" mathvariant="normal">̃</mml:mo></mml:mover></mml:math></inline-formula>.</p>
      <p id="d2e5283">Note that Eq. (<xref ref-type="disp-formula" rid="Ch1.E27.28"/>) is a simple point estimator, which formalises that the averaged Jacobian <inline-formula><mml:math id="M224" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:mo>[</mml:mo><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>]</mml:mo></mml:mrow></mml:math></inline-formula> is well approximated by <inline-formula><mml:math id="M225" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:msub><mml:mo>|</mml:mo><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="bold">0</mml:mn></mml:mrow></mml:msub></mml:mrow></mml:math></inline-formula> when the distribution of projected innovations is concentrated near zero. The Stein lemma, which provides a regression-based estimator of this average, is not required per se to ascertain Eq. (<xref ref-type="disp-formula" rid="Ch1.E27.28"/>), but offers an alternative expression which we leverage in Appendix <xref ref-type="sec" rid="App1.Ch1.S8"/>.</p>
</sec>
<sec id="Ch1.S3.SS3.SSS2">
  <label>3.3.2</label><title>Invariance and equivariance</title>
      <p id="d2e5371">An important way to reduce the computational cost and complexity of interpreting the mean marginal gain <inline-formula><mml:math id="M226" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal" stretchy="true">̃</mml:mo></mml:mover></mml:math></inline-formula> is to exploit the symmetries of the DA problem, when applicable. If the model variables are observed homogeneously and homoscedastically, then the probability laws defining the DA problem are invariant under these symmetries, and the corresponding analysis operator is equivariant. As a result, the components of <inline-formula><mml:math id="M227" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal" stretchy="true">̃</mml:mo></mml:mover></mml:math></inline-formula> related by symmetry are redundant, so that its interpretation can be restricted to a reduced set of representative components.</p>
      <p id="d2e5394">For instance, in the one-dimensional periodic L96 model with homogeneous and homoscedastic observations, a cyclic translation of the state variables induces the same cyclic translation of the observations, innovations, and analysis increments. The probability laws defining the DA problem are therefore invariant under the translation group, while the corresponding analysis operator is equivariant. Consequently, if the trained DAN preserves this symmetry, any trajectory-averaged sensitivity tensor must have a circulant structure: the information associated with different grid points is identical up to a cyclic shift. The group-theoretical argument below provides a formal justification for this circulant averaging.</p>
      <p id="d2e5397">Let us generically denote <inline-formula><mml:math id="M228" display="inline"><mml:mi mathvariant="script">G</mml:mi></mml:math></inline-formula> such group of symmetries for the DA process, which are assumed to be isometries. It is chosen to be the maximal group for which both the dynamics and the observation process are equivariant. Appendix <xref ref-type="sec" rid="App1.Ch1.S6"/> gives the formal definitions for this group of symmetries.</p>
      <p id="d2e5409">The action of <inline-formula><mml:math id="M229" display="inline"><mml:mrow><mml:mi>g</mml:mi><mml:mo>∈</mml:mo><mml:mi mathvariant="script">G</mml:mi></mml:mrow></mml:math></inline-formula> on <inline-formula><mml:math id="M230" display="inline"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> is denoted <inline-formula><mml:math id="M231" display="inline"><mml:mrow><mml:mi>g</mml:mi><mml:mo>⊙</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>. It is a tensor field for <inline-formula><mml:math id="M232" display="inline"><mml:mi mathvariant="script">G</mml:mi></mml:math></inline-formula>, in the sense that it is <italic>equivariant</italic> under the action of this symmetry group following the transformation rule, <inline-formula><mml:math id="M233" display="inline"><mml:mrow><mml:mo>∀</mml:mo><mml:mi>g</mml:mi><mml:mo>∈</mml:mo><mml:mi mathvariant="script">G</mml:mi><mml:mo>,</mml:mo><mml:mo>∀</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>∈</mml:mo><mml:msub><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>,</mml:mo><mml:mo>∀</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∈</mml:mo><mml:msub><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>:

              <disp-formula id="Ch1.E33" content-type="numbered"><label>17</label><mml:math id="M234" display="block"><mml:mrow><mml:mi>g</mml:mi><mml:mo>⊙</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:mi>g</mml:mi><mml:mo>⊗</mml:mo><mml:msup><mml:mi>g</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo>⊗</mml:mo><mml:msup><mml:mi>g</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo>∘</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

            where the ordering of the three tensorial factors follows the convention of Eq. (<xref ref-type="disp-formula" rid="Ch1.E18"/>). A proof of the equivariance Eq. (<xref ref-type="disp-formula" rid="Ch1.E33"/>) is proposed in Appendix <xref ref-type="sec" rid="App1.Ch1.S6"/>.</p>
      <p id="d2e5606">Invoking the ergodicity of the dynamics, any symmetry of <inline-formula><mml:math id="M235" display="inline"><mml:mi mathvariant="script">G</mml:mi></mml:math></inline-formula> leaves the invariant distribution of the dynamics <inline-formula><mml:math id="M236" display="inline"><mml:mi mathvariant="italic">π</mml:mi></mml:math></inline-formula>, and the projected innovation distribution <inline-formula><mml:math id="M237" display="inline"><mml:mi mathvariant="italic">ρ</mml:mi></mml:math></inline-formula>, unchanged, <inline-formula><mml:math id="M238" display="inline"><mml:mrow><mml:mo>∀</mml:mo><mml:mi>g</mml:mi><mml:mo>∈</mml:mo><mml:mi mathvariant="script">G</mml:mi><mml:mo>,</mml:mo><mml:mo>∀</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>∈</mml:mo><mml:msub><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>,</mml:mo><mml:mo>∀</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∈</mml:mo><mml:msub><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>:

              <disp-formula id="Ch1.E34" content-type="numbered"><label>18</label><mml:math id="M239" display="block"><mml:mrow><mml:mi mathvariant="italic">π</mml:mi><mml:mo>(</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:mi mathvariant="italic">π</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mo>,</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>(</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

            where <inline-formula><mml:math id="M240" display="inline"><mml:mrow><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mo>(</mml:mo><mml:mo>⋅</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> denotes the action of <inline-formula><mml:math id="M241" display="inline"><mml:mi>g</mml:mi></mml:math></inline-formula> on a field.</p>
      <p id="d2e5752">Leveraging the equivariance of the marginal gain and the symmetries of the invariant distribution, we now demonstrate the invariance of the mean marginal gain <inline-formula><mml:math id="M242" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal" stretchy="true">̃</mml:mo></mml:mover></mml:math></inline-formula>; for <inline-formula><mml:math id="M243" display="inline"><mml:mrow><mml:mi>g</mml:mi><mml:mo>∈</mml:mo><mml:mi mathvariant="script">G</mml:mi></mml:mrow></mml:math></inline-formula>, we have
            

                  <disp-formula id="Ch1.E35" specific-use="align" content-type="subnumberedsingle"><mml:math id="M244" display="block"><mml:mtable displaystyle="true"><mml:mlabeledtr id="Ch1.E35.36"><mml:mtd><mml:mtext>19a</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mi>g</mml:mi><mml:mo>⊙</mml:mo><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal" stretchy="true">̃</mml:mo></mml:mover></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace linebreak="nobreak" width="-0.125em"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mspace linebreak="nobreak" width="0.125em"/><mml:mi mathvariant="italic">π</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mi>g</mml:mi><mml:mo>⊙</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="Ch1.E35.37"><mml:mtd><mml:mtext>19b</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mspace linebreak="nobreak" width="0.125em"/><mml:mi mathvariant="italic">π</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mtr><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi>g</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mo>∘</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="normal">d</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi>g</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mo>∘</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mtd></mml:mtr><mml:mlabeledtr id="Ch1.E35.38"><mml:mtd><mml:mtext>19c</mml:mtext></mml:mtd><mml:mtd><mml:mstyle class="stylechange" displaystyle="true"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>×</mml:mo><mml:mi mathvariant="italic">π</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi>g</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mo>∘</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi>g</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mo>∘</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="Ch1.E35.39"><mml:mtd><mml:mtext>19d</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mspace width="0.125em" linebreak="nobreak"/><mml:mi mathvariant="italic">π</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo stretchy="true" mathvariant="normal">̃</mml:mo></mml:mover><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

            where a change of variables was carried out from Eq. (<xref ref-type="disp-formula" rid="Ch1.E35.36"/>) to  Eq. (<xref ref-type="disp-formula" rid="Ch1.E35.38"/>). The invariance of <inline-formula><mml:math id="M245" display="inline"><mml:mi mathvariant="italic">π</mml:mi></mml:math></inline-formula> and <inline-formula><mml:math id="M246" display="inline"><mml:mi mathvariant="italic">ρ</mml:mi></mml:math></inline-formula> under <inline-formula><mml:math id="M247" display="inline"><mml:mi mathvariant="script">G</mml:mi></mml:math></inline-formula>, and the fact that the determinant of the Jacobian of <inline-formula><mml:math id="M248" display="inline"><mml:mrow><mml:msup><mml:mi>g</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula> is <inline-formula><mml:math id="M249" display="inline"><mml:mn mathvariant="normal">1</mml:mn></mml:math></inline-formula> since <inline-formula><mml:math id="M250" display="inline"><mml:mrow><mml:msup><mml:mi>g</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula> is an isometry were utilised from Eq. (<xref ref-type="disp-formula" rid="Ch1.E35.38"/>) to  Eq. (<xref ref-type="disp-formula" rid="Ch1.E35.39"/>). We finally conclude:

              <disp-formula id="Ch1.E40" content-type="numbered"><label>20</label><mml:math id="M251" display="block"><mml:mrow><mml:mo>∀</mml:mo><mml:mi>g</mml:mi><mml:mo>∈</mml:mo><mml:mi mathvariant="script">G</mml:mi><mml:mo>:</mml:mo><mml:mi>g</mml:mi><mml:mo>⊙</mml:mo><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo stretchy="true" mathvariant="normal">̃</mml:mo></mml:mover><mml:mo>=</mml:mo><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo stretchy="true" mathvariant="normal">̃</mml:mo></mml:mover><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula>

            The same result can be obtained for <inline-formula><mml:math id="M252" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover></mml:math></inline-formula>, with a simpler derivation only involving the invariant distribution <inline-formula><mml:math id="M253" display="inline"><mml:mi mathvariant="italic">π</mml:mi></mml:math></inline-formula> of the underlying dynamics. However, the symmetry group <inline-formula><mml:math id="M254" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover></mml:math></inline-formula> must be the same as that of <inline-formula><mml:math id="M255" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo stretchy="true" mathvariant="normal">̃</mml:mo></mml:mover></mml:math></inline-formula>, and not the potentially larger group associated to <inline-formula><mml:math id="M256" display="inline"><mml:mi mathvariant="italic">π</mml:mi></mml:math></inline-formula>:

              <disp-formula id="Ch1.E41" content-type="numbered"><label>21</label><mml:math id="M257" display="block"><mml:mrow><mml:mo>∀</mml:mo><mml:mi>g</mml:mi><mml:mo>∈</mml:mo><mml:mi mathvariant="script">G</mml:mi><mml:mo>:</mml:mo><mml:mi>g</mml:mi><mml:mo>⊙</mml:mo><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mo>=</mml:mo><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula>

            As a consequence, in the rest of this section, we assume that the results apply equally to either <inline-formula><mml:math id="M258" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo stretchy="true" mathvariant="normal">̃</mml:mo></mml:mover></mml:math></inline-formula> or <inline-formula><mml:math id="M259" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover></mml:math></inline-formula>.</p>

      <fig id="F1" specific-use="star"><label>Figure 1</label><caption><p id="d2e6289">Plot of the normalised mean marginal gain <inline-formula><mml:math id="M260" display="inline"><mml:mrow><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="normal">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi></mml:mrow><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msubsup><mml:mo>/</mml:mo><mml:mo>max⁡</mml:mo><mml:mo mathsize="1.1em">|</mml:mo><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="normal">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi></mml:mrow><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msubsup><mml:mo mathsize="1.1em">|</mml:mo></mml:mrow></mml:math></inline-formula> in the fully observed DA configuration of the L96 model, obtained with a model size of <inline-formula><mml:math id="M261" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">40</mml:mn></mml:mrow></mml:math></inline-formula> <bold>(</bold>panel <bold>a)</bold> and <inline-formula><mml:math id="M262" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">80</mml:mn></mml:mrow></mml:math></inline-formula> <bold>(</bold>panel <bold>b)</bold>.</p></caption>
            <graphic xlink:href="https://npg.copernicus.org/articles/33/401/2026/npg-33-401-2026-f01.jpg"/>

          </fig>

</sec>
<sec id="Ch1.S3.SS3.SSS3">
  <label>3.3.3</label><title>Numerical illustrations</title>
      <p id="d2e6399">Leveraging the equivariance induced by the translational invariance of the L96 model, for a fixed reference site <inline-formula><mml:math id="M263" display="inline"><mml:mi>r</mml:mi></mml:math></inline-formula>, we define the <italic>slice</italic> matrix <inline-formula><mml:math id="M264" display="inline"><mml:mrow><mml:msup><mml:mover accent="true"><mml:mi mathvariant="bold">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msup><mml:mo>∈</mml:mo><mml:msup><mml:mi mathvariant="double-struck">R</mml:mi><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>×</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula> component-wise by

              <disp-formula id="Ch1.E42" content-type="numbered"><label>22</label><mml:math id="M265" display="block"><mml:mrow><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="normal">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi></mml:mrow><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msubsup><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:msub><mml:mover accent="true"><mml:mi mathvariant="normal">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi><mml:mi>r</mml:mi></mml:mrow></mml:msub><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula>

            The index <inline-formula><mml:math id="M266" display="inline"><mml:mi>r</mml:mi></mml:math></inline-formula> is not an additional free index of <inline-formula><mml:math id="M267" display="inline"><mml:mrow><mml:msup><mml:mover accent="true"><mml:mi mathvariant="bold">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula>; it labels the chosen slice of the averaged 3-tensor. For visual convenience, <inline-formula><mml:math id="M268" display="inline"><mml:mi>r</mml:mi></mml:math></inline-formula> is chosen to be in the middle of the domain <inline-formula><mml:math id="M269" display="inline"><mml:mrow><mml:mi>r</mml:mi><mml:mo>=</mml:mo><mml:mo>⌊</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>/</mml:mo><mml:mn mathvariant="normal">2</mml:mn><mml:mo>⌋</mml:mo></mml:mrow></mml:math></inline-formula> in the L96 case. The simple but tedious details justifying Eq. (<xref ref-type="disp-formula" rid="Ch1.E42"/>) are given in Appendix <xref ref-type="sec" rid="App1.Ch1.S7"/>. How to numerically compute this <inline-formula><mml:math id="M270" display="inline"><mml:mrow><mml:msup><mml:mover accent="true"><mml:mi mathvariant="bold">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula> matrix is then discussed in Appendix <xref ref-type="sec" rid="App1.Ch1.S8"/>.</p>
      <p id="d2e6576">To start with, we choose the fully observed DA setup <inline-formula><mml:math id="M271" display="inline"><mml:mrow><mml:mi mathvariant="bold">H</mml:mi><mml:mo>=</mml:mo><mml:mi mathvariant="bold">R</mml:mi><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="bold">I</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, which applies to both the training of <inline-formula><mml:math id="M272" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> and the subsequent DA tests. The computation of <inline-formula><mml:math id="M273" display="inline"><mml:mrow><mml:msup><mml:mover accent="true"><mml:mi mathvariant="bold">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula> is carried out through the composite approach (see Appendix <xref ref-type="sec" rid="App1.Ch1.S8"/>). The results are shown in Fig. <xref ref-type="fig" rid="F1"/>.</p>
      <p id="d2e6632">The dominant values of <inline-formula><mml:math id="M274" display="inline"><mml:mrow><mml:mo>|</mml:mo><mml:msup><mml:mover accent="true"><mml:mi mathvariant="bold">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msup><mml:mo>|</mml:mo></mml:mrow></mml:math></inline-formula> form a pattern. They are concentrated in the vicinity of the perturbed variable of the forecast state, which makes them local. To further qualify the local patterns, we also trained <inline-formula><mml:math id="M275" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> on a L96 model but with <inline-formula><mml:math id="M276" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">80</mml:mn></mml:mrow></mml:math></inline-formula>, i.e. twice the size of the standard L96 model, while all other parameters either related to the dynamics or the DA experiments, remain the same. Then, <inline-formula><mml:math id="M277" display="inline"><mml:mrow><mml:msup><mml:mover accent="true"><mml:mi mathvariant="bold">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula> is similarly computed and plotted in Fig. <xref ref-type="fig" rid="F1"/>. As expected, the same pattern emerges with the same spatial extension. This further supports the EnKF-like performance of <inline-formula><mml:math id="M278" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> trained with <inline-formula><mml:math id="M279" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">40</mml:mn></mml:mrow></mml:math></inline-formula> when tested with <inline-formula><mml:math id="M280" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">80</mml:mn></mml:mrow></mml:math></inline-formula> (as recalled in Sect. <xref ref-type="sec" rid="Ch1.S2.SS3"/>).</p>
</sec>
<sec id="Ch1.S3.SS3.SSS4">
  <label>3.3.4</label><title>Patterns with non-trivial observation operators</title>
      <p id="d2e6758">We carried out the exact same experiments described above, but now with three different observation configurations instead of the full observation setup. The corresponding <inline-formula><mml:math id="M281" display="inline"><mml:mrow><mml:msup><mml:mover accent="true"><mml:mi mathvariant="bold">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula> are plotted in Fig. <xref ref-type="fig" rid="F2"/>. Panel (a) corresponds to the fully observed configuration for reference. The first configuration (panel b) corresponds to the observation of every other site: <inline-formula><mml:math id="M282" display="inline"><mml:mrow><mml:mo>[</mml:mo><mml:mi mathvariant="bold">H</mml:mi><mml:msub><mml:mo>]</mml:mo><mml:mrow><mml:mi>j</mml:mi><mml:mspace width="0.125em" linebreak="nobreak"/><mml:mi>i</mml:mi></mml:mrow></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="italic">δ</mml:mi><mml:mrow><mml:mi>i</mml:mi><mml:mo>,</mml:mo><mml:mn mathvariant="normal">2</mml:mn><mml:mi>j</mml:mi></mml:mrow></mml:msub></mml:mrow></mml:math></inline-formula> for <inline-formula><mml:math id="M283" display="inline"><mml:mrow><mml:mn mathvariant="normal">1</mml:mn><mml:mo>≤</mml:mo><mml:mi>i</mml:mi><mml:mo>≤</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> and <inline-formula><mml:math id="M284" display="inline"><mml:mrow><mml:mn mathvariant="normal">1</mml:mn><mml:mo>≤</mml:mo><mml:mi>j</mml:mi><mml:mo>≤</mml:mo><mml:mo>⌊</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>/</mml:mo><mml:mn mathvariant="normal">2</mml:mn><mml:mo>⌋</mml:mo></mml:mrow></mml:math></inline-formula>. The second (panel c) corresponds, at each time step <inline-formula><mml:math id="M285" display="inline"><mml:mrow><mml:msub><mml:mi>t</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, to an observation at <inline-formula><mml:math id="M286" display="inline"><mml:mrow><mml:msubsup><mml:mi>N</mml:mi><mml:mi mathvariant="normal">y</mml:mi><mml:mi>k</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula> random but distinct sites, where <inline-formula><mml:math id="M287" display="inline"><mml:mrow><mml:msubsup><mml:mi>N</mml:mi><mml:mi mathvariant="normal">y</mml:mi><mml:mi>k</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula> is uniformly drawn at each time step in between <inline-formula><mml:math id="M288" display="inline"><mml:mn mathvariant="normal">0</mml:mn></mml:math></inline-formula> and <inline-formula><mml:math id="M289" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> (bounds included). The third configuration (panel d) is the same as the second but with <inline-formula><mml:math id="M290" display="inline"><mml:mrow><mml:msubsup><mml:mi>N</mml:mi><mml:mi mathvariant="normal">y</mml:mi><mml:mi>k</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula> uniformly drawn at each time step in between <inline-formula><mml:math id="M291" display="inline"><mml:mrow><mml:mo>⌊</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>/</mml:mo><mml:mn mathvariant="normal">2</mml:mn><mml:mo>⌋</mml:mo></mml:mrow></mml:math></inline-formula> and <inline-formula><mml:math id="M292" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. It is remarkable that the same local pattern emerges in all configurations, even when every other site is never observed. However, the magnitude of the sensitivities (values of the patterns) changes depending on the information balance in the analysis and hence in the gain magnitude. Finally, note that <inline-formula><mml:math id="M293" display="inline"><mml:mrow><mml:msup><mml:mover accent="true"><mml:mi mathvariant="bold">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula> only represents an average pattern. It is possible to exhibit a family of modal patterns but it would go beyond the aim of the present paper.</p>

      <fig id="F2" specific-use="star"><label>Figure 2</label><caption><p id="d2e6982">Plot of the mean marginal gain <inline-formula><mml:math id="M294" display="inline"><mml:mrow><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="normal">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi></mml:mrow><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msubsup></mml:mrow></mml:math></inline-formula> normalised by the maximum of its absolute value over all entries and over the four panels, in several sparse observation DA configuration of the L96 model.</p></caption>
            <graphic xlink:href="https://npg.copernicus.org/articles/33/401/2026/npg-33-401-2026-f02.jpg"/>

          </fig>

</sec>
</sec>
</sec>
<sec id="Ch1.S4">
  <label>4</label><title>Data assimilation networks in stronger nonlinear regimes</title>
      <p id="d2e7025">In Sect. <xref ref-type="sec" rid="Ch1.S3"/>, we made several contributions to the understanding of DAN. The numerical experiments were set in a mildly nonlinear regime of L96 where <inline-formula><mml:math id="M295" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">0.05</mml:mn></mml:mrow></mml:math></inline-formula> in between analyses, known to correspond to <inline-formula><mml:math id="M296" display="inline"><mml:mn mathvariant="normal">6</mml:mn></mml:math></inline-formula> h of a synoptic meteorological model <xref ref-type="bibr" rid="bib1.bibx45" id="paren.51"/>, and a forcing <inline-formula><mml:math id="M297" display="inline"><mml:mi>F</mml:mi></mml:math></inline-formula> set to <inline-formula><mml:math id="M298" display="inline"><mml:mn mathvariant="normal">8</mml:mn></mml:math></inline-formula>. We now examine the ability of the method to learn efficient analysis schemes under stronger nonlinear conditions. While we exclude cases in which the nonlinearity is so severe that it induces implicit or explicit recurrent multi-modal priors, we do consider regimes that exhibit substantial departures from mild nonlinearity.</p>
      <p id="d2e7070">Probing such mildly to strongly nonlinear regimes can be achieved by less frequent observation, typically increasing the update time-step <inline-formula><mml:math id="M299" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. The dimensional analysis of Appendix 1 in <xref ref-type="bibr" rid="bib1.bibx9" id="text.52"/> shows that varying <inline-formula><mml:math id="M300" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is indeed relevant to achieve such objective for the L96 model versus, e.g., increasing the observation error amplitude. The forcing <inline-formula><mml:math id="M301" display="inline"><mml:mi>F</mml:mi></mml:math></inline-formula> can also be varied to that end. However, it rather stands as a signature of the magnitude of the instability of the dynamics (e.g., a covariant function of the Kaplan-Yorke dimension, a measure of the fractal dimension of the dynamics attractor) rather than the signature of the deviation from Gaussianity.</p>
<sec id="Ch1.S4.SS1">
  <label>4.1</label><title>Performance as a function of the update time-step</title>
      <p id="d2e7112">Increasing <inline-formula><mml:math id="M302" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> to multiples of <inline-formula><mml:math id="M303" display="inline"><mml:mn mathvariant="normal">0.05</mml:mn></mml:math></inline-formula> is the experimental design chosen in <xref ref-type="bibr" rid="bib1.bibx59" id="text.53"/> and <xref ref-type="bibr" rid="bib1.bibx11" id="text.54"/> to evaluate the performance of the iterative Ensemble Kalman Filter (IEnKF). As the ensemble variant of the iterative Kalman filter <xref ref-type="bibr" rid="bib1.bibx65 bib1.bibx36" id="paren.55"/>, the IEnKF still stands, to our best knowledge, as the most accurate scalable DA method in mildly to strongly nonlinear conditions <xref ref-type="bibr" rid="bib1.bibx12" id="paren.56"/>. It is hence a hard-to-beat baseline for learning an advanced DA analysis scheme in such conditions. The remarkable performance of the IEnKF stems from its ensemble-variational formulation obtained from Bayesian first principles: an ensemble is used to construct a time-dependent prior, and the analysis is performed through a nonlinear iterative optimisation <xref ref-type="bibr" rid="bib1.bibx13" id="paren.57"/>.</p>
      <p id="d2e7149">The IEnKF can be made even more accurate (both for smoothing and filtering) by choosing longer DA windows, yielding the iterative ensemble Kalman smoother <xref ref-type="bibr" rid="bib1.bibx13 bib1.bibx55" id="paren.58"><named-content content-type="pre">IEnKS,</named-content></xref>. However, it works over longer DA windows, as opposed to the DAN implemented here, which would bias the comparison. Actually, we have developed (recurrent) variants of DAN that work on extended DA windows similarly to the IEnKS, but reporting on them is beyond the goals of this paper.</p>
      <p id="d2e7157">We choose a simple common observational configuration for the many DA methods we intend to compare. All sites are observed through <inline-formula><mml:math id="M304" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:msub><mml:mi mathvariant="bold">I</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> and <inline-formula><mml:math id="M305" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:msub><mml:mi mathvariant="bold">I</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, a well documented setup in the literature. In this configuration, any useful, but not necessarily accurate, DA method must exhibit a test RMSE slightly below <inline-formula><mml:math id="M306" display="inline"><mml:mn mathvariant="normal">1</mml:mn></mml:math></inline-formula>. We consider the following DA methods: <list list-type="bullet"><list-item>
      <p id="d2e7212">A well tuned EnKF with an ensemble of size <inline-formula><mml:math id="M307" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">e</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">40</mml:mn></mml:mrow></mml:math></inline-formula>. Optimal multiplicative inflation is addressed through the finite-size EnKF <xref ref-type="bibr" rid="bib1.bibx7 bib1.bibx14" id="paren.59"/>. This first contender is meant to illustrate the progressive failure of the EnKF in stronger nonlinear conditions.</p></list-item><list-item>
      <p id="d2e7241">A well tuned IEnKF with an ensemble of size <inline-formula><mml:math id="M308" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">e</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">40</mml:mn></mml:mrow></mml:math></inline-formula>, whose optimal multiplicative inflation is addressed through the finite-size IEnKF <xref ref-type="bibr" rid="bib1.bibx11" id="paren.60"/>. This is our hard baseline.</p></list-item><list-item>
      <p id="d2e7270">A <italic>baseline</italic> learned DAN scheme using the neural network and the training parameters values set in Appendix <xref ref-type="sec" rid="App1.Ch1.S2"/>.</p></list-item><list-item>
      <p id="d2e7279">A <italic>boosted</italic> learned DAN scheme using <inline-formula><mml:math id="M309" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">80</mml:mn></mml:mrow></mml:math></inline-formula>, <inline-formula><mml:math id="M310" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msup><mml:mn mathvariant="normal">2</mml:mn><mml:mn mathvariant="normal">19</mml:mn></mml:msup></mml:mrow></mml:math></inline-formula>, <inline-formula><mml:math id="M311" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">32</mml:mn></mml:mrow></mml:math></inline-formula>, <inline-formula><mml:math id="M312" display="inline"><mml:mrow><mml:msub><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">512</mml:mn></mml:mrow></mml:math></inline-formula>, which is parameter and data intensive, and hence much more time-consuming to train on a single GPU, while its inference remains cheap.</p></list-item><list-item>
      <p id="d2e7349">A learned DAN scheme where the explicit dependence on the forecast state is discarded, while the dependence on the projected innovations is maintained. We expect the resulting DA method to perform similarly to a well tuned 3D-Var, see Boc24.</p></list-item><list-item>
      <p id="d2e7353">A learned DAN scheme where the activation functions are all linear, such that <inline-formula><mml:math id="M313" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is linear in its inputs. Like the previous approach, we expect the resulting DA method to perform similarly to a well tuned 3D-Var, see Boc24.</p></list-item></list></p>

      <fig id="F3" specific-use="star"><label>Figure 3</label><caption><p id="d2e7370">Test RMSEs of DA methods as a function of the update time-step <inline-formula><mml:math id="M314" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> in between analyses. See text for details.</p></caption>
          <graphic xlink:href="https://npg.copernicus.org/articles/33/401/2026/npg-33-401-2026-f03.png"/>

        </fig>

      <p id="d2e7390">To avoid early divergences in the training when <inline-formula><mml:math id="M315" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>≫</mml:mo><mml:mn mathvariant="normal">0.05</mml:mn></mml:mrow></mml:math></inline-formula>, all the DAN schemes benefited from a modified Eq. (2):

            <disp-formula id="Ch1.E43" content-type="numbered"><label>23</label><mml:math id="M316" display="block"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup><mml:mo>=</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo>+</mml:mo><mml:mi mathvariant="italic">α</mml:mi><mml:msubsup><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup><mml:msubsup><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:msub><mml:mi mathvariant="bold-italic">δ</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>+</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo mathsize="1.1em">(</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo>,</mml:mo><mml:msubsup><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup><mml:msubsup><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:msub><mml:mi mathvariant="bold-italic">δ</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

          where <inline-formula><mml:math id="M317" display="inline"><mml:mi mathvariant="italic">α</mml:mi></mml:math></inline-formula> is a trainable scalar. Note that this formulation is mathematically equivalent to the original Eq. (2). This is only meant to explicitly enforce the solution <inline-formula><mml:math id="M318" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> when <inline-formula><mml:math id="M319" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="bold">I</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, which guides the training in its first few epochs.</p>
      <p id="d2e7547">The test RMSEs of those DA methods, over a long DA run, are displayed in Fig. <xref ref-type="fig" rid="F3"/> as a function of <inline-formula><mml:math id="M320" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. Note that <inline-formula><mml:math id="M321" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">0.60</mml:mn></mml:mrow></mml:math></inline-formula> is already very significantly nonlinear as it corresponds to the Lyapunov time of L96, i.e. the time horizon beyond which the DA system becomes significantly non-Gaussian.</p>
      <p id="d2e7578">As expected, the two degraded DAN operators severely underperform the other DA schemes, which leverage non-static priors, with a test RMSE that ranges from <inline-formula><mml:math id="M322" display="inline"><mml:mn mathvariant="normal">0.38</mml:mn></mml:math></inline-formula> for <inline-formula><mml:math id="M323" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">0.05</mml:mn></mml:mrow></mml:math></inline-formula> to an asymptotic RMSE below <inline-formula><mml:math id="M324" display="inline"><mml:mn mathvariant="normal">1</mml:mn></mml:math></inline-formula> for much larger <inline-formula><mml:math id="M325" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. This is consistent with the findings of Boc24 and mirrors the performance of a 3D-Var with static background covariance matrix.</p>
      <p id="d2e7621">The EnKF offers a very good performance in the mildly nonlinear regime <inline-formula><mml:math id="M326" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>≈</mml:mo><mml:mn mathvariant="normal">0.05</mml:mn></mml:mrow></mml:math></inline-formula> but gradually degrades as <inline-formula><mml:math id="M327" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is increased. Moreover, beyond <inline-formula><mml:math id="M328" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">0.80</mml:mn></mml:mrow></mml:math></inline-formula>, the EnKF becomes uninformative and its test RMSE is not reported. As already shown by <xref ref-type="bibr" rid="bib1.bibx59" id="text.61"/>, the IEnKF offers significantly better performance, from a marginal improvement over the EnKF at <inline-formula><mml:math id="M329" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">0.05</mml:mn></mml:mrow></mml:math></inline-formula> that gets more and more significant as <inline-formula><mml:math id="M330" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is increased. Note that, beyond <inline-formula><mml:math id="M331" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">0.60</mml:mn></mml:mrow></mml:math></inline-formula>, the IEnKF is trickier to stabilise and hence its performance is not reported.</p>
      <p id="d2e7710">Remarkably, the boosted DAN operator achieves performance very similar to the IEnKF, but can still be learned for much larger <inline-formula><mml:math id="M332" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, and remains informative with still a very significant edge over the static prior methods. Again, this is achieved without the use of an ensemble but of a single forecast state. Moreover, the learned DAN does not explicitly resort to a nonlinear (Gauss-Newton) iterative minimisation, in contrast to the IEnKF. This aspect of such DAN is reminiscent of approaches meant to learn a solver for a variational DA problem <xref ref-type="bibr" rid="bib1.bibx28 bib1.bibx33 bib1.bibx41 bib1.bibx31 bib1.bibx39" id="paren.62"/>. The baseline DAN operator is slightly less performing but follows the same trend. We could have evaluated the methods for even larger <inline-formula><mml:math id="M333" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>&gt;</mml:mo><mml:mn mathvariant="normal">1.40</mml:mn></mml:mrow></mml:math></inline-formula>; however, <inline-formula><mml:math id="M334" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1.20</mml:mn></mml:mrow></mml:math></inline-formula> already stands for twice the Lyapunov time, which is equivalent to <inline-formula><mml:math id="M335" display="inline"><mml:mn mathvariant="normal">6</mml:mn></mml:math></inline-formula> d in the L96 correspondence.</p>
      <p id="d2e7765">We suspect that the test RMSEs should primarily be a function of <inline-formula><mml:math id="M336" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> rather than just <inline-formula><mml:math id="M337" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, accounting for the forgetful effect associated to the chaotic dynamics. Hence, to reach the same test RMSEs, <inline-formula><mml:math id="M338" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub></mml:mrow></mml:math></inline-formula> could be roughly chosen inversely proportional to <inline-formula><mml:math id="M339" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. To test this hypothesis, we compare the test RMSE on a large number of trained DANs, varying <inline-formula><mml:math id="M340" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> (including for <inline-formula><mml:math id="M341" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>≤</mml:mo><mml:mn mathvariant="normal">0.05</mml:mn></mml:mrow></mml:math></inline-formula>) and <inline-formula><mml:math id="M342" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub></mml:mrow></mml:math></inline-formula> with results shown in Fig. <xref ref-type="fig" rid="F4"/>. Leveraging the findings of Appendix <xref ref-type="sec" rid="App1.Ch1.S2"/> and the use of smaller batches to mitigate the numerical cost, we have chosen for their training, <inline-formula><mml:math id="M343" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msup><mml:mn mathvariant="normal">2</mml:mn><mml:mn mathvariant="normal">16</mml:mn></mml:msup><mml:mo>=</mml:mo><mml:mn mathvariant="normal">65</mml:mn><mml:mspace width="0.125em" linebreak="nobreak"/><mml:mn mathvariant="normal">536</mml:mn></mml:mrow></mml:math></inline-formula> and <inline-formula><mml:math id="M344" display="inline"><mml:mrow><mml:msub><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msup><mml:mn mathvariant="normal">2</mml:mn><mml:mn mathvariant="normal">7</mml:mn></mml:msup><mml:mo>=</mml:mo><mml:mn mathvariant="normal">128</mml:mn></mml:mrow></mml:math></inline-formula>. The test RMSEs are shown in Fig. <xref ref-type="fig" rid="F4"/>. The results corroborate the intuition with the weaker and weaker dependence on <inline-formula><mml:math id="M345" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub></mml:mrow></mml:math></inline-formula> of the performance when <inline-formula><mml:math id="M346" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is increased. Conversely, a much larger <inline-formula><mml:math id="M347" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub></mml:mrow></mml:math></inline-formula> is required when <inline-formula><mml:math id="M348" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> gets very small (<inline-formula><mml:math id="M349" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>≈</mml:mo><mml:mn mathvariant="normal">0.01</mml:mn></mml:mrow></mml:math></inline-formula>).</p>

      <fig id="F4"><label>Figure 4</label><caption><p id="d2e7970">Test RMSEs of DANs as a function of both <inline-formula><mml:math id="M350" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> and <inline-formula><mml:math id="M351" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub></mml:mrow></mml:math></inline-formula>.</p></caption>
          <graphic xlink:href="https://npg.copernicus.org/articles/33/401/2026/npg-33-401-2026-f04.png"/>

        </fig>

      <p id="d2e8001">Hence, DAN is numerically more difficult to train when <inline-formula><mml:math id="M352" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>&lt;</mml:mo><mml:mn mathvariant="normal">0.05</mml:mn></mml:mrow></mml:math></inline-formula> requiring larger <inline-formula><mml:math id="M353" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub></mml:mrow></mml:math></inline-formula>, which corresponds to quasi-linear regimes  where DAN is nonetheless of limited interest.</p>
</sec>
<sec id="Ch1.S4.SS2">
  <label>4.2</label><title>Performance as a function of the energy forcing</title>
      <p id="d2e8038">The forcing <inline-formula><mml:math id="M354" display="inline"><mml:mi>F</mml:mi></mml:math></inline-formula> injects and removes energy from the L96 dynamics and feeds their instability. Besides <inline-formula><mml:math id="M355" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, this is another tunable parameter of the nonlinearity of the dynamics. There is a wealth of dynamical phenomenology of the L96 dynamics for a wide range of <inline-formula><mml:math id="M356" display="inline"><mml:mi>F</mml:mi></mml:math></inline-formula> <xref ref-type="bibr" rid="bib1.bibx6" id="paren.63"><named-content content-type="pre">see, e.g.,</named-content><named-content content-type="post">and references therein</named-content></xref>. For the range of <inline-formula><mml:math id="M357" display="inline"><mml:mi>F</mml:mi></mml:math></inline-formula> we focus on here, instabilities progressively develop in between <inline-formula><mml:math id="M358" display="inline"><mml:mrow><mml:mn mathvariant="normal">1</mml:mn><mml:mo>≲</mml:mo><mml:mi>F</mml:mi><mml:mo>≲</mml:mo><mml:mn mathvariant="normal">4</mml:mn></mml:mrow></mml:math></inline-formula>, while chaos fully sets in beyond <inline-formula><mml:math id="M359" display="inline"><mml:mrow><mml:mi>F</mml:mi><mml:mo>≳</mml:mo><mml:mn mathvariant="normal">4</mml:mn></mml:mrow></mml:math></inline-formula> <xref ref-type="bibr" rid="bib1.bibx64" id="paren.64"/>. The number of Lyapunov exponents, and similarly the Kaplan-Yorke dimension, increases monotonically from <inline-formula><mml:math id="M360" display="inline"><mml:mn mathvariant="normal">4</mml:mn></mml:math></inline-formula> to about <inline-formula><mml:math id="M361" display="inline"><mml:mn mathvariant="normal">30</mml:mn></mml:math></inline-formula> where it saturates <xref ref-type="bibr" rid="bib1.bibx38" id="paren.65"/>.</p>
      <p id="d2e8129">We choose the same setup as in the previous experiments and consider the following DA methods: <list list-type="bullet"><list-item>
      <p id="d2e8134">A well tuned EnKF with an ensemble of size <inline-formula><mml:math id="M362" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">e</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">40</mml:mn></mml:mrow></mml:math></inline-formula>. Optimal multiplicative inflation is addressed through the finite-size EnKF <xref ref-type="bibr" rid="bib1.bibx7 bib1.bibx14" id="paren.66"/>, in its Dirac-Jeffreys variant <xref ref-type="bibr" rid="bib1.bibx14" id="paren.67"/> required to handle the weakly nonlinear regime (<inline-formula><mml:math id="M363" display="inline"><mml:mrow><mml:mn mathvariant="normal">4</mml:mn><mml:mo>≲</mml:mo><mml:mi>F</mml:mi><mml:mo>≲</mml:mo><mml:mn mathvariant="normal">8</mml:mn></mml:mrow></mml:math></inline-formula>).</p></list-item><list-item>
      <p id="d2e8182">A well tuned IEnKF with an ensemble of size <inline-formula><mml:math id="M364" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">e</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">40</mml:mn></mml:mrow></mml:math></inline-formula>, whose optimal multiplicative inflation is addressed through the finite-size IEnKF <xref ref-type="bibr" rid="bib1.bibx11" id="paren.68"/> in its Dirac-Jeffreys variant. This is our hard baseline.</p></list-item><list-item>
      <p id="d2e8211">A (baseline) learned DAN scheme using the neural network and training parameters as defined in Appendix <xref ref-type="sec" rid="App1.Ch1.S2"/>.</p></list-item></list> The test RMSEs are displayed in Fig. <xref ref-type="fig" rid="F5"/>. The IEnKF has a slight edge over the EnKF with larger <inline-formula><mml:math id="M365" display="inline"><mml:mi>F</mml:mi></mml:math></inline-formula> with the increasing Kaplan-Yorke dimension. Hence, the DA system does not deviate much from Gaussianity as <inline-formula><mml:math id="M366" display="inline"><mml:mi>F</mml:mi></mml:math></inline-formula> increases, rather, it is mainly the magnitude of the instabilities that changes. The DAN achieves a performance in between that of the EnKF and that of the IEnKF, which is patent for large <inline-formula><mml:math id="M367" display="inline"><mml:mi>F</mml:mi></mml:math></inline-formula>. Note that it turns out trickier to train DANs for <inline-formula><mml:math id="M368" display="inline"><mml:mi>F</mml:mi></mml:math></inline-formula> getting close to <inline-formula><mml:math id="M369" display="inline"><mml:mn mathvariant="normal">4</mml:mn></mml:math></inline-formula>. There, the dynamics become more and more laminar and exhibit almost periodic waves, with patterns that, although simpler, are very different from those learned in the regimes explored so far.</p>

      <fig id="F5" specific-use="star"><label>Figure 5</label><caption><p id="d2e8257">Test RMSEs of DA methods as a function of the forcing <inline-formula><mml:math id="M370" display="inline"><mml:mi>F</mml:mi></mml:math></inline-formula>. See text for details.</p></caption>
          <graphic xlink:href="https://npg.copernicus.org/articles/33/401/2026/npg-33-401-2026-f05.png"/>

        </fig>


</sec>
<sec id="Ch1.S4.SS3">
  <label>4.3</label><title>Reasons for the efficiency of data assimilation networks</title>
      <p id="d2e8284">In the light of the previous numerical results, we discuss the reasons why DAN can be as accurate as the IEnKF, without an ensemble, without any experimental tuning, and even in mildly to strongly nonlinear conditions.</p>
      <p id="d2e8287">We have already shown in Sect. <xref ref-type="sec" rid="Ch1.S3.SS2"/> that in the mildly nonlinear regime, i.e. <inline-formula><mml:math id="M371" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>≈</mml:mo><mml:mn mathvariant="normal">0.05</mml:mn></mml:mrow></mml:math></inline-formula>, the success of DAN mainly resides in its implicit estimation of the map <inline-formula><mml:math id="M372" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>↦</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>, in line with the results by <xref ref-type="bibr" rid="bib1.bibx57" id="text.69"/> and <xref ref-type="bibr" rid="bib1.bibx58" id="text.70"/>, and closely related to the map <inline-formula><mml:math id="M373" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>↦</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>. As shown in Sect. <xref ref-type="sec" rid="Ch1.S3.SS2.SSS1"/>, this amounts to assume a non-static but Gaussian prior in the analysis: this is equivalent to having <inline-formula><mml:math id="M374" display="inline"><mml:mrow><mml:mo mathsize="1.1em">‖</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>-</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:msubsup><mml:mo mathsize="1.1em">‖</mml:mo><mml:mrow><mml:msup><mml:mfenced close=")" open="("><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup></mml:mrow><mml:mn mathvariant="normal">2</mml:mn></mml:msubsup></mml:mrow></mml:math></inline-formula> as the background term in the analysis cost function. Whether this mechanism is sufficient to ensure the performance of DAN when <inline-formula><mml:math id="M375" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>≥</mml:mo><mml:mn mathvariant="normal">0.05</mml:mn></mml:mrow></mml:math></inline-formula> is doubtful.</p>
<sec id="Ch1.S4.SS3.SSS1">
  <label>4.3.1</label><title>The linear-in-<inline-formula><mml:math id="M376" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> data assimilation network beyond mild nonlinearity</title>
      <p id="d2e8447">To address this question, let us assess the linear-in-<inline-formula><mml:math id="M377" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> DAN, see Sect. <xref ref-type="sec" rid="Ch1.S3.SS2"/>, in stronger nonlinear regimes <inline-formula><mml:math id="M378" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>≥</mml:mo><mml:mn mathvariant="normal">0.05</mml:mn></mml:mrow></mml:math></inline-formula>. We could anticipate that it accounts well for the errors of the day, but that it may not be able to handle stronger nonlinearity/non-Gaussianity, e.g., if <inline-formula><mml:math id="M379" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>≫</mml:mo><mml:mn mathvariant="normal">0.05</mml:mn></mml:mrow></mml:math></inline-formula>, because of the implied Gaussian prior. It should hence match the EnKF, rather than the IEnKF.</p>
      <p id="d2e8489">Let us check that hypothesis numerically. The test RMSEs of this specific DAN scheme, which mirrors Eq. (<xref ref-type="disp-formula" rid="Ch1.E10"/>), are reported in Fig. <xref ref-type="fig" rid="F3"/>, as the linear-in-<inline-formula><mml:math id="M380" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> DAN. Let us first remark that, in accordance with the claims of Sect. <xref ref-type="sec" rid="Ch1.S3.SS2"/>, it performs as well as the EnKF for <inline-formula><mml:math id="M381" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">0.05</mml:mn></mml:mrow></mml:math></inline-formula>. However, as <inline-formula><mml:math id="M382" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> increases, its performance significantly degrades compared to the EnKF, not to mention the IEnKF. Even though it relies on an estimate of the <inline-formula><mml:math id="M383" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>↦</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> map, its underlying Gaussian assumption penalises it  beyond the mildly nonlinear regime, as expected.</p>
</sec>
<sec id="Ch1.S4.SS3.SSS2">
  <label>4.3.2</label><title>Deviation of the data assimilation network prior from Gaussianity</title>
      <p id="d2e8567">We conclude that the full DAN scheme not only exploits the flow-dependent information represented by the <inline-formula><mml:math id="M384" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>↦</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> map, but also learns an effective nonlinear analysis response consistent with a non-Gaussian prior, which is more informative than the Gaussian prior associated to the analysis cost function background term <inline-formula><mml:math id="M385" display="inline"><mml:mrow><mml:mo mathsize="1.1em">‖</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>-</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:msubsup><mml:mo mathsize="1.1em">‖</mml:mo><mml:mrow><mml:msup><mml:mfenced open="(" close=")"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup></mml:mrow><mml:mn mathvariant="normal">2</mml:mn></mml:msubsup></mml:mrow></mml:math></inline-formula>. As shown, both abilities are required for DAN to perform so well in the extended range of mildly to strongly nonlinear regimes.</p>

      <fig id="F6" specific-use="star"><label>Figure 6</label><caption><p id="d2e8644">Scaling of the standardised analysis increments of <inline-formula><mml:math id="M386" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> in the projected innovations, for a large range of <inline-formula><mml:math id="M387" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> values.</p></caption>
            <graphic xlink:href="https://npg.copernicus.org/articles/33/401/2026/npg-33-401-2026-f06.png"/>

          </fig>

      <p id="d2e8675">We investigate the deviation of <inline-formula><mml:math id="M388" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> from the presumed quasi-linearity in <inline-formula><mml:math id="M389" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> by defining the scalar function

              <disp-formula id="Ch1.E44" content-type="numbered"><label>24</label><mml:math id="M390" display="block"><mml:mrow><mml:mi>r</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:mrow></mml:msub><mml:mfenced close="]" open="["><mml:mstyle displaystyle="true"><mml:mfrac style="display"><mml:mrow><mml:mfenced close="∥" open="∥"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:msup><mml:mo>)</mml:mo><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mfenced open="(" close=")"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="italic">λ</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>-</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mn mathvariant="bold">0</mml:mn><mml:mo>)</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:mfenced></mml:mrow><mml:mrow><mml:mfenced open="∥" close="∥"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:msup><mml:mo>)</mml:mo><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mfenced close=")" open="("><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>-</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mn mathvariant="bold">0</mml:mn><mml:mo>)</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:mfenced></mml:mrow></mml:mfrac></mml:mstyle></mml:mfenced><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

            where <inline-formula><mml:math id="M391" display="inline"><mml:mrow><mml:mfenced open="∥" close="∥"><mml:mo>⋅</mml:mo></mml:mfenced></mml:mrow></mml:math></inline-formula> is the Euclidean norm. It depends on a dimensionless scale parameter <inline-formula><mml:math id="M392" display="inline"><mml:mrow><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>&gt;</mml:mo><mml:mn mathvariant="normal">0</mml:mn></mml:mrow></mml:math></inline-formula> and measures deviations from the linearity in <inline-formula><mml:math id="M393" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>. In Eq. (<xref ref-type="disp-formula" rid="Ch1.E44"/>), <inline-formula><mml:math id="M394" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:msup><mml:mo>)</mml:mo><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula> is meant to standardise the deviations from linearity. Indeed, in the quasi-linear regime, we have

              <disp-formula id="Ch1.E45" content-type="numbered"><label>25</label><mml:math id="M395" display="block"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:msup><mml:mo>)</mml:mo><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mfenced open="(" close=")"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="italic">λ</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>-</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mn mathvariant="bold">0</mml:mn><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mo>≈</mml:mo><mml:mi mathvariant="italic">λ</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

            such that <inline-formula><mml:math id="M396" display="inline"><mml:mrow><mml:mi>r</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>)</mml:mo><mml:mo>≃</mml:mo><mml:mi mathvariant="italic">λ</mml:mi></mml:mrow></mml:math></inline-formula> should hold. The ratio <inline-formula><mml:math id="M397" display="inline"><mml:mrow><mml:mi>r</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> is estimated using perturbations as in Boc24: <inline-formula><mml:math id="M398" display="inline"><mml:mi mathvariant="bold">x</mml:mi></mml:math></inline-formula> and <inline-formula><mml:math id="M399" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> are sampled from the forecast state <inline-formula><mml:math id="M400" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> and the projected innovations <inline-formula><mml:math id="M401" display="inline"><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>=</mml:mo><mml:msup><mml:mi mathvariant="bold">H</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:msup><mml:mi mathvariant="bold">R</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold">y</mml:mi><mml:mo>-</mml:mo><mml:msup><mml:mi mathvariant="bold">Hx</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> that are obtained from a long trajectory.</p>
      <p id="d2e9056">The deviation from <inline-formula><mml:math id="M402" display="inline"><mml:mrow><mml:mi>r</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>)</mml:mo><mml:mo>≃</mml:mo><mml:mi mathvariant="italic">λ</mml:mi></mml:mrow></mml:math></inline-formula> is demonstrated in Fig. <xref ref-type="fig" rid="F6"/> with <inline-formula><mml:math id="M403" display="inline"><mml:mrow><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>↦</mml:mo><mml:mi>r</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> plotted for several values of <inline-formula><mml:math id="M404" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> in the range <inline-formula><mml:math id="M405" display="inline"><mml:mrow><mml:mo>[</mml:mo><mml:mn mathvariant="normal">0.05</mml:mn><mml:mo>,</mml:mo><mml:mn mathvariant="normal">1.5</mml:mn><mml:mo>]</mml:mo></mml:mrow></mml:math></inline-formula>. These curves should be appreciated knowing the range of values taken by the projected innovations in a long DA run for the selected values of <inline-formula><mml:math id="M406" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> which, for each <inline-formula><mml:math id="M407" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, points to the relevant range of <inline-formula><mml:math id="M408" display="inline"><mml:mi mathvariant="italic">λ</mml:mi></mml:math></inline-formula> values to consider and which mainly contributes to the computation of <inline-formula><mml:math id="M409" display="inline"><mml:mrow><mml:mi>r</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>. This is shown in Fig. <xref ref-type="fig" rid="F7"/> in the form of histograms of those values. Given the range of innovation values and the logarithmic scale of Fig. <xref ref-type="fig" rid="F6"/>, the most relevant part of the scaling behaviour sits in the range <inline-formula><mml:math id="M410" display="inline"><mml:mrow><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>∈</mml:mo><mml:mo>[</mml:mo><mml:mn mathvariant="normal">1</mml:mn><mml:mo>,</mml:mo><mml:mn mathvariant="normal">10</mml:mn><mml:mo>]</mml:mo></mml:mrow></mml:math></inline-formula>. In this range of the scaling, as seen in Fig. <xref ref-type="fig" rid="F6"/>, the more nonlinear the DA run, the steeper <inline-formula><mml:math id="M411" display="inline"><mml:mrow><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>↦</mml:mo><mml:mi>r</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>:  the innovation impact is stronger than the one expected in the linear regime, especially for large magnitude innovations.</p>

      <fig id="F7" specific-use="star"><label>Figure 7</label><caption><p id="d2e9215">Histograms of the projected innovations' norm, for a large range of <inline-formula><mml:math id="M412" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">Δ</mml:mi><mml:mi>t</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> values.</p></caption>
            <graphic xlink:href="https://npg.copernicus.org/articles/33/401/2026/npg-33-401-2026-f07.png"/>

          </fig>

</sec>
</sec>
</sec>
<sec id="Ch1.S5" sec-type="conclusions">
  <label>5</label><title>Discussion and conclusions</title>
      <p id="d2e9246">In this paper, we have continued to explore the potential of learning sequential DA operators with neural networks for tracking chaotic dynamical systems, following on the initial results and conclusions of Boc24 who built on the concepts of data assimilation networks (DANs) introduced by <xref ref-type="bibr" rid="bib1.bibx48" id="text.71"/> and <xref ref-type="bibr" rid="bib1.bibx18" id="text.72"/>. Assuming the dynamics to be known, the focus is on learning the analysis. Compared to learning the analysis from a dataset of inputs and outputs of DA runs, the training is numerically challenging since the analysis operator is learned through several DA cycles and from trajectories of the dynamics and its observations only.</p>
      <p id="d2e9255">The resulting DANs are robust, in the sense that they do not require inflation or any other correction and regularisation. They can operate without an ensemble and only use the forecast state as prior information. And yet, they are as accurate as a well tuned EnKF in mildly nonlinear regime, and as accurate as a well tuned IEnKF from mildly to strongly nonlinear conditions.</p>
<sec id="Ch1.S5.SS1">
  <label>5.1</label><title>Abilities of data assimilation networks</title>
      <p id="d2e9265">We have previously shown that, to achieve this level of performance, DAN must implicitly learn a map <inline-formula><mml:math id="M413" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>↦</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>, at least in the mildly nonlinear regime. Its existence is supported by a multiplicative ergodic theorem applied to the entire DA process viewed as a dynamical system. The network must implicitly identify spatial local patterns in <inline-formula><mml:math id="M414" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> in order to internally represent components of <inline-formula><mml:math id="M415" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> or <inline-formula><mml:math id="M416" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>, a property that makes the learned DA method scalable.</p>
      <p id="d2e9346">In this paper, we further examined the reliance of DANs on the map <inline-formula><mml:math id="M417" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>↦</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> by constructing an ad hoc learnable DAN that explicitly incorporates this mapping. For the L96 dynamics, we identified an average characteristic local pattern by leveraging both the invariant distribution of the dynamics and the translational symmetry of the model. We also showed that DAN can learn an effective nonlinear analysis response consistent with non-Gaussian prior information inferred from <inline-formula><mml:math id="M418" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula>, and that this nonlinear analysis is necessary for DAN to match the performance of the IEnKF under more stringent nonlinear conditions. In this regime, we demonstrated that implicit or explicit knowledge of the mapping alone is insufficient. Thus, both mechanisms must operate within DAN, paralleling IEnKF's critical reliance on its ensemble for flow-dependent error estimation and on its Gauss-Newton iterative solver to probe departures of the dynamics from linearity.</p>
</sec>
<sec id="Ch1.S5.SS2">
  <label>5.2</label><title>Implication for the end-to-end processors in numerical weather prediction</title>
      <p id="d2e9395">Taken in the context of past DA literature, these results are somewhat surprising. For a long time, it was believed that an ensemble was essential for estimating flow-dependent errors. Moreover, the proper construction of non-Gaussian priors has remained a long-standing challenge, whereas even a simple DAN can rapidly learn an effective nonlinear analysis response consistent with such non-Gaussian information. These findings should inform the (re-)design of future DA algorithms.</p>
      <p id="d2e9398">These considerations have implications for what DAN-like operators are capable of achieving. For example, recently developed end-to-end atmospheric processors <xref ref-type="bibr" rid="bib1.bibx2 bib1.bibx17" id="paren.73"/> that ingest observations and predict future observations, implicitly construct their own internal representation of the system and repeatedly compare this latent state to newly assimilated observations. In doing so, they implicitly learn an analysis operator in their latent space. <xref ref-type="bibr" rid="bib1.bibx43" id="text.74"/> concluded that their processor, GraphDOP, must be able to learn not only a climatological background but also dynamical priors, a result that may seem surprising given that GraphDOP does not rely on any explicit background information. However, in light of our results, GraphDOP can be interpreted as learning a mapping from the 12 h observational snapshot used as input to the processor to a latent representation that contains information analogous to underlying error covariances. Consequently, it must be able to construct its own background, incorporating advanced error statistics that go beyond a mere climatology. This interpretation is consistent with the diagnostic study of <xref ref-type="bibr" rid="bib1.bibx42" id="text.75"/>, who applied classical DA tools, including forecast-sensitivity observation-impact diagnostics, to GraphDOP. Their results suggest that GraphDOP learns physically meaningful spatial relationships and latent Earth-system representations from observations. While this does not show that GraphDOP explicitly estimates a forecast-error covariance, it supports the broader view that end-to-end observation-driven processors can develop DA-like internal representations without being supplied with an explicit background state.</p>
      <p id="d2e9410">This challenges the view that the accuracy of such end-to-end processors is fundamentally limited by the absence of a background (such as a forecast ensemble or climatological information) in their inputs. While an explicit background representation would certainly provide additional information, the extent of the achievable performance gains remains a subtler question.</p>
</sec>
<sec id="Ch1.S5.SS3">
  <label>5.3</label><title>Ensembles, uncertainty quantification, and multiplicative ergodic theorem</title>
      <p id="d2e9422">Our results show that, in the perfect-model filtering setting considered here, an explicit forecast ensemble is not strictly required for a learned analysis operator to extract the flow-dependent information needed to achieve EnKF-like point-estimation accuracy. This conclusion should not be interpreted as a dismissal of ensemble representations in general. Ensembles remain essential for probabilistic forecasting, uncertainty quantification, the diagnosis of model and observation errors, smoothing, risk-sensitive applications, and regimes in which the posterior distribution is strongly non-Gaussian or multi-modal.</p>
      <p id="d2e9425">Moreover, the deterministic analysis operator <inline-formula><mml:math id="M419" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> could itself be used as a building block for ensemble generation. For instance, applying <inline-formula><mml:math id="M420" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> to perturbed innovations would produce a set of analysis states, in a way that is consistent with the local, innovation-dependent interpretation used in, e.g., Appendix <xref ref-type="sec" rid="App1.Ch1.S9"/> to obtain the linear regression approximation of <inline-formula><mml:math id="M421" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> with respect to <inline-formula><mml:math id="M422" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>. Such an analysis ensemble could then be propagated by the forecast model to estimate forecast uncertainty. We have not pursued this probabilistic use of DAN in the present study, since our focus was on point-estimation accuracy, but it represents a natural direction for future work.</p>
      <p id="d2e9470">At a more theoretical level, the success of DAN may be facilitated by the existence, in the present setting, of a sufficiently regular and local dependence of the relevant flow-dependent analysis correction on the forecast state. This should not be taken for granted in general. For example, the multiplicative ergodic theorem ensures that covariant Lyapunov subspaces are defined as measurable functions of the state, for almost every state on the attractor, but it does not guarantee that this state-to-Oseledets-splitting map is continuous, local, or easily learnable from finite data. Other applications beyond DA, such as learning covariant Lyapunov vectors directly from the state, may therefore involve maps with poorer regularity or locality, making them substantially more difficult to learn and possibly less scalable. This question is left for future work.</p>
</sec>
</sec>

      
      </body>
    <back><app-group>

<app id="App1.Ch1.S1">
  <label>Appendix A</label><title>Neural network architecture</title>
      <p id="d2e9486">As described in Boc24, we choose for <inline-formula><mml:math id="M423" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> a basic residual convolutional neural network (CNN) architecture.  A schematic of the CNN architecture is displayed in Fig. <xref ref-type="fig" rid="FA1"/>. It begins with an initial convolution that takes <inline-formula><mml:math id="M424" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">e</mml:mi></mml:msub><mml:mo>+</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:math></inline-formula> channels as inputs and, with <inline-formula><mml:math id="M425" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> filters, outputs <inline-formula><mml:math id="M426" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> channels.  This initial layer is followed by <inline-formula><mml:math id="M427" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> residual blocks. Each one of these blocks is a succession of <inline-formula><mml:math id="M428" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>sb</mml:mtext></mml:msub></mml:mrow></mml:math></inline-formula> sub-blocks.  Each subblock is made of: (i) a convolutional layer with <inline-formula><mml:math id="M429" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> channels as inputs, which has <inline-formula><mml:math id="M430" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> filters and a kernel size <inline-formula><mml:math id="M431" display="inline"><mml:mrow><mml:msub><mml:mi>f</mml:mi><mml:mi mathvariant="normal">v</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> for each of its filter, (ii) a batch normalisation layer, and (iii) an activation function chosen to be Mish <xref ref-type="bibr" rid="bib1.bibx49" id="paren.76"/>. The CNN ends with a final convolutional layer that takes <inline-formula><mml:math id="M432" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> channels as inputs and, with <inline-formula><mml:math id="M433" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">e</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> filters, outputs <inline-formula><mml:math id="M434" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">e</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> channels.  The kernel size of the initial and final channels is <inline-formula><mml:math id="M435" display="inline"><mml:mrow><mml:msub><mml:mi>f</mml:mi><mml:mi mathvariant="normal">v</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>.  Hence, the internal state of the CNN consists of <inline-formula><mml:math id="M436" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> copies of the latent space which we simply choose to be isomorphic to the state space <inline-formula><mml:math id="M437" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="double-struck">R</mml:mi><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula>. In this paper, only <inline-formula><mml:math id="M438" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">e</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:math></inline-formula> is used. For all experiments, the internal architecture parameter values are <inline-formula><mml:math id="M439" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">5</mml:mn></mml:mrow></mml:math></inline-formula>, <inline-formula><mml:math id="M440" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>sb</mml:mtext></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">5</mml:mn></mml:mrow></mml:math></inline-formula>, <inline-formula><mml:math id="M441" display="inline"><mml:mrow><mml:msub><mml:mi>f</mml:mi><mml:mi mathvariant="normal">v</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">5</mml:mn></mml:mrow></mml:math></inline-formula>.</p>

      <fig id="FA1" specific-use="star"><label>Figure A1</label><caption><p id="d2e9732">Architecture of the residual convolutional network where, for this specific illustration, <inline-formula><mml:math id="M442" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">2</mml:mn></mml:mrow></mml:math></inline-formula>, <inline-formula><mml:math id="M443" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>sb</mml:mtext></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">3</mml:mn></mml:mrow></mml:math></inline-formula>. <inline-formula><mml:math id="M444" display="inline"><mml:mrow><mml:msub><mml:mtext>conv</mml:mtext><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mn mathvariant="normal">1</mml:mn></mml:msub><mml:mo>,</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mn mathvariant="normal">2</mml:mn></mml:msub><mml:mo>,</mml:mo><mml:mi>f</mml:mi></mml:mrow></mml:msub></mml:mrow></mml:math></inline-formula> is a generic one-dimensional convolutional layer of dimension <inline-formula><mml:math id="M445" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mn mathvariant="normal">1</mml:mn></mml:msub></mml:mrow></mml:math></inline-formula>, with <inline-formula><mml:math id="M446" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mn mathvariant="normal">2</mml:mn></mml:msub></mml:mrow></mml:math></inline-formula> filters of kernel size <inline-formula><mml:math id="M447" display="inline"><mml:mi>f</mml:mi></mml:math></inline-formula>. See text for more details.</p></caption>
        <graphic xlink:href="https://npg.copernicus.org/articles/33/401/2026/npg-33-401-2026-f08.png"/>

      </fig>

</app>

<app id="App1.Ch1.S2">
  <label>Appendix B</label><title>Sensitivity to the batch size, the size of the datasets, and the backpropagation truncation</title>
      <p id="d2e9835">The key parameters in the design of <inline-formula><mml:math id="M448" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> and especially in its training are: <list list-type="bullet"><list-item>
      <p id="d2e9851">the  number of channels/filters <inline-formula><mml:math id="M449" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> processed by the convolutional neural network (see Appendix <xref ref-type="sec" rid="App1.Ch1.S1"/>). This essentially gives away the complexity of the neural network, how many features it can identify and process.</p></list-item><list-item>
      <p id="d2e9868">the number of trajectory <inline-formula><mml:math id="M450" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> processed in parallel. The larger <inline-formula><mml:math id="M451" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, the more DA runs the neural network can learn from and be made robust against. <inline-formula><mml:math id="M452" display="inline"><mml:mrow><mml:mn mathvariant="normal">10</mml:mn><mml:mspace width="0.125em" linebreak="nobreak"/><mml:mi mathvariant="italic">%</mml:mi></mml:mrow></mml:math></inline-formula> of these are reserved for validation.</p></list-item><list-item>
      <p id="d2e9905">the number of cycles <inline-formula><mml:math id="M453" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub></mml:mrow></mml:math></inline-formula> through which the gradient is computed. This corresponds to the limit imposed by the truncated backpropagation through time. The larger <inline-formula><mml:math id="M454" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub><mml:mo>≪</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">c</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, the better the information transmission from one cycle to the next should be learned, but the more costly and less accurate the gradients.</p></list-item><list-item>
      <p id="d2e9938">the size of the batch <inline-formula><mml:math id="M455" display="inline"><mml:mrow><mml:msub><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. Hence, the number of steps in each epoch is about <inline-formula><mml:math id="M456" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub><mml:mo>/</mml:mo><mml:msub><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> (training and validation).</p></list-item></list> The training parameters <inline-formula><mml:math id="M457" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, <inline-formula><mml:math id="M458" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub></mml:mrow></mml:math></inline-formula>, and to a lesser extend <inline-formula><mml:math id="M459" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">c</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> are the key dimensions specifying how the data are fed to the training schedule as schematised in Fig. <xref ref-type="fig" rid="FB1"/>.</p>

      <fig id="FB1" specific-use="star"><label>Figure B1</label><caption><p id="d2e10009">This schematic describes how data are fed to the training scheme; it must be read from left to right (time arrow). For instance, in epoch <inline-formula><mml:math id="M460" display="inline"><mml:mn mathvariant="normal">2</mml:mn></mml:math></inline-formula>, <inline-formula><mml:math id="M461" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub></mml:mrow></mml:math></inline-formula>-long segments of <inline-formula><mml:math id="M462" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> trajectories feed the training algorithm. The segments are organised and provided in batches of size <inline-formula><mml:math id="M463" display="inline"><mml:mrow><mml:msub><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>.</p></caption>
        <graphic xlink:href="https://npg.copernicus.org/articles/33/401/2026/npg-33-401-2026-f09.png"/>

      </fig>

      <p id="d2e10058">The dependence of the performance of <inline-formula><mml:math id="M464" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> on those parameters was studied in Boc24. The values <inline-formula><mml:math id="M465" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">16</mml:mn></mml:mrow></mml:math></inline-formula>, <inline-formula><mml:math id="M466" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msup><mml:mn mathvariant="normal">2</mml:mn><mml:mn mathvariant="normal">18</mml:mn></mml:msup></mml:mrow></mml:math></inline-formula>, <inline-formula><mml:math id="M467" display="inline"><mml:mrow><mml:msub><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">2048</mml:mn></mml:mrow></mml:math></inline-formula> were chosen for the <inline-formula><mml:math id="M468" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> hyperparameters of the reference setup, as a compromise between training speed and accuracy of the resulting <inline-formula><mml:math id="M469" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. However, the dependence on <inline-formula><mml:math id="M470" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub></mml:mrow></mml:math></inline-formula> and <inline-formula><mml:math id="M471" display="inline"><mml:mrow><mml:msub><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> was barely reported and discussed, so that we focus on them in what follows.</p>
      <p id="d2e10166">Using the reference DA setup, we compute the test RMSE of the DAN schemes as a function of the truncation number <inline-formula><mml:math id="M472" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub></mml:mrow></mml:math></inline-formula>. The results are shown in Fig. <xref ref-type="fig" rid="FB2"/>. As expected, <inline-formula><mml:math id="M473" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub><mml:mo>≤</mml:mo><mml:mn mathvariant="normal">5</mml:mn></mml:mrow></mml:math></inline-formula> prevents DAN from learning an efficient prior that relies on the errors of the day. It is however remarkable that the improvement in the test RMSE as <inline-formula><mml:math id="M474" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub></mml:mrow></mml:math></inline-formula> increases is noticeable up to about <inline-formula><mml:math id="M475" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub><mml:mo>≃</mml:mo><mml:mn mathvariant="normal">40</mml:mn></mml:mrow></mml:math></inline-formula>, which corresponds to about <inline-formula><mml:math id="M476" display="inline"><mml:mn mathvariant="normal">6</mml:mn></mml:math></inline-formula> times the doubling time of the L96 model in the reference setup.</p>

      <fig id="FB2" specific-use="star"><label>Figure B2</label><caption><p id="d2e10233">Test RMSE of DAN as a function of the truncation cycles number <inline-formula><mml:math id="M477" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mtext>iter</mml:mtext></mml:msub><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn><mml:mo>,</mml:mo><mml:mi mathvariant="normal">…</mml:mi><mml:mo>,</mml:mo><mml:mn mathvariant="normal">40</mml:mn></mml:mrow></mml:math></inline-formula> in the truncated backpropagation. For each value of <inline-formula><mml:math id="M478" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">c</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, an ensemble of <inline-formula><mml:math id="M479" display="inline"><mml:mn mathvariant="normal">5</mml:mn></mml:math></inline-formula> <inline-formula><mml:math id="M480" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> operators is learned. Plus and minus one standard deviation of the RMSE are displayed as shades around the RMSE curve.</p></caption>
        <graphic xlink:href="https://npg.copernicus.org/articles/33/401/2026/npg-33-401-2026-f10.png"/>

      </fig>

      <p id="d2e10294">We have also experimented with the batch size <inline-formula><mml:math id="M481" display="inline"><mml:mrow><mml:msub><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> much more thoroughly than in Boc24. We found that using smaller batches is beneficial to the performance of the trained <inline-formula><mml:math id="M482" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. This may also enable reducing the number of trajectories <inline-formula><mml:math id="M483" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> in the dataset. Nonetheless, we empirically found that the number of steps, i.e. <inline-formula><mml:math id="M484" display="inline"><mml:mrow><mml:mo>∼</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub><mml:mo>/</mml:mo><mml:msub><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> in each epoch still needs to remain large to achieve high accuracy. Experimenting, we learned a large set of <inline-formula><mml:math id="M485" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> operators with <inline-formula><mml:math id="M486" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> in the range <inline-formula><mml:math id="M487" display="inline"><mml:mrow><mml:msup><mml:mn mathvariant="normal">2</mml:mn><mml:mn mathvariant="normal">10</mml:mn></mml:msup></mml:mrow></mml:math></inline-formula>–<inline-formula><mml:math id="M488" display="inline"><mml:mrow><mml:msup><mml:mn mathvariant="normal">2</mml:mn><mml:mn mathvariant="normal">18</mml:mn></mml:msup></mml:mrow></mml:math></inline-formula>, while <inline-formula><mml:math id="M489" display="inline"><mml:mrow><mml:msub><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is chosen in the range <inline-formula><mml:math id="M490" display="inline"><mml:mrow><mml:msup><mml:mn mathvariant="normal">2</mml:mn><mml:mn mathvariant="normal">3</mml:mn></mml:msup></mml:mrow></mml:math></inline-formula>–<inline-formula><mml:math id="M491" display="inline"><mml:mrow><mml:msup><mml:mn mathvariant="normal">2</mml:mn><mml:mn mathvariant="normal">8</mml:mn></mml:msup></mml:mrow></mml:math></inline-formula>. The corresponding test RMSEs are plotted as a function of either <inline-formula><mml:math id="M492" display="inline"><mml:mrow><mml:msub><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, as shown in Fig. <xref ref-type="fig" rid="FB3"/>a, or <inline-formula><mml:math id="M493" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> as shown in Fig. <xref ref-type="fig" rid="FB3"/>b.</p>

      <fig id="FB3" specific-use="star"><label>Figure B3</label><caption><p id="d2e10457">Test RMSEs of DAN as a function of the batch size <inline-formula><mml:math id="M494" display="inline"><mml:mrow><mml:msub><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> for a selection of <inline-formula><mml:math id="M495" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> values <bold>(</bold>panel <bold>a)</bold> and as a function of the number of dataset trajectories <inline-formula><mml:math id="M496" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> for a selection of <inline-formula><mml:math id="M497" display="inline"><mml:mrow><mml:msub><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> values <bold>(</bold>panel <bold>b)</bold>. For each pair <inline-formula><mml:math id="M498" display="inline"><mml:mrow><mml:mo>(</mml:mo><mml:msub><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub><mml:mo>,</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>, an ensemble of <inline-formula><mml:math id="M499" display="inline"><mml:mn mathvariant="normal">3</mml:mn></mml:math></inline-formula> <inline-formula><mml:math id="M500" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> operators is learned, from which error bars (plus or minus the standard deviation) are estimated and added to the curve plots.</p></caption>
        <graphic xlink:href="https://npg.copernicus.org/articles/33/401/2026/npg-33-401-2026-f11.png"/>

      </fig>

      <p id="d2e10563">For this specific configuration a scaling law can be numerically estimated. The following Ansatz is assumed:

          <disp-formula id="App1.Ch1.S2.E46" content-type="numbered"><label>B1</label><mml:math id="M501" display="block"><mml:mrow><mml:msup><mml:mtext>RMSE</mml:mtext><mml:mrow><mml:mn mathvariant="normal">1</mml:mn><mml:mo>/</mml:mo><mml:mi mathvariant="italic">γ</mml:mi></mml:mrow></mml:msup><mml:mo>=</mml:mo><mml:mi>f</mml:mi><mml:mfenced close=")" open="("><mml:mstyle displaystyle="true"><mml:mfrac style="display"><mml:mrow><mml:msubsup><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi><mml:mi mathvariant="italic">α</mml:mi></mml:msubsup></mml:mrow><mml:mrow><mml:msubsup><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi><mml:mi mathvariant="italic">β</mml:mi></mml:msubsup></mml:mrow></mml:mfrac></mml:mstyle></mml:mfenced><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

        where <inline-formula><mml:math id="M502" display="inline"><mml:mi>f</mml:mi></mml:math></inline-formula> is a polynomial of order <inline-formula><mml:math id="M503" display="inline"><mml:mn mathvariant="normal">2</mml:mn></mml:math></inline-formula>. This Ansatz (<inline-formula><mml:math id="M504" display="inline"><mml:mn mathvariant="normal">3</mml:mn></mml:math></inline-formula> polynomial coefficients and <inline-formula><mml:math id="M505" display="inline"><mml:mn mathvariant="normal">3</mml:mn></mml:math></inline-formula> exponents) is fitted to the test RMSE results. The fit relevance can be visualised through the plot of <inline-formula><mml:math id="M506" display="inline"><mml:mrow><mml:msup><mml:mi>f</mml:mi><mml:mi mathvariant="italic">γ</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> in Fig. <xref ref-type="fig" rid="FB4"/>. The fitted exponents are <inline-formula><mml:math id="M507" display="inline"><mml:mrow><mml:mi mathvariant="italic">γ</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1.435</mml:mn></mml:mrow></mml:math></inline-formula>, <inline-formula><mml:math id="M508" display="inline"><mml:mrow><mml:mi mathvariant="italic">α</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">0.103</mml:mn></mml:mrow></mml:math></inline-formula>, and <inline-formula><mml:math id="M509" display="inline"><mml:mrow><mml:mi mathvariant="italic">β</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">0.060</mml:mn></mml:mrow></mml:math></inline-formula>. What really matters is the ratio <inline-formula><mml:math id="M510" display="inline"><mml:mrow><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>=</mml:mo><mml:mi mathvariant="italic">β</mml:mi><mml:mo>/</mml:mo><mml:mi mathvariant="italic">α</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">0.58</mml:mn></mml:mrow></mml:math></inline-formula>, since the test RMSE turns out to show a strong dependence on <inline-formula><mml:math id="M511" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub><mml:mo>/</mml:mo><mml:msubsup><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula>.</p>

      <fig id="FB4" specific-use="star"><label>Figure B4</label><caption><p id="d2e10729">Checking the relevance of the functional regression by plotting the fit function <inline-formula><mml:math id="M512" display="inline"><mml:mrow><mml:msup><mml:mi>f</mml:mi><mml:mi mathvariant="italic">γ</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> with respect to <inline-formula><mml:math id="M513" display="inline"><mml:mrow><mml:msubsup><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi><mml:mi mathvariant="italic">α</mml:mi></mml:msubsup><mml:mo>/</mml:mo><mml:msubsup><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi><mml:mi mathvariant="italic">β</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula> (curve), and of the test RMSE results (dots).</p></caption>
        <graphic xlink:href="https://npg.copernicus.org/articles/33/401/2026/npg-33-401-2026-f12.png"/>

      </fig>

      <p id="d2e10771">In practice, the interest of using smaller batches <inline-formula><mml:math id="M514" display="inline"><mml:mrow><mml:msub><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> and hence smaller <inline-formula><mml:math id="M515" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> must be weighted against the overheads created by the dataset pipeline but also by the transfer of the batches from RAM to VRAM. It is however possible to run several training experiments in parallel over the same GPU with smaller batches. Hence, the efficiency of using mini-batches is very dependent on the accelerator device(s) and the type of experiment to conduct. Note that, when training <inline-formula><mml:math id="M516" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> on much higher dimensional systems, relying on mini-batches may become mandatory so as to fit into VRAM.</p>
      <p id="d2e10807">Finally, the scaling law Eq. (<xref ref-type="disp-formula" rid="App1.Ch1.S2.E46"/>) can be leveraged to reduce both <inline-formula><mml:math id="M517" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> and <inline-formula><mml:math id="M518" display="inline"><mml:mrow><mml:msub><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> and still be able to extrapolate to values yielding better test RMSEs, using the dependence on <inline-formula><mml:math id="M519" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub><mml:mo>/</mml:mo><mml:msubsup><mml:mi>S</mml:mi><mml:mi mathvariant="normal">b</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula>. This scaling could nonetheless change with a different DA setup.</p>
</app>

<app id="App1.Ch1.S3">
  <label>Appendix C</label><title>Neural network implementation of the effective <inline-formula><mml:math id="M520" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>↦</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> map</title>
      <p id="d2e10891">Here, we detail how to build the linear-in-<inline-formula><mml:math id="M521" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> DAN meant to enforce Eq. (<xref ref-type="disp-formula" rid="Ch1.E14"/>) in Sect. <xref ref-type="sec" rid="Ch1.S3.SS2"/>. Implementing the map <inline-formula><mml:math id="M522" display="inline"><mml:mrow><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>↦</mml:mo><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mo>⋅</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:mrow></mml:math></inline-formula> as a neural network is non-trivial if we wish to make it scalable. First, <inline-formula><mml:math id="M523" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> is symmetric positive definite; to enforce such constraint, the usual most efficient approach is to write: <inline-formula><mml:math id="M524" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:msup><mml:mo>)</mml:mo><mml:mo>⊺</mml:mo></mml:msup></mml:mrow></mml:math></inline-formula>, where <inline-formula><mml:math id="M525" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> is a matrix of anomalies which may be easier to interpret than <inline-formula><mml:math id="M526" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>. The first difficulty towards scalability is the fact that <inline-formula><mml:math id="M527" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>, or <inline-formula><mml:math id="M528" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>, is of size <inline-formula><mml:math id="M529" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>×</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, which is considered non-scalable. However, if <inline-formula><mml:math id="M530" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> can be approximated as low-rank, then <inline-formula><mml:math id="M531" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mo>≈</mml:mo><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:msup><mml:mo>)</mml:mo><mml:mo>⊺</mml:mo></mml:msup></mml:mrow></mml:math></inline-formula> with <inline-formula><mml:math id="M532" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> of size <inline-formula><mml:math id="M533" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>×</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, with <inline-formula><mml:math id="M534" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> remaining small enough when <inline-formula><mml:math id="M535" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is increased. Unfortunately, <inline-formula><mml:math id="M536" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> should not realistically be considered low-rank. However, one can exploit the locality of the covariances and write <inline-formula><mml:math id="M537" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mo>≈</mml:mo><mml:mi mathvariant="bold-italic">ρ</mml:mi><mml:mo>∘</mml:mo><mml:mfenced close=")" open="("><mml:mrow><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:msup><mml:mo>)</mml:mo><mml:mo>⊺</mml:mo></mml:msup></mml:mrow></mml:mfenced></mml:mrow></mml:math></inline-formula>, where <inline-formula><mml:math id="M538" display="inline"><mml:mi mathvariant="bold-italic">ρ</mml:mi></mml:math></inline-formula> is the localisation correlation matrix and <inline-formula><mml:math id="M539" display="inline"><mml:mo>∘</mml:mo></mml:math></inline-formula> is the Schur/Hadamard product. In addition to making <inline-formula><mml:math id="M540" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> full rank in spite of a manageable number of parameters in <inline-formula><mml:math id="M541" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>, it also tapers spurious correlations that could be learned in the course of the training. Indeed, the implementation of the localisation significantly accelerates the training. This is reminiscent of the proposal by <xref ref-type="bibr" rid="bib1.bibx10" id="text.77"/> to estimate <inline-formula><mml:math id="M542" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> through a loss involving a Schur product with <inline-formula><mml:math id="M543" display="inline"><mml:mi mathvariant="bold-italic">ρ</mml:mi></mml:math></inline-formula>.</p>
      <p id="d2e11409">Furthermore, given <inline-formula><mml:math id="M544" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>=</mml:mo><mml:mi mathvariant="bold-italic">ρ</mml:mi><mml:mo>∘</mml:mo><mml:mfenced open="(" close=")"><mml:mrow><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:msup><mml:mfenced open="(" close=")"><mml:mrow><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup></mml:mrow></mml:mfenced><mml:mo>⊺</mml:mo></mml:msup></mml:mrow></mml:mfenced></mml:mrow></mml:math></inline-formula> and the projected innovation <inline-formula><mml:math id="M545" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>, the implementation of such mapping can be efficiently coded using <xref ref-type="bibr" rid="bib1.bibx27" id="paren.78"><named-content content-type="pre">see, e.g.,</named-content></xref>

          <disp-formula id="App1.Ch1.S3.E47" content-type="numbered"><label>C1</label><mml:math id="M546" display="block"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>⋅</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>=</mml:mo><mml:mi mathvariant="bold-italic">ρ</mml:mi><mml:mo>∘</mml:mo><mml:mfenced open="(" close=")"><mml:mrow><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:msup><mml:mfenced close=")" open="("><mml:mrow><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup></mml:mrow></mml:mfenced><mml:mo>⊺</mml:mo></mml:msup></mml:mrow></mml:mfenced><mml:mo>⋅</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>=</mml:mo><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>l</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub></mml:mrow></mml:munderover><mml:msubsup><mml:mi mathvariant="bold">X</mml:mi><mml:mi>l</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup><mml:mo>∘</mml:mo><mml:mfenced close=")" open="("><mml:mrow><mml:mi mathvariant="bold-italic">ρ</mml:mi><mml:mo>⋅</mml:mo><mml:mfenced open="(" close=")"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">X</mml:mi><mml:mi>l</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup><mml:mo>∘</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:mrow></mml:mfenced></mml:mrow></mml:mfenced><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

        where the <inline-formula><mml:math id="M547" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">X</mml:mi><mml:mi>l</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula> are the columns of <inline-formula><mml:math id="M548" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula>, and <inline-formula><mml:math id="M549" display="inline"><mml:mo>⋅</mml:mo></mml:math></inline-formula> denotes the usual matrix/vector multiplication. The matrix multiplication by the localisation matrix <inline-formula><mml:math id="M550" display="inline"><mml:mi mathvariant="bold-italic">ρ</mml:mi></mml:math></inline-formula> is scalable since <inline-formula><mml:math id="M551" display="inline"><mml:mi mathvariant="bold-italic">ρ</mml:mi></mml:math></inline-formula> is assumed to be a banded matrix. With L96 in mind, i.e. in a one-dimensional context, with a localisation matrix support of (band-)width <inline-formula><mml:math id="M552" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">l</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, the numerical complexity of <inline-formula><mml:math id="M553" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>⋅</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:mrow></mml:math></inline-formula> is <inline-formula><mml:math id="M554" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mn mathvariant="normal">2</mml:mn><mml:mo>+</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">l</mml:mi></mml:msub><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>.</p>
      <p id="d2e11651">If localisation is not useful and <inline-formula><mml:math id="M555" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> is low-rank, then it is easy to implement <inline-formula><mml:math id="M556" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>⋅</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>=</mml:mo><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>⋅</mml:mo><mml:mfenced open="(" close=")"><mml:mrow><mml:msup><mml:mfenced close=")" open="("><mml:mrow><mml:msup><mml:mi mathvariant="bold">X</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup></mml:mrow></mml:mfenced><mml:mo>⊺</mml:mo></mml:msup><mml:mo>⋅</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:mrow></mml:mfenced></mml:mrow></mml:math></inline-formula>, which is reminiscent of the very popular machine learning <italic>attention</italic> mechanism. The numerical complexity is then <inline-formula><mml:math id="M557" display="inline"><mml:mrow><mml:mn mathvariant="normal">2</mml:mn><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">r</mml:mi></mml:msub><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>.</p>
      <p id="d2e11736">An alternative linear-in-<inline-formula><mml:math id="M558" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> DAN is to implement an <italic>hypernetwork</italic> which would map <inline-formula><mml:math id="M559" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> to a set of weights and biases of a linear neural network that would then be applied to <inline-formula><mml:math id="M560" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>. Naively, the number of weights and biases could scale like <inline-formula><mml:math id="M561" display="inline"><mml:mrow><mml:msubsup><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi><mml:mn mathvariant="normal">2</mml:mn></mml:msubsup></mml:mrow></mml:math></inline-formula>. However, we can instead map <inline-formula><mml:math id="M562" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> to weights and biases of a sequence of convolutional neural networks that we later apply to <inline-formula><mml:math id="M563" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>. Yet, we did not test this more sophisticated construction since the former approach is scalable and successful.</p>
</app>

<app id="App1.Ch1.S4">
  <label>Appendix D</label><title>Stein lemma for <inline-formula><mml:math id="M564" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula></title>
      <p id="d2e11833">Here, we offer a proof of the Stein lemma in the degenerate case where the Gaussian density is singular within the embedding space. This is useful with sparse observations resulting in <inline-formula><mml:math id="M565" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> confined within a subspace of <inline-formula><mml:math id="M566" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. This subsumes the full-rank case. Let us assume that <inline-formula><mml:math id="M567" display="inline"><mml:mi mathvariant="italic">ρ</mml:mi></mml:math></inline-formula> is the pdf defined over <inline-formula><mml:math id="M568" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> of the Gaussian random vector <inline-formula><mml:math id="M569" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>, whose mean is <inline-formula><mml:math id="M570" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover></mml:math></inline-formula> and whose covariance matrix is <inline-formula><mml:math id="M571" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> which is assumed positive semi-definite. Hence, the support of <inline-formula><mml:math id="M572" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> may be singular in <inline-formula><mml:math id="M573" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. That is why we resort to the singular value decomposition <inline-formula><mml:math id="M574" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mi mathvariant="bold">U</mml:mi><mml:msub><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">λ</mml:mi></mml:msub><mml:msup><mml:mi mathvariant="bold">U</mml:mi><mml:mo>⊺</mml:mo></mml:msup></mml:mrow></mml:math></inline-formula>, where <inline-formula><mml:math id="M575" display="inline"><mml:mi mathvariant="bold">U</mml:mi></mml:math></inline-formula> is an orthonormal (though not necessarily orthogonal) matrix such that <inline-formula><mml:math id="M576" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">U</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mi mathvariant="bold">U</mml:mi><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="bold">I</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, and <inline-formula><mml:math id="M577" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">λ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is a positive definite diagonal matrix of rank lower or equal to <inline-formula><mml:math id="M578" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>. We can parametrise the random vector <inline-formula><mml:math id="M579" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> by

          <disp-formula id="App1.Ch1.S4.E48" content-type="numbered"><label>D1</label><mml:math id="M580" display="block"><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:mover accent="true"><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mo>+</mml:mo><mml:mi mathvariant="bold">U</mml:mi><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

        where the random vector <inline-formula><mml:math id="M581" display="inline"><mml:mi mathvariant="bold-italic">ω</mml:mi></mml:math></inline-formula> has <inline-formula><mml:math id="M582" display="inline"><mml:mrow><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:mi>n</mml:mi><mml:mo>(</mml:mo><mml:mn mathvariant="bold">0</mml:mn><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">λ</mml:mi></mml:msub><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> for Gaussian pdf. Then, denoting <inline-formula><mml:math id="M583" display="inline"><mml:mrow><mml:mi>f</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> for brevity, we have 

              <disp-formula id="App1.Ch1.S4.E49" specific-use="align" content-type="subnumberedsingle"><mml:math id="M584" display="block"><mml:mtable displaystyle="true"><mml:mtr><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mtext>Cov</mml:mtext></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:msub><mml:mi/><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced close="]" open="["><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>,</mml:mo><mml:mi>f</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:mtd></mml:mtr><mml:mlabeledtr id="App1.Ch1.S4.E49.50"><mml:mtd><mml:mtext>D2a</mml:mtext></mml:mtd><mml:mtd><mml:mstyle class="stylechange" displaystyle="true"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:msub><mml:mtext>Cov</mml:mtext><mml:mrow><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">λ</mml:mi></mml:mrow></mml:msub><mml:mfenced close="]" open="["><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>,</mml:mo><mml:mi>f</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S4.E49.51"><mml:mtd><mml:mtext>D2b</mml:mtext></mml:mtd><mml:mtd><mml:mstyle class="stylechange" displaystyle="true"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace linebreak="nobreak" width="-0.125em"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>-</mml:mo><mml:mover accent="true"><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mo>)</mml:mo><mml:mo>⊗</mml:mo><mml:mfenced open="(" close=")"><mml:mrow><mml:mi>f</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>)</mml:mo><mml:mo>-</mml:mo><mml:mi>f</mml:mi><mml:mo>(</mml:mo><mml:mover accent="true"><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mo>)</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S4.E49.52"><mml:mtd><mml:mtext>D2c</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace linebreak="nobreak" width="-0.125em"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>(</mml:mo><mml:mi mathvariant="bold">U</mml:mi><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>⊗</mml:mo><mml:mi>f</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S4.E49.53"><mml:mtd><mml:mtext>D2d</mml:mtext></mml:mtd><mml:mtd><mml:mstyle class="stylechange" displaystyle="true"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:mi mathvariant="bold">U</mml:mi><mml:msub><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">λ</mml:mi></mml:msub><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo mathsize="1.1em">(</mml:mo><mml:msubsup><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">λ</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>⊗</mml:mo><mml:mi>f</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S4.E49.54"><mml:mtd><mml:mtext>D2e</mml:mtext></mml:mtd><mml:mtd><mml:mstyle class="stylechange" displaystyle="true"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:mo>-</mml:mo><mml:mi mathvariant="bold">U</mml:mi><mml:msub><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">λ</mml:mi></mml:msub><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ω</mml:mi></mml:msub><mml:mi>ln⁡</mml:mi><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>⊗</mml:mo><mml:mi>f</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S4.E49.55"><mml:mtd><mml:mtext>D2f</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:mo>-</mml:mo><mml:mi mathvariant="bold">U</mml:mi><mml:msub><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">λ</mml:mi></mml:msub><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ω</mml:mi></mml:msub><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>⊗</mml:mo><mml:mi>f</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S4.E49.56"><mml:mtd><mml:mtext>D2g</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:mi mathvariant="bold">U</mml:mi><mml:msub><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">λ</mml:mi></mml:msub><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ω</mml:mi></mml:msub><mml:mfenced close=")" open="("><mml:mrow><mml:mi>f</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S4.E49.57"><mml:mtd><mml:mtext>D2h</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:mi mathvariant="bold">U</mml:mi><mml:msub><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">λ</mml:mi></mml:msub><mml:msup><mml:mi mathvariant="bold">U</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mi mathvariant="italic">λ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>(</mml:mo><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:mi>f</mml:mi><mml:mo>)</mml:mo><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S4.E49.58"><mml:mtd><mml:mtext>D2i</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">λ</mml:mi></mml:mrow></mml:msub><mml:mfenced open="[" close="]"><mml:mrow><mml:mo>(</mml:mo><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:mi>f</mml:mi><mml:mo>)</mml:mo><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ω</mml:mi><mml:mo>)</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S4.E49.59"><mml:mtd><mml:mtext>D2j</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced close="]" open="["><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:mi>f</mml:mi></mml:mrow></mml:mfenced><mml:mo>.</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

        Hence, we conclude:

          <disp-formula id="App1.Ch1.S4.E60" content-type="numbered"><label>D3</label><mml:math id="M585" display="block"><mml:mrow><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced open="[" close="]"><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:mi>f</mml:mi></mml:mrow></mml:mfenced><mml:mo>=</mml:mo><mml:msubsup><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>†</mml:mo></mml:msubsup><mml:msub><mml:mtext>Cov</mml:mtext><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced close="]" open="["><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>,</mml:mo><mml:mi>f</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

        where <inline-formula><mml:math id="M586" display="inline"><mml:mrow><mml:mo>(</mml:mo><mml:mo>⋅</mml:mo><mml:msup><mml:mo>)</mml:mo><mml:mo>†</mml:mo></mml:msup></mml:mrow></mml:math></inline-formula> is the Moore-Penrose inverse operator, which comes with the regularisation choice to taper <inline-formula><mml:math id="M587" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced close="]" open="["><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:mi>f</mml:mi></mml:mrow></mml:mfenced></mml:mrow></mml:math></inline-formula> outside of the range of <inline-formula><mml:math id="M588" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>. Applied to <inline-formula><mml:math id="M589" display="inline"><mml:mrow><mml:mi>f</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>, this yields:
        

          <disp-formula id="App1.Ch1.S4.E61.62" content-type="subnumberedon"><label>D4a</label><mml:math id="M590" display="block"><mml:mrow><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced close="]" open="["><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mo>=</mml:mo><mml:msubsup><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>†</mml:mo></mml:msubsup><mml:msub><mml:mtext>Cov</mml:mtext><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced close="]" open="["><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

        which, if <inline-formula><mml:math id="M591" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is full rank, can be written (usual Stein lemma)

          <disp-formula id="App1.Ch1.S4.E61.63" content-type="subnumberedoff"><label>D4b</label><mml:math id="M592" display="block"><mml:mrow><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced open="[" close="]"><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mo>=</mml:mo><mml:msubsup><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:msub><mml:mtext>Cov</mml:mtext><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced open="[" close="]"><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula></p>
</app>

<app id="App1.Ch1.S5">
  <label>Appendix E</label><title>Comparing the empirical and theoretical mean marginal gains</title>
      <p id="d2e13042">In Sect. <xref ref-type="sec" rid="Ch1.S3.SS3"/>, we showed that the theoretical mean marginal gain <inline-formula><mml:math id="M593" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover></mml:math></inline-formula> is expected to be a good approximation of the less simple theoretical mean

          <disp-formula id="App1.Ch1.S5.E64" content-type="numbered"><label>E1</label><mml:math id="M594" display="block"><mml:mrow><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo stretchy="true" mathvariant="normal">̃</mml:mo></mml:mover><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mspace linebreak="nobreak" width="0.125em"/><mml:mi mathvariant="italic">π</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula>

        The latter can now be related to the empirical mean of <inline-formula><mml:math id="M595" display="inline"><mml:mi mathvariant="bold">Γ</mml:mi></mml:math></inline-formula> over a long DA run, denoted <inline-formula><mml:math id="M596" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo stretchy="true" mathvariant="normal">^</mml:mo></mml:mover></mml:math></inline-formula>, and which is obtained from numerical experiments. This is meant to ensure that a pattern emerging from our approximation of <inline-formula><mml:math id="M597" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover></mml:math></inline-formula>, is nonetheless consistent with those learned through <inline-formula><mml:math id="M598" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> over the training DA dataset. Hence, given a long trajectory of true states and projected innovations <inline-formula><mml:math id="M599" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="script">T</mml:mi><mml:mrow><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:mrow></mml:msub><mml:mo>=</mml:mo><mml:mo mathsize="1.1em" mathvariant="italic">{</mml:mo><mml:mo mathsize="1.1em">(</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo mathsize="1.1em">)</mml:mo><mml:msub><mml:mo mathsize="1.1em" mathvariant="italic">}</mml:mo><mml:mrow><mml:mi>k</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn><mml:mo>,</mml:mo><mml:mi mathvariant="normal">…</mml:mi><mml:mo>,</mml:mo><mml:mi>K</mml:mi></mml:mrow></mml:msub><mml:mo>⊂</mml:mo><mml:mo>(</mml:mo><mml:msub><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>×</mml:mo><mml:msub><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:msup><mml:mo>)</mml:mo><mml:mi>K</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula>, the empirical sensitivity associated to <inline-formula><mml:math id="M600" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo stretchy="true" mathvariant="normal">̃</mml:mo></mml:mover></mml:math></inline-formula>, and hence <inline-formula><mml:math id="M601" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover></mml:math></inline-formula>, should be 

              <disp-formula id="App1.Ch1.S5.E65" specific-use="align" content-type="subnumberedsingle"><mml:math id="M602" display="block"><mml:mtable displaystyle="true"><mml:mlabeledtr id="App1.Ch1.S5.E65.66"><mml:mtd><mml:mtext>E2a</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal" stretchy="true">^</mml:mo></mml:mover></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:mo>〈</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:msub><mml:mo>〉</mml:mo><mml:mrow><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>∈</mml:mo><mml:msub><mml:mi mathvariant="script">T</mml:mi><mml:mrow><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:mrow></mml:msub></mml:mrow></mml:msub></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S5.E65.67"><mml:mtd><mml:mtext>E2b</mml:mtext></mml:mtd><mml:mtd><mml:mstyle class="stylechange" displaystyle="true"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:munder><mml:mo>=</mml:mo><mml:mrow><mml:mi>K</mml:mi><mml:mo>→</mml:mo><mml:mi mathvariant="normal">∞</mml:mi></mml:mrow></mml:munder><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mspace width="0.125em" linebreak="nobreak"/><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

        where <inline-formula><mml:math id="M603" display="inline"><mml:mrow><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> is the joint distribution of <inline-formula><mml:math id="M604" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> and <inline-formula><mml:math id="M605" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>. However, <inline-formula><mml:math id="M606" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> not only depends on <inline-formula><mml:math id="M607" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula> but also on the forecast <inline-formula><mml:math id="M608" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula>, so that:

          <disp-formula id="App1.Ch1.S5.E68" content-type="numbered"><label>E3</label><mml:math id="M609" display="block"><mml:mrow><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo stretchy="true" mathvariant="normal">^</mml:mo></mml:mover><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mi mathvariant="normal">d</mml:mi><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mspace linebreak="nobreak" width="0.125em"/><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

        or, introducing the forecast error <inline-formula><mml:math id="M610" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>-</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula>,

          <disp-formula id="App1.Ch1.S5.E69" content-type="numbered"><label>E4</label><mml:math id="M611" display="block"><mml:mrow><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal" stretchy="true">^</mml:mo></mml:mover><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace linebreak="nobreak" width="-0.125em"/><mml:mi mathvariant="normal">d</mml:mi><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mi mathvariant="normal">d</mml:mi><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mspace width="0.125em" linebreak="nobreak"/><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>+</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula>

        By marginalising over <inline-formula><mml:math id="M612" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula>, we have
        

              <disp-formula id="App1.Ch1.S5.E70" specific-use="align" content-type="subnumberedsingle"><mml:math id="M613" display="block"><mml:mtable displaystyle="true"><mml:mlabeledtr id="App1.Ch1.S5.E70.71"><mml:mtd><mml:mtext>E5a</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal" stretchy="true">^</mml:mo></mml:mover></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace linebreak="nobreak" width="-0.125em"/><mml:mi mathvariant="normal">d</mml:mi><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mi mathvariant="italic">π</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace linebreak="nobreak" width="-0.125em"/><mml:mi mathvariant="normal">d</mml:mi><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mspace linebreak="nobreak" width="0.125em"/><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>|</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>+</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S5.E70.72"><mml:mtd><mml:mtext>E5b</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mi mathvariant="italic">π</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace linebreak="nobreak" width="-0.125em"/><mml:mi mathvariant="normal">d</mml:mi><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mspace linebreak="nobreak" width="0.125em"/><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>|</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>|</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>+</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S5.E70.73"><mml:mtd><mml:mtext>E5c</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>≈</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mi mathvariant="italic">π</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mspace linebreak="nobreak" width="0.125em"/><mml:mo mathsize="1.1em">[</mml:mo><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>|</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>+</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:msub><mml:mo mathsize="1.1em">]</mml:mo><mml:mrow><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>=</mml:mo><mml:mn mathvariant="bold">0</mml:mn></mml:mrow></mml:msub></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S5.E70.74"><mml:mtd><mml:mtext>E5d</mml:mtext></mml:mtd><mml:mtd><mml:mstyle class="stylechange" displaystyle="true"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mi mathvariant="italic">π</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mspace linebreak="nobreak" width="0.125em"/><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo stretchy="true" mathvariant="normal">̃</mml:mo></mml:mover><mml:mo>.</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

        From Eq. (<xref ref-type="disp-formula" rid="App1.Ch1.S5.E70.71"/>) to Eq. (<xref ref-type="disp-formula" rid="App1.Ch1.S5.E70.72"/>), we use <inline-formula><mml:math id="M614" display="inline"><mml:mrow><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>|</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>|</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>|</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> since the full dependence of <inline-formula><mml:math id="M615" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> on <inline-formula><mml:math id="M616" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> is in <inline-formula><mml:math id="M617" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula>. From Eq. (<xref ref-type="disp-formula" rid="App1.Ch1.S5.E70.72"/>) to Eq. (<xref ref-type="disp-formula" rid="App1.Ch1.S5.E70.73"/>), we assume that the forecast error norm is small compared to the norm of <inline-formula><mml:math id="M618" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula>, which should indeed be the case in the weak assimilation regime. From Eq. (<xref ref-type="disp-formula" rid="App1.Ch1.S5.E70.73"/>) to Eq. (<xref ref-type="disp-formula" rid="App1.Ch1.S5.E70.74"/>), we approximate <inline-formula><mml:math id="M619" display="inline"><mml:mrow><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>|</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>=</mml:mo><mml:mn mathvariant="bold">0</mml:mn><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> by the marginal <inline-formula><mml:math id="M620" display="inline"><mml:mrow><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>. This points to the (reasonable) approximations made when identifying <inline-formula><mml:math id="M621" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal" stretchy="true">̃</mml:mo></mml:mover></mml:math></inline-formula>, Eq. (<xref ref-type="disp-formula" rid="App1.Ch1.S5.E64"/>), with the empirical marginal gain <inline-formula><mml:math id="M622" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo stretchy="true" mathvariant="normal">^</mml:mo></mml:mover></mml:math></inline-formula>, <inline-formula><mml:math id="M623" display="inline"><mml:mrow><mml:mo>〈</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:msub><mml:mo>〉</mml:mo><mml:mrow><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>∈</mml:mo><mml:msub><mml:mi mathvariant="script">T</mml:mi><mml:mrow><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:mrow></mml:msub></mml:mrow></mml:msub></mml:mrow></mml:math></inline-formula>, emerging from a long DA run.</p>
      <p id="d2e14289">Moreover, a formal expression for <inline-formula><mml:math id="M624" display="inline"><mml:mrow><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>|</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> which appeared in the previous derivation is

              <disp-formula specific-use="align" content-type="numbered"><mml:math id="M625" display="block"><mml:mtable displaystyle="true"><mml:mtr><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>|</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace width="-0.125em" linebreak="nobreak"/><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ε</mml:mi><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold">H</mml:mi><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold">R</mml:mi><mml:mspace width="0.125em" linebreak="nobreak"/><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ε</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold">H</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold">R</mml:mi><mml:mo>|</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:mtd></mml:mtr><mml:mlabeledtr id="App1.Ch1.S5.E75"><mml:mtd><mml:mtext>E6</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>×</mml:mo><mml:mi mathvariant="italic">δ</mml:mi><mml:mo mathsize="1.1em">(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>-</mml:mo><mml:msup><mml:mi mathvariant="bold">H</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:msup><mml:mi mathvariant="bold">R</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ε</mml:mi><mml:mo>-</mml:mo><mml:msup><mml:mi mathvariant="bold">He</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

        where <inline-formula><mml:math id="M626" display="inline"><mml:mrow><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ε</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold">H</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold">R</mml:mi><mml:mo>|</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> is the pdf of the joint distribution for the observation error <inline-formula><mml:math id="M627" display="inline"><mml:mi mathvariant="bold-italic">ε</mml:mi></mml:math></inline-formula>, the observation operator <inline-formula><mml:math id="M628" display="inline"><mml:mi mathvariant="bold">H</mml:mi></mml:math></inline-formula>, and the observation error covariance matrix <inline-formula><mml:math id="M629" display="inline"><mml:mi mathvariant="bold">R</mml:mi></mml:math></inline-formula>, given the forecast error <inline-formula><mml:math id="M630" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula>. Marginalising over <inline-formula><mml:math id="M631" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula>, we obtain
        

              <disp-formula id="App1.Ch1.S5.E76" specific-use="align" content-type="subnumberedsingle"><mml:math id="M632" display="block"><mml:mtable displaystyle="true"><mml:mlabeledtr id="App1.Ch1.S5.E76.77"><mml:mtd><mml:mtext>E7a</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace linebreak="nobreak" width="-0.125em"/><mml:mi mathvariant="normal">d</mml:mi><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mspace width="0.125em" linebreak="nobreak"/><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>|</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mtr><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:mo movablelimits="false">∫</mml:mo><mml:mspace linebreak="nobreak" width="-0.125em"/><mml:mi mathvariant="normal">d</mml:mi><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold-italic">ε</mml:mi><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold">H</mml:mi><mml:mi mathvariant="normal">d</mml:mi><mml:mi mathvariant="bold">R</mml:mi><mml:mspace width="0.125em" linebreak="nobreak"/><mml:mi>p</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">e</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ε</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold">H</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold">R</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mtd></mml:mtr><mml:mlabeledtr id="App1.Ch1.S5.E76.78"><mml:mtd><mml:mtext>E7b</mml:mtext></mml:mtd><mml:mtd><mml:mstyle class="stylechange" displaystyle="true"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>×</mml:mo><mml:mi mathvariant="italic">δ</mml:mi><mml:mo mathsize="1.1em">(</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>-</mml:mo><mml:msup><mml:mi mathvariant="bold">H</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:msup><mml:mi mathvariant="bold">R</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">ε</mml:mi><mml:mo>-</mml:mo><mml:msup><mml:mi mathvariant="bold">He</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:mo>)</mml:mo><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>.</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

        This expression is helpful to formally investigate the symmetries of the distribution of <inline-formula><mml:math id="M633" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>, for which Eq. (<xref ref-type="disp-formula" rid="Ch1.E34"/>) applies.</p>
</app>

<app id="App1.Ch1.S6">
  <label>Appendix F</label><title>Proof of the equivariance of the marginal gain tensor</title>
      <p id="d2e14700">We wish to prove the equivariance of the marginal gain tensor, i.e. that for all <inline-formula><mml:math id="M634" display="inline"><mml:mi mathvariant="bold">x</mml:mi></mml:math></inline-formula> and <inline-formula><mml:math id="M635" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>, <inline-formula><mml:math id="M636" display="inline"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:mi>g</mml:mi><mml:mo>⊗</mml:mo><mml:msup><mml:mi>g</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo>⊗</mml:mo><mml:msup><mml:mi>g</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo>∘</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>, under the action of an isometry <inline-formula><mml:math id="M637" display="inline"><mml:mrow><mml:mi>g</mml:mi><mml:mo>∈</mml:mo><mml:mi mathvariant="script">G</mml:mi></mml:mrow></mml:math></inline-formula>. The action of <inline-formula><mml:math id="M638" display="inline"><mml:mi>g</mml:mi></mml:math></inline-formula> on either state vector <inline-formula><mml:math id="M639" display="inline"><mml:mi mathvariant="bold">x</mml:mi></mml:math></inline-formula> or <inline-formula><mml:math id="M640" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> is represented by an orthogonal matrix <inline-formula><mml:math id="M641" display="inline"><mml:mi mathvariant="bold">G</mml:mi></mml:math></inline-formula>: <inline-formula><mml:math id="M642" display="inline"><mml:mrow><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>=</mml:mo><mml:mi mathvariant="bold">Gx</mml:mi></mml:mrow></mml:math></inline-formula>, <inline-formula><mml:math id="M643" display="inline"><mml:mrow><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>=</mml:mo><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:mrow></mml:math></inline-formula>.</p>
      <p id="d2e14852">We say that <inline-formula><mml:math id="M644" display="inline"><mml:mi>g</mml:mi></mml:math></inline-formula> preserves the fibres (preimages) of <inline-formula><mml:math id="M645" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> if, for all <inline-formula><mml:math id="M646" display="inline"><mml:mi mathvariant="bold">x</mml:mi></mml:math></inline-formula>, <inline-formula><mml:math id="M647" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mo>′</mml:mo></mml:msup></mml:mrow></mml:math></inline-formula> such that <inline-formula><mml:math id="M648" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mo>′</mml:mo></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> one has <inline-formula><mml:math id="M649" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:msup><mml:mi mathvariant="bold">x</mml:mi><mml:mo>′</mml:mo></mml:msup><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>. An isometry <inline-formula><mml:math id="M650" display="inline"><mml:mrow><mml:msub><mml:mi>g</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> defined over the observation space of <inline-formula><mml:math id="M651" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> can then be associated to such <inline-formula><mml:math id="M652" display="inline"><mml:mi>g</mml:mi></mml:math></inline-formula> through <inline-formula><mml:math id="M653" display="inline"><mml:mrow><mml:msub><mml:mi>g</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:mo>∘</mml:mo><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:msup><mml:mi>g</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo>∘</mml:mo><mml:mo>(</mml:mo><mml:mo>⋅</mml:mo><mml:mo>)</mml:mo><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mo>⋅</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>. The action of such induced isometry <inline-formula><mml:math id="M654" display="inline"><mml:mrow><mml:msub><mml:mi>g</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is represented by the orthogonal matrix <inline-formula><mml:math id="M655" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>: <inline-formula><mml:math id="M656" display="inline"><mml:mrow><mml:msub><mml:mi>g</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:mo>∘</mml:mo><mml:mi mathvariant="bold">y</mml:mi><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:mi mathvariant="bold">y</mml:mi></mml:mrow></mml:math></inline-formula>. Because <inline-formula><mml:math id="M657" display="inline"><mml:mi mathvariant="bold">G</mml:mi></mml:math></inline-formula> and <inline-formula><mml:math id="M658" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> are orthogonal, one has <inline-formula><mml:math id="M659" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">G</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mo>=</mml:mo><mml:msup><mml:mi mathvariant="bold">G</mml:mi><mml:mo>⊺</mml:mo></mml:msup></mml:mrow></mml:math></inline-formula> and <inline-formula><mml:math id="M660" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:mo>=</mml:mo><mml:msubsup><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup></mml:mrow></mml:math></inline-formula>.</p>
      <p id="d2e15156">With these definitions in hand, we consider a maximal group of isometries <inline-formula><mml:math id="M661" display="inline"><mml:mi mathvariant="script">G</mml:mi></mml:math></inline-formula> defined over the state space such that <list list-type="bullet"><list-item>
      <p id="d2e15168"><inline-formula><mml:math id="M662" display="inline"><mml:mi mathvariant="script">G</mml:mi></mml:math></inline-formula> preserves the fibres of all <inline-formula><mml:math id="M663" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, inducing a group of isometries <inline-formula><mml:math id="M664" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="script">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> (possibly for each <inline-formula><mml:math id="M665" display="inline"><mml:mi>k</mml:mi></mml:math></inline-formula>). <inline-formula><mml:math id="M666" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="script">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is isomorphic to <inline-formula><mml:math id="M667" display="inline"><mml:mi mathvariant="script">G</mml:mi></mml:math></inline-formula>,</p></list-item><list-item>
      <p id="d2e15225">the associated <inline-formula><mml:math id="M668" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="script">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> satisfies <inline-formula><mml:math id="M669" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:msubsup><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, which accounts for any heteroscedasticity of the observation error statistics,</p></list-item><list-item>
      <p id="d2e15270"><inline-formula><mml:math id="M670" display="inline"><mml:mi mathvariant="script">G</mml:mi></mml:math></inline-formula> commutes with the autonomous dynamics, i.e. <inline-formula><mml:math id="M671" display="inline"><mml:mrow><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="script">M</mml:mi><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">G</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo>(</mml:mo><mml:mo>⋅</mml:mo><mml:mo>)</mml:mo><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:mi mathvariant="script">M</mml:mi><mml:mo>(</mml:mo><mml:mo>⋅</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>.</p></list-item></list> A consequence of the equivariance with respect to <inline-formula><mml:math id="M672" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, i.e. <inline-formula><mml:math id="M673" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mfenced close=")" open="("><mml:mrow><mml:msup><mml:mi mathvariant="bold">G</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo>(</mml:mo><mml:mo>⋅</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mo>⋅</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>, is <inline-formula><mml:math id="M674" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:msup><mml:mi mathvariant="bold">G</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, readily obtained by differentiation.<fn id="App1.Ch1.Footn1"><p id="d2e15398">A simplifying classical trick would be to consider that the physical system is fully observed at any time, with observation error variances that can take infinite values in the absence of observations, which would shift the observation equivariance constraint onto that of its statistics.</p></fn> Coming back to the proof of the equivariance we first consider the optimisation problem that defines <inline-formula><mml:math id="M675" display="inline"><mml:mrow><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>↦</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> for any <inline-formula><mml:math id="M676" display="inline"><mml:mi>g</mml:mi></mml:math></inline-formula> in such <inline-formula><mml:math id="M677" display="inline"><mml:mi mathvariant="script">G</mml:mi></mml:math></inline-formula>:
        

              <disp-formula id="App1.Ch1.S6.E79" specific-use="align" content-type="subnumberedsingle"><mml:math id="M678" display="block"><mml:mtable displaystyle="true"><mml:mlabeledtr id="App1.Ch1.S6.E79.80"><mml:mtd><mml:mtext>F1a</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mi mathvariant="script">L</mml:mi><mml:mo mathsize="1.1em">(</mml:mo><mml:mi mathvariant="bold-italic">θ</mml:mi><mml:mo mathsize="1.1em">|</mml:mo><mml:mo mathvariant="italic" mathsize="1.1em">{</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo mathvariant="italic" mathsize="1.1em">}</mml:mo><mml:mo mathsize="1.1em">)</mml:mo></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>k</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mi>K</mml:mi></mml:munderover><mml:msup><mml:mfenced open="∥" close="∥"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>-</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">θ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mn mathvariant="normal">2</mml:mn></mml:msup><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S6.E79.81"><mml:mtd><mml:mtext>F1b</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo>+</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo mathsize="1.1em">(</mml:mo><mml:msubsup><mml:mi mathvariant="bold">Gx</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo>,</mml:mo><mml:mi mathvariant="bold">G</mml:mi><mml:msub><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S6.E79.82"><mml:mtd><mml:mtext>F1c</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:msub><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:msubsup><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup><mml:msubsup><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:mo mathsize="1.1em">(</mml:mo><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>-</mml:mo><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo mathsize="1.1em">(</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo mathsize="1.1em">)</mml:mo><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S6.E79.83"><mml:mtd><mml:mtext>F1d</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mrow><mml:mi>k</mml:mi><mml:mo>+</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:mi mathvariant="script">M</mml:mi><mml:mo mathsize="1.1em">(</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

        which is equivalent to
        

              <disp-formula id="App1.Ch1.S6.E84" specific-use="align" content-type="subnumberedsingle"><mml:math id="M679" display="block"><mml:mtable displaystyle="true"><mml:mlabeledtr id="App1.Ch1.S6.E84.85"><mml:mtd><mml:mtext>F2a</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mi mathvariant="script">L</mml:mi><mml:mo mathsize="1.1em">(</mml:mo><mml:mi mathvariant="bold-italic">θ</mml:mi><mml:mo mathsize="1.1em">|</mml:mo><mml:mo mathsize="1.1em" mathvariant="italic">{</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo mathsize="1.1em" mathvariant="italic">}</mml:mo><mml:mo mathsize="1.1em">)</mml:mo></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>k</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mi>K</mml:mi></mml:munderover><mml:msup><mml:mfenced open="∥" close="∥"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">Gx</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>-</mml:mo><mml:msubsup><mml:mi mathvariant="bold">Gx</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">θ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mn mathvariant="normal">2</mml:mn></mml:msup><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S6.E84.86"><mml:mtd><mml:mtext>F2b</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:msubsup><mml:mi mathvariant="bold">Gx</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:msubsup><mml:mi mathvariant="bold">Gx</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo>+</mml:mo><mml:msub><mml:mi mathvariant="bold">Ga</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo mathsize="1.1em">(</mml:mo><mml:msubsup><mml:mi mathvariant="bold">Gx</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo>,</mml:mo><mml:mi mathvariant="bold">G</mml:mi><mml:msub><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mtr><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mi mathvariant="bold">G</mml:mi><mml:msub><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:msubsup><mml:mi mathvariant="bold">GH</mml:mi><mml:mi>k</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup><mml:msubsup><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:msubsup><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:msubsup><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub></mml:mrow></mml:mtd></mml:mtr><mml:mlabeledtr id="App1.Ch1.S6.E84.87"><mml:mtd><mml:mtext>F2c</mml:mtext></mml:mtd><mml:mtd><mml:mstyle class="stylechange" displaystyle="true"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>×</mml:mo><mml:mo mathsize="1.1em">(</mml:mo><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>-</mml:mo><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo mathsize="1.1em">(</mml:mo><mml:msup><mml:mi mathvariant="bold">G</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:msubsup><mml:mi mathvariant="bold">Gx</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo mathsize="1.1em">)</mml:mo><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S6.E84.88"><mml:mtd><mml:mtext>F2d</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:msubsup><mml:mi mathvariant="bold">Gx</mml:mi><mml:mrow><mml:mi>k</mml:mi><mml:mo>+</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="script">M</mml:mi><mml:mo mathsize="1.1em">(</mml:mo><mml:msup><mml:mi mathvariant="bold">G</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:msubsup><mml:mi mathvariant="bold">Gx</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

        
        where Eq. (<xref ref-type="disp-formula" rid="App1.Ch1.S6.E84.85"/>) is obtained from Eq. (<xref ref-type="disp-formula" rid="App1.Ch1.S6.E79.80"/>) because <inline-formula><mml:math id="M680" display="inline"><mml:mi mathvariant="bold">G</mml:mi></mml:math></inline-formula> is orthogonal, and Eqs. (<xref ref-type="disp-formula" rid="App1.Ch1.S6.E84.86"/>, <xref ref-type="disp-formula" rid="App1.Ch1.S6.E84.87"/>, <xref ref-type="disp-formula" rid="App1.Ch1.S6.E84.88"/>) are obtained from a multiplication on the left by <inline-formula><mml:math id="M681" display="inline"><mml:mi mathvariant="bold">G</mml:mi></mml:math></inline-formula> and insertion of <inline-formula><mml:math id="M682" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">G</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mi mathvariant="bold">G</mml:mi><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="bold">I</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> and <inline-formula><mml:math id="M683" display="inline"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="bold">I</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> in Eqs. (<xref ref-type="disp-formula" rid="App1.Ch1.S6.E79.81"/>, <xref ref-type="disp-formula" rid="App1.Ch1.S6.E79.82"/>, <xref ref-type="disp-formula" rid="App1.Ch1.S6.E79.83"/>). Hence, denoting <inline-formula><mml:math id="M684" display="inline"><mml:mrow><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="bold">x</mml:mi><mml:mo stretchy="false" mathvariant="normal">̃</mml:mo></mml:mover><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup><mml:mo>=</mml:mo><mml:msubsup><mml:mi mathvariant="bold">Gx</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula>, <inline-formula><mml:math id="M685" display="inline"><mml:mrow><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="bold">x</mml:mi><mml:mo stretchy="false" mathvariant="normal">̃</mml:mo></mml:mover><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo>=</mml:mo><mml:msubsup><mml:mi mathvariant="bold">Gx</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula>, <inline-formula><mml:math id="M686" display="inline"><mml:mrow><mml:msub><mml:mover accent="true"><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo stretchy="false" mathvariant="normal">̃</mml:mo></mml:mover><mml:mi>k</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mi mathvariant="bold">G</mml:mi><mml:msub><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, the problem is reformulated as
        

              <disp-formula id="App1.Ch1.S6.E89" specific-use="align" content-type="subnumberedsingle"><mml:math id="M687" display="block"><mml:mtable displaystyle="true"><mml:mlabeledtr id="App1.Ch1.S6.E89.90"><mml:mtd><mml:mtext>F3a</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mi mathvariant="script">L</mml:mi><mml:mo mathsize="1.1em">(</mml:mo><mml:mi mathvariant="bold-italic">θ</mml:mi><mml:mo mathsize="1.1em">|</mml:mo><mml:mo mathvariant="italic" mathsize="1.1em">{</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo mathvariant="italic" mathsize="1.1em">}</mml:mo><mml:mo mathsize="1.1em">)</mml:mo></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>k</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mi>K</mml:mi></mml:munderover><mml:msup><mml:mfenced close="∥" open="∥"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">Gx</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>-</mml:mo><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="bold">x</mml:mi><mml:mo stretchy="false" mathvariant="normal">̃</mml:mo></mml:mover><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">θ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mn mathvariant="normal">2</mml:mn></mml:msup><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S6.E89.91"><mml:mtd><mml:mtext>F3b</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="bold">x</mml:mi><mml:mo stretchy="false" mathvariant="normal">̃</mml:mo></mml:mover><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="bold">x</mml:mi><mml:mo stretchy="false" mathvariant="normal">̃</mml:mo></mml:mover><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo>+</mml:mo><mml:msub><mml:mi mathvariant="bold">Ga</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo mathsize="1.1em">(</mml:mo><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="bold">x</mml:mi><mml:mo mathvariant="normal" stretchy="false">̃</mml:mo></mml:mover><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo>,</mml:mo><mml:msub><mml:mover accent="true"><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo mathvariant="normal" stretchy="false">̃</mml:mo></mml:mover><mml:mi>k</mml:mi></mml:msub><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mtr><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:msub><mml:mover accent="true"><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo stretchy="false" mathvariant="normal">̃</mml:mo></mml:mover><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:msup><mml:mfenced open="(" close=")"><mml:mrow><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:msup><mml:mi mathvariant="bold">G</mml:mi><mml:mo>⊺</mml:mo></mml:msup></mml:mrow></mml:mfenced><mml:mo>⊺</mml:mo></mml:msup><mml:mo mathsize="1.1em">(</mml:mo><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:msubsup><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:msubsup><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup><mml:mo mathsize="1.1em">)</mml:mo></mml:mrow></mml:mtd></mml:mtr><mml:mlabeledtr id="App1.Ch1.S6.E89.92"><mml:mtd><mml:mtext>F3c</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>×</mml:mo><mml:mo mathsize="1.1em">(</mml:mo><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>-</mml:mo><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo mathsize="1.1em">(</mml:mo><mml:msup><mml:mi mathvariant="bold">G</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="bold">x</mml:mi><mml:mo mathvariant="normal" stretchy="false">̃</mml:mo></mml:mover><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo mathsize="1.1em">)</mml:mo><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S6.E89.93"><mml:mtd><mml:mtext>F3d</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="bold">x</mml:mi><mml:mo stretchy="false" mathvariant="normal">̃</mml:mo></mml:mover><mml:mrow><mml:mi>k</mml:mi><mml:mo>+</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="script">M</mml:mi><mml:mo mathsize="1.1em">(</mml:mo><mml:msup><mml:mi mathvariant="bold">G</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="bold">x</mml:mi><mml:mo stretchy="false" mathvariant="normal">̃</mml:mo></mml:mover><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>.</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

        Leveraging the assumptions on <inline-formula><mml:math id="M688" display="inline"><mml:mi mathvariant="script">G</mml:mi></mml:math></inline-formula>, we finally obtain
        

              <disp-formula id="App1.Ch1.S6.E94" specific-use="align" content-type="subnumberedsingle"><mml:math id="M689" display="block"><mml:mtable displaystyle="true"><mml:mlabeledtr id="App1.Ch1.S6.E94.95"><mml:mtd><mml:mtext>F4a</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mi mathvariant="script">L</mml:mi><mml:mo mathsize="1.1em">(</mml:mo><mml:mi mathvariant="bold-italic">θ</mml:mi><mml:mo mathsize="1.1em">|</mml:mo><mml:mfenced close="}" open="{"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:mfenced><mml:mo mathsize="1.1em">)</mml:mo></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>k</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mi>K</mml:mi></mml:munderover><mml:msup><mml:mfenced close="∥" open="∥"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">Gx</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>-</mml:mo><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="bold">x</mml:mi><mml:mo stretchy="false" mathvariant="normal">̃</mml:mo></mml:mover><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi mathvariant="bold-italic">θ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mn mathvariant="normal">2</mml:mn></mml:msup><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S6.E94.96"><mml:mtd><mml:mtext>F4b</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="bold">x</mml:mi><mml:mo stretchy="false" mathvariant="normal">̃</mml:mo></mml:mover><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="bold">x</mml:mi><mml:mo mathvariant="normal" stretchy="false">̃</mml:mo></mml:mover><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo>+</mml:mo><mml:msub><mml:mi mathvariant="bold">Ga</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo mathsize="1.1em">(</mml:mo><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="bold">x</mml:mi><mml:mo mathvariant="normal" stretchy="false">̃</mml:mo></mml:mover><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo>,</mml:mo><mml:msub><mml:mover accent="true"><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo mathvariant="normal" stretchy="false">̃</mml:mo></mml:mover><mml:mi>k</mml:mi></mml:msub><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S6.E94.97"><mml:mtd><mml:mtext>F4c</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:msub><mml:mover accent="true"><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo mathvariant="normal" stretchy="false">̃</mml:mo></mml:mover><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo>=</mml:mo><mml:msubsup><mml:mi mathvariant="bold">H</mml:mi><mml:mi>k</mml:mi><mml:mo>⊺</mml:mo></mml:msubsup><mml:msubsup><mml:mi mathvariant="bold">R</mml:mi><mml:mi>k</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:mo mathsize="1.1em">(</mml:mo><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>-</mml:mo><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo mathsize="1.1em">(</mml:mo><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="bold">x</mml:mi><mml:mo mathvariant="normal" stretchy="false">̃</mml:mo></mml:mover><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo mathsize="1.1em">)</mml:mo><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S6.E94.98"><mml:mtd><mml:mtext>F4d</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="bold">x</mml:mi><mml:mo stretchy="false" mathvariant="normal">̃</mml:mo></mml:mover><mml:mrow><mml:mi>k</mml:mi><mml:mo>+</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:mi mathvariant="script">M</mml:mi><mml:mo mathsize="1.1em">(</mml:mo><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="bold">x</mml:mi><mml:mo mathvariant="normal" stretchy="false">̃</mml:mo></mml:mover><mml:mi>k</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msubsup><mml:mo mathsize="1.1em">)</mml:mo><mml:mo>.</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

        This shows that <inline-formula><mml:math id="M690" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">G</mml:mi><mml:mo>⋅</mml:mo><mml:mo>,</mml:mo><mml:mi mathvariant="bold">G</mml:mi><mml:mo>⋅</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> is the solution of Eq. (F1) whose input is the dataset <inline-formula><mml:math id="M691" display="inline"><mml:mrow><mml:mfenced open="{" close="}"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:mfenced></mml:mrow></mml:math></inline-formula>, while <inline-formula><mml:math id="M692" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">Ga</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mo>⋅</mml:mo><mml:mo>,</mml:mo><mml:mo>⋅</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> is the solution of Eq. (F4) whose input is the dataset <inline-formula><mml:math id="M693" display="inline"><mml:mrow><mml:mfenced open="{" close="}"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">Gx</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>)</mml:mo><mml:mo>+</mml:mo><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold-italic">ε</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:msubsup><mml:mi mathvariant="bold">Gx</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>)</mml:mo><mml:mo>+</mml:mo><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold-italic">ε</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:mfenced></mml:mrow></mml:math></inline-formula>. Since both the invariant distribution of the dynamics and the distribution of the observations errors are invariant under <inline-formula><mml:math id="M694" display="inline"><mml:mi mathvariant="script">G</mml:mi></mml:math></inline-formula>, the datasets <inline-formula><mml:math id="M695" display="inline"><mml:mrow><mml:mfenced close="}" open="{"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:mfenced></mml:mrow></mml:math></inline-formula> and <inline-formula><mml:math id="M696" display="inline"><mml:mrow><mml:mfenced open="{" close="}"><mml:mrow><mml:msubsup><mml:mi mathvariant="bold">Gx</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">t</mml:mi></mml:msubsup><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">y</mml:mi><mml:mi>k</mml:mi></mml:msub></mml:mrow></mml:mfenced></mml:mrow></mml:math></inline-formula> must asymptotically yield the same solution for a large enough number of samples <inline-formula><mml:math id="M697" display="inline"><mml:mi>K</mml:mi></mml:math></inline-formula>. This proves the equivariance, <inline-formula><mml:math id="M698" display="inline"><mml:mrow><mml:mo>∀</mml:mo><mml:mi>g</mml:mi><mml:mo>∈</mml:mo><mml:mi mathvariant="script">G</mml:mi><mml:mo>,</mml:mo><mml:mo>∀</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>∈</mml:mo><mml:msub><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo>,</mml:mo><mml:mo>∀</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∈</mml:mo><mml:msub><mml:mi mathvariant="bold">E</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>:

          <disp-formula id="App1.Ch1.S6.E99" content-type="numbered"><label>F5</label><mml:math id="M699" display="block"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula></p>
      <p id="d2e17092">Then, taking the gradient with respect to <inline-formula><mml:math id="M700" display="inline"><mml:mi mathvariant="bold">x</mml:mi></mml:math></inline-formula> and <inline-formula><mml:math id="M701" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> of <inline-formula><mml:math id="M702" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> yields a covariant action <inline-formula><mml:math id="M703" display="inline"><mml:mrow><mml:mi>g</mml:mi><mml:mo>⊗</mml:mo><mml:mi>g</mml:mi></mml:mrow></mml:math></inline-formula> onto the tensor factors for <inline-formula><mml:math id="M704" display="inline"><mml:mi mathvariant="bold">x</mml:mi></mml:math></inline-formula> and <inline-formula><mml:math id="M705" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>, alternatively a contravariant action <inline-formula><mml:math id="M706" display="inline"><mml:mrow><mml:msup><mml:mi>g</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo>⊗</mml:mo><mml:msup><mml:mi>g</mml:mi><mml:mo>⊺</mml:mo></mml:msup></mml:mrow></mml:math></inline-formula> on to the right-hand side of Eq. (<xref ref-type="disp-formula" rid="App1.Ch1.S6.E99"/>), which proves the equivariance of <inline-formula><mml:math id="M707" display="inline"><mml:mi mathvariant="bold">Γ</mml:mi></mml:math></inline-formula>, Eq. (<xref ref-type="disp-formula" rid="Ch1.E33"/>). The equivariance assumption on the observation operator is rather stringent. A weaker assumption is to assume that <inline-formula><mml:math id="M708" display="inline"><mml:mrow><mml:msub><mml:mfenced close="}" open="{"><mml:mrow><mml:msub><mml:mi mathvariant="bold">G</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:msup><mml:mi mathvariant="bold">G</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mrow><mml:mi>k</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn><mml:mo>,</mml:mo><mml:mi mathvariant="normal">…</mml:mi><mml:mo>,</mml:mo><mml:mi>K</mml:mi></mml:mrow></mml:msub></mml:mrow></mml:math></inline-formula> almost spans the same set as <inline-formula><mml:math id="M709" display="inline"><mml:mrow><mml:msub><mml:mfenced close="}" open="{"><mml:mrow><mml:msub><mml:mi mathvariant="script">H</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:msubsup><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msubsup><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mrow><mml:mi>k</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn><mml:mo>,</mml:mo><mml:mi mathvariant="normal">…</mml:mi><mml:mo>,</mml:mo><mml:mi>K</mml:mi></mml:mrow></mml:msub></mml:mrow></mml:math></inline-formula> for <inline-formula><mml:math id="M710" display="inline"><mml:mrow><mml:mi>K</mml:mi><mml:mo>→</mml:mo><mml:mi mathvariant="normal">∞</mml:mi></mml:mrow></mml:math></inline-formula>. Then the optimisation problems Eq. (F1) and Eq. (F4) should almost coincide. This is for instance useful when one considers random observation operators for which operator instances have no specific symmetry, while their distribution does exhibit the symmetry, a case occurring in Sect. <xref ref-type="sec" rid="Ch1.S3.SS3.SSS4"/>.</p>
</app>

<app id="App1.Ch1.S7">
  <label>Appendix G</label><title>Sleek representation of the mean marginal gain</title>
      <p id="d2e17307">Assume that the states and projected innovations are defined as fields over a physical manifold <inline-formula><mml:math id="M711" display="inline"><mml:mi mathvariant="script">D</mml:mi></mml:math></inline-formula>, and further discretised at <inline-formula><mml:math id="M712" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> collocation space points of <inline-formula><mml:math id="M713" display="inline"><mml:mi mathvariant="script">D</mml:mi></mml:math></inline-formula> indexed by <inline-formula><mml:math id="M714" display="inline"><mml:mrow><mml:mi>i</mml:mi><mml:mo>∈</mml:mo><mml:mo fence="true">⟦</mml:mo><mml:mn mathvariant="normal">1</mml:mn><mml:mo>,</mml:mo><mml:mi mathvariant="normal">…</mml:mi><mml:mo>,</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo fence="true">⟧</mml:mo></mml:mrow></mml:math></inline-formula>. Hence, <inline-formula><mml:math id="M715" display="inline"><mml:mi mathvariant="script">G</mml:mi></mml:math></inline-formula> is a discrete group of isometries. As a consequence, <inline-formula><mml:math id="M716" display="inline"><mml:mrow><mml:mi>g</mml:mi><mml:mo>∈</mml:mo><mml:mi mathvariant="script">G</mml:mi></mml:mrow></mml:math></inline-formula> can be seen as a bijection of <inline-formula><mml:math id="M717" display="inline"><mml:mrow><mml:mo fence="true">⟦</mml:mo><mml:mn mathvariant="normal">1</mml:mn><mml:mo>,</mml:mo><mml:mi mathvariant="normal">…</mml:mi><mml:mo>,</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo fence="true">⟧</mml:mo></mml:mrow></mml:math></inline-formula> and the action of <inline-formula><mml:math id="M718" display="inline"><mml:mrow><mml:mi>g</mml:mi><mml:mo>∈</mml:mo><mml:mi mathvariant="script">G</mml:mi></mml:mrow></mml:math></inline-formula> on the fields <inline-formula><mml:math id="M719" display="inline"><mml:mi mathvariant="bold">x</mml:mi></mml:math></inline-formula>  and <inline-formula><mml:math id="M720" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> reads

          <disp-formula id="App1.Ch1.S7.E100" content-type="numbered"><label>G1</label><mml:math id="M721" display="block"><mml:mrow><mml:mo>[</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:msub><mml:mo>]</mml:mo><mml:mi>i</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mfenced close="]" open="["><mml:mi mathvariant="bold">x</mml:mi></mml:mfenced><mml:mrow><mml:mi>g</mml:mi><mml:mo>(</mml:mo><mml:mi>i</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msub><mml:mo>,</mml:mo><mml:mo>[</mml:mo><mml:mi>g</mml:mi><mml:mo>∘</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:msub><mml:mo>]</mml:mo><mml:mi>j</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mo>[</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:msub><mml:mo>]</mml:mo><mml:mrow><mml:mi>g</mml:mi><mml:mo>(</mml:mo><mml:mi>j</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msub><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

        respectively. Likewise, the action of <inline-formula><mml:math id="M722" display="inline"><mml:mrow><mml:mi>g</mml:mi><mml:mo>∈</mml:mo><mml:mi mathvariant="script">G</mml:mi></mml:mrow></mml:math></inline-formula> on <inline-formula><mml:math id="M723" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover></mml:math></inline-formula> is, for all <inline-formula><mml:math id="M724" display="inline"><mml:mrow><mml:mi>i</mml:mi><mml:mo>,</mml:mo><mml:mi>j</mml:mi><mml:mo>,</mml:mo><mml:mi>l</mml:mi></mml:mrow></mml:math></inline-formula>:

          <disp-formula id="App1.Ch1.S7.E101" content-type="numbered"><label>G2</label><mml:math id="M725" display="block"><mml:mrow><mml:msub><mml:mfenced close="]" open="["><mml:mrow><mml:mi>g</mml:mi><mml:mo>⊙</mml:mo><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover></mml:mrow></mml:mfenced><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi><mml:mi>l</mml:mi></mml:mrow></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mfenced close="]" open="["><mml:mrow><mml:mi>g</mml:mi><mml:mo>⊗</mml:mo><mml:msup><mml:mi>g</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo>⊗</mml:mo><mml:msup><mml:mi>g</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo>∘</mml:mo><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover></mml:mrow></mml:mfenced><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi><mml:mi>l</mml:mi></mml:mrow></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mover accent="true"><mml:mi mathvariant="normal">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mi>g</mml:mi><mml:mo>(</mml:mo><mml:mi>i</mml:mi><mml:mo>)</mml:mo><mml:mspace linebreak="nobreak" width="0.125em"/><mml:msup><mml:mi>g</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo>(</mml:mo><mml:mi>j</mml:mi><mml:mo>)</mml:mo><mml:mspace width="0.125em" linebreak="nobreak"/><mml:msup><mml:mi>g</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo>(</mml:mo><mml:mi>l</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msub><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

        so that Eq. (<xref ref-type="disp-formula" rid="Ch1.E41"/>) reads, for all <inline-formula><mml:math id="M726" display="inline"><mml:mrow><mml:mi>i</mml:mi><mml:mo>,</mml:mo><mml:mi>j</mml:mi><mml:mo>,</mml:mo><mml:mi>l</mml:mi></mml:mrow></mml:math></inline-formula>:

          <disp-formula id="App1.Ch1.S7.E102" content-type="numbered"><label>G3</label><mml:math id="M727" display="block"><mml:mrow><mml:msub><mml:mover accent="true"><mml:mi mathvariant="normal">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi><mml:mi>l</mml:mi></mml:mrow></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mover accent="true"><mml:mi mathvariant="normal">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mi>g</mml:mi><mml:mo>(</mml:mo><mml:mi>i</mml:mi><mml:mo>)</mml:mo><mml:mspace width="0.125em" linebreak="nobreak"/><mml:msup><mml:mi>g</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo>(</mml:mo><mml:mi>j</mml:mi><mml:mo>)</mml:mo><mml:mspace linebreak="nobreak" width="0.125em"/><mml:msup><mml:mi>g</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo>(</mml:mo><mml:mi>l</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msub><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula>

        Let us choose one of the collocation points in <inline-formula><mml:math id="M728" display="inline"><mml:mi mathvariant="script">D</mml:mi></mml:math></inline-formula> with index <inline-formula><mml:math id="M729" display="inline"><mml:mrow><mml:mi>r</mml:mi><mml:mo>∈</mml:mo><mml:mo fence="true">⟦</mml:mo><mml:mn mathvariant="normal">1</mml:mn><mml:mo>,</mml:mo><mml:mi mathvariant="normal">…</mml:mi><mml:mo>,</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo fence="true">⟧</mml:mo></mml:mrow></mml:math></inline-formula>. With the above assumptions, the orbit of the site indexed by <inline-formula><mml:math id="M730" display="inline"><mml:mi>r</mml:mi></mml:math></inline-formula> under the action of <inline-formula><mml:math id="M731" display="inline"><mml:mi mathvariant="script">G</mml:mi></mml:math></inline-formula> is <inline-formula><mml:math id="M732" display="inline"><mml:mrow><mml:mo fence="true">⟦</mml:mo><mml:mn mathvariant="normal">1</mml:mn><mml:mo>,</mml:mo><mml:mi mathvariant="normal">…</mml:mi><mml:mo>,</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo fence="true">⟧</mml:mo></mml:mrow></mml:math></inline-formula>. We can then define a 2-tensor <inline-formula><mml:math id="M733" display="inline"><mml:mrow><mml:msup><mml:mover accent="true"><mml:mi mathvariant="bold">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula> componentwise by, for all <inline-formula><mml:math id="M734" display="inline"><mml:mrow><mml:mi>i</mml:mi><mml:mo>,</mml:mo><mml:mi>j</mml:mi></mml:mrow></mml:math></inline-formula>:

          <disp-formula id="App1.Ch1.S7.E103" content-type="numbered"><label>G4</label><mml:math id="M735" display="block"><mml:mrow><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="normal">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi></mml:mrow><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msubsup><mml:mo>=</mml:mo><mml:msub><mml:mover accent="true"><mml:mi mathvariant="normal">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi><mml:mi>r</mml:mi></mml:mrow></mml:msub><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula>

        For all <inline-formula><mml:math id="M736" display="inline"><mml:mrow><mml:mi>l</mml:mi><mml:mo>∈</mml:mo><mml:mo fence="true">⟦</mml:mo><mml:mn mathvariant="normal">1</mml:mn><mml:mo>,</mml:mo><mml:mi mathvariant="normal">…</mml:mi><mml:mo>,</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub><mml:mo fence="true">⟧</mml:mo></mml:mrow></mml:math></inline-formula>, we can pick at least one <inline-formula><mml:math id="M737" display="inline"><mml:mrow><mml:msubsup><mml:mi>g</mml:mi><mml:mi>l</mml:mi><mml:mi>r</mml:mi></mml:msubsup><mml:mo>∈</mml:mo><mml:mi mathvariant="script">G</mml:mi></mml:mrow></mml:math></inline-formula> such that <inline-formula><mml:math id="M738" display="inline"><mml:mrow><mml:msubsup><mml:mi>g</mml:mi><mml:mi>l</mml:mi><mml:mi>r</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:mi>l</mml:mi></mml:mrow></mml:math></inline-formula> and let us denote its inverse by <inline-formula><mml:math id="M739" display="inline"><mml:mrow><mml:msubsup><mml:mi>g</mml:mi><mml:mi>r</mml:mi><mml:mi>l</mml:mi></mml:msubsup></mml:mrow></mml:math></inline-formula> which coincides with its adjoint <inline-formula><mml:math id="M740" display="inline"><mml:mrow><mml:msup><mml:mi>g</mml:mi><mml:mo>⊺</mml:mo></mml:msup></mml:mrow></mml:math></inline-formula> and satisfies <inline-formula><mml:math id="M741" display="inline"><mml:mrow><mml:msubsup><mml:mi>g</mml:mi><mml:mi>r</mml:mi><mml:mi>l</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi>l</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:mi>r</mml:mi></mml:mrow></mml:math></inline-formula> in particular. Hence, we have from Eq. (<xref ref-type="disp-formula" rid="Ch1.E41"/>) and for all <inline-formula><mml:math id="M742" display="inline"><mml:mrow><mml:mi>i</mml:mi><mml:mo>,</mml:mo><mml:mi>j</mml:mi><mml:mo>,</mml:mo><mml:mi>l</mml:mi></mml:mrow></mml:math></inline-formula>:

          <disp-formula id="App1.Ch1.S7.E104" content-type="numbered"><label>G5</label><mml:math id="M743" display="block"><mml:mrow><mml:msub><mml:mover accent="true"><mml:mi mathvariant="normal">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi><mml:mi>l</mml:mi></mml:mrow></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mover accent="true"><mml:mi mathvariant="normal">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:msubsup><mml:mi>g</mml:mi><mml:mi>l</mml:mi><mml:mi>r</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi>i</mml:mi><mml:mo>)</mml:mo><mml:mspace linebreak="nobreak" width="0.125em"/><mml:msubsup><mml:mi>g</mml:mi><mml:mi>r</mml:mi><mml:mi>l</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi>j</mml:mi><mml:mo>)</mml:mo><mml:mspace width="0.125em" linebreak="nobreak"/><mml:msubsup><mml:mi>g</mml:mi><mml:mi>r</mml:mi><mml:mi>l</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi>l</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mover accent="true"><mml:mi mathvariant="normal">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:msubsup><mml:mi>g</mml:mi><mml:mi>l</mml:mi><mml:mi>r</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi>i</mml:mi><mml:mo>)</mml:mo><mml:mspace width="0.125em" linebreak="nobreak"/><mml:msubsup><mml:mi>g</mml:mi><mml:mi>r</mml:mi><mml:mi>l</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi>j</mml:mi><mml:mo>)</mml:mo><mml:mspace width="0.125em" linebreak="nobreak"/><mml:mi>r</mml:mi></mml:mrow></mml:msub><mml:mo>=</mml:mo><mml:msubsup><mml:mover accent="true"><mml:mi mathvariant="normal">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:msubsup><mml:mi>g</mml:mi><mml:mi>l</mml:mi><mml:mi>r</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi>i</mml:mi><mml:mo>)</mml:mo><mml:mspace linebreak="nobreak" width="0.125em"/><mml:msubsup><mml:mi>g</mml:mi><mml:mi>r</mml:mi><mml:mi>l</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi>j</mml:mi><mml:mo>)</mml:mo></mml:mrow><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msubsup><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula>

        As a consequence of the symmetry and Eq. (<xref ref-type="disp-formula" rid="App1.Ch1.S7.E104"/>), the 3-tensor <inline-formula><mml:math id="M744" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover></mml:math></inline-formula> can be entirely specified by the 2-tensor <inline-formula><mml:math id="M745" display="inline"><mml:mrow><mml:msup><mml:mover accent="true"><mml:mi mathvariant="bold">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula>, where <inline-formula><mml:math id="M746" display="inline"><mml:mi>r</mml:mi></mml:math></inline-formula>, a reference site index, is arbitrarily chosen. In the case where <inline-formula><mml:math id="M747" display="inline"><mml:mi mathvariant="script">D</mml:mi></mml:math></inline-formula> is one-dimensional (as for L96), <inline-formula><mml:math id="M748" display="inline"><mml:mrow><mml:msup><mml:mover accent="true"><mml:mi mathvariant="bold">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula> is a matrix, hence depictable and more easily interpretable.</p>
</app>

<app id="App1.Ch1.S8">
  <label>Appendix H</label><title>Numerical computation of the mean marginal gain</title>
      <p id="d2e18231">The mean marginal gain can be computed from states of a trajectory <inline-formula><mml:math id="M749" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="script">T</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> of the ergodic dynamics, and the ability to evaluate <inline-formula><mml:math id="M750" display="inline"><mml:mrow><mml:mi mathvariant="bold">x</mml:mi><mml:mo>↦</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> as defined by Eq. (<xref ref-type="disp-formula" rid="Ch1.E15.17"/>). The trajectory should be long enough so that its states adequately sample the invariant distribution <inline-formula><mml:math id="M751" display="inline"><mml:mi mathvariant="italic">π</mml:mi></mml:math></inline-formula>. From Eq. (<xref ref-type="disp-formula" rid="Ch1.E19"/>), we hence have the empirical estimator:

          <disp-formula id="App1.Ch1.S8.E105" content-type="numbered"><label>H1</label><mml:math id="M752" display="block"><mml:mrow><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mo>=</mml:mo><mml:mo>〈</mml:mo><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:msub><mml:mo>〉</mml:mo><mml:mrow><mml:mi mathvariant="bold">x</mml:mi><mml:mo>∈</mml:mo><mml:msub><mml:mi mathvariant="script">T</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub></mml:mrow></mml:msub><mml:mo>=</mml:mo><mml:mstyle displaystyle="true"><mml:mfrac style="display"><mml:mn mathvariant="normal">1</mml:mn><mml:mi>K</mml:mi></mml:mfrac></mml:mstyle><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>k</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mi>K</mml:mi></mml:munderover><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:msub><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>)</mml:mo><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula>

        As a result, the computational complexity of the mean marginal gain is proportional to <inline-formula><mml:math id="M753" display="inline"><mml:mi>K</mml:mi></mml:math></inline-formula>, but may be significantly alleviated by the presence of symmetries as discussed before. Such symmetries must make both <inline-formula><mml:math id="M754" display="inline"><mml:mi mathvariant="italic">π</mml:mi></mml:math></inline-formula> and <inline-formula><mml:math id="M755" display="inline"><mml:mi mathvariant="italic">ρ</mml:mi></mml:math></inline-formula> invariant even though the definition of <inline-formula><mml:math id="M756" display="inline"><mml:mover accent="true"><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover></mml:math></inline-formula> only implicitly depends on <inline-formula><mml:math id="M757" display="inline"><mml:mi mathvariant="italic">ρ</mml:mi></mml:math></inline-formula>.</p>
      <p id="d2e18383">We now turn to the estimation of the marginal gain <inline-formula><mml:math id="M758" display="inline"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>. Its computation can be achieved through several routes with distinct numerical complexities which, as approximations, may not be equivalent and may lead to mildly differing results.</p>
      <p id="d2e18400">The first way to compute <inline-formula><mml:math id="M759" display="inline"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> is through automatic differentiation. As a second-order sensitivity of <inline-formula><mml:math id="M760" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> with respect to <inline-formula><mml:math id="M761" display="inline"><mml:mi mathvariant="bold">x</mml:mi></mml:math></inline-formula> and <inline-formula><mml:math id="M762" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>, <inline-formula><mml:math id="M763" display="inline"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:msub><mml:mo>)</mml:mo><mml:mrow><mml:mo>|</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="bold">0</mml:mn></mml:mrow></mml:msub></mml:mrow></mml:math></inline-formula> requires taking the Jacobian of <inline-formula><mml:math id="M764" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> twice. Hence, such computation through either JAX, PyTorch or TensorFlow, can be prohibitive, with a substantial need for GPU memory. On an NVIDIA RTX5000 Ada GPU with <inline-formula><mml:math id="M765" display="inline"><mml:mn mathvariant="normal">32</mml:mn></mml:math></inline-formula> GB of memory, using the JAX-inspired PyTorch <monospace>torch.func</monospace> module (<uri>https://pytorch.org/docs/stable/func.html</uri>, last access: 7 August 2026), we found it to be achievable with the L96 model, difficult with a Kuramoto-Sivashinsky model <xref ref-type="bibr" rid="bib1.bibx40 bib1.bibx60" id="paren.79"/>, but prohibitive with a single-layer QG model on the sphere. Hence, it is likely to be impractical with high-dimensional models.</p>
      <p id="d2e18522">Note that the mean Eq. (<xref ref-type="disp-formula" rid="App1.Ch1.S8.E105"/>) can be computed through updates whenever a new <inline-formula><mml:math id="M766" display="inline"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:msub><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> is computed, preventing the need to store them. Moreover, when exploiting symmetries of <inline-formula><mml:math id="M767" display="inline"><mml:mi mathvariant="script">G</mml:mi></mml:math></inline-formula>, the intermediate tensor
        

          <disp-formula id="App1.Ch1.S8.E106.107" content-type="subnumberedon"><label>H2a</label><mml:math id="M768" display="block"><mml:mrow><mml:msubsup><mml:mi mathvariant="normal">Ω</mml:mi><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi></mml:mrow><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msubsup><mml:mo>(</mml:mo><mml:msub><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>)</mml:mo><mml:mo>=</mml:mo><mml:mstyle displaystyle="true"><mml:mfrac style="display"><mml:mn mathvariant="normal">1</mml:mn><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:mfrac></mml:mstyle><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>l</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:munderover><mml:msub><mml:mi mathvariant="normal">Γ</mml:mi><mml:mrow><mml:msubsup><mml:mi>g</mml:mi><mml:mi>r</mml:mi><mml:mi>l</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi>i</mml:mi><mml:mo>)</mml:mo><mml:mspace linebreak="nobreak" width="0.125em"/><mml:msubsup><mml:mi>g</mml:mi><mml:mi>l</mml:mi><mml:mi>r</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi>j</mml:mi><mml:mo>)</mml:mo><mml:mspace linebreak="nobreak" width="0.125em"/><mml:mi>l</mml:mi></mml:mrow></mml:msub><mml:mo>(</mml:mo><mml:msub><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>)</mml:mo><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

        can be computed, and will contribute to the computation of <inline-formula><mml:math id="M769" display="inline"><mml:mrow><mml:msup><mml:mover accent="true"><mml:mi mathvariant="bold">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msup></mml:mrow></mml:math></inline-formula> through the update of

          <disp-formula id="App1.Ch1.S8.E106.108" content-type="subnumberedoff"><label>H2b</label><mml:math id="M770" display="block"><mml:mrow><mml:msup><mml:mover accent="true"><mml:mi mathvariant="bold">Ω</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msup><mml:mo>=</mml:mo><mml:mo>〈</mml:mo><mml:msup><mml:mi mathvariant="bold">Ω</mml:mi><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:msub><mml:mo>〉</mml:mo><mml:mrow><mml:mi mathvariant="bold">x</mml:mi><mml:mo>∈</mml:mo><mml:msub><mml:mi mathvariant="script">T</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub></mml:mrow></mml:msub><mml:mo>=</mml:mo><mml:mstyle displaystyle="true"><mml:mfrac style="display"><mml:mn mathvariant="normal">1</mml:mn><mml:mi>K</mml:mi></mml:mfrac></mml:mstyle><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>k</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mi>K</mml:mi></mml:munderover><mml:msup><mml:mi mathvariant="bold">Ω</mml:mi><mml:mrow><mml:mo>(</mml:mo><mml:mi>r</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:msup><mml:mo>(</mml:mo><mml:msub><mml:mi mathvariant="bold">x</mml:mi><mml:mi>k</mml:mi></mml:msub><mml:mo>)</mml:mo><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula></p>
      <p id="d2e18771">In Boc24, either the gain <inline-formula><mml:math id="M771" display="inline"><mml:mrow><mml:mi mathvariant="bold">K</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> or <inline-formula><mml:math id="M772" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">a</mml:mi></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> were obtained by generating an ensemble of perturbations to feed a regression. The same idea can be used for <inline-formula><mml:math id="M773" display="inline"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>, once again assuming a quasi-linear behaviour of <inline-formula><mml:math id="M774" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> and <inline-formula><mml:math id="M775" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> as functions of <inline-formula><mml:math id="M776" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula>. From the results in Sect. <xref ref-type="sec" rid="Ch1.S3.SS3.SSS1"/> and Appendix <xref ref-type="sec" rid="App1.Ch1.S5"/>, we infer that
        

              <disp-formula id="App1.Ch1.S8.E109" specific-use="align" content-type="subnumberedsingle"><mml:math id="M777" display="block"><mml:mtable displaystyle="true"><mml:mlabeledtr id="App1.Ch1.S8.E109.110"><mml:mtd><mml:mtext>H3a</mml:mtext></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:msub><mml:mo>)</mml:mo><mml:mrow><mml:mo>|</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="bold">0</mml:mn></mml:mrow></mml:msub></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S8.E109.111"><mml:mtd><mml:mtext>H3b</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>≈</mml:mo><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced open="[" close="]"><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S8.E109.112"><mml:mtd><mml:mtext>H3c</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle class="stylechange" displaystyle="true"/><mml:mo>≈</mml:mo><mml:msubsup><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi><mml:mo>†</mml:mo></mml:msubsup><mml:msub><mml:mtext>Cov</mml:mtext><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced close="]" open="["><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

        which tells that a sampling approach can be applied to <inline-formula><mml:math id="M778" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mo>⋅</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>. Assuming <inline-formula><mml:math id="M779" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> is regular enough, the gradients with respect to <inline-formula><mml:math id="M780" display="inline"><mml:mi mathvariant="bold">x</mml:mi></mml:math></inline-formula> and <inline-formula><mml:math id="M781" display="inline"><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:math></inline-formula> commute and we also have <inline-formula><mml:math id="M782" display="inline"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo><mml:mo>≈</mml:mo><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="double-struck">E</mml:mi><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced close="]" open="["><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold-italic">ζ</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:math></inline-formula>, although this could considerably complexify backpropagation if automatic differentiation is used to handle <inline-formula><mml:math id="M783" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>.</p>
      <p id="d2e19161">Automatic differentiation is hence used only once for the computation of the Jacobian <inline-formula><mml:math id="M784" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mo>⋅</mml:mo><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>, as opposed to the full automatic differentiation approach. Hence, <inline-formula><mml:math id="M785" display="inline"><mml:mrow><mml:mi mathvariant="bold">Γ</mml:mi><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> can be computed using a <italic>composite</italic> Monte Carlo/differentiation approach. The details of the subsequent regression are reported in Appendix <xref ref-type="sec" rid="App1.Ch1.S9"/>.</p>
</app>

<app id="App1.Ch1.S9">
  <label>Appendix I</label><title>Regression for the composite mean marginal gain</title>
      <p id="d2e19217">An ensemble of <inline-formula><mml:math id="M786" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">p</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> perturbations <inline-formula><mml:math id="M787" display="inline"><mml:mrow><mml:mo>∂</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi>p</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> generated from <inline-formula><mml:math id="M788" display="inline"><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">p</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> samples <inline-formula><mml:math id="M789" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>p</mml:mi></mml:msub><mml:mo>∼</mml:mo><mml:mi>N</mml:mi><mml:mo>(</mml:mo><mml:mn mathvariant="bold">0</mml:mn><mml:mo>,</mml:mo><mml:mi mathvariant="bold">Ξ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula> for <inline-formula><mml:math id="M790" display="inline"><mml:mrow><mml:mi>p</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn><mml:mo>,</mml:mo><mml:mi mathvariant="normal">…</mml:mi><mml:mo>,</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">p</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> should first be computed,

          <disp-formula id="App1.Ch1.S9.E113" content-type="numbered"><label>I1</label><mml:math id="M791" display="block"><mml:mrow><mml:msub><mml:mfenced open="[" close="]"><mml:mrow><mml:mo>∂</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi>p</mml:mi></mml:msub></mml:mrow></mml:mfenced><mml:mrow><mml:mi>i</mml:mi><mml:mi>l</mml:mi></mml:mrow></mml:msub><mml:mo>=</mml:mo><mml:msub><mml:mfenced open="[" close="]"><mml:mrow><mml:msub><mml:mo>∂</mml:mo><mml:mrow><mml:msub><mml:mi>x</mml:mi><mml:mi>l</mml:mi></mml:msub></mml:mrow></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>p</mml:mi></mml:msub><mml:mo>)</mml:mo></mml:mrow></mml:mfenced><mml:mi>i</mml:mi></mml:msub><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

        via an ensemble of first-order Jacobians. In the best linear unbiased estimator framework, the covariance matrix <inline-formula><mml:math id="M792" display="inline"><mml:mi mathvariant="bold">Ξ</mml:mi></mml:math></inline-formula> should roughly match <inline-formula><mml:math id="M793" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">H</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:msup><mml:mi mathvariant="bold">R</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mo>(</mml:mo><mml:mi mathvariant="bold">R</mml:mi><mml:mo>+</mml:mo><mml:msup><mml:mi mathvariant="bold">HP</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:msup><mml:mi mathvariant="bold">H</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:mo>)</mml:mo><mml:msup><mml:mi mathvariant="bold">R</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mi mathvariant="bold">H</mml:mi></mml:mrow></mml:math></inline-formula> where <inline-formula><mml:math id="M794" display="inline"><mml:mrow><mml:msup><mml:mi mathvariant="bold">P</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup></mml:mrow></mml:math></inline-formula> and <inline-formula><mml:math id="M795" display="inline"><mml:mrow><mml:mi mathvariant="bold">R</mml:mi><mml:mo>+</mml:mo><mml:msup><mml:mi mathvariant="bold">HP</mml:mi><mml:mi mathvariant="normal">f</mml:mi></mml:msup><mml:msup><mml:mi mathvariant="bold">H</mml:mi><mml:mo>⊺</mml:mo></mml:msup></mml:mrow></mml:math></inline-formula> are the forecast error and innovation covariance matrices, respectively. Hence, in the weak assimilation regime, we can use the approximation <inline-formula><mml:math id="M796" display="inline"><mml:mrow><mml:mi mathvariant="bold">Ξ</mml:mi><mml:mo>≈</mml:mo><mml:msup><mml:mi mathvariant="bold">H</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:msup><mml:mi mathvariant="bold">R</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mi mathvariant="bold">H</mml:mi></mml:mrow></mml:math></inline-formula>, which should be regarded as a scale for the perturbations anyway, and generate samples with <inline-formula><mml:math id="M797" display="inline"><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>=</mml:mo><mml:msup><mml:mi mathvariant="bold">H</mml:mi><mml:mo>⊺</mml:mo></mml:msup><mml:msup><mml:mi mathvariant="bold">R</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mfrac><mml:mn mathvariant="normal">1</mml:mn><mml:mn mathvariant="normal">2</mml:mn></mml:mfrac></mml:mrow></mml:msup><mml:mi mathvariant="bold-italic">ξ</mml:mi></mml:mrow></mml:math></inline-formula>, where <inline-formula><mml:math id="M798" display="inline"><mml:mrow><mml:mi mathvariant="bold-italic">ξ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="script">N</mml:mi><mml:mo>(</mml:mo><mml:mn mathvariant="bold">0</mml:mn><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="bold">I</mml:mi><mml:mi mathvariant="normal">y</mml:mi></mml:msub><mml:mo>)</mml:mo></mml:mrow></mml:math></inline-formula>. Introducing for <inline-formula><mml:math id="M799" display="inline"><mml:mrow><mml:mi>p</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn><mml:mo>,</mml:mo><mml:mi mathvariant="normal">…</mml:mi><mml:mo>,</mml:mo><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">p</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, the recentred samples

          <disp-formula id="App1.Ch1.S9.E114" content-type="numbered"><label>I2</label><mml:math id="M800" display="block"><mml:mrow><mml:mo>∂</mml:mo><mml:msubsup><mml:mi mathvariant="bold">a</mml:mi><mml:mi>p</mml:mi><mml:mo>′</mml:mo></mml:msubsup><mml:mo>=</mml:mo><mml:mo>∂</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi>p</mml:mi></mml:msub><mml:mo>-</mml:mo><mml:msubsup><mml:mi>N</mml:mi><mml:mi mathvariant="normal">p</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>p</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">p</mml:mi></mml:msub></mml:mrow></mml:munderover><mml:mo>∂</mml:mo><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi>p</mml:mi></mml:msub><mml:mo>,</mml:mo><mml:msubsup><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>p</mml:mi><mml:mo>′</mml:mo></mml:msubsup><mml:mo>=</mml:mo><mml:msub><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>p</mml:mi></mml:msub><mml:mo>-</mml:mo><mml:msubsup><mml:mi>N</mml:mi><mml:mi mathvariant="normal">p</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msubsup><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>p</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">p</mml:mi></mml:msub></mml:mrow></mml:munderover><mml:msub><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>p</mml:mi></mml:msub><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

        we have from the definitions <inline-formula><mml:math id="M801" display="inline"><mml:mrow><mml:mi mathvariant="bold">C</mml:mi><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:msub><mml:mtext>Cov</mml:mtext><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>∼</mml:mo><mml:mi mathvariant="italic">ρ</mml:mi></mml:mrow></mml:msub><mml:mfenced open="[" close="]"><mml:mrow><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>,</mml:mo><mml:msub><mml:mi mathvariant="normal">∇</mml:mi><mml:mi mathvariant="bold">x</mml:mi></mml:msub><mml:msub><mml:mi mathvariant="bold">a</mml:mi><mml:mi mathvariant="bold-italic">θ</mml:mi></mml:msub><mml:mo>(</mml:mo><mml:mi mathvariant="bold">x</mml:mi><mml:mo>,</mml:mo><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mo>)</mml:mo></mml:mrow></mml:mfenced></mml:mrow></mml:math></inline-formula> and <inline-formula><mml:math id="M802" display="inline"><mml:mrow><mml:mi mathvariant="bold">D</mml:mi><mml:mover><mml:mo>=</mml:mo><mml:mo>Δ</mml:mo></mml:mover><mml:msub><mml:mi mathvariant="bold">Σ</mml:mi><mml:mi mathvariant="italic">ρ</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>:

          <disp-formula id="App1.Ch1.S9.E115" content-type="numbered"><label>I3</label><mml:math id="M803" display="block"><mml:mrow><mml:msub><mml:mfenced close="]" open="["><mml:mi mathvariant="bold">C</mml:mi></mml:mfenced><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi><mml:mi>l</mml:mi></mml:mrow></mml:msub><mml:mo>≈</mml:mo><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>p</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">p</mml:mi></mml:msub></mml:mrow></mml:munderover><mml:mo mathsize="1.1em">[</mml:mo><mml:msubsup><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>p</mml:mi><mml:mo>′</mml:mo></mml:msubsup><mml:msub><mml:mo mathsize="1.1em">]</mml:mo><mml:mi>j</mml:mi></mml:msub><mml:mo mathsize="1.1em">[</mml:mo><mml:mo>∂</mml:mo><mml:msubsup><mml:mi mathvariant="bold">a</mml:mi><mml:mi>p</mml:mi><mml:mo>′</mml:mo></mml:msubsup><mml:msub><mml:mo mathsize="1.1em">]</mml:mo><mml:mrow><mml:mi>i</mml:mi><mml:mi>l</mml:mi></mml:mrow></mml:msub><mml:mo>,</mml:mo><mml:msub><mml:mfenced open="[" close="]"><mml:mi mathvariant="bold">D</mml:mi></mml:mfenced><mml:mrow><mml:mi>j</mml:mi><mml:mi>l</mml:mi></mml:mrow></mml:msub><mml:mo>≈</mml:mo><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>p</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">p</mml:mi></mml:msub></mml:mrow></mml:munderover><mml:mo mathsize="1.1em">[</mml:mo><mml:msubsup><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>p</mml:mi><mml:mo>′</mml:mo></mml:msubsup><mml:msub><mml:mo mathsize="1.1em">]</mml:mo><mml:mi>j</mml:mi></mml:msub><mml:mo mathsize="1.1em">[</mml:mo><mml:msubsup><mml:mi mathvariant="bold-italic">ζ</mml:mi><mml:mi>p</mml:mi><mml:mo>′</mml:mo></mml:msubsup><mml:msub><mml:mo mathsize="1.1em">]</mml:mo><mml:mi>l</mml:mi></mml:msub><mml:mo>,</mml:mo></mml:mrow></mml:math></disp-formula>

        which, from Eq. (<xref ref-type="disp-formula" rid="App1.Ch1.S8.E109.110"/>), yields

          <disp-formula id="App1.Ch1.S9.E116" content-type="numbered"><label>I4</label><mml:math id="M804" display="block"><mml:mrow><mml:msub><mml:mfenced close="]" open="["><mml:mi mathvariant="bold">Γ</mml:mi></mml:mfenced><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi><mml:mi>l</mml:mi></mml:mrow></mml:msub><mml:mo>=</mml:mo><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>m</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:munderover><mml:msub><mml:mfenced open="[" close="]"><mml:mi mathvariant="bold">C</mml:mi></mml:mfenced><mml:mrow><mml:mi>i</mml:mi><mml:mi>m</mml:mi><mml:mi>l</mml:mi></mml:mrow></mml:msub><mml:mo mathsize="1.1em">[</mml:mo><mml:msup><mml:mi mathvariant="bold">D</mml:mi><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:msub><mml:mo mathsize="1.1em">]</mml:mo><mml:mrow><mml:mi>m</mml:mi><mml:mi>j</mml:mi></mml:mrow></mml:msub><mml:mo>.</mml:mo></mml:mrow></mml:math></disp-formula></p>
      <p id="d2e19924">Obviously, in a high-dimensional context, the approach would necessitate reduction methods such as Lanczos vectors or (randomised) singular value decompositions, and the generation of the ensemble would require a massive vectorisation on GPUs. <inline-formula><mml:math id="M805" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">Ω</mml:mi><mml:mi>r</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula> can then be computed by averaging <inline-formula><mml:math id="M806" display="inline"><mml:mi mathvariant="bold">Γ</mml:mi></mml:math></inline-formula> using, e.g., Eqs. (H2). Moreover, it is not difficult to show that <inline-formula><mml:math id="M807" display="inline"><mml:mrow><mml:msub><mml:mi mathvariant="bold">Ω</mml:mi><mml:mi>r</mml:mi></mml:msub></mml:mrow></mml:math></inline-formula>, as defined by Eq. (<xref ref-type="disp-formula" rid="App1.Ch1.S8.E106.107"/>), can alternatively be obtained by first averaging over <inline-formula><mml:math id="M808" display="inline"><mml:mi mathvariant="bold">C</mml:mi></mml:math></inline-formula> and <inline-formula><mml:math id="M809" display="inline"><mml:mi mathvariant="bold">D</mml:mi></mml:math></inline-formula> before performing the inversion of the regression, that is:
        

              <disp-formula id="App1.Ch1.S9.E117" specific-use="align" content-type="subnumberedsingle"><mml:math id="M810" display="block"><mml:mtable displaystyle="true"><mml:mlabeledtr id="App1.Ch1.S9.E117.118"><mml:mtd><mml:mtext>I5a</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:msub><mml:mi mathvariant="bold">Ω</mml:mi><mml:mi>r</mml:mi></mml:msub><mml:mo>=</mml:mo><mml:mover accent="true"><mml:mi mathvariant="bold">C</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mspace width="0.125em" linebreak="nobreak"/><mml:msup><mml:mover accent="true"><mml:mi mathvariant="bold">D</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:mrow><mml:mo>-</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow></mml:msup><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S9.E117.119"><mml:mtd><mml:mtext>I5b</mml:mtext></mml:mtd><mml:mtd><mml:mstyle class="stylechange" displaystyle="true"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo mathsize="1.1em">[</mml:mo><mml:mover accent="true"><mml:mi mathvariant="bold">C</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:msub><mml:mo mathsize="1.1em">]</mml:mo><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi><mml:mi>l</mml:mi></mml:mrow></mml:msub><mml:mo>=</mml:mo><mml:mstyle displaystyle="true"><mml:mfrac style="display"><mml:mn mathvariant="normal">1</mml:mn><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:mfrac></mml:mstyle><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>s</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:munderover><mml:msub><mml:mfenced close="]" open="["><mml:mi mathvariant="bold">C</mml:mi></mml:mfenced><mml:mrow><mml:msubsup><mml:mi>g</mml:mi><mml:mi>s</mml:mi><mml:mi>l</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi>i</mml:mi><mml:mo>)</mml:mo><mml:mspace linebreak="nobreak" width="0.125em"/><mml:msubsup><mml:mi>g</mml:mi><mml:mi>l</mml:mi><mml:mi>s</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi>j</mml:mi><mml:mo>)</mml:mo><mml:mspace linebreak="nobreak" width="0.125em"/><mml:mi>s</mml:mi></mml:mrow></mml:msub><mml:mo>,</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr><mml:mlabeledtr id="App1.Ch1.S9.E117.120"><mml:mtd><mml:mtext>I5c</mml:mtext></mml:mtd><mml:mtd><mml:mstyle displaystyle="true" class="stylechange"/></mml:mtd><mml:mtd><mml:mrow><mml:mstyle displaystyle="true" class="stylechange"/><mml:mo mathsize="1.1em">[</mml:mo><mml:mover accent="true"><mml:mi mathvariant="bold">D</mml:mi><mml:mo mathvariant="normal">‾</mml:mo></mml:mover><mml:msub><mml:mo mathsize="1.1em">]</mml:mo><mml:mrow><mml:mi>i</mml:mi><mml:mi>j</mml:mi></mml:mrow></mml:msub><mml:mo>=</mml:mo><mml:mstyle displaystyle="true"><mml:mfrac style="display"><mml:mn mathvariant="normal">1</mml:mn><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:mfrac></mml:mstyle><mml:munderover><mml:mo movablelimits="false">∑</mml:mo><mml:mrow><mml:mi>s</mml:mi><mml:mo>=</mml:mo><mml:mn mathvariant="normal">1</mml:mn></mml:mrow><mml:mrow><mml:msub><mml:mi>N</mml:mi><mml:mi mathvariant="normal">x</mml:mi></mml:msub></mml:mrow></mml:munderover><mml:msub><mml:mfenced open="[" close="]"><mml:mi mathvariant="bold">D</mml:mi></mml:mfenced><mml:mrow><mml:msubsup><mml:mi>g</mml:mi><mml:mi>s</mml:mi><mml:mi>j</mml:mi></mml:msubsup><mml:mo>(</mml:mo><mml:mi>i</mml:mi><mml:mo>)</mml:mo><mml:mspace width="0.125em" linebreak="nobreak"/><mml:mi>s</mml:mi></mml:mrow></mml:msub><mml:mo>.</mml:mo></mml:mrow></mml:mtd></mml:mlabeledtr></mml:mtable></mml:math></disp-formula>

        Either way, the composite approach may turn out numerically cheaper than the full differentiation approach.</p>
</app>
  </app-group><notes notes-type="codedataavailability"><title>Code and data availability</title>

      <p id="d2e20187">The core source code for training and testing one-dimensional DANs is publicly available under <uri>https://github.com/cerea-daml/Dan1D</uri> and Zenodo (<ext-link xlink:href="https://doi.org/10.5281/zenodo.21427793" ext-link-type="DOI">10.5281/zenodo.21427793</ext-link>, <xref ref-type="bibr" rid="bib1.bibx8" id="altparen.80"/>).</p>
  </notes><notes notes-type="authorcontribution"><title>Author contributions</title>

      <p id="d2e20202">MB performed the mathematical, algorithmic, and numerical analysis. MB and TSF discussed the implications of the results. All the authors worked on the structure of the manuscript. All the authors reviewed and edited the manuscript.</p>
  </notes><notes notes-type="competinginterests"><title>Competing interests</title>

      <p id="d2e20208">The contact author has declared that none of the authors has any competing interests.</p>
  </notes><notes notes-type="disclaimer"><title>Disclaimer</title>

      <p id="d2e20214">Publisher's note: Copernicus Publications remains neutral with regard to jurisdictional claims made in the text, published maps, institutional affiliations, or any other geographical representation in this paper. The authors bear the ultimate responsibility for providing appropriate place names. Views expressed in the text are those of the authors and do not necessarily reflect the views of the publisher.</p>
  </notes><ack><title>Acknowledgements</title><p id="d2e20220">The authors thank an anonymous Reviewer and Patrick N. Raanes for their sharp and inspiring comments and suggestions which benefited the paper. AI was used to polish the English of a limited number of paragraphs of the manuscript, and for a thorough check of notation consistency. CEREA is a member of Institut Pierre-Simon Laplace (IPSL).</p></ack><notes notes-type="financialsupport"><title>Financial support</title>

      <p id="d2e20225">This project – Learning efficient Data Assimilation from Artificial Intelligence (DAbyAI) – has been supported by NVIDIA and their Academic Grant Program through the grant of two RTX 6000 Ada GPUs that were intensively used in the numerical experiments of this work. This paper is also a contribution to the DRUIDS project, supported by France 2030 PEPR Maths-Vives, grant ANR-24-EXMA-0002. Tobias S. Finn acknowledges the support of the project SASIP (grant no. G-24-66154) funded by Schmidt Sciences – a philanthropic initiative that seeks to improve societal outcomes through the development of emerging science and technologies, and the support of France 2030 PEPR Maths-Vives, grant no. ANR-24-EXMA-0001, project Climaths/GenClimEx. Sibo Cheng acknowledges the support of the French Agence Nationale de la Recherche (ANR) under reference ANR-22-CPJ2-0143-01.</p>
  </notes><notes notes-type="reviewstatement"><title>Review statement</title>

      <p id="d2e20231">This paper was edited by Natale Alberto Carrassi and reviewed by Patrick N. Raanes and one anonymous referee.</p>
  </notes><ref-list>
    <title>References</title>

      <ref id="bib1.bibx1"><label>Agarwal et al.(2021)Agarwal, Jabbari, Agarwal, Upadhyay, Wu, and Lakkaraju</label><mixed-citation>Agarwal, S., Jabbari, S., Agarwal, C., Upadhyay, S., Wu, S., and Lakkaraju, H.: Towards the Unification and Robustness of Perturbation and Gradient Based Explanations, in: Proceedings of the 38th International Conference on Machine Learning, vol. 139, edited by Meila, M. and Zhang, T., Proceedings of Machine Learning Research, PMLR, 110–119, <uri>https://proceedings.mlr.press/v139/agarwal21c.html</uri> (last access: 7 August 2026), 2021.</mixed-citation></ref>
      <ref id="bib1.bibx2"><label>Allen et al.(2025)Allen, Markou, Tebbutt, Requeima, Bruinsma, Andersson, Herzog, Lane, Chantry, Hosking, and Turner</label><mixed-citation>Allen, A., Markou, S., Tebbutt, W., Requeima, J., Bruinsma, W. P., Andersson, T. R., Herzog, M., Lane, N. D., Chantry, M., Hosking, J. S., and Turner, R. E.: End-to-end data-driven weather prediction, Nature, <ext-link xlink:href="https://doi.org/10.1038/s41586-025-08897-0" ext-link-type="DOI">10.1038/s41586-025-08897-0</ext-link>, 2025.</mixed-citation></ref>
      <ref id="bib1.bibx3"><label>Arnold(1998)</label><mixed-citation>Arnold, L.: Random Dynamical Systems, Springer Berlin, Heidelberg, <ext-link xlink:href="https://doi.org/10.1007/978-3-662-12878-7" ext-link-type="DOI">10.1007/978-3-662-12878-7</ext-link>, 1998.</mixed-citation></ref>
      <ref id="bib1.bibx4"><label>Asch et al.(2016)Asch, Bocquet, and Nodet</label><mixed-citation>Asch, M., Bocquet, M., and Nodet, M.: Data Assimilation: Methods, Algorithms, and Applications, Fundamentals of Algorithms, SIAM, Philadelphia, <ext-link xlink:href="https://doi.org/10.1137/1.9781611974546" ext-link-type="DOI">10.1137/1.9781611974546</ext-link>, 2016.</mixed-citation></ref>
      <ref id="bib1.bibx5"><label>Bannister(2017)</label><mixed-citation>Bannister, R. N.: A review of operational methods of variational and ensemble-variational data assimilation, Q. J. Roy. Meteor. Soc., 143, 607–633, <ext-link xlink:href="https://doi.org/10.1002/qj.2982" ext-link-type="DOI">10.1002/qj.2982</ext-link>, 2017.</mixed-citation></ref>
      <ref id="bib1.bibx6"><label>Barone et al.(2025)Barone, Carrassi, Savary, Demaeyer, and Vannitsem</label><mixed-citation>Barone, A., Carrassi, A., Savary, T., Demaeyer, J., and Vannitsem, S.: Structural origins and real-time predictors of intermittency, Chaos, 35, 103119, <ext-link xlink:href="https://doi.org/10.1063/5.0287572" ext-link-type="DOI">10.1063/5.0287572</ext-link>, 2025.</mixed-citation></ref>
      <ref id="bib1.bibx7"><label>Bocquet(2011)</label><mixed-citation>Bocquet, M.: Ensemble Kalman filtering without the intrinsic need for inflation, Nonlin. Processes Geophys., 18, 735–750, <ext-link xlink:href="https://doi.org/10.5194/npg-18-735-2011" ext-link-type="DOI">10.5194/npg-18-735-2011</ext-link>, 2011.</mixed-citation></ref>
      <ref id="bib1.bibx8"><label>Bocquet(202026)</label><mixed-citation>Bocquet, M.: Dan1D: One-Dimensional Data Assimilation Network [Computer software], Zenodo [code], <ext-link xlink:href="https://doi.org/10.5281/zenodo.21427793" ext-link-type="DOI">10.5281/zenodo.21427793</ext-link>, 2026 (code also available at: <uri>https://github.com/cerea-daml/Dan1D</uri>, last access: 7 August 2026).</mixed-citation></ref>
      <ref id="bib1.bibx9"><label>Bocquet and Carrassi(2017)</label><mixed-citation>Bocquet, M. and Carrassi, A.: Four-dimensional ensemble variational data assimilation and the unstable subspace, Tellus A, 69, 1304504, <ext-link xlink:href="https://doi.org/10.1080/16000870.2017.1304504" ext-link-type="DOI">10.1080/16000870.2017.1304504</ext-link>, 2017.</mixed-citation></ref>
      <ref id="bib1.bibx10"><label>Bocquet and Farchi(2019)</label><mixed-citation>Bocquet, M. and Farchi, A.: On the consistency of the perturbation update of local ensemble square root Kalman filters, Tellus A, 71, 1–21, <ext-link xlink:href="https://doi.org/10.1080/16000870.2019.1613142" ext-link-type="DOI">10.1080/16000870.2019.1613142</ext-link>, 2019.</mixed-citation></ref>
      <ref id="bib1.bibx11"><label>Bocquet and Sakov(2012)</label><mixed-citation>Bocquet, M. and Sakov, P.: Combining inflation-free and iterative ensemble Kalman filters for strongly nonlinear systems, Nonlin. Processes Geophys., 19, 383–399, <ext-link xlink:href="https://doi.org/10.5194/npg-19-383-2012" ext-link-type="DOI">10.5194/npg-19-383-2012</ext-link>, 2012.</mixed-citation></ref>
      <ref id="bib1.bibx12"><label>Bocquet and Sakov(2013)</label><mixed-citation>Bocquet, M. and Sakov, P.: Joint state and parameter estimation with an iterative ensemble Kalman smoother, Nonlin. Processes Geophys., 20, 803–818, <ext-link xlink:href="https://doi.org/10.5194/npg-20-803-2013" ext-link-type="DOI">10.5194/npg-20-803-2013</ext-link>, 2013.</mixed-citation></ref>
      <ref id="bib1.bibx13"><label>Bocquet and Sakov(2014)</label><mixed-citation>Bocquet, M. and Sakov, P.: An iterative ensemble Kalman smoother, Q. J. Roy. Meteor. Soc., 140, 1521–1535, <ext-link xlink:href="https://doi.org/10.1002/qj.2236" ext-link-type="DOI">10.1002/qj.2236</ext-link>, 2014.</mixed-citation></ref>
      <ref id="bib1.bibx14"><label>Bocquet et al.(2015)Bocquet, Raanes, and Hannart</label><mixed-citation>Bocquet, M., Raanes, P. N., and Hannart, A.: Expanding the validity of the ensemble Kalman filter without the intrinsic need for inflation, Nonlin. Processes Geophys., 22, 645–662, <ext-link xlink:href="https://doi.org/10.5194/npg-22-645-2015" ext-link-type="DOI">10.5194/npg-22-645-2015</ext-link>, 2015.</mixed-citation></ref>
      <ref id="bib1.bibx15"><label>Bocquet et al.(2017)Bocquet, Gurumoorthy, Apte, Carrassi, Grudzien, and Jones</label><mixed-citation>Bocquet, M., Gurumoorthy, K. S., Apte, A., Carrassi, A., Grudzien, C., and Jones, C. K. R. T.: Degenerate Kalman filter error covariances and their convergence onto the unstable subspace, SIAM/ASA J. Uncertain. Quantif., 5, 304–333, <ext-link xlink:href="https://doi.org/10.1137/16M1068712" ext-link-type="DOI">10.1137/16M1068712</ext-link>, 2017.</mixed-citation></ref>
      <ref id="bib1.bibx16"><label>Bocquet et al.(2024)Bocquet, Farchi, Finn, Durand, Cheng, Chen, Pasmans, and Carrassi</label><mixed-citation>Bocquet, M., Farchi, A., Finn, T. S., Durand, C., Cheng, S., Chen, Y., Pasmans, I., and Carrassi, A.: Accurate deep learning-based filtering for chaotic dynamics by identifying instabilities without an ensemble, Chaos, 34, 091104, <ext-link xlink:href="https://doi.org/10.1063/5.0230837" ext-link-type="DOI">10.1063/5.0230837</ext-link>, 2024.</mixed-citation></ref>
      <ref id="bib1.bibx17"><label>Boucher et al.(2025)Boucher, Alexe, Lean, Pinnington, Lang, Laloyaux, Zampieri, de Rosnay, Bormann, and McNally</label><mixed-citation>Boucher, E., Alexe, M., Lean, P., Pinnington, E., Lang, S., Laloyaux, P., Zampieri, L., de Rosnay, P., Bormann, N., and McNally, A.: Learning Coupled Earth System Dynamics with GraphDOP, arXiv [preprint], <ext-link xlink:href="https://doi.org/10.48550/arXiv.2510.20416" ext-link-type="DOI">10.48550/arXiv.2510.20416</ext-link>, 2025.</mixed-citation></ref>
      <ref id="bib1.bibx18"><label>Boudier et al.(2023)Boudier, Fillion, Gratton, Gürol, and Zhang</label><mixed-citation>Boudier, P., Fillion, A., Gratton, S., Gürol, S., and Zhang, S.: Data Assimilation Networks, J. Adv. Model. Earth Sy., 15, e2022MS003353, <ext-link xlink:href="https://doi.org/10.1029/2022MS003353" ext-link-type="DOI">10.1029/2022MS003353</ext-link>, 2023.</mixed-citation></ref>
      <ref id="bib1.bibx19"><label>Buehner et al.(2015)Buehner, McTaggart-Cowan, Beaulne, Charette, Garand, Heilliette, Lapalme, Laroche, Macpherson, Morneau, and Zadra</label><mixed-citation>Buehner, M., McTaggart-Cowan, R., Beaulne, A., Charette, C., Garand, L., Heilliette, S., Lapalme, E., Laroche, S., Macpherson, S. R., Morneau, J., and Zadra, A.: Implementation of Deterministic Weather Forecasting Systems based on Ensemble-Variational Data Assimilation at Environment Canada. Part I: The Global System, Mon. Weather Rev., 143, 2532–2559, <ext-link xlink:href="https://doi.org/10.1175/MWR-D-14-00354.1" ext-link-type="DOI">10.1175/MWR-D-14-00354.1</ext-link>, 2015.</mixed-citation></ref>
      <ref id="bib1.bibx20"><label>Carrassi et al.(2008)Carrassi, Ghil, Trevisan, and Uboldi</label><mixed-citation>Carrassi, A., Ghil, M., Trevisan, A., and Uboldi, F.: Data assimilation as a nonlinear dynamical systems problem: Stability and convergence of the prediction-assimilation system, Chaos, 18, 023112, <ext-link xlink:href="https://doi.org/10.1063/1.2909862" ext-link-type="DOI">10.1063/1.2909862</ext-link>, 2008.</mixed-citation></ref>
      <ref id="bib1.bibx21"><label>Carrassi et al.(2018)Carrassi, Bocquet, Bertino, and Evensen</label><mixed-citation>Carrassi, A., Bocquet, M., Bertino, L., and Evensen, G.: Data Assimilation in the Geosciences: An overview on methods, issues, and perspectives, WIREs Clim. Change, 9, e535, <ext-link xlink:href="https://doi.org/10.1002/wcc.535" ext-link-type="DOI">10.1002/wcc.535</ext-link>, 2018.</mixed-citation></ref>
      <ref id="bib1.bibx22"><label>Carrassi et al.(2022)Carrassi, Bocquet, Demaeyer, Gruzien, Raanes, and Vannitsem</label><mixed-citation>Carrassi, A., Bocquet, M., Demaeyer, J., Gruzien, C., Raanes, P. N., and Vannitsem, S.: Data assimilation for chaotic dynamics, in: Data Assimilation for Atmospheric, Oceanic and Hydrologic Applications, vol. IV, edited by: Seon, K. P. and Liang, X., Springer International Publishing, Cham, 1–42, <ext-link xlink:href="https://doi.org/10.1007/978-3-030-77722-7_1" ext-link-type="DOI">10.1007/978-3-030-77722-7_1</ext-link>, 2022.</mixed-citation></ref>
      <ref id="bib1.bibx23"><label>Chekroun et al.(2011)Chekroun, Simonnet, and Ghil</label><mixed-citation>Chekroun, M. D., Simonnet, E., and Ghil, M.: Stochastic climate dynamics: Random attractors and time-dependent invariant measures, Physica D, 240, 1685–1700, <ext-link xlink:href="https://doi.org/10.1016/j.physd.2011.06.005" ext-link-type="DOI">10.1016/j.physd.2011.06.005</ext-link>, 2011.</mixed-citation></ref>
      <ref id="bib1.bibx24"><label>Cheng et al.(2023)Cheng, Quilodran-Casas, Ouala, Farchi, Liu, Tandeo, Fablet, Lucor, Iooss, Brajard, Xiao, Janjic, Ding, Guo, Carrassi, Bocquet, and Arcucci</label><mixed-citation>Cheng, S., Quilodran-Casas, C., Ouala, S., Farchi, A., Liu, C., Tandeo, P., Fablet, R., Lucor, D., Iooss, B., Brajard, J., Xiao, D., Janjic, T., Ding, W., Guo, Y., Carrassi, A., Bocquet, M., and Arcucci, R.: Machine learning with data assimilation and uncertainty quantification for dynamical systems: a review, IEEE/CAA J. Autom. Sin., 10, 1361–1387, <ext-link xlink:href="https://doi.org/10.1109/JAS.2023.123537" ext-link-type="DOI">10.1109/JAS.2023.123537</ext-link>, 2023.</mixed-citation></ref>
      <ref id="bib1.bibx25"><label>Cintra and de Campos Velho(2018)</label><mixed-citation>Cintra, R. S. and de Campos Velho, H. F.: Data assimilation by artificial neural networks for an atmospheric general circulation model, Chap. 17, IntechOpen, 265–286, <ext-link xlink:href="https://doi.org/10.5772/intechopen.70791" ext-link-type="DOI">10.5772/intechopen.70791</ext-link>, 2018.</mixed-citation></ref>
      <ref id="bib1.bibx26"><label>Daley(1991)</label><mixed-citation> Daley, R.: Atmospheric Data Analysis, Cambridge University Press, New York, ISBN 978-0-521-38215-1, 1991.</mixed-citation></ref>
      <ref id="bib1.bibx27"><label>Desroziers et al.(2014)Desroziers, Camino, and Berre</label><mixed-citation>Desroziers, G., Camino, J.-T., and Berre, L.: 4DEnVar: link with 4D state formulation of variational assimilation and different possible implementations, Q. J. Roy. Meteor. Soc., 140, 2097–2110, <ext-link xlink:href="https://doi.org/10.1002/qj.2325" ext-link-type="DOI">10.1002/qj.2325</ext-link>, 2014.</mixed-citation></ref>
      <ref id="bib1.bibx28"><label>Fablet et al.(2021)Fablet, Chapron, Drumetz, Mémin, Pannekoucke, and Rousseau</label><mixed-citation>Fablet, R., Chapron, B., Drumetz, L., Mémin, E., Pannekoucke, O., and Rousseau, F.: Learning Variational Data Assimilation Models and Solvers, J. Adv. Model. Earth Sy., 13, e2021MS002572, <ext-link xlink:href="https://doi.org/10.1029/2021MS002572" ext-link-type="DOI">10.1029/2021MS002572</ext-link>, 2021.</mixed-citation></ref>
      <ref id="bib1.bibx29"><label>Fillion et al.(2018)Fillion, Bocquet, and Gratton</label><mixed-citation>Fillion, A., Bocquet, M., and Gratton, S.: Quasi-static ensemble variational data assimilation: a theoretical and numerical study with the iterative ensemble Kalman smoother, Nonlin. Processes Geophys., 25, 315–334, <ext-link xlink:href="https://doi.org/10.5194/npg-25-315-2018" ext-link-type="DOI">10.5194/npg-25-315-2018</ext-link>, 2018.</mixed-citation></ref>
      <ref id="bib1.bibx30"><label>Fillion et al.(2020)Fillion, Bocquet, Gratton, Gürol, and Sakov</label><mixed-citation>Fillion, A., Bocquet, M., Gratton, S., Gürol, S., and Sakov, P.: An iterative ensemble Kalman smoother in presence of additive model error, SIAM/ASA J. Uncertain. Quantif., 8, 198–228, <ext-link xlink:href="https://doi.org/10.1137/19M1244147" ext-link-type="DOI">10.1137/19M1244147</ext-link>, 2020.</mixed-citation></ref>
      <ref id="bib1.bibx31"><label>Filoche et al.(2023)Filoche, Brajard, Charantonis, and Béréziat</label><mixed-citation>Filoche, A., Brajard, J., Charantonis, A., and Béréziat, D.: Learning 4DVAR Inversion Directly from Observations, in: Computational Science – ICCS 2023, edited by: Mikyška, J., de Mulatier, C., Paszynski, M., Krzhizhanovskaya, V. V., Dongarra, J. J., and Sloot, P. M., Springer Nature Switzerland, Cham, 414–421, <ext-link xlink:href="https://doi.org/10.1007/978-3-031-36027-5_32" ext-link-type="DOI">10.1007/978-3-031-36027-5_32</ext-link>, 2023.</mixed-citation></ref>
      <ref id="bib1.bibx32"><label>Flandoli and Tonello(2021)</label><mixed-citation>Flandoli, F. and Tonello, E.: An introduction to random dynamical systems for climate, <uri>https://pagine.dm.unipi.it/flandoli/Part1bis.pdf</uri> (last access: 7 August 2026), 2021.</mixed-citation></ref>
      <ref id="bib1.bibx33"><label>Frerix et al.(2021)Frerix, Kochkov, Smith, Cremers, Brenner, and Hoyer</label><mixed-citation>Frerix, T., Kochkov, D., Smith, J., Cremers, D., Brenner, M., and Hoyer, S.: Variational Data Assimilation with a Learned Inverse Observation Operator, in: Proceedings of the 38th International Conference on Machine Learning, edited by Meila, M. and Zhang, T., vol. 139 of Proceedings of Machine Learning Research, PMLR, 3449–3458, <uri>https://proceedings.mlr.press/v139/frerix21a.html</uri> (last access: 7 August 2026), 2021.</mixed-citation></ref>
      <ref id="bib1.bibx34"><label>Ghil and Sciamarella(2023)</label><mixed-citation>Ghil, M. and Sciamarella, D.: Review article: Dynamical systems, algebraic topology and the climate sciences, Nonlin. Processes Geophys., 30, 399–434, <ext-link xlink:href="https://doi.org/10.5194/npg-30-399-2023" ext-link-type="DOI">10.5194/npg-30-399-2023</ext-link>, 2023.</mixed-citation></ref>
      <ref id="bib1.bibx35"><label>Härter and de Campos Velho(2012)</label><mixed-citation>Härter, T. P. and de Campos Velho, H. F.: Data Assimilation Procedure by Recurrent Neural Network, Eng. Appl. Comp. Fluid, 6, 224–233, <ext-link xlink:href="https://doi.org/10.1080/19942060.2012.11015417" ext-link-type="DOI">10.1080/19942060.2012.11015417</ext-link>, 2012.</mixed-citation></ref>
      <ref id="bib1.bibx36"><label>Jazwinski(1970)</label><mixed-citation>Jazwinski, A. H.: Stochastic Processes and Filtering Theory, Academic Press, New York, ISBN 978-0-12-381550-7, <ext-link xlink:href="https://doi.org/10.1016/S0076-5392(09)60368-4" ext-link-type="DOI">10.1016/S0076-5392(09)60368-4</ext-link>, 1970.</mixed-citation></ref>
      <ref id="bib1.bibx37"><label>Kalnay(2003)</label><mixed-citation>Kalnay, E.: Atmospheric Modeling, Data Assimilation and Predictability, Cambridge University Press, Cambridge, ISBN 978-0-521-79629-3, <ext-link xlink:href="https://doi.org/10.1017/CBO9780511802270" ext-link-type="DOI">10.1017/CBO9780511802270</ext-link>, 2003.</mixed-citation></ref>
      <ref id="bib1.bibx38"><label>Karimi and Paul(2010)</label><mixed-citation>Karimi, A. and Paul, M. R.: Extensive chaos in the Lorenz-96 model, Chaos, 20, 043105, <ext-link xlink:href="https://doi.org/10.1063/1.3496397" ext-link-type="DOI">10.1063/1.3496397</ext-link>, 2010.</mixed-citation></ref>
      <ref id="bib1.bibx39"><label>Keller and Potthast(2024)</label><mixed-citation>Keller, J. D. and Potthast, R.: AI-based data assimilation: Learning the functional of analysis estimation, arXiv [preprint], <ext-link xlink:href="https://doi.org/10.48550/arXiv.2406.00390" ext-link-type="DOI">10.48550/arXiv.2406.00390</ext-link>, 2024.</mixed-citation></ref>
      <ref id="bib1.bibx40"><label>Kuramoto and Tsuzuki(1976)</label><mixed-citation>Kuramoto, Y. and Tsuzuki, T.: Persistent propagation of concentration waves in dissipative media far from thermal equilibrium, Prog. Theor. Phys., 55, 356–369, <ext-link xlink:href="https://doi.org/10.1143/PTP.55.356" ext-link-type="DOI">10.1143/PTP.55.356</ext-link>, 1976.</mixed-citation></ref>
      <ref id="bib1.bibx41"><label>Lafon et al.(2023)Lafon, Fablet, and Naveau</label><mixed-citation>Lafon, N., Fablet, R., and Naveau, P.: Uncertainty Quantification When Learning Dynamical Models and Solvers With Variational Methods, J. Adv. Model. Earth Sy., 15, e2022MS003446, <ext-link xlink:href="https://doi.org/10.1029/2022MS003446" ext-link-type="DOI">10.1029/2022MS003446</ext-link>, 2023.</mixed-citation></ref>
      <ref id="bib1.bibx42"><label>Laloyaux et al.(2025)Laloyaux, Alexe, Boucher, Lean, Pinnington, Lang, Necker, and McNally</label><mixed-citation>Laloyaux, P., Alexe, M., Boucher, E., Lean, P., Pinnington, E., Lang, S., Necker, T., and McNally, A.: Using data assimilation tools to dissect GraphDOP, arXiv [preprint], <ext-link xlink:href="https://doi.org/10.48550/arXiv.2510.27388" ext-link-type="DOI">10.48550/arXiv.2510.27388</ext-link>, 2025.</mixed-citation></ref>
      <ref id="bib1.bibx43"><label>Lean et al.(2025)Lean, Alexe, Boucher, Pinnington, Lang, Laloyaux, Bormann, and McNally</label><mixed-citation>Lean, P., Alexe, M., Boucher, E., Pinnington, E., Lang, S., Laloyaux, P., Bormann, N., and McNally, A.: Learning from nature: insights into GraphDOP's representations of the Earth System, arXiv [preprint], <ext-link xlink:href="https://doi.org/10.48550/arXiv.2508.18018" ext-link-type="DOI">10.48550/arXiv.2508.18018</ext-link>, 2025.</mixed-citation></ref>
      <ref id="bib1.bibx44"><label>Liu(1994)</label><mixed-citation>Liu, J. S.: Siegel's formula via Stein's identities, Stat. Probabil. Lett., 21, 247–251, <ext-link xlink:href="https://doi.org/10.1016/0167-7152(94)90121-X" ext-link-type="DOI">10.1016/0167-7152(94)90121-X</ext-link>, 1994.</mixed-citation></ref>
      <ref id="bib1.bibx45"><label>Lorenz and Emanuel(1998)</label><mixed-citation>Lorenz, E. N. and Emanuel, K. A.: Optimal sites for supplementary weather observations: simulation with a small model, J. Atmos. Sci., 55, 399–414, <ext-link xlink:href="https://doi.org/10.1175/1520-0469(1998)055&lt;0399:OSFSWO&gt;2.0.CO;2" ext-link-type="DOI">10.1175/1520-0469(1998)055&lt;0399:OSFSWO&gt;2.0.CO;2</ext-link>, 1998.</mixed-citation></ref>
      <ref id="bib1.bibx46"><label>Lu(2025)</label><mixed-citation>Lu, F.: U-Net Kalman Filter (UNetKF): An Example of Machine Learning-Assisted Data Assimilation, J. Adv. Model. Earth Sy., 17, e2023MS003979, <ext-link xlink:href="https://doi.org/10.1029/2023MS003979" ext-link-type="DOI">10.1029/2023MS003979</ext-link>, 2025.</mixed-citation></ref>
      <ref id="bib1.bibx47"><label>Maddy et al.(2024)Maddy, Boukabara, and Iturbide-Sanchez</label><mixed-citation>Maddy, E. S., Boukabara, S. A., and Iturbide-Sanchez, F.: Assessing the Feasibility of an NWP Satellite Data Assimilation System Entirely Based on AI Techniques, IEEE J. Sel. Top. Appl., 17, 9828–9845, <ext-link xlink:href="https://doi.org/10.1109/JSTARS.2024.3397078" ext-link-type="DOI">10.1109/JSTARS.2024.3397078</ext-link>, 2024.</mixed-citation></ref>
      <ref id="bib1.bibx48"><label>McCabe and Brown(2021)</label><mixed-citation>McCabe, M. and Brown, J.: Learning to Assimilate in Chaotic Dynamical Systems, in: Advances in Neural Information Processing Systems, vol. 34, edited by: Ranzato, M., Beygelzimer, A., Dauphin, Y., Liang, P., and Vaughan, J. W., Curran Associates, Inc., 12237–12250, <uri>https://proceedings.neurips.cc/paper_files/paper/2021/file/65cc2c8205a05d7379fa3a6386f710e1-Paper.pdf</uri> (last access: 7 August 2026), 2021.</mixed-citation></ref>
      <ref id="bib1.bibx49"><label>Misra(2019)</label><mixed-citation>Misra, D.: Mish: A Self Regularized Non-Monotonic Neural Activation Function, arXiv [preprint], <ext-link xlink:href="https://doi.org/10.48550/arXiv.1908.08681" ext-link-type="DOI">10.48550/arXiv.1908.08681</ext-link>, 2019.</mixed-citation></ref>
      <ref id="bib1.bibx50"><label>Oseledec(1968)</label><mixed-citation> Oseledec, V. I.: A multiplicative ergodic theorem. Ljapunov characteristic numbers for dynamical systems, Trans. Moscow Math Soc., 19, 197–231, 1968.</mixed-citation></ref>
      <ref id="bib1.bibx51"><label>Palatella et al.(2013)Palatella, Carrassi, and Trevisan</label><mixed-citation>Palatella, L., Carrassi, A., and Trevisan, A.: Lyapunov vectors and assimilation in the unstable subspace: theory and applications, J. Phys. A-Math. Theor., 46, 254020, <ext-link xlink:href="https://doi.org/10.1088/1751-8113/46/25/254020" ext-link-type="DOI">10.1088/1751-8113/46/25/254020</ext-link>, 2013.</mixed-citation></ref>
      <ref id="bib1.bibx52"><label>Pannekoucke and Fablet(2020)</label><mixed-citation>Pannekoucke, O. and Fablet, R.: PDE-NetGen 1.0: from symbolic partial differential equation (PDE) representations of physical processes to trainable neural network representations, Geosci. Model Dev., 13, 3373–3382, <ext-link xlink:href="https://doi.org/10.5194/gmd-13-3373-2020" ext-link-type="DOI">10.5194/gmd-13-3373-2020</ext-link>, 2020. </mixed-citation></ref>
      <ref id="bib1.bibx53"><label>Pannekoucke et al.(2016)Pannekoucke, Ricci, Barthelemy, Ménard, and Thual</label><mixed-citation>Pannekoucke, O., Ricci, S., Barthelemy, S., Ménard, R., and Thual, O.: Parametric Kalman filter for chemical transport model, Tellus A, 68, 31457, <ext-link xlink:href="https://doi.org/10.3402/tellusa.v68.31547" ext-link-type="DOI">10.3402/tellusa.v68.31547</ext-link>, 2016.</mixed-citation></ref>
      <ref id="bib1.bibx54"><label>Pannekoucke et al.(2018)Pannekoucke, Bocquet, and Ménard</label><mixed-citation>Pannekoucke, O., Bocquet, M., and Ménard, R.: Parametric covariance dynamics for the nonlinear diffusive Burgers equation, Nonlin. Processes Geophys., 25, 481–495, <ext-link xlink:href="https://doi.org/10.5194/npg-25-481-2018" ext-link-type="DOI">10.5194/npg-25-481-2018</ext-link>, 2018.</mixed-citation></ref>
      <ref id="bib1.bibx55"><label>Raanes et al.(2019)Raanes, Stordal, and Evensen</label><mixed-citation>Raanes, P. N., Stordal, A. S., and Evensen, G.: Revising the stochastic iterative ensemble smoother, Nonlin. Processes Geophys., 26, 325–338, <ext-link xlink:href="https://doi.org/10.5194/npg-26-325-2019" ext-link-type="DOI">10.5194/npg-26-325-2019</ext-link>, 2019.</mixed-citation></ref>
      <ref id="bib1.bibx56"><label>Ribeiro et al.(2016)Ribeiro, Singh, and Guestrin</label><mixed-citation>Ribeiro, M. T., Singh, S., and Guestrin, C.: Why Should I Trust You?: Explaining the Predictions of Any Classifier, in: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, KDD '16, Association for Computing Machinery, New York, NY, USA, 1135–1144, <ext-link xlink:href="https://doi.org/10.1145/2939672.2939778" ext-link-type="DOI">10.1145/2939672.2939778</ext-link>, 2016.</mixed-citation></ref>
      <ref id="bib1.bibx57"><label>Sacco et al.(2024)Sacco, Pulido, Ruiz, and Tandeo</label><mixed-citation>Sacco, M. A., Pulido, M., Ruiz, J. J., and Tandeo, P.: On-line machine-learning forecast uncertainty estimation for sequential data assimilation, Q. J. Roy. Meteor. Soc., 150, 2937–2954, <ext-link xlink:href="https://doi.org/10.1002/qj.4743" ext-link-type="DOI">10.1002/qj.4743</ext-link>, 2024.</mixed-citation></ref>
      <ref id="bib1.bibx58"><label>Sakov(2025)</label><mixed-citation>Sakov, P.: On building the state error covariance from a state estimate, arXiv [preprint], <ext-link xlink:href="https://doi.org/10.48550/arXiv.2411.14809" ext-link-type="DOI">10.48550/arXiv.2411.14809</ext-link>, 2025.</mixed-citation></ref>
      <ref id="bib1.bibx59"><label>Sakov et al.(2012)Sakov, Oliver, and Bertino</label><mixed-citation>Sakov, P., Oliver, D. S., and Bertino, L.: An iterative EnKF for strongly nonlinear systems, Mon. Weather Rev., 140, 1988–2004, <ext-link xlink:href="https://doi.org/10.1175/MWR-D-11-00176.1" ext-link-type="DOI">10.1175/MWR-D-11-00176.1</ext-link>, 2012.</mixed-citation></ref>
      <ref id="bib1.bibx60"><label>Sivashinsky(1977)</label><mixed-citation>Sivashinsky, G. I.: Nonlinear analysis of hydrodynamic instability in laminar flames-I. Derivation of basic equations, Acta Astronaut., 4, 1177–1206, <ext-link xlink:href="https://doi.org/10.1016/0094-5765(77)90096-0" ext-link-type="DOI">10.1016/0094-5765(77)90096-0</ext-link>, 1977.</mixed-citation></ref>
      <ref id="bib1.bibx61"><label>Smilkov et al.(2017)Smilkov, Thorat, Kim, Viégas, and Wattenberg</label><mixed-citation>Smilkov, D., Thorat, N., Kim, B., Viégas, F. B., and Wattenberg, M.: SmoothGrad: removing noise by adding noise, CoRR, arXiv [preprint], <ext-link xlink:href="https://doi.org/10.48550/arXiv.1706.03825" ext-link-type="DOI">10.48550/arXiv.1706.03825</ext-link>, 2017.</mixed-citation></ref>
      <ref id="bib1.bibx62"><label>Stordal et al.(2016)Stordal, Szklarz, and Leeuwenburgh</label><mixed-citation>Stordal, A. S., Szklarz, S. P., and Leeuwenburgh, O.: A Theoretical look at Ensemble-Based Optimization in Reservoir Management, Math. Geosci., 48, 399–417, <ext-link xlink:href="https://doi.org/10.1007/s11004-015-9598-6" ext-link-type="DOI">10.1007/s11004-015-9598-6</ext-link>, 2016.</mixed-citation></ref>
      <ref id="bib1.bibx63"><label>Tang and Glass(2018)</label><mixed-citation>Tang, H. and Glass, J.: On Training Recurrent Networks with Truncated Backpropagation Through time in Speech Recognition, in: 2018 IEEE Spoken Language Technology Workshop (SLT), 48–55, <ext-link xlink:href="https://doi.org/10.1109/SLT.2018.8639517" ext-link-type="DOI">10.1109/SLT.2018.8639517</ext-link>, 2018.</mixed-citation></ref>
      <ref id="bib1.bibx64"><label>van Kekem and Sterk(2018)</label><mixed-citation>van Kekem, D. L. and Sterk, A. E.: Travelling waves and their bifurcations in the Lorenz-96 model, Physica D, 367, 38–60, <ext-link xlink:href="https://doi.org/10.1016/j.physd.2017.11.008" ext-link-type="DOI">10.1016/j.physd.2017.11.008</ext-link>, 2018.</mixed-citation></ref>
      <ref id="bib1.bibx65"><label>Wishner et al.(1969)Wishner, Tabaczynski, and Athans</label><mixed-citation>Wishner, R. P., Tabaczynski, J. A., and Athans, M.: A Comparison of Three Non-Linear Filters, Automatica, 5, 487–496, <ext-link xlink:href="https://doi.org/10.1016/0005-1098(69)90110-1" ext-link-type="DOI">10.1016/0005-1098(69)90110-1</ext-link>, 1969.</mixed-citation></ref>

  </ref-list></back>
    <!--<article-title-html>Elucidating the performance of data assimilation neural networks for chaotic dynamics</article-title-html>
<abstract-html/>
<ref-html id="bib1.bib1"><label>Agarwal et al.(2021)Agarwal, Jabbari, Agarwal, Upadhyay, Wu, and Lakkaraju</label><mixed-citation>
      
Agarwal, S., Jabbari, S., Agarwal, C., Upadhyay, S., Wu, S., and Lakkaraju, H.: Towards the Unification and Robustness of Perturbation and Gradient Based Explanations, in: Proceedings of the 38th International Conference on Machine Learning, vol. 139, edited by Meila, M. and Zhang, T., Proceedings of Machine Learning Research, PMLR, 110–119, <a href="https://proceedings.mlr.press/v139/agarwal21c.html" target="_blank"/> (last access: 7 August 2026), 2021.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib2"><label>Allen et al.(2025)Allen, Markou, Tebbutt, Requeima, Bruinsma, Andersson, Herzog, Lane, Chantry, Hosking, and Turner</label><mixed-citation>
      
Allen, A., Markou, S., Tebbutt, W., Requeima, J., Bruinsma, W. P., Andersson, T. R., Herzog, M., Lane, N. D., Chantry, M., Hosking, J. S., and Turner, R. E.:
End-to-end data-driven weather prediction, Nature, <a href="https://doi.org/10.1038/s41586-025-08897-0" target="_blank">https://doi.org/10.1038/s41586-025-08897-0</a>, 2025.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib3"><label>Arnold(1998)</label><mixed-citation>
      
Arnold, L.:
Random Dynamical Systems, Springer Berlin, Heidelberg, <a href="https://doi.org/10.1007/978-3-662-12878-7" target="_blank">https://doi.org/10.1007/978-3-662-12878-7</a>, 1998.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib4"><label>Asch et al.(2016)Asch, Bocquet, and Nodet</label><mixed-citation>
      
Asch, M., Bocquet, M., and Nodet, M.:
Data Assimilation: Methods, Algorithms, and Applications, Fundamentals of Algorithms, SIAM, Philadelphia, <a href="https://doi.org/10.1137/1.9781611974546" target="_blank">https://doi.org/10.1137/1.9781611974546</a>, 2016.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib5"><label>Bannister(2017)</label><mixed-citation>
      
Bannister, R. N.:
A review of operational methods of variational and ensemble-variational data assimilation, Q. J. Roy. Meteor. Soc., 143, 607–633, <a href="https://doi.org/10.1002/qj.2982" target="_blank">https://doi.org/10.1002/qj.2982</a>, 2017.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib6"><label>Barone et al.(2025)Barone, Carrassi, Savary, Demaeyer, and Vannitsem</label><mixed-citation>
      
Barone, A., Carrassi, A., Savary, T., Demaeyer, J., and Vannitsem, S.:
Structural origins and real-time predictors of intermittency, Chaos, 35, 103119, <a href="https://doi.org/10.1063/5.0287572" target="_blank">https://doi.org/10.1063/5.0287572</a>, 2025.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib7"><label>Bocquet(2011)</label><mixed-citation>
      
Bocquet, M.: Ensemble Kalman filtering without the intrinsic need for inflation, Nonlin. Processes Geophys., 18, 735–750, <a href="https://doi.org/10.5194/npg-18-735-2011" target="_blank">https://doi.org/10.5194/npg-18-735-2011</a>, 2011.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib8"><label>Bocquet(202026)</label><mixed-citation>
      
Bocquet, M.: Dan1D: One-Dimensional Data Assimilation Network [Computer software], Zenodo [code], <a href="https://doi.org/10.5281/zenodo.21427793" target="_blank">https://doi.org/10.5281/zenodo.21427793</a>, 2026 (code also available at: <a href="https://github.com/cerea-daml/Dan1D" target="_blank"/>, last access: 7 August 2026).

    </mixed-citation></ref-html>
<ref-html id="bib1.bib9"><label>Bocquet and Carrassi(2017)</label><mixed-citation>
      
Bocquet, M. and Carrassi, A.:
Four-dimensional ensemble variational data assimilation and the unstable subspace, Tellus A, 69, 1304504, <a href="https://doi.org/10.1080/16000870.2017.1304504" target="_blank">https://doi.org/10.1080/16000870.2017.1304504</a>, 2017.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib10"><label>Bocquet and Farchi(2019)</label><mixed-citation>
      
Bocquet, M. and Farchi, A.:
On the consistency of the perturbation update of local ensemble square root Kalman filters, Tellus A, 71, 1–21, <a href="https://doi.org/10.1080/16000870.2019.1613142" target="_blank">https://doi.org/10.1080/16000870.2019.1613142</a>, 2019.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib11"><label>Bocquet and Sakov(2012)</label><mixed-citation>
      
Bocquet, M. and Sakov, P.: Combining inflation-free and iterative ensemble Kalman filters for strongly nonlinear systems, Nonlin. Processes Geophys., 19, 383–399, <a href="https://doi.org/10.5194/npg-19-383-2012" target="_blank">https://doi.org/10.5194/npg-19-383-2012</a>, 2012.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib12"><label>Bocquet and Sakov(2013)</label><mixed-citation>
      
Bocquet, M. and Sakov, P.: Joint state and parameter estimation with an iterative ensemble Kalman smoother, Nonlin. Processes Geophys., 20, 803–818, <a href="https://doi.org/10.5194/npg-20-803-2013" target="_blank">https://doi.org/10.5194/npg-20-803-2013</a>, 2013.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib13"><label>Bocquet and Sakov(2014)</label><mixed-citation>
      
Bocquet, M. and Sakov, P.:
An iterative ensemble Kalman smoother, Q. J. Roy. Meteor. Soc., 140, 1521–1535, <a href="https://doi.org/10.1002/qj.2236" target="_blank">https://doi.org/10.1002/qj.2236</a>, 2014.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib14"><label>Bocquet et al.(2015)Bocquet, Raanes, and Hannart</label><mixed-citation>
      
Bocquet, M., Raanes, P. N., and Hannart, A.: Expanding the validity of the ensemble Kalman filter without the intrinsic need for inflation, Nonlin. Processes Geophys., 22, 645–662, <a href="https://doi.org/10.5194/npg-22-645-2015" target="_blank">https://doi.org/10.5194/npg-22-645-2015</a>, 2015.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib15"><label>Bocquet et al.(2017)Bocquet, Gurumoorthy, Apte, Carrassi, Grudzien, and Jones</label><mixed-citation>
      
Bocquet, M., Gurumoorthy, K. S., Apte, A., Carrassi, A., Grudzien, C., and Jones, C. K. R. T.:
Degenerate Kalman filter error covariances and their convergence onto the unstable subspace, SIAM/ASA J. Uncertain. Quantif., 5, 304–333, <a href="https://doi.org/10.1137/16M1068712" target="_blank">https://doi.org/10.1137/16M1068712</a>, 2017.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib16"><label>Bocquet et al.(2024)Bocquet, Farchi, Finn, Durand, Cheng, Chen, Pasmans, and Carrassi</label><mixed-citation>
      
Bocquet, M., Farchi, A., Finn, T. S., Durand, C., Cheng, S., Chen, Y., Pasmans, I., and Carrassi, A.:
Accurate deep learning-based filtering for chaotic dynamics by identifying instabilities without an ensemble, Chaos, 34, 091104, <a href="https://doi.org/10.1063/5.0230837" target="_blank">https://doi.org/10.1063/5.0230837</a>, 2024.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib17"><label>Boucher et al.(2025)Boucher, Alexe, Lean, Pinnington, Lang, Laloyaux, Zampieri, de Rosnay, Bormann, and McNally</label><mixed-citation>
      
Boucher, E., Alexe, M., Lean, P., Pinnington, E., Lang, S., Laloyaux, P., Zampieri, L., de Rosnay, P., Bormann, N., and McNally, A.:
Learning Coupled Earth System Dynamics with GraphDOP, arXiv [preprint], <a href="https://doi.org/10.48550/arXiv.2510.20416" target="_blank">https://doi.org/10.48550/arXiv.2510.20416</a>, 2025.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib18"><label>Boudier et al.(2023)Boudier, Fillion, Gratton, Gürol, and Zhang</label><mixed-citation>
      
Boudier, P., Fillion, A., Gratton, S., Gürol, S., and Zhang, S.:
Data Assimilation Networks, J. Adv. Model. Earth Sy., 15, e2022MS003353, <a href="https://doi.org/10.1029/2022MS003353" target="_blank">https://doi.org/10.1029/2022MS003353</a>, 2023.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib19"><label>Buehner et al.(2015)Buehner, McTaggart-Cowan, Beaulne, Charette, Garand, Heilliette, Lapalme, Laroche, Macpherson, Morneau, and Zadra</label><mixed-citation>
      
Buehner, M., McTaggart-Cowan, R., Beaulne, A., Charette, C., Garand, L., Heilliette, S., Lapalme, E., Laroche, S., Macpherson, S. R., Morneau, J., and Zadra, A.:
Implementation of Deterministic Weather Forecasting Systems based on Ensemble-Variational Data Assimilation at Environment Canada. Part I: The Global System, Mon. Weather Rev., 143, 2532–2559, <a href="https://doi.org/10.1175/MWR-D-14-00354.1" target="_blank">https://doi.org/10.1175/MWR-D-14-00354.1</a>, 2015.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib20"><label>Carrassi et al.(2008)Carrassi, Ghil, Trevisan, and Uboldi</label><mixed-citation>
      
Carrassi, A., Ghil, M., Trevisan, A., and Uboldi, F.:
Data assimilation as a nonlinear dynamical systems problem: Stability and convergence of the prediction-assimilation system, Chaos, 18, 023112, <a href="https://doi.org/10.1063/1.2909862" target="_blank">https://doi.org/10.1063/1.2909862</a>, 2008.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib21"><label>Carrassi et al.(2018)Carrassi, Bocquet, Bertino, and Evensen</label><mixed-citation>
      
Carrassi, A., Bocquet, M., Bertino, L., and Evensen, G.:
Data Assimilation in the Geosciences: An overview on methods, issues, and perspectives, WIREs Clim. Change, 9, e535, <a href="https://doi.org/10.1002/wcc.535" target="_blank">https://doi.org/10.1002/wcc.535</a>, 2018.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib22"><label>Carrassi et al.(2022)Carrassi, Bocquet, Demaeyer, Gruzien, Raanes, and Vannitsem</label><mixed-citation>
      
Carrassi, A., Bocquet, M., Demaeyer, J., Gruzien, C., Raanes, P. N., and Vannitsem, S.:
Data assimilation for chaotic dynamics, in: Data Assimilation for Atmospheric, Oceanic and Hydrologic Applications, vol. IV, edited by: Seon, K. P. and Liang, X., Springer International Publishing, Cham, 1–42, <a href="https://doi.org/10.1007/978-3-030-77722-7_1" target="_blank">https://doi.org/10.1007/978-3-030-77722-7_1</a>, 2022.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib23"><label>Chekroun et al.(2011)Chekroun, Simonnet, and Ghil</label><mixed-citation>
      
Chekroun, M. D., Simonnet, E., and Ghil, M.:
Stochastic climate dynamics: Random attractors and time-dependent invariant measures, Physica D, 240, 1685–1700, <a href="https://doi.org/10.1016/j.physd.2011.06.005" target="_blank">https://doi.org/10.1016/j.physd.2011.06.005</a>, 2011.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib24"><label>Cheng et al.(2023)Cheng, Quilodran-Casas, Ouala, Farchi, Liu, Tandeo, Fablet, Lucor, Iooss, Brajard, Xiao, Janjic, Ding, Guo, Carrassi, Bocquet, and Arcucci</label><mixed-citation>
      
Cheng, S., Quilodran-Casas, C., Ouala, S., Farchi, A., Liu, C., Tandeo, P., Fablet, R., Lucor, D., Iooss, B., Brajard, J., Xiao, D., Janjic, T., Ding, W., Guo, Y., Carrassi, A., Bocquet, M., and Arcucci, R.:
Machine learning with data assimilation and uncertainty quantification for dynamical systems: a review, IEEE/CAA J. Autom. Sin., 10, 1361–1387, <a href="https://doi.org/10.1109/JAS.2023.123537" target="_blank">https://doi.org/10.1109/JAS.2023.123537</a>, 2023.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib25"><label>Cintra and de Campos Velho(2018)</label><mixed-citation>
      
Cintra, R. S. and de Campos Velho, H. F.:
Data assimilation by artificial neural networks for an atmospheric general circulation model, Chap. 17, IntechOpen, 265–286, <a href="https://doi.org/10.5772/intechopen.70791" target="_blank">https://doi.org/10.5772/intechopen.70791</a>, 2018.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib26"><label>Daley(1991)</label><mixed-citation>
      
Daley, R.: Atmospheric Data Analysis, Cambridge University Press, New York, ISBN 978-0-521-38215-1, 1991.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib27"><label>Desroziers et al.(2014)Desroziers, Camino, and Berre</label><mixed-citation>
      
Desroziers, G., Camino, J.-T., and Berre, L.:
4DEnVar: link with 4D state formulation of variational assimilation and different possible implementations, Q. J. Roy. Meteor. Soc., 140, 2097–2110, <a href="https://doi.org/10.1002/qj.2325" target="_blank">https://doi.org/10.1002/qj.2325</a>, 2014.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib28"><label>Fablet et al.(2021)Fablet, Chapron, Drumetz, Mémin, Pannekoucke, and Rousseau</label><mixed-citation>
      
Fablet, R., Chapron, B., Drumetz, L., Mémin, E., Pannekoucke, O., and Rousseau, F.:
Learning Variational Data Assimilation Models and Solvers, J. Adv. Model. Earth Sy., 13, e2021MS002572, <a href="https://doi.org/10.1029/2021MS002572" target="_blank">https://doi.org/10.1029/2021MS002572</a>, 2021.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib29"><label>Fillion et al.(2018)Fillion, Bocquet, and Gratton</label><mixed-citation>
      
Fillion, A., Bocquet, M., and Gratton, S.: Quasi-static ensemble variational data assimilation: a theoretical and numerical study with the iterative ensemble Kalman smoother, Nonlin. Processes Geophys., 25, 315–334, <a href="https://doi.org/10.5194/npg-25-315-2018" target="_blank">https://doi.org/10.5194/npg-25-315-2018</a>, 2018.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib30"><label>Fillion et al.(2020)Fillion, Bocquet, Gratton, Gürol, and Sakov</label><mixed-citation>
      
Fillion, A., Bocquet, M., Gratton, S., Gürol, S., and Sakov, P.:
An iterative ensemble Kalman smoother in presence of additive model error, SIAM/ASA J. Uncertain. Quantif., 8, 198–228, <a href="https://doi.org/10.1137/19M1244147" target="_blank">https://doi.org/10.1137/19M1244147</a>, 2020.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib31"><label>Filoche et al.(2023)Filoche, Brajard, Charantonis, and Béréziat</label><mixed-citation>
      
Filoche, A., Brajard, J., Charantonis, A., and Béréziat, D.:
Learning 4DVAR
Inversion Directly from Observations, in: Computational Science – ICCS 2023, edited by: Mikyška, J., de Mulatier, C., Paszynski, M., Krzhizhanovskaya, V. V., Dongarra, J. J., and Sloot, P. M., Springer Nature Switzerland, Cham, 414–421, <a href="https://doi.org/10.1007/978-3-031-36027-5_32" target="_blank">https://doi.org/10.1007/978-3-031-36027-5_32</a>, 2023.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib32"><label>Flandoli and Tonello(2021)</label><mixed-citation>
      
Flandoli, F. and Tonello, E.: An introduction to random dynamical systems for climate, <a href="https://pagine.dm.unipi.it/flandoli/Part1bis.pdf" target="_blank"/> (last access: 7 August 2026), 2021.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib33"><label>Frerix et al.(2021)Frerix, Kochkov, Smith, Cremers, Brenner, and Hoyer</label><mixed-citation>
      
Frerix, T., Kochkov, D., Smith, J., Cremers, D., Brenner, M., and Hoyer, S.:
Variational Data Assimilation with a Learned Inverse Observation Operator, in: Proceedings of the 38th International Conference on Machine Learning, edited by Meila, M. and Zhang, T., vol. 139 of Proceedings of Machine Learning Research, PMLR, 3449–3458, <a href="https://proceedings.mlr.press/v139/frerix21a.html" target="_blank"/> (last access: 7 August 2026), 2021.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib34"><label>Ghil and Sciamarella(2023)</label><mixed-citation>
      
Ghil, M. and Sciamarella, D.: Review article: Dynamical systems, algebraic topology and the climate sciences, Nonlin. Processes Geophys., 30, 399–434, <a href="https://doi.org/10.5194/npg-30-399-2023" target="_blank">https://doi.org/10.5194/npg-30-399-2023</a>, 2023.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib35"><label>Härter and de Campos Velho(2012)</label><mixed-citation>
      
Härter, T. P. and de Campos Velho, H. F.: Data Assimilation Procedure by Recurrent Neural Network, Eng. Appl. Comp. Fluid, 6, 224–233, <a href="https://doi.org/10.1080/19942060.2012.11015417" target="_blank">https://doi.org/10.1080/19942060.2012.11015417</a>, 2012.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib36"><label>Jazwinski(1970)</label><mixed-citation>
      
Jazwinski, A. H.: Stochastic Processes and Filtering Theory, Academic Press, New York, ISBN 978-0-12-381550-7, <a href="https://doi.org/10.1016/S0076-5392(09)60368-4" target="_blank">https://doi.org/10.1016/S0076-5392(09)60368-4</a>, 1970.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib37"><label>Kalnay(2003)</label><mixed-citation>
      
Kalnay, E.: Atmospheric Modeling, Data Assimilation and Predictability, Cambridge University Press, Cambridge, ISBN 978-0-521-79629-3, <a href="https://doi.org/10.1017/CBO9780511802270" target="_blank">https://doi.org/10.1017/CBO9780511802270</a>, 2003.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib38"><label>Karimi and Paul(2010)</label><mixed-citation>
      
Karimi, A. and Paul, M. R.:
Extensive chaos in the Lorenz-96 model, Chaos, 20, 043105, <a href="https://doi.org/10.1063/1.3496397" target="_blank">https://doi.org/10.1063/1.3496397</a>, 2010.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib39"><label>Keller and Potthast(2024)</label><mixed-citation>
      
Keller, J. D. and Potthast, R.:
AI-based data assimilation: Learning the functional of analysis estimation, arXiv [preprint], <a href="https://doi.org/10.48550/arXiv.2406.00390" target="_blank">https://doi.org/10.48550/arXiv.2406.00390</a>, 2024.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib40"><label>Kuramoto and Tsuzuki(1976)</label><mixed-citation>
      
Kuramoto, Y. and Tsuzuki, T.:
Persistent propagation of concentration waves in dissipative media far from thermal equilibrium, Prog. Theor. Phys., 55, 356–369, <a href="https://doi.org/10.1143/PTP.55.356" target="_blank">https://doi.org/10.1143/PTP.55.356</a>, 1976.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib41"><label>Lafon et al.(2023)Lafon, Fablet, and Naveau</label><mixed-citation>
      
Lafon, N., Fablet, R., and Naveau, P.:
Uncertainty Quantification When Learning Dynamical Models and Solvers With Variational Methods, J. Adv. Model. Earth Sy., 15, e2022MS003446, <a href="https://doi.org/10.1029/2022MS003446" target="_blank">https://doi.org/10.1029/2022MS003446</a>, 2023.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib42"><label>Laloyaux et al.(2025)Laloyaux, Alexe, Boucher, Lean, Pinnington, Lang, Necker, and McNally</label><mixed-citation>
      
Laloyaux, P., Alexe, M., Boucher, E., Lean, P., Pinnington, E., Lang, S., Necker, T., and McNally, A.:
Using data assimilation tools to dissect GraphDOP, arXiv [preprint], <a href="https://doi.org/10.48550/arXiv.2510.27388" target="_blank">https://doi.org/10.48550/arXiv.2510.27388</a>, 2025.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib43"><label>Lean et al.(2025)Lean, Alexe, Boucher, Pinnington, Lang, Laloyaux, Bormann, and McNally</label><mixed-citation>
      
Lean, P., Alexe, M., Boucher, E., Pinnington, E., Lang, S., Laloyaux, P., Bormann, N., and McNally, A.:
Learning from nature: insights into GraphDOP's representations of the Earth System, arXiv [preprint], <a href="https://doi.org/10.48550/arXiv.2508.18018" target="_blank">https://doi.org/10.48550/arXiv.2508.18018</a>, 2025.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib44"><label>Liu(1994)</label><mixed-citation>
      
Liu, J. S.:
Siegel's formula via Stein's identities, Stat. Probabil. Lett., 21, 247–251, <a href="https://doi.org/10.1016/0167-7152(94)90121-X" target="_blank">https://doi.org/10.1016/0167-7152(94)90121-X</a>, 1994.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib45"><label>Lorenz and Emanuel(1998)</label><mixed-citation>
      
Lorenz, E. N. and Emanuel, K. A.:
Optimal sites for supplementary weather observations: simulation with a small model, J. Atmos. Sci., 55, 399–414, <a href="https://doi.org/10.1175/1520-0469(1998)055&lt;0399:OSFSWO&gt;2.0.CO;2" target="_blank">https://doi.org/10.1175/1520-0469(1998)055&lt;0399:OSFSWO&gt;2.0.CO;2</a>, 1998.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib46"><label>Lu(2025)</label><mixed-citation>
      
Lu, F.:
U-Net Kalman Filter (UNetKF): An Example of Machine Learning-Assisted Data Assimilation, J. Adv. Model. Earth Sy., 17, e2023MS003979, <a href="https://doi.org/10.1029/2023MS003979" target="_blank">https://doi.org/10.1029/2023MS003979</a>, 2025.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib47"><label>Maddy et al.(2024)Maddy, Boukabara, and Iturbide-Sanchez</label><mixed-citation>
      
Maddy, E. S., Boukabara, S. A., and Iturbide-Sanchez, F.:
Assessing the Feasibility of an NWP Satellite Data Assimilation System Entirely Based on AI Techniques, IEEE J. Sel. Top. Appl., 17, 9828–9845, <a href="https://doi.org/10.1109/JSTARS.2024.3397078" target="_blank">https://doi.org/10.1109/JSTARS.2024.3397078</a>, 2024.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib48"><label>McCabe and Brown(2021)</label><mixed-citation>
      
McCabe, M. and Brown, J.: Learning to Assimilate in Chaotic Dynamical Systems, in: Advances in Neural Information Processing Systems, vol. 34, edited by: Ranzato, M., Beygelzimer, A., Dauphin, Y., Liang, P., and Vaughan, J. W., Curran Associates, Inc., 12237–12250, <a href="https://proceedings.neurips.cc/paper_files/paper/2021/file/65cc2c8205a05d7379fa3a6386f710e1-Paper.pdf" target="_blank"/> (last access: 7 August 2026), 2021.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib49"><label>Misra(2019)</label><mixed-citation>
      
Misra, D.:
Mish: A Self Regularized Non-Monotonic Neural Activation Function, arXiv [preprint], <a href="https://doi.org/10.48550/arXiv.1908.08681" target="_blank">https://doi.org/10.48550/arXiv.1908.08681</a>, 2019.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib50"><label>Oseledec(1968)</label><mixed-citation>
      
Oseledec, V. I.:
A multiplicative ergodic theorem. Ljapunov characteristic numbers for dynamical systems, Trans. Moscow Math Soc., 19, 197–231, 1968.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib51"><label>Palatella et al.(2013)Palatella, Carrassi, and Trevisan</label><mixed-citation>
      
Palatella, L., Carrassi, A., and Trevisan, A.:
Lyapunov vectors and assimilation in the unstable subspace: theory and applications, J. Phys. A-Math. Theor., 46, 254020, <a href="https://doi.org/10.1088/1751-8113/46/25/254020" target="_blank">https://doi.org/10.1088/1751-8113/46/25/254020</a>, 2013.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib52"><label>Pannekoucke and Fablet(2020)</label><mixed-citation>
      
Pannekoucke, O. and Fablet, R.: PDE-NetGen 1.0: from symbolic partial differential equation (PDE) representations of physical processes to trainable neural network representations, Geosci. Model Dev., 13, 3373–3382, <a href="https://doi.org/10.5194/gmd-13-3373-2020" target="_blank">https://doi.org/10.5194/gmd-13-3373-2020</a>, 2020.


    </mixed-citation></ref-html>
<ref-html id="bib1.bib53"><label>Pannekoucke et al.(2016)Pannekoucke, Ricci, Barthelemy, Ménard, and Thual</label><mixed-citation>
      
Pannekoucke, O., Ricci, S., Barthelemy, S., Ménard, R., and Thual, O.:
Parametric Kalman filter for chemical transport model, Tellus A, 68, 31457, <a href="https://doi.org/10.3402/tellusa.v68.31547" target="_blank">https://doi.org/10.3402/tellusa.v68.31547</a>, 2016.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib54"><label>Pannekoucke et al.(2018)Pannekoucke, Bocquet, and Ménard</label><mixed-citation>
      
Pannekoucke, O., Bocquet, M., and Ménard, R.: Parametric covariance dynamics for the nonlinear diffusive Burgers equation, Nonlin. Processes Geophys., 25, 481–495, <a href="https://doi.org/10.5194/npg-25-481-2018" target="_blank">https://doi.org/10.5194/npg-25-481-2018</a>, 2018.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib55"><label>Raanes et al.(2019)Raanes, Stordal, and Evensen</label><mixed-citation>
      
Raanes, P. N., Stordal, A. S., and Evensen, G.: Revising the stochastic iterative ensemble smoother, Nonlin. Processes Geophys., 26, 325–338, <a href="https://doi.org/10.5194/npg-26-325-2019" target="_blank">https://doi.org/10.5194/npg-26-325-2019</a>, 2019.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib56"><label>Ribeiro et al.(2016)Ribeiro, Singh, and Guestrin</label><mixed-citation>
      
Ribeiro, M. T., Singh, S., and Guestrin, C.:
Why Should I Trust You?: Explaining the Predictions of Any Classifier, in: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, KDD '16, Association for Computing Machinery, New York, NY, USA, 1135–1144, <a href="https://doi.org/10.1145/2939672.2939778" target="_blank">https://doi.org/10.1145/2939672.2939778</a>, 2016.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib57"><label>Sacco et al.(2024)Sacco, Pulido, Ruiz, and Tandeo</label><mixed-citation>
      
Sacco, M. A., Pulido, M., Ruiz, J. J., and Tandeo, P.:
On-line machine-learning forecast uncertainty estimation for sequential data assimilation, Q. J. Roy. Meteor. Soc., 150, 2937–2954, <a href="https://doi.org/10.1002/qj.4743" target="_blank">https://doi.org/10.1002/qj.4743</a>, 2024.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib58"><label>Sakov(2025)</label><mixed-citation>
      
Sakov, P.:
On building the state error covariance from a state estimate, arXiv [preprint], <a href="https://doi.org/10.48550/arXiv.2411.14809" target="_blank">https://doi.org/10.48550/arXiv.2411.14809</a>, 2025.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib59"><label>Sakov et al.(2012)Sakov, Oliver, and Bertino</label><mixed-citation>
      
Sakov, P., Oliver, D. S., and Bertino, L.:
An iterative EnKF for strongly nonlinear systems, Mon. Weather Rev., 140, 1988–2004, <a href="https://doi.org/10.1175/MWR-D-11-00176.1" target="_blank">https://doi.org/10.1175/MWR-D-11-00176.1</a>, 2012.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib60"><label>Sivashinsky(1977)</label><mixed-citation>
      
Sivashinsky, G. I.:
Nonlinear analysis of hydrodynamic instability in laminar flames-I. Derivation of basic equations, Acta Astronaut., 4, 1177–1206, <a href="https://doi.org/10.1016/0094-5765(77)90096-0" target="_blank">https://doi.org/10.1016/0094-5765(77)90096-0</a>, 1977.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib61"><label>Smilkov et al.(2017)Smilkov, Thorat, Kim, Viégas, and Wattenberg</label><mixed-citation>
      
Smilkov, D., Thorat, N., Kim, B., Viégas, F. B., and Wattenberg, M.:
SmoothGrad: removing noise by adding noise, CoRR, arXiv [preprint], <a href="https://doi.org/10.48550/arXiv.1706.03825" target="_blank">https://doi.org/10.48550/arXiv.1706.03825</a>, 2017.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib62"><label>Stordal et al.(2016)Stordal, Szklarz, and Leeuwenburgh</label><mixed-citation>
      
Stordal, A. S., Szklarz, S. P., and Leeuwenburgh, O.:
A Theoretical look at Ensemble-Based Optimization in Reservoir Management, Math. Geosci., 48, 399–417, <a href="https://doi.org/10.1007/s11004-015-9598-6" target="_blank">https://doi.org/10.1007/s11004-015-9598-6</a>, 2016.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib63"><label>Tang and Glass(2018)</label><mixed-citation>
      
Tang, H. and Glass, J.:
On Training Recurrent Networks with Truncated Backpropagation Through time in Speech Recognition, in: 2018 IEEE Spoken Language Technology Workshop (SLT), 48–55, <a href="https://doi.org/10.1109/SLT.2018.8639517" target="_blank">https://doi.org/10.1109/SLT.2018.8639517</a>, 2018.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib64"><label>van Kekem and Sterk(2018)</label><mixed-citation>
      
van Kekem, D. L. and Sterk, A. E.:
Travelling waves and their bifurcations in the Lorenz-96 model, Physica D, 367, 38–60, <a href="https://doi.org/10.1016/j.physd.2017.11.008" target="_blank">https://doi.org/10.1016/j.physd.2017.11.008</a>, 2018.

    </mixed-citation></ref-html>
<ref-html id="bib1.bib65"><label>Wishner et al.(1969)Wishner, Tabaczynski, and Athans</label><mixed-citation>
      
Wishner, R. P., Tabaczynski, J. A., and Athans, M.:
A Comparison of Three Non-Linear Filters, Automatica, 5, 487–496, <a href="https://doi.org/10.1016/0005-1098(69)90110-1" target="_blank">https://doi.org/10.1016/0005-1098(69)90110-1</a>, 1969.

    </mixed-citation></ref-html>--></article>
