← 返回 2026-09-01

不确定性感知的端到端AI天气预报:解耦观测与模型的贡献 Uncertainty-Aware End-to-End AI Weather Forecasting: Disentangling Observation and Model Contributions

Rodrigo Almeida, Noelia Otero, Jost Arndt, Simon Baur, Wojciech Samek, Jackie Ma 📅 2026-08-31 👍 1 2026-09-01 18:30
AI天气预报 CRPS 不确定性量化 方差分解 蒙特卡洛Dropout 集合预报

用嵌套集合把端到端AI天气预报升级为概率系统,并将不确定性分解为观测与模型来源

前置知识

数据同化

数值天气预报(NWP)的起点:把散乱、不规则的真实观测(卫星辐射、探空、船舶报告等)与上一次预报的背景场融合,得到网格化的分析场,再分析数据集 ERA5 就是这一流程的历史产物。同化是 NWP 流水线中最昂贵的环节之一,需要伴随算子和巨大的计算资源。

主流 AI 天气模型(GraphCast、Pangu 等)以 ERA5 为输入和训练目标,因此仍挂在同化流水线上;本文的端到端模型正是要绕过它,而"观测侧不确定性"的归因对应的正是 NWP 中的分析与观测不确定性概念。

偶然不确定性与认知不确定性

深度学习不确定性量化文献中的经典二分:偶然不确定性(aleatoric)来自观测系统的固有变异性(传感器噪声、观测稀疏区域的模糊性),原则上不可再减;认知不确定性(epistemic)源于模型参数与训练数据不足,可用更多数据、更好架构或更大集合减小。二者之和构成预测不确定性。

本文的中心假设是 encoder 噪声分支 $\approx U_{\mathrm{alea}}$、dropout 分支 $\approx U_{\mathrm{epis}}$,全文的方差分解与观测否定实验都是围绕这一对应关系的检验展开的。

CRPS(连续排序概率评分)

度量整个概率预报分布与真值之间积分距离的 proper score:当且仅当预报分布等于真值分布(校准且锐利)时取最小值。fair CRPS 对有限集合尺寸做了修正,避免小集合虚高技巧。单成员确定性预报的 CRPS 退化为绝对误差,因此确定性与概率预报可以在同一尺度上比较。

本文用 fair CRPS 既作概率微调目标也作主评价指标,理解它才能理解"概率微调反而改善均值预报"这一反直觉的关键结果。

蒙特卡洛 Dropout

推理时保持 dropout 开启,对同一输入多次前向传播,每次随机丢弃不同权重(掩码),等价于对贝叶斯后验的近似采样(Gal & Ghahramani),由此产生的成员散布被解读为认知不确定性。dropout 率 $p$ 控制扰动强度。

本文的 processor 使用 $p=0.05$ 的 MC dropout 并在每个 rollout 步重采掩码,是集合中"模型侧"方差的全部来源,也是归因讨论的焦点。

Spread–skill ratio(离散度-误差比)

集合离散度(成员间标准差)除以集合均值预报的 RMSE。SSR $=1$ 表示完美校准(散布恰好匹配误差),大于 1 过散、小于 1 欠散。有限集合需乘以 $\sqrt{(K+1)/K}$ 修正(本文 $K=49$)。

它是本文校准结论的核心指标(中期平均 0.98),也是作者选择 dropout 率 $p=0.05$ 的依据,读懂所有校准讨论都依赖它。

全方差定律与嵌套 ANOVA 分解

概率论恒等式 $\mathrm{Var}[y|x] = \mathrm{Var}_a(\mathbb{E}_\omega[y|x,a]) + \mathbb{E}_a(\mathrm{Var}_\omega[y|x,a])$:总方差等于组均值之间的方差加上组内方差的期望。在嵌套集合上用单因素随机效应 ANOVA 的组内/组间均方 $MS_W$、$MS_B$ 实现无偏估计:$\hat{U}_{\mathrm{drop}} = MS_W$,$\hat{U}_{\mathrm{enc}} = \max(0, (MS_B - MS_W)/N)$。

这是本文把 49 成员集合的方差严格分解为 encoder 与 dropout 两个分量的数学基础,$MS_W/N$ 的扣除用于防止 dropout 方差泄漏进 encoder 估计。

观测系统实验(OSE)

经典的观测网评估手段:在数据同化/预报系统中撤掉某一类观测(如某个卫星探测器),重跑系统并与基线比较,量化该观测对分析与预报技巧的贡献。传统 OSE 需要重跑数月的完整 NWP 同化循环,成本极高。

本文把 OSE 改造成方差分解的因果交叉验证:断开一条观测流只应推高 encoder 分支,若响应泄漏到 dropout 轴则说明归因无效——这是全文论证链的关键一环。

研究动机

过去数年,GraphCast、Pangu-Weather 等 AI 天气模型在技巧上追平甚至超过数值天气预报(NWP),但它们以 ERA5 再分析为输入和训练目标——ERA5 本身是数据同化把卫星辐射、探空等散乱观测与背景预报融合成的网格化重建,因此这些模型始终依赖昂贵的同化流水线。Aardvark Weather 与 ECMWF 的 GraphDOP 等端到端(E2E)模型直接从原始观测预报,省去同化、成本降低几个数量级,但它们是纯确定性的:只输出一个确定预报值,不给任何不确定性信息。而概率输出对理性决策是刚需——最优行动取决于事件概率与用户自身的成本-损失比,不同用户比例不同,单一确定预报不可能对所有人最优;运营评估也日益强调概率技巧与经济价值。已有的 AI 集合方法(输入扰动、随机噪声注入、扩散模型)全部针对再分析训练的模型,E2E 模型完全缺席这一发展:既不输出校准的不确定性,也无法回答不确定性究竟来自观测还是来自模型本身。

本文的目标是本文的目标是在不从头训练新概率系统的前提下,把预训练的确定性 Aardvark 模型"抬升"为概率预报系统,并让不确定性可归因。具体回答三个再分析训练系统无法回答的问题:(1)解释——E2E 模型的预测不确定性究竟产生于观测编码(同化类比)步骤,还是学习到的预报动力学(模型不确定性类比);(2)解耦——两个贡献能否在深度学习偶然/认知不确定性的意义上被分离并分别归因;(3)成本——能否在不损害均值预报的前提下,把随机性廉价地微调进预训练系统。量化目标包括:集合对 ERA5 在中期范围内校准、均值预报不被概率化损害、方差分解能被观测否定实验因果验证,为观测驱动的大气数字孪生迈出透明化的一步。

与已有工作不同的是,本文的独特切入是利用 Aardvark 的模块化 encoder–processor–decoder 结构做"组件对齐的随机化":每个组件只挂一种随机源——encoder 接学习型输入相关高斯噪声,processor 接蒙特卡洛 dropout,decoder 保持确定并冻结——并用嵌套采样($M$ 个 encoder 噪声抽取、每个再展开 $N$ 个 dropout rollout)使总方差可以用全方差定律严格分解为两个分量。这与已有工作的本质区别在于:AIFS-CRPS 等只有单一噪声源,集合散布无法区分两类不确定性来源;NWP 则要靠整套集合数据同化(EDA)机器才能得到初始不确定性。E2E 模型自己从原始观测构建大气状态,"观测不确定性"由此成为全新问题。此外作者在方法学上异常谨慎:在归因被验证之前刻意只用机制命名(encoder 分支/dropout 分支),把 aleatoric/epistemic 解读当作待检验的设计选择而非先验假设,并用观测否定实验给出可证伪的预测。

核心方法

直觉上,E2E 预报的不确定性应来自两头:观测本身稀疏含噪(观测/同化不确定性),或学到的动力学不可靠(模型不确定性)。Aardvark 恰好分成三段,作者把两种随机机制分别接到两段上。encoder 改为随机映射 $E_\theta(x;a) = \mu_\theta(x) + \sigma_\theta(x) \odot a$,其中 $\mu_\theta(x)$ 是预训练确定性分析,$\sigma_\theta(x)$ 是学习到的输入相关噪声幅度,$a \sim \mathcal{N}(0, I)$——即 Kendall & Gal 的异方差构造被放到同化接口上;processor 的 ViT 权重施加推理期 dropout($p=0.05$),每个 rollout 步重采掩码,作为近似贝叶斯推断;decoder 确定且冻结,保证每个随机源只属于一个组件。推理时采 $M=7$ 个 encoder 噪声、每个展开 $N=7$ 个 dropout rollout,共 49 成员,与 IFS ENS 的 50 成员规模可比。两个随机组件都在预训练权重上以 fair CRPS 目标分别微调:encoder 对 ERA5 分析微调,processor 以随机 encoder 产生的初始条件按 lead 1→10 顺序微调,一条完整概率链总计约 65 A100 小时。

核心创新是"嵌套集合 + 方差分解":每个随机源只属于一个组件,因此固定 encoder 抽取 $a^{(i)}$ 的组内散布只能归因于 processor 的 dropout,组均值之间的散布只能归因于 encoder 噪声。全方差定律 $\mathrm{Var}[y|x] = \mathrm{Var}_a(\mathbb{E}_\omega[y|x,a]) + \mathbb{E}_a(\mathrm{Var}_\omega[y|x,a])$ 给出 $U_{\mathrm{enc}} + U_{\mathrm{drop}} = U_{\mathrm{tot}}$ 的严格两路分解,用单因素随机效应 ANOVA 的无偏估计量实现:$\hat{U}_{\mathrm{drop}} = MS_W$,$\hat{U}_{\mathrm{enc}} = \max(0, (MS_B - MS_W)/N)$,其中减去 $MS_W/N$ 去除组均值继承的有限 $N$ 抽样噪声,防止 dropout 方差泄漏进 encoder 估计而系统性高估观测分支。工程上的关键选择是噪声注入方式:per-patch 噪声经小 MLP 映射后,通过 FiLM 式条件 LayerNorm(norm conditioning,+8.7M 参数)在每个 transformer block 重新注入,零初始化投影保证初始时等价于预训练 encoder;该方案比一次性 embedding 注入在相等集合尺寸下变量平均 CRPS 低 4–5%,且不改变归因结论。

方法步骤详情

1. 载入公开的 Aardvark 确定性权重;观测输入为九条流共约 0.73TB(HadISD、ICOADS、IGRA、AMSU-A/B、HIRS、IASI、ASCAT、GridSat),ERA5(156GB)作训练目标与验证真值;2007–2017 训练、2019 验证、2018 测试。2. encoder 随机化:per-patch 噪声 $a$ 经小 MLP 与 FiLM 式条件 LayerNorm 在每个 block 注入(norm conditioning,+8.7M 参数)。3. encoder 微调:对 ERA5 00UTC 分析、$M=7$ 噪声成员的 fair CRPS,AdamW lr $3\times10^{-5}$、20 epochs,4×A100 约 4.7 小时。4. processor 微调:开启 dropout $p=0.05$(由 SSR 扫描选出),输入为随机 encoder 的初始条件,7 成员 fair CRPS,lr $10^{-4}$ 退火至 $10^{-6}$,按 lead 1→10 顺序训练约 11.5 小时;decoder 沿用发布权重并冻结。5. 推理:$M=7 \times N=7=49$ 成员嵌套集合。6. 方差分解:逐变量/格点/lead 计算组内均方 $MS_W$ 与组间均方 $MS_B$,得 $\hat{U}_{\mathrm{drop}} = MS_W$、$\hat{U}_{\mathrm{enc}} = \max(0,(MS_B-MS_W)/N)$ 及占比 $\rho_{\mathrm{drop}}$ 空间场。7. OSE 交叉验证:把某观测流(如 IASI)的网格 embedding 置零(SetConv 接口下等价于该流缺席),配对相同随机种子,在 24 个初始时刻重跑完整嵌套集合,比较 $\Delta U_{\mathrm{enc}}$ 与 $\Delta U_{\mathrm{drop}}$。

技术新颖性

(1)方向新:这是第一个给端到端天气系统引入可分解不确定性的工作,E2E 模型此前完全不在 AI 概率预报的发展版图内。(2)机制新:嵌套设计加 ANOVA 无偏估计把"不确定性归因"变成推理时一次前向即可计算的空间场,而非训练后的定性讨论;$MS_W/N$ 的扣除专门处理有限集合下 dropout 方差泄漏这一被普遍忽视的系统性偏差。(3)成本新:观测敏感性分析从"重跑数月 NWP/伴随系统"变成"单 GPU 数小时重新编码重跑集合",且天然可证伪——否定响应若泄漏到 dropout 轴即宣告分解无效,这在方法论上把归因从叙事升级为假设检验。(4)架构消融新:FiLM 式 norm conditioning 相比 embedding injection 在相等集合尺寸下 CRPS 低 4–5%,说明"噪声进入的位置与方式"本身是值得优化的设计自由度。(5)方法学态度新:坚持用机制命名直至 OSE 验证通过才赋予 aleatoric/epistemic 解读,明确承认这是组件对齐的归因而非恢复的真值,并列出三条替代机制解释观测侧占比为何偏低。

E2E ensemble architecture
Figure 2: E2E ensemble architecture

实验结果

均值预报:49 成员集合均值相对 Aardvark 在 6 变量(T2M、T850、U10、V10、Z500、MSLP)×10 lead 共 60 个组合上平均 RMSE 降 4.2%(95% CI $[-4.9,-3.4]\%$),单点最高 16%,day 1 降 6.1%、day 10 降 8.1%;50/60 显著,无一显著变差——概率微调靠 loss attenuation 反而改善均值。概率技巧:fair CRPS 比确定性 proper score 好 24–38%,全部显著。与 IFS ENS 差距:CRPS day 1 落后约 80%、day 10 收窄至 18–36%,Z500/MSLP 差距最大,源于 encoder 缺飞机与掩星观测、探空权重最低。校准:变量平均 spread–skill ratio day 1 为 1.21、day 5 约 0.92、day 10 为 0.97,days 1–10 平均 0.98,全程无事后散布调整;encoder 分支单独欠散(SSR 0.46→0.19),分析时刻 SSR=0.78。站点(HadISD):T2M/WS10 的 RMSE 差距 ≤2.4%(day 9–10 显著好 4.2–5.2%),CRPS 每个 lead 显著更好(T2M 24–28%、WS10 11–19%);站点集合欠散,encoder 占站点方差 ≤12%。分解:总方差 day 1→10 增约 7 倍,encoder 占比 0.14→0.04、dropout 0.86→0.96——day 1 观测侧也至多占 1/7,与经典集合"初期由初始条件主导"的直觉相反。OSE 因果验证:断开 IASI 使 $U_{\mathrm{enc}}$ 在 day 1–3 翻倍(+96–111%)、day 10 衰减至 +5%,$U_{\mathrm{drop}}$ 响应 ≤8%;断开 IGRA 所有分量 ≤1%。附带收获:随机 encoder 的分析场 RMSE 好 14%、CRPS 好 33%。

Skill and calibration of the probabilistically finetuned E2E ensemble, verified against ERA5 for 2018 with latitude-weighted scores
Figure 3: Skill and calibration of the probabilistically finetuned E2E ensemble, verified against ERA5 for 2018 with latitude-weighted scores
Verification against HadISD surface stations for 2-m temperature (T2M) and 10-m wind speed (WS10), for 2018
Figure 4: Verification against HadISD surface stations for 2-m temperature (T2M) and 10-m wind speed (WS10), for 2018
Ensemble variance attributed to its observation (encoder) and model (dropout) sources across lead times, in space, and under observation denial
Figure 5: Ensemble variance attributed to its observation (encoder) and model (dropout) sources across lead times, in space, and under observation denial
查看结构化数据
任务指标本文基线提升
全球网格确定性预报(集合均值) RMSE(纬度加权,相对基线变化) 平均降低 4.2%(95% CI [-4.9,-3.4]%),单点最高 16%,60 个变量-lead 组合中 50 个显著 Aardvark 确定性模型(模块化发布版) 均值预报显著改善且无任何变量-lead 显著变差
全球网格概率预报 fair CRPS 比确定性 proper score 好 24–38%,所有变量与 lead 均显著 Aardvark 确定性预报(CRPS 退化为绝对误差) +24–38%
与运营集合预报对比 fair CRPS 相对 IFS ENS day 1 落后约 80%,day 10 落后 18–36%,差距随 lead 收窄 ECMWF IFS ENS(50 成员运营集合) 仍落后;差距部分归因于 1.5° 精简 backbone 与观测流缺失
集合校准 spread–skill ratio(SSR) days 1–10 变量平均 0.98(day 1 为 1.21、day 5 约 0.92、day 10 为 0.97),无事后调整 IFS ENS(day 1 为 1.24,之后略高于 1) 接近完美校准,表现与运营集合相当
站点预报(HadISD) RMSE 与 fair CRPS RMSE 差距 ≤2.4%;CRPS 每个 lead 显著更好(T2M 24–28%、WS10 11–19%),四个区域一致 Aardvark 确定性站点预报 概率技巧全面提升,确定性精度基本持平
分析场质量(lead 0) ensemble-mean RMSE / CRPS RMSE 好 14%,CRPS 好 33% 确定性 Aardvark 分析场 随机 encoder 直接改善同化产物
观测归因因果验证(OSE) ΔU_enc / ΔU_drop 断开 IASI 使 U_enc 增 96–111%(day 1–3)、day 10 衰减至 +5%;U_drop 响应 ≤8%;断开 IGRA 所有分量 ≤1% 完整观测流的嵌套集合(24 个初始时刻,配对种子) 组件归因获得因果支持,encoder 分支 ≈ 观测驱动不确定性

局限与改进

作者承认的结构性限制:decoder 是确定性的,下采样阶段不产生任何散布,站点级欠散正集中于此;dropout 率是固定超参 $p=0.05$ 而非学习量,dropout 散布只能通过 fair CRPS 微调间接校准,deep ensemble 会是更强的认知不确定性参照但训练更贵;验证只覆盖单个 held-out 年份(2018)、一个 backbone、$M=N=7$ 的适中集合规模,encoder 方差估计的 $\max(0,\cdot)$ 下限在长 lead 偶尔激活;backbone 刻意精简(1.5° 网格、约 0.73TB 观测、九条流),与 IFS ENS 的差距(day 1 约 80%)部分应归因于 backbone 而非概率机制,报告的技巧应读作该方法的上限空间之下的下界;aleatoric/epistemic 解读始终是组件对齐的归因而非恢复的真值。我的补充观察:全方差分解的条件顺序把 encoder–processor 交互项吸收进 dropout 项,分解"纯度"依赖这一选择且文中未实测交互项大小;MC dropout 作为认知不确定性代理在深度学习界本身有争议,$p=0.05$ 很小且掩码逐步重采更像随机物理扰动而非固定后验抽取;ERA5 既是训练目标又是网格验证真值,可能隐藏对 ERA5 的系统性偏向;站点验证限于 Aardvark 原始协议的站点子集与两个变量;与 IFS 的差距在 day 1 高达 80%,就"替代 NWP"的叙事而言仍是实际障碍。

独立分析的弱点

(1)encoder 分支系统性欠散:单独评估时 SSR 从 0.46 降到 0.19、分析时刻仅 0.78,说明学习的观测噪声远未覆盖真实分析误差,因此"观测侧至多占总方差 1/7"更可能是估计下限而非事实,结论强度被削弱;改进方向是对 $\sigma_\theta(x)$ 增加显式校准正则,或与 ERA5 EDA 的同化散布做定量对齐后再下结论。(2)交互项不可见:$a$–$\omega$ 交互被条件顺序吸收进 dropout 项,作者提出的"冻结 dropout 掩码、变化 encoder 抽取"的交叉设计并未实施;且 $M=N=7$ 时 ANOVA 估计量方差偏大,长 lead 的 $\max(0,\cdot)$ 截断会系统性低估 $U_{\mathrm{enc}}$,可增大 $M$ 或改用分层 bootstrap 置信区间。(3)dropout 的认知地位薄弱:$p=0.05$ 由粗粒度 SSR 扫描选出而非学习得到,掩码每步重采使扰动沿 rollout 累积,行为更接近随机参数化(stochastic physics),epistemic 解读需要保留;补救是对比每个成员固定单一掩码的 rollout,以隔离累积效应。(4)验证单一性:一年(2018)、一个模式、ERA5 唯一网格真值、站点子集两个变量,泛化到极端事件、不同气候态(如 ENSO 年)与独立观测尚属空白,至少应扩展到多年份滚动评估。(5)站点欠散无解:decoder 第三随机分支(如异方差输出头或生成式下采样)是显见的补救,本文只指出而未实现,属于最容易跟进的低垂果实。

未来方向

作者明确提出的方向:一是把 encoder 散布与 ERA5 集合数据同化(EDA)做系统对比——这是对"观测噪声低估"假说的直接检验,同时把 EDA 自身的欠散当作定性参照而非真值;二是把否定实验从归因扩展到观测网设计:逐条扫描摄入的观测系统,回答"哪条流的丢失/降级最会推高 day-3 预报不确定性"这类问题,以单 GPU 数小时的推理成本完成传统 OSE 需要整套同化-预报循环的工作,这正是观测驱动大气数字孪生的核心交易。此外作者建议:给 decoder 加第三随机分支以补足站点散布;用 deep ensemble processor 提供更强的认知参照;用冻结掩码的 rollout 隔离方差累积机制;并探索对损坏或对抗扰动观测输入的审计。基于本文成果还可延伸:把嵌套分解框架移植到 GraphDOP 等其他 E2E 系统检验通用性;在极端天气个例上评估两个方差分量的判别力与预警价值;用分解结果指导观测网增量设计与主动学习——encoder 散布大的区域即观测加密的优先区域;以及探索与共形预测等后处理校准的结合,同时守住"无事后调整"这一卖点。

复现评估

开源情况良好:微调后的模型权重与全部评估数据发布在 HuggingFace(rodrigoalmeida1994/uqe2e),复现代码在 GitLab(gitlab.hhi.fraunhofer.de/ai-aml/uqe2e)公开;训练输入完全公开——Aardvark 预处理数据集(九条观测流共约 0.73TB)加 ERA5(156GB),IFS ENS 参考分数可经 WeatherBench 获取。算力门槛适中:4×NVIDIA A100 80GB 数据并行,encoder 微调约 4.7 小时、processor 按 lead 1→10 顺序微调约 11.5 小时,一条完整概率链约 65 A100 小时,且未做数据加载优化(即实际可更快)。复现难度中等:主要成本在 0.73TB 数据的下载、预处理与对齐;方法细节(fair CRPS 实现、嵌套采样与种子配对、移动块 bootstrap、Diebold–Mariano 检验与 HAC 方差)论文交代得相当完整,评估严格遵循 WeatherBench 2 协议,在同类工作中属于可复现性较好的水平。一个需要注意的点:作者以模块化(非端到端微调)Aardvark 作为确定性基线,因为官方端到端微调版只发布了单 lead 权重且未能复现其站点分数,复现者在对比站点结果时应留意这一基线差异。