以数据规模化突破高分辨率天气预报的极限 Pushing the Limits of High-Resolution Weather Forecasting through Data Scaling
用逐变量超分辨率合成0.1°数据,证明高分辨率预报瓶颈在数据,性能超越IFS-HRES
前置知识
再分析数据与 ERA5
再分析是利用固定的数值预报模式对历史观测资料做同化,反演出时空连续、格点化的「历史大气状态」数据集。ERA5 是 ECMWF 的第五代全球再分析,提供自 1940 年至今约 0.25°(约 25–31 km)分辨率的逐小时格点数据,共约 47 年可用档案,是训练 AI 天气大模型的主力数据源,但分辨率低于业务分析数据。
本文的核心矛盾正是:ERA5 有 47 年但只有 0.25°,而 0.1° 的 ECMWF 业务分析只有约 10 年。理解这种「分辨率–数据时长」失衡,才能理解为什么作者要用超分辨率从 ERA5 合成 0.1° 训练数据。
超分辨率(Super-Resolution, SR)
从低分辨率观测重建高分辨率场的学习任务。本文用 Swin2SR(基于 Swin Transformer 的图像超分模型)对每个大气变量独立训练一个 SR 模型,在配对的 0.25°–0.1° EC 分析样本上以 MAE 重建损失训练,随后批量处理 0.25° ERA5 生成 0.1° 伪标签。与预报不同,SR 是同一时刻的空间重建,无需学习时间演化动力学。
论文的全部方法论建立在「SR 比预报更简单、更稳健」这一观察上:SR 被当作可规模化的数据合成器,而不是最终产品。不理解 SR 与预报在任务性质上的差异,就无法理解为什么「换数据」路线能成立。
缩放定律(Scaling Law)
模型性能随数据量、参数量或算力按幂律 $E \propto D^{-\alpha}$ 平滑提升的经验规律,最早在 NLP 中被系统化。本文首次在 0.1° 高分辨率天气预报中验证了数据维度的幂律:训练数据从 7 年扩展到 18 年,72 小时预报 RMSE 降低 4.6%,120 小时降低 4.9%,且斜率在不同 lead time 之间高度一致。
论文的中心论点是「0.1° 预报的根本瓶颈是数据而非架构」。这一主张的实证支撑就是缩放定律实验——没有幂律证据,「扩大数据就能持续涨点」只是假设而非结论。
误差放大因子(Amplification Factor)
衡量模型映射对输入扰动敏感度的指标:向输入注入强度为 $\sigma$ 的高斯噪声,计算 $|\mathrm{RMSE}_\sigma - \mathrm{RMSE}_0|/\sigma$,即单位噪声引起的预测误差增量。放大因子小说明映射函数本身稳定,不会把输入的微小不确定性在推理过程中放大。
这是论文论证「SR 比自回归预报更适合作为分辨率迁移载体」的关键实验证据:SR 的放大因子为 0.6–0.8×,而预报为 1.0–1.2×。理解该指标才能读懂 Fig. 1 与整条论证链。
自回归滚动与误差累积(Autoregressive Rollout)
预报模型以 6 小时为步长,把上一步的输出作为下一步的输入递归生成更长时效的预报。每一步的误差会被后续步继承并放大,导致长时效性能衰减。为训练长时效稳定性,近年模型常引入受强化学习启发的回放缓冲区(replay buffer),把历史预报存回训练集。
BaguanHR 的自适应滚动策略(时效感知损失加权 + 随机缓冲区替换)直接针对该问题,Table 1 的消融实验也围绕它展开。理解误差累积机制才能看懂为什么单纯强调长时效反而损害短期精度。
加权 RMSE 与 ACC
纬度加权的均方根误差 RMSE 度量预报场与真值的平均偏差,越小越好;距平相关系数 ACC 度量预报对气候距平形态的再现能力,越接近 1 越好。两者是 WeatherBench 及主流 AI 天气模型(GraphCast、Pangu、FuXi 等)论文的标准评估指标。
论文所有定量结论都以这两个指标表述(如「RMSE 降低 4.0%」「ACC 从 0.61 升至 0.64」),正确理解其含义是解读实验结果的前提。
研究动机
机器学习天气模型在 0.25° 分辨率上已系统性超越传统数值预报,但推进到 0.1°(约 9 km)分辨率时撞上了数据墙:ECMWF 业务分析自 2016 年之后才提供全球 0.1° 数据,到 2026 年最多约 10 年训练样本,对大规模 ML 模型而言极易过拟合;而 ERA5 再分析虽有 47 年档案,却只有 0.25° 粗分辨率。这种「分辨率–数据时长」失衡成为高分辨率预报的关键瓶颈。现有两条应对路线都无法绕开它:一是把 0.25° 模型的输出用 Swin2SR 等工具事后超分到 0.1°,但粗网格输入的信息瓶颈决定了细节无法被恢复,功率谱分析显示这类后处理系统性衰减中尺度能量;二是 Aurora、Fengwu-GHR 式的「粗到精迁移学习」——预训练 0.25° 模型再在少量 0.1° 样本上微调,但预训练模型的表征绑定在粗网格上,无法充分利用 0.1° 分析场中的丰富信息,且预报任务远比降尺度复杂,需要同时学会细尺度过程和正确的多尺度动力学,有限微调难以兼顾,导致精度提升受限且严重依赖复杂的架构改造。
本文的目标是本文的目标是构建 0.1° 全球中期预报模型 BaguanHR,并借它回答三个层层递进的问题:(1)「换数据」是否优于「换模型」——即用超分辨率合成的 0.1° 训练数据从头训练,是否比在少量真实数据上微调预训练模型更有效;(2)0.1° 预报是否存在数据缩放定律——训练数据翻倍能换来多大收益、何时饱和;(3)综合效果能否在 2025 年真实分析数据上同时超越 IFS-HRES 业务数值预报和各类 ML 基线(包括 0.25° 模型加事后超分、粗到精迁移模型)。作者希望证明一个更一般的命题:高分辨率 ML 预报的根本瓶颈是数据可用性而非架构设计,并给出一个简单、通用的数据构建方案,可推广到其他高分辨率任务。
与已有工作不同的是,独特切入角度是把分辨率迁移问题从「模型迁移」翻转为「数据迁移」。作者的洞察是:超分辨率是同一时刻的条件重建任务,其条件熵严格低于多步预报——用当前观测重建当前细尺度场,天然比初值问题容易。论文用三步闭环论证这一洞察:(1)实验上,向输入注入高斯噪声测得 SR 的误差放大因子仅 0.6–0.8×,而预报为 1.0–1.2×,z500 上 SR 的 RMSE 为 13.8 而一步预报为 23.6;(2)理论上,在多簇高斯混合加线性回归的简化设定中证明:用 SR 式合成增广数据训练的估计器误差随总样本量 $N$ 下降(定理 3),而只依赖干净小数据集(定理 1)或只依赖缺失簇标签的大噪声数据(定理 2,误差下界 $\sigma^2\mathrm{VAR}(w_1,\dots,w_m)$ 在 $N\to\infty$ 时依然存在)都更差;(3)系统上,把逐变量 SR 应用于 47 年 ERA5 档案,构建 10 年 0.1° 伪标签后从头训练。相比之下,Aurora 与 Fengwu-GHR 都把 0.1° 建模当作架构与微调问题,而 0.1° 分辨率下数据缩放定律是否存在此前无人验证。
核心方法
BaguanHR 由「逐变量超分辨率生成器 + 高分辨率预报模型」两部分组成,核心是「合成+真实」训练策略。直觉上:既然 0.1° 真实数据只有约 8 年而 0.25° 的 ERA5 有 47 年,就让一个只学「空间重建」的 SR 模型把 ERA5 逐变量升尺度成 0.1° 伪标签,把训练集从 8 年扩到 18 年,然后完全从头训练预报模型,绕开参数级迁移。技术路线上:SR 侧对每个大气变量独立训练一个 Swin2SR,在 2017–2024 年配对的 EC 分析(0.25° 对 0.1°)上用 MAE 重建损失训练,再批量应用于 2007–2016 年的 0.25° ERA5 得到 10 年伪标签;预报侧输入形状为 $V\times H\times W\times D$($V=80$ 个变量,$H=1801$、$W=3600$,即全球 0.1° 格点),经逐变量 patch 化、分层天气嵌入、Swin Transformer 块和线性投影头,以 6 小时步长自回归预报。整个训练在 32 张 NVIDIA A800 上约 20 天完成,分三阶段:真实数据预训练、合成数据微调、自适应滚动训练,并配套针对 60TB 数据的 I/O 优化。
核心创新是「迁移数据而非迁移模型」,并把它建立在可检验的证据链上。与 Aurora(双线性上采样对齐 patch 后微调)和 Fengwu-GHR(分解式/组合式迁移学习)的本质区别在于:他们让模型参数去适配新的分辨率网格,而 BaguanHR 让数据去适配模型——先用条件熵更低、误差放大更小的超分辨率任务(放大因子 0.6–0.8× 对预报的 1.0–1.2×;z500 RMSE 13.8 对 23.6)把 47 年粗分辨率档案转成高分辨率训练数据,再从头训练。第二个关键选择是逐变量 SR:作者发现 SR 任务偏好单变量内部纹理而非跨变量耦合,逐变量独立训练在地面变量上大幅优于全变量联合 SR(sp 改进 90.7%、t2m 23.9%、msl 23.8%)。第三个创新是自适应滚动训练:时效感知损失加权防止长时效累积误差主导优化、随机缓冲区替换保证批内时效多样性,解决了 RL 式回放缓冲过度强调长时效反而损害短期精度的「遗忘效应」。
方法步骤详情
第一步(SR 数据合成):对每个大气变量独立训练 Swin2SR,输入为 0.25° 状态 $Z_t\in\mathbb{R}^{V\times H'\times W'}$,输出 0.1° 伪标签 $\hat{X}_t$,用 2017–2024 年 EC 分析的配对数据以 MAE 重建损失训练;随后把模型应用于 2007–2016 年 0.25° ERA5,得到 10 年合成数据。第二步(数据组织):真实部分为 0.1° ECMWF 4D-Var 分析(2017–2024),分析存档缺失的累积量(fdir、ssrd、tp)取自 IFS-HRES 零时效预报;变量覆盖 13 个气压层(50–1000 hPa)的高空量 z/t/u/v/q,以及 t2m、d2m、u10、v10、msl、sp、u100、v100、lcc、tcc、sst、ssrd、fdir、tcw、tcwv、tp 等地面与辐射量。第三步(预报模型前向):输入 $V\times H\times W\times D$($V=80$,$H=1801$,$W=3600$),逐变量 patch 化为 $V\times h\times w\times D$($h=H/p$、$w=W/p$,$p$ 为 patch 尺寸);把变量分成 12 组,先组内蒸馏为组查询、再融合为全局摘要(分层嵌入,避免暴力交叉注意力的显存开销);经 Swin Transformer 块交互后,由线性投影头 $\mathbb{R}^{D\times Vp^2}$ 恢复空间分辨率,输出 $\hat{X}_{t+\Delta t}$($\Delta t=6$ 小时),自回归递推。第四步(三阶段训练):(1) 8 年 EC 真实数据预训练 250k 步约 14 天;(2) 混入 10 年 ERA5-SR 合成数据微调 70k 步约 4 天;(3) 自适应滚动训练 2 天——回放缓冲区存储历史预报,按 lead time 施加损失权重 $W[\text{Lead}]$,并用随机替换而非 FIFO 更新缓冲以保证每批含异质时效。第五步(I/O 优化):单个 32 位数据文件达 4–5 GB,通过每节点 12TB SSD 数据分片,以及混合存储(UTC 00/12 时次放 SSD、06/18 时次留 NAS)加缓冲队列调度,取得 4× 读取加速。
技术新颖性
技术新颖性体现在四个层面。(1)范式层面:首次把「分辨率迁移」明确形式化为数据问题,并用条件熵与误差放大因子论证 SR 比预报更适合作为迁移载体——SR 是同条件重建,不需要学习多步演化动力学,天然更稳。(2)理论层面:在多簇高斯混合加线性回归的简化设定中,定理 1 给出干净小数据集的估计误差 $\mathcal{O}(\gamma\sqrt{dm/n\log(1/\delta)})$,定理 2 证明无簇标签的噪声大数据即使 $N\to\infty$ 误差仍有不消失的下界 $\sigma^2\mathrm{VAR}(w_1,\dots,w_m)$,定理 3 证明用预测的簇标签增广输入后误差降为 $\mathcal{O}(\gamma\sqrt{dm/N\log(1/\delta)})$——为「恰当构造的合成数据可降低泛化误差」提供了理论支撑,反驳了「合成数据必然损害泛化」的通行观点;尽管是线性化简模型,但方向性论证在 ML 气象论文中少见。(3)粒度层面:「逐变量 SR 优于全变量 SR」的实证发现及其「SR 偏好变量内纹理」的解释,细化了 SR 在气象场上的正确使用方式,与预报需要跨变量耦合的常识形成有趣对照。(4)系统层面:针对 0.1°×18 年数据的 SSD/NAS 分层 I/O 方案,以及「时效感知加权 + 随机缓冲替换」的滚动训练策略,都是可独立复用的工程贡献。
实验结果
实验结果分五块。(1)范式对比(Fig. 2):在 2025 年实时分析数据上,「合成+真实从头训练」对比「粗到精迁移」(按 Fengwu-GHR 方法复现的 Baguan+GHR),多数变量 RMSE 降幅最高达 20%,证明数据构建优于参数迁移。(2)数据缩放定律(Fig. 4):在 5/10/18 年等数据点上,各变量、各时效的 RMSE 随数据量呈幂律下降,斜率在不同 lead time 间高度一致;训练数据从 7 年扩到 18 年,72h 预报 RMSE 降 4.6%、120h 降 4.9%;外推显示 18 年之后边际收益递减,且变量敏感度异质——z500、t2m 较早饱和,msl 仍有持续改进空间。(3)总体基准(Fig. 5):BaguanHR 在 72h 内超过 85% 的 lead time 上优于全部基线;相对 IFS-HRES 平均 RMSE 降低 4.0%,其中 24h 降 5.8%、72h 降 9.7%;并显著优于 Baguan+swin2sr(0.25° 输出事后超分),尤其在短时效窗口——事后超分受粗网格信息瓶颈限制而系统性平滑,功率谱上 BaguanHR 在 20–100 km 短波长保留更多谱能量。(4)极端事件(Fig. 6):以 q850 ≥ 14 g/kg 为强降水代理的分类检测中,Threat Score 超基线 10% 以上;t2m 90/10 分位极端冷热事件中在 70% 以上情形最优,短时效比 Baguan+swin2sr 好 15%、长时效保持 3% 优势;z850 < 13,500 m²/s² 的中纬度低压系统上超 IFS-HRES 30% 以上。(5)消融与个例(Fig. 7、Table 1、Fig. 8):逐变量 SR 对 sp/t2m/msl 的 RMSE 改进达 90.7%/23.9%/23.8%(高空层仅 1.2–4.7%,q_850 为 -2.5%);SR 伪标签物理一致性诊断显示 RH ≥ 0.94、地转风 |Vg| ≥ 0.82、位温差 Δθ ≥ 0.93;Table 1 消融显示完整策略使 T2M-72h RMSE 从 1.12 降至 1.09、MSL-72h 从 147.80 降至 144.57、TCC-72h ACC 从 0.61 升至 0.64;台风 CO-MAY 双登陆个例中 BaguanHR 精确命中两次登陆点,五大湖寒潮 t2m RMSE 为 1.774°C,而 Baguan+swin2sr 为 2.543°C。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 0.1° 全球中期预报(对数值预报,72h 内) | 加权 RMSE | 超过 85% 的 lead time 上最优;相对 IFS-HRES 平均 RMSE 降低 4.0%(24h 降 5.8%,72h 降 9.7%) | IFS-HRES(ECMWF 业务数值预报,0.1°) | 平均 4.0%,短时效最高 9.7% |
| 高分辨率适配范式对比(合成+真实 vs 粗到精迁移) | 相对 RMSE 差异 | 合成+真实从头训练在多数变量上占优 | 粗到精迁移学习(复现 Fengwu-GHR 方法的 Baguan+GHR) | RMSE 最高降低 20% |
| 训练数据量扩展(7 年 → 18 年) | RMSE | 72h 预报降 4.6%,120h 预报降 4.9% | 7 年训练数据 | 约 4.6–4.9%,幂律趋势在不同 lead time 一致 |
| 极端温度事件(t2m 90/10 分位) | RMSE | 70% 以上情形最优;短时效领先 15%,长时效保持 3% 优势 | Baguan+swin2sr(0.25° 预报事后超分) | 短时效 15% |
| 中纬度低压系统(z850 < 13,500 m²/s² 阈值事件) | RMSE | 1–2 天和 9–10 天时效均领先,优于 IFS-HRES 30% 以上 | IFS-HRES | >30% |
| 强水汽事件分类检测(q850 ≥ 14 g/kg,强降水代理) | Threat Score (TS) | 多数情形 TS 提高超 10% | Baguan+swin2sr / IFS-HRES | >10% |
| 逐变量 SR vs 全变量 SR(地面气压 sp) | RMSE 改进幅度 | 逐变量 SR 改进 90.7%(t2m 23.9%、msl 23.8%) | 全变量联合超分辨率 | sp 达 90.7% |
局限与改进
作者承认的局限:在 10–15 天 lead time 上 BaguanHR 只有有限增益,因为长时效预报由大尺度环流型主导,细尺度结构变得弱可预报;数据缩放的外推(超出 18 年)只是趋势分析而非性能估计,18 年后边际收益递减,继续扩数据要权衡存储与 I/O 成本。我自己的观察:(1)评估仅在 2025 一年的分析数据上进行(00/12 UTC 起报),而训练数据 2017–2024 EC 分析与验证年紧邻,SR 训练对也来自同期 EC 分析,可能高估真实泛化能力;(2)论文只做确定性预报,没有集合预报与不确定性量化,对极端事件的风险决策应用是不完整的;(3)q_850 在逐变量 SR 中 RMSE 反而恶化 2.5%,说明逐变量解耦会破坏部分跨变量耦合(水汽与温度、风场的相关),作者只报告未 remedy;(4)全部结论基于 ECMWF 一家分析数据,未在其他再分析体系或业务中心验证,结论对数据源的依赖程度未知;(5)SR 伪标签的「物理一致性」仅用三个诊断量的相关系数(RH、|Vg|、Δθ)衡量,未验证能量守恒或变量间平衡关系,伪标签中的高频伪影可能被预报模型继承并在滚动中放大。
独立分析的弱点
弱点 1:SR 质量受限于配对数据的年代——Swin2SR 只能用 2017–2024 年约 8 年的 0.25°–0.1° 配对样本训练,却要处理 2007–2016 年的 ERA5;若两个年代的气候态因增暖趋势存在分布漂移,伪标签会有系统性偏差。改进方向:引入域适应约束或仅保留「分辨率映射」不变性,或用扩散式 SR 提升对分布外年代的稳健性。弱点 2:MAE 重建目标天然趋向条件均值,会产生过度平滑,对极端值和尖锐梯度不友好——极端事件实验结果好,可能主要归功于真实数据部分而非合成数据的尾部还原能力。改进方向:采用对抗或扩散目标,并加入谱损失保留高频。弱点 3:验证集单一(2025 年、仅 00/12 UTC 起报),缺少多年滚动验证与更多起报时次,结论稳健性有待检验。改进方向:跨多年交叉验证并加入 06/18 UTC 评估。弱点 4:10–15 天时效无优势,意味着框架价值区间集中在前 72 小时,与「中期预报」的定位存在落差。改进方向:与大尺度模式倾向预测耦合,或输出集合均值。弱点 5:缩放定律拟合点只有 5/10/18 年等少数档位,幂律拟合自由度较大,外推到 47 年的说法证据不足。改进方向:补充 3、7、13 年等中间数据档位增加拟合约束。
未来方向
作者提出的方向:以 BaguanHR 为高分辨率组件构建不断演进的 NJU-Earth 系列模型族,扩展到集合预报和业务应用(如台风强度预测)。基于本文成果可自然延伸的方向:(1)把 SR 数据合成推进到 47 年全量 ERA5,实测缩放曲线的真实饱和点,并绘制「合成数据占比–性能」曲线,弄清真实与合成数据的最佳配比;(2)把逐变量 SR 替换为条件生成模型(扩散/流匹配),在保留高频纹理的同时注入随机扰动,一次性解决数据合成与集合预报初始扰动两件事;(3)把「数据迁移」范式推广到次季节预测、区域公里级模式和气候降尺度(如 CMIP6 情景数据到观测分辨率)等其他受数据瓶颈约束的高分辨率任务;(4)理论上把三定理的多簇线性设定推广到非线性模型或核回归,给出合成数据带来增益的一般条件;(5)建立「SR 保真度–预报精度」的定量关系,量化伪标签误差如何经自回归滚动传播,为合成数据质量控制提供准则。
复现评估
复现难度中偏高。数据方面:ERA5 与 0.25° 数据公开可得,但 0.1° ECMWF 实时 4D-Var 分析需要 ECMWF 数据许可(注册/付费),累积变量还依赖 IFS-HRES 零时效预报,这是最大的外部门槛。代码方面:论文未声明开源代码或模型权重,NJU-Earth 系列尚在开发中;Swin2SR 本身是公开模型,网络结构(12 组变量分组、patch 化、投影头)与三阶段训练步数(250k/70k/2 天)描述完整,理论证明在补充材料。算力方面:完整复现需要 32 张 A800 训练约 20 天、60TB 存储,普通实验室难以负担;但核心论证实验——SR 与 FC 的噪声放大因子对比、缩放定律的子集训练——可以在小得多的配置上部分复现。若只想验证「合成+真实优于粗到精」这一核心论点,用公开 ERA5 数据做 0.25°→更高分辨率的降尺度对照实验是可行的低成本替代方案。
论文图表