← 返回 2026-08-10

往返一致性:双向扩散模型能预测自身的展开误差 Round-Trip Consistency: Bidirectional Diffusion Models Can Predict Their Own Rollout Errors

Alexander Scheinker 📅 2026-08-01 👍 9 2026-08-15 18:30
PDE代理模型 双向时间动力学 循环一致性 扩散模型 潜空间生成模型 离分布检测 自监督不确定性量化

用方向标志训练单一双向扩散模型,以前后往返的不一致自监督估计展开误差。

前置知识

自回归展开与误差累积

代理模型部署时把上一步预测当作下一步输入,逐步向前滚动到深度 i。单步小误差通过反馈闭环复合,输入分布也从训练分布漂移,速率随初始条件变化莫测。真实误差 $E_i = \mathrm{MSE}(z_{t+i}, \hat z_{t+i})$ 在测试时不可观测,因为没有 ground truth。

本文要解决的核心问题就是:模型自己如何在测试时、无 ground truth 地估计这个不可观测的 $E_i$。理解误差为何累积,才能理解为什么需要一个新的信任信号。

潜空间条件扩散模型

先用 β-VAE 把每个高维物理场(如 512×512×6 的 MHD 状态)压缩到紧凑潜变量(16×16×4,约 256× 压缩),再用标准 DDIM 去噪扩散在潜空间学习转移。去噪器 $\epsilon_\theta$ 训练来预测固定方差表注入的噪声,条件信息与加噪潜变量一起进入网络。

本文的双向动力学代理就建立在潜扩散框架上;理解 VAE 编码、ε-预测损失 $\mathcal{L} = \mathbb{E}\|\epsilon - \epsilon_\theta(\cdot)\|^2$、adaLN-Zero 条件融合,才能看懂方向标志如何让一个网络同时做前向和反向。

循环一致性 / 往返一致性

一个古老思想:若过程可逆,向前走 i 步再向后走 i 步必须回到起点,任何偏离都标志不可靠。它早已用于光流对应、未配对图像翻译 cycle loss(CycleGAN)、逆成像里用已知前向算子与学习逆算子循环量化不确定性(Huang 2023)。本文把它迁移到学到的动力学代理上。

往返一致性误差 $C_i$ 是本文提出的核心信任信号。理解这个原理的来源和它在已有领域里的用法,才能看出本文真正的创新点:两段循环都是同一个学到的双向生成器,且循环在 2i 步自回归展开上闭合。

异方差高斯校准

把校准建模为 $\log E_i \sim \mathcal{N}(\mu, \sigma^2)$,均值和对数方差都是 $\log C_i$ 的多项式。在训练展开上拟合后,把 $C_i$ 转成对 $E_i$ 幅度的预测,用 68%/95% 覆盖率和误校准面积(MCA)评估。

光有 $C_i$ 与 $E_i$ 的秩相关不够;部署需要预测误差幅度。校准器是本文把探测信号变成可操作信任信号的关键工具,校准的 ×68/×95 因子和覆盖率是评估方法是否可用的核心指标。

双李普希茨连续性与共李普希茨条件

反向映射 $\Phi^-$ 在访问到的对集合上满足 $\mu\|a-b\| \leq \|\Phi^-(a)-\Phi^-(b)\| \leq L\|a-b\|$。上界是普通李普希茨连续;下界($\mu>0$)是共李普希茨或膨胀性,禁止反向映射把不同终态坍缩到同一返回种子——这正是反抵消条件。

命题 1 的三明治界 $\max\{\mu^i E_p^i - \delta_i, 0\} \leq C_i \leq L^{2i}(E_p^i + \delta_i)$ 完全建立在 $(\mu, L)$ 和反向残差 $\delta_i$ 上。理解这个条件才能看懂理论保证何时成立、何时失效。

研究动机

学习型代理(neural surrogates)越来越多地被部署为数值求解器的替代品,覆盖科学计算的方方面面——从图网络求解器、消息传递求解器、神经算子,到扩散模型概率预报器,再到操作级概率天气集合预报(Price et al. 2025, Nature)。这些模型在部署时是自回归地滚动的:把上一步的预测当作下一步的输入,因此单步的小误差会随深度复合,输入分布从训练分布漂移出去,而且漂移速率在不同初始条件下变化莫测。问题在于:在真实部署场景(等离子体控制 Degrave 2022、加速器诊断、天气预报)下,根本没有 ground truth 来衡量这种累积误差,模型自己无法回答「我还能被信任到多远的未来」。标准的不确定性量化方法(深度集成、MC dropout、学习方差、共形区间、样本离散度)其实度量的是模型自己与自己分歧多少(aleatoric 宽度),而不是「学到的动力学是否被准确地施加到当前轨迹上」;更糟的是,这些基于离散度的信号在自回归展开引入的分布漂移下会退化。

本文的目标是本文要给生成式动力学代理一个在测试时、无 ground truth 下可直接读出的信任信号——一个能告诉操作员「这条展开已经偏离多远、是否该早停、是否在训练分布外」的标量度量。具体目标包括:(1) 信号必须只用模型自身可计算,不需要集成、不需要保留数据、不需要知道控制方程;(2) 信号必须定量追踪真实的潜在展开误差 $E_i$,而不仅仅是单调随深度增长(任何随深度增长的信号都能匹配 depth-only 基线);(3) 信号要在分布漂移下仍然有效,能在模型「自信却错误」的离分布场景下报警;(4) 信号要能驱动选择性预测(按预测误差推迟样本),并理想情况下能整合进单一一个网络而不增加架构复杂度,最好还能顺便提供逆求解能力。

与已有工作不同的是,作者独特切入:把「循环一致性」这个古老思想从光流对应、未配对图像翻译、逆成像里搬到学到的动力学代理上。关键区别是:以前的工作里至少有一段是已知的解析算子(比如逆成像里的物理前向模型 Huang 2023),而本文里往返两段都是同一个学到的双向生成器,循环是在一条 2i 步的自回归展开上闭合的——两段都随深度累积误差。所以本文的核心贡献不是「提出循环一致性」,而是定量证明这种自闭环的 $C_i$ 能追踪深度依赖的 $E_i$,给出基于双李普希茨分析的理论保证(命题 1 的三明治界),并在三个物理系统加一个人脸视频系统上验证其忠实度。此外,方向标志让单一网络同时是前向代理和时间逆求解器,这种双向训练在低数据下还能以负代价超过方向专家,是另一条独特的切入。

核心方法

整体思路先有一个直觉:如果一个模型既会向前又会向后预测,那么「向前 i 步再向后 i 步」必须回到起点;任何偏离都是误差的迹象。技术路线上,作者在潜空间里训练一个条件扩散 transformer 作为动力学代理:每个物理场先用 β-VAE(β=10⁻³)独立压缩成 16×16×4 的潜变量(约 256× 压缩),然后用标准 DDIM 去噪扩散在潜空间里学习转移。区别于普通扩散代理的地方只有一个:方向标志 $c_d \in \{+1, -1\}$ 通过 adaLN-Zero 调制每一个 transformer 块,使同一个权重集既能向前($c_d=+1$,代理求解器)又能向后($c_d=-1$,逆求解器)预测。往返一致性误差 $C_i = \frac{1}{2}\langle \text{MSE}(z_{t-1}, \tilde z_{t-1}^{(i)}) + \text{MSE}(z_t, \tilde z_t^{(i)}) \rangle$ 在测试时由一次额外的反向展开计算,与不可观测的真实误差 $E_i$ 之间的差,就是模型对自己展开质量的自我评估。

核心创新是把「双向性」既当作能力又当作自检仪器:同一个网络代表系统的前向演化和时间逆,因此可逆性变成一个可检验的不变量——精确的模型与自己逆复合后应该是恒等映射 $\Phi_i^- \circ \Phi_i^+ = \text{Id}$,留下的偏差 $C_i$ 在测试时可测、且不需要 ground truth。这与已有的不确定性量化方法在本质上不同:那些方法测的是模型与自己的「分歧」(dispersion),在分布漂移下会失效甚至反向(OOD 时 AUROC=0.00);而 $C_i$ 测的是「学到的动力学是否被准确施加到当前轨迹」,因为往返漂移必须在分布漂移下增长。另一个本质区别是:以前循环一致性的工作里至少一段是已知算子,本文两段都是同一个学到的双向生成器,所以理论保证(命题 1 的「三明治界」)必须处理两段都累积误差的情形,并显式建模反向映射的「共李普希茨」条件 $\mu > 0$ 作为反抵消条件。

方法步骤详情

步骤分四步。(1) 编码——每个物理场(MHD 的六场:ρ、P、$v_x, v_y$、$B_x, B_y$)用各自的 cVAE 独立压缩到 16×16×4 潜空间;人脸视频用冻结的 Stable Diffusion VAE 把 256×256 压成 32×32×4。(2) 训练——扩散 transformer 把目标帧、最近 n=2 个上下文帧、一个锚帧 patchify 成一条 token 序列;标量条件(去噪步 k、时间 t、方向 $c_d$)通过 adaLN-Zero 调制每个块;用 ε-预测损失 $\mathcal{L} = \mathbb{E}\|\epsilon - \epsilon_\theta(\cdot)\|^2$ 配 cosine 噪声表和 min-SNR-γ=5 加权训练,正反向样本各半。(3) 自检——部署时用确定性 DDIM 向前展开到深度 i,再用同一网络设 $c_d=-1$ 反向展开 i 步回到起点,与编码真值对计算 $C_i$,开销 2× 推理。(4) 校准——在训练展开上拟合异方差高斯校准器,多项式阶数 (4,2) 由 5 折交叉验证选出。

技术新颖性

技术新颖性集中在四点。(1) 方向标志让单一潜扩散网络同时是前向代理和时间逆求解器,且双向训练在低数据下以「负代价」超过方向专家——湍流辐射层(80 条训练轨迹)上双向模型在专家自己的方向上反而好 7-10%(前向 0.0630 vs 0.0675,反向 0.0621 vs 0.0689)。Proposition 2 用线性分析解释:对平稳动力学时间反转是前向的重参数化($A^- = \Sigma A^\top \Sigma^{-1}$),双向训练是正确指定的权重共享,估计方差减半。(2) 理论「三明治界」 $\max\{\mu^i E_p^i - \delta_i, 0\} \leq C_i \leq L^{2i}(E_p^i + \delta_i)$ 把 $C_i$ 与真实误差用反向映射的双李普希茨常数 $(\mu, L)$ 和残差 $\delta_i$ 钉死,下界里的 $\mu > 0$ 正是反抵消条件。(3) 把循环一致性变成可校准、可驱动选择性预测、可做 OOD 检测的实用信任信号。(4) 反向方向免费变成快速逆求解器。

Physical-field inverse rollouts. Backward rollout (cd = −1) of a held-out MHD test trajectory seeded with only the true terminal pair
Figure 6: Physical-field inverse rollouts. Backward rollout (cd = −1) of a held-out MHD test trajectory seeded with only the true terminal pair
Latent rollouts, forward. Latent trajectories of a held-out MHD test trajectory in the 16×16×4 per-field latent space
Figure 8: Latent rollouts, forward. Latent trajectories of a held-out MHD test trajectory in the 16×16×4 per-field latent space
Latent rollouts, backward. Latent trajectories of a held-out MHD test trajectory in the 16×16×4 per-field latent space
Figure 9: Latent rollouts, backward. Latent trajectories of a held-out MHD test trajectory in the 16×16×4 per-field latent space

实验结果

在三个耗散非线性物理系统加一个人脸视频系统上做了系统验证。(1) 追踪真实误差:留出 MHD 上 $C_i$ 与 $E_i$ 固定深度 Spearman 高达 0.91-0.98(i=20 时 0.97),轨迹内 0.69±0.16;校准器把误差预测到 1.14×(68%)和 1.29×(95%),覆盖率 66.3%/95.1% 接近名义,误校准面积仅 0.013,比 depth-only 基线提升 1.0 nat 留出对数似然,每深度持续 0.6-1.3 nat。(2) OOD 检测:Orszag-Tang 涡旋上 AUROC 在深度 5、10 达 1.0,而样本离散度基线在 i=5 时 AUROC=0.00。(3) 选择性预测:推迟误差最高 20% 把均摊潜在误差降 15%,是 depth-only 早停(5%)的三倍。(4) 解码场迁移:增益迁移到全部六个物理场(+0.32 到 +0.73 nat)。(5) 反向能力:设 $c_d=-1$ 把代理变成快速逆求解器,$C_i^-$ 同样追踪反向误差。(6) 人脸探针:CelebV-HQ 上 Spearman 0.79-0.81。

Test-time trust signals for learned predictors
Table 1: Test-time trust signals for learned predictors
Test-time signals vs. true rollout error on held-out MHD trajectories
Table 2: Test-time signals vs. true rollout error on held-out MHD trajectories
Calibrated error prediction on held-out MHD trajectories (50 trajectories × 98 depths)
Table 3: Calibrated error prediction on held-out MHD trajectories (50 trajectories × 98 depths)
Head-to-head on LE-PDE-UQ's Navier–Stokes benchmark
Table 4: Head-to-head on LE-PDE-UQ's Navier–Stokes benchmark
Per-field calibration of decoded reconstruction errors on held-out trajectories
Table 5: Per-field calibration of decoded reconstruction errors on held-out trajectories
Predicted vs. true RMS errors on test data for the rolled-out latents and all six MHD fields
Figure 2: Predicted vs. true RMS errors on test data for the rolled-out latents and all six MHD fields
Out-of-distribution detection: distribution of log C over 50 held-out trajectories at three depths, with the Orszag–Tang vortex marked
Figure 3: Out-of-distribution detection: distribution of log C over 50 held-out trajectories at three depths, with the Orszag–Tang vortex marked
C tends to detect when faces morph OOD
Figure 4: C tends to detect when faces morph OOD
Round-trip consistency Ci vs. true latent rollout error Ei on the 50 held-out MHD trajectories, colored by turnaround depth i
Figure 5: Round-trip consistency Ci vs. true latent rollout error Ei on the 50 held-out MHD trajectories, colored by turnaround depth i
Predicting unknown latent rollout error: Round-trip consistency forward or backward in time
Figure 7: Predicting unknown latent rollout error: Round-trip consistency forward or backward in time
Forward-rollout error on the Navier–Stokes benchmark: mean relative L2 vs. rollout depth with the interquartile range
Figure 10: Forward-rollout error on the Navier–Stokes benchmark: mean relative L2 vs. rollout depth with the interquartile range
Predicted µ ± 2σ of Ei as a function of Ci, fit on validation data, relative to actual measurements on LE-PDE-UQ test data
Figure 11: Predicted µ ± 2σ of Ei as a function of Ci, fit on validation data, relative to actual measurements on LE-PDE-UQ test data
MHD forward (top) and backward (bottom) autoregressive rollout error accumulation
Figure 19: MHD forward (top) and backward (bottom) autoregressive rollout error accumulation
查看结构化数据
任务指标本文基线提升
MHD 留出轨迹固定深度 Spearman($C_i$ vs $E_i$ 排序) Spearman ρ at i=20 0.97(往返一致性 C_i,2× 推理) 0.98(S=5 rollout spread,5× 推理) 在分布内基本持平,但 $C_i$ 兼容确定性部署且在 OOD 上完胜
离分布检测(Orszag-Tang 涡旋 vs 50 条留出 MHD 轨迹) AUROC(i=5/10) 1.00(深度 5、10;轨迹均值 0.98) 0.00(S=5 rollout spread at i=5) 样本离散度信号在 OOD 上完全反向;$C_i$ 在 compute 花费前就报警
校准误差预测(留出 MHD,4900 深度-轨迹对) ×68 / ×95 / MCA 1.14 / 1.29 / 0.013(µ(C_i) 校准器) 1.41 / 1.92 / 0.059(depth-only 校准器) 区间宽度约一半,留出 NLL 提升 1.0 nat
选择性预测(推迟误差最高 20%) 均摊潜在误差降低(80% 覆盖) 15% 5%(depth-only 早停) 三倍于 depth-only 基线
LE-PDE-UQ Navier-Stokes 基准(2D 涡度,64²,Re=10⁴) per-trajectory block relative L2 0.244(单一双向模型,2× rollout) 0.190(十模型集成,10× 训练/推理) 在十分之一训练成本下达 1.29× 精度,且零精度代价附加信任信号
方向专家消融(湍流辐射层,80 训练轨迹) VRMSE(前向/反向,方向匹配) 0.0630 / 0.0621(双向) 0.0675 / 0.0689(方向专家) 7-10% 提升,半数参数、半数每方向样本,过拟合更晚

局限与改进

作者坦承的局限:(1) $C_i$ 是必要条件而非充分条件——前向和反向误差原则上可能抵消,命题 1 用共李普希茨条件 $\mu > 0$ 显式刻画这种「抵消」何时会让信号失灵;经验上抵消很罕见(95.1% 的留出点落在校准的 ±2σ 带内),但小的 $C_i$ 只是证据不是认证,命题 1 让对反向映射条件的依赖变得明确。(2) 强耗散系统的反向动力学在连续极限下是病态的;本文研究的视界内学到的逆仍然提供信息,但非常长的视界和刚性系统需要专门研究。(3) $C_i$ 生活在潜空间,把它和物理校准的场空间度量关联起来是自然的精细化方向——作者已经做了六个场的迁移校准但承认这是简化。(4) 我自己的观察:在湍流辐射层上每轨迹因子太小(±11% vs MHD 的 ±28%),被 $C_i$ 自身的每深度噪声掩盖,固定深度 Spearman 只有 0.11 接近理论上限 0.12,意味着对「轨迹差异度小的系统」信号边际价值低;人脸视频这种多模态系统里 $E_i$ 对单一实现的未来增长很快,点误差本身就是噪声指标;深度条件校准在 i≥40 时漂移到 MCA=0.27。

独立分析的弱点

独立分析的弱点:(1) 强不可逆内容失效——作者明确把倒水、烟雾等强不可逆现象排除,因为反向方向学不出来;改进方向是引入熵增正则化或仅在可逆子空间自检。(2) 低异质性系统信号弱——湍流辐射层(每轨迹因子 ±11%)上 $C_i$ 退化为带噪深度代理,留出测试 −0.008±0.005 nat 增益不显著;改进方向是把 $C_i$ 尺度与 S=5 种子离散度空间形状组合(LE-PDE-UQ 上 MA 从 0.100 降到 0.082)。(3) 深度条件校准漂移——i≥40 时每深度 MCA 达 0.27 vs 池化 0.013;改进方向是按深度重新校准或加 split-conformal。(4) MAE 偏弱——LE-PDE-UQ 上 MAE 0.204 vs 集成 0.161-0.181,因指标加权后期高幅帧。(5) 没有把信号变成修正——作者把「用 $C_i$ 在线梯度-free 自适应反馈修正预测」留作未来工作,是最大实用缺口。

未来方向

作者明确提出的方向:(1) $C_i$ 是可测标量代价,原则上可在线用无梯度自适应反馈(Scheinker & Scheinker 2016 的有界极值寻找)最小化,把「误差检测」变成测试时「误差修正」——作者明确说这是本文范围外正在进行的工作,是把信任信号闭环成自纠错系统的关键一步。(2) 把原理扩展到离散序列模型:时间反转的语言模型已能提供无监督反馈(Yerram 2024),但语言严重的非单射性($\mu \to 0$)使这成为独立而有趣的领域。(3) 把 $C_i$ 与物理校准的场空间度量关联作为自然精细化。基于成果可延伸:(4) 用 certified bi-Lipschitz 架构(如可逆残差网络 Behrmann 2019)得到保证的 $(\mu, L)$;(5) 把 $C_i$ 尺度和离散度空间形状系统组合成混合校准器;(6) 在多场、多物理的更大规模代理上验证(Los Alamos 加速器诊断应用有现成场景);(7) 专门研究强耗散/刚性系统的长视界反向动力学。

复现评估

复现评估总体良好。(1) 数据可得性——MHD 用 Mocz et al. 2014 的约束传输代码生成(附录 A.3 给了守恒律形式和初始磁场的 100 高斯混合向量势,可复现);湍流辐射层和人脸视频来自公开基准 The Well 和 CelebV-HQ;Navier-Stokes 用 Li et al. 2021 标准神经算子数据集(64²,Re=10⁴,1200 条轨迹,官方切分)。(2) 架构充分披露——附录 A 给了完整细节:DiT width 384、depth 12、6 头、patch size 2、min-SNR-γ=5、β=10⁻³;cVAE 配置(MHD cVAE 192M、扩散 29M、人脸扩散 912M);条件融合用 adaLN-Zero 和 FiLM。(3) 校准协议严格——5 折交叉验证选阶数、输入截断到训练支撑、训练/校准/测试严格分离。(4) 算力——MHD 在 Google v6e TPU,其他在 NVIDIA H200;MHD 训练 1M 步 batch 16。(5) 论文未提代码开源,但配置足以复现,门槛是 MHD 模拟代码和大算力,中等难度。