面向多步视觉推理的层级去噪框架 HDR Hierarchical Denoising For Multi-Step Visual Reasoning
用树状层级潜变量实现粗到细推理,兼顾多步规划与低延迟流式生成。
前置知识
双向扩散 (Bidirectional Diffusion) 与流式自回归扩散 (Streaming AR Diffusion)
双向扩散模型在每个去噪步联合更新整段视频潜变量序列 $z_t = \{z_t^1, ..., z_t^N\}$,即 $z_{t-1} = D_\theta(z_t, t, c)$,所有时间token在中间步骤都保持含噪,信息可全局流动,从而能维持并修正不确定假设;代价是每步都要密集更新固定长序列,部署成本高、难以低延迟流式输出。流式自回归扩散则把生成分解为 $p(z|c) = \prod_{i=1}^{N} p(z^i | z_{<i}, c)$,从左到右逐token生成,可流式推理并复用KV缓存,但一旦早期token生成便无法回头修正,多步推理的逻辑一致性较差。
HDR 的整个动机正是建立在这两类范式各自的权衡之上。不理解双向扩散的‘全局可修订性’和自回归扩散的‘不可逆提交’之间的张力,就无法理解作者为什么要在因果生成前插入一层‘层级潜空间’来弥补自回归范式无法回头的缺陷。
Flow Matching (流匹配) 与速度场回归
Flow Matching 是一种生成式训练目标,通过学习一个时变速度场 $u_\theta$ 沿连接数据与噪声的线性概率路径运输样本。本文用线性插值 $v_{\ell,i}^t = (1-t)v_{\ell,i}^0 + t\epsilon$ 构造含噪token,目标速度场为 $u_{\ell,i}^t = \epsilon - v_{\ell,i}^0$,训练时最小化速度回归损失。相比传统 DDPM 式扩散,Flow Matching 路径更平直、训练更稳定,且每个层级可独立设置去噪预算 $K_\ell$ 与残差噪声 $\rho_\ell$。
论文的层级去噪目标 $\mathcal{L}_{HDR}$ 完全建立在 Flow Matching 的速度场回归之上,且‘逐层匹配去噪强度’这一核心设计($K_1 < K_2 < ... < K_L$,$\rho_1 > \rho_2 > ... > \rho_L$)依赖于把每层视为独立 flow 路径来调度。读懂损失式与采样预算分配必须先掌握 Flow Matching 的速度目标含义。
KV 缓存与稀疏注意力掩码
自回归生成中,每个token生成后把其key/value状态写入缓存,后续token仅按注意力掩码选择性地检索已缓存状态,避免对全序列做密集注意力。SHAP(Sparse Hierarchical Attention Pattern)定义了一种常数大小的稀疏上下文 $A^{SHAP}(\ell,i)$,每个token只关注同层前驱、父层及其左右邻居以及首帧条件 $x_{ref}$,再通过 $\phi(\ell,i)=i+\sum_{r<\ell} N_r$ 把树坐标展平为序列坐标生成二值掩码 $M^{SHAP}$。
SHAP 是 HDR 实现跨层级信息流和低延迟的关键机制,论文明确指出它‘使每行只有常数个有效注意力目标,与视频长度无关’并自然诱导跨层 KV 缓存共享。不理解 SHAP 的稀疏结构与展平顺序,就难以理解 HDR 为何能在保持流式延迟的同时实现多尺度信息传播。
层级潜变量树 (Hierarchical Latent Tree)
HDR 把视频表示为树状层级潜变量集合 $T = \{V_1, V_2, ..., V_L\}$,其中 $V_\ell = \{v_{\ell,1}, ..., v_{\ell,N_\ell}\}$,$\ell=1$ 为最粗层、$\ell=L$ 为最细层。粗层token汇总全局时间结构代表高层规划,细层token编码局部视觉细节并落实最终动态。每个非根token有父节点 $\pi(\ell,i) = (\ell-1, p_\ell(i))$,父节点表示当前token所细化的粗时间片段。
这是整篇方法的骨架。论文所有机制(逐层去噪调度、SHAP 父子链接、推理时由粗到细展平生成)都围绕这棵树展开。理解‘粗层保留多个可能全局规划、细层把它们实例化为具体视觉状态’是把握 HDR 核心创新的前提。
视频推理基准与 Success / Average Progress 指标
作者构建了六任务多步视频推理基准:迷宫导航、汉诺塔、一笔画、滑动拼图、推箱子、倒水。每个任务评测两类指标:Success 衡量精确完成任务的比例;Average Progress 衡量部分进度,反映中间逻辑一致性。基准按难度分层并包含 OOD 样本,共 370 个保留视频,最终用六任务的非加权平均得到 Overall 分数。
论文几乎所有核心数字(成功 34.22→60.29、进度 76.00→89.56)都来自这个基准。理解 Success 和 Average Progress 的差别(前者看终点、后者看轨迹一致性)对判断 HDR 究竟在‘规划’还是‘插值’至关重要。
研究动机
视频生成模型正从逼真视频合成器进化为通用视觉基础模型,需要在迷宫导航、物理推理、工具使用等任务上通过生成视觉轨迹完成多步推理。然而现有两大范式都难以同时满足‘多步逻辑一致性’与‘低延迟流式生成’。流式自回归扩散模型(如 CausVid、CausalForcing)通过只依赖历史上下文逐token生成而高效,但这种从左到右的提交使其一旦早期做出错误决定(如在迷宫里选错分支)便无法回头修正,多步推理成功率受限。双向扩散模型(如 Wan2.2)允许跨时间全局信息流动与修订,能维持并迭代精炼候选解,但每步都要密集更新整段固定长度序列,导致 37.92s/latent 的高延迟和昂贵的部署成本,难以与流式生成兼容。具体而言,在作者的六任务基准上,CausalForcing 仅获 34.22 的总体成功率和 76.00 的平均进度,而双向扩散虽成功率达 60.00 却付出 54.2 倍的延迟代价。这一根本性张力——要么高效但逻辑不一致、要么全局推理但高延迟固定序列去噪——正是本文要解决的核心问题。
本文的目标是本文的目标是设计一个统一框架,既保留流式自回归扩散的低延迟流式生成能力(与 CausalForcing 相当的延迟、可复用 KV 缓存、支持滑动窗口无限生成),又恢复双向扩散那样的全局规划与多步推理的修订能力,使得在迷宫、汉诺塔、推箱子等需要长轨迹逻辑一致性的任务上达到甚至超过双向扩散的成功率。同时作者希望该框架在数据稀少(仅 2% 训练数据)和去噪步数压缩(仅 1 步)的极端条件下仍保持鲁棒,并能迁移到真实世界机器人交互,作为一种新型物理世界建模范式。简言之,HDR 要在‘流式效率’与‘全局可修订推理’之间架起桥梁,并用统一的层级潜空间同时优化最终任务完成度、中间推理一致性、部署延迟和数据效率四个目标。
与已有工作不同的是,以往工作大多只是基准评测或分析双向生成器中涌现的推理行为(如 VBVR、VR-Bench、对扩散中间态的研究),而很少有人设计能在流式约束下保留推理能力的架构。HDR 的独特切入角度在于:不去在‘双向 vs 自回归’二选一中做工程折中,而是引入一个显式的树状层级潜空间作为中间规划层。其根本洞见是‘把去噪强度与层级匹配’——粗层故意停在较高噪声水平以保留多个可能的全局规划(高熵假设),细层用更强去噪与更低残差噪声把这些假设逐步精炼为具体视觉状态。这样既不放弃因果生成的低延迟结构,又为模型提供了在提交到帧级细节之前进行可修订高层规划的显式空间,从而填补了‘流式约束下的可修订多步推理’这一架构空白。
核心方法
HDR 的直觉是:在因果流式生成‘说话’前,先让模型在多时间分辨率的层级潜空间里‘想一想’。技术路线是把视频潜token组织成 $L$ 层树 $T=\{V_1,...,V_L\}$,根层代表粗时间结构(全局规划),叶层代表细视觉细节(最终动态)。训练时每层级token沿 Flow Matching 路径 $v_{\ell,i}^t=(1-t)v_{\ell,i}^0+t\epsilon$ 加噪,学预测速度 $u_{\ell,i}^t=\epsilon-v_{\ell,i}^0$,用层级加权和 $\mathcal{L}_{HDR}=\sum_{\ell}\lambda_\ell \frac{1}{N_\ell}\sum_i \mathbb{E}\|\epsilon-v_{\ell,i}^0-u_\theta(v_{\ell,i}^t,t,h_{\ell,i},c)\|_2^2$ 联合优化。推理时按 $\phi(\ell,i)=i+\sum_{r<\ell}N_r$ 由粗到细展平:先生成 $V_1$ 再 $V_2$ 直到 $V_L$,每层内部从左到右因果生成,保留流式结构。整体构建在 Wan2.2-5B-TI2V 上,用 6 个潜层级与熵匹配去噪调度。
核心创新点在于把‘层级’当作一种与去噪强度耦合的归纳偏置,而不是简单地把视频分成多分辨率堆叠。其本质区别有三:第一,HDR 显式地让去噪预算随层级递增 $K_1\rho_2>\cdots>\rho_L$,因此粗层在更高噪声处停止、预测保持部分随机性,能保留‘多个可能的全局规划’这种高熵假设,细层接受更强去噪把假设实例化。作者还给出 $K_\ell$ 的熵匹配推导(附录 C)。第二,SHAP 注意力掩码把每个token的上下文严格限制为同层前驱 $(\ell,i-1)$、首帧条件 $x_{ref}$、以及父节点 $\pi(\ell,i)$ 及其左右邻居,使每行只有常数个有效注意力目标,与视频长度无关。第三,SHAP 自然诱导跨层 KV 缓存共享:粗层生成的key/value被细层通过掩码选择性检索,从而用稀疏注意力实现多尺度信息流。这三点合起来使 HDR 既能像双向扩散那样在生成前维持与精炼不确定假设,又像自回归扩散那样保持 0.70s/latent 的低延迟与 KV 缓存复用。
方法步骤详情
方法分四步。步骤一(构造层级树):按多时间分辨率构建 $L$ 层树,第 $\ell$ 层含 $N_\ell$ 个token,非根token经父映射 $\pi(\ell,i)=(\ell-1,p_\ell(i))$ 指向上一粗层父token。步骤二(层级 Flow Matching 训练):对 $v_{\ell,i}^0$ 采样 $\epsilon\sim\mathcal{N}(0,I)$ 构造 $v_{\ell,i}^t=(1-t)v_{\ell,i}^0+t\epsilon$,目标 $u_{\ell,i}^t=\epsilon-v_{\ell,i}^0$;输入含噪token、时间步、稀疏上下文 $h_{\ell,i}$ 与条件 $c$,输出预测速度,最小化式 (4) 损失。步骤三(由粗到细展平):按 $\phi(\ell,i)=i+\sum_{r<\ell}N_r$ 展平,先全部生成 $V_1$ 再 $V_2$ 直到 $V_L$,每层从左到右自回归,每token用层级专属步数 $K_\ell$ 去噪、残差噪声随层级降低。步骤四(SHAP 与 KV 共享):稀疏上下文 $A^{SHAP}(\ell,i)=\mathbb{1}[i>1]\{(\ell,i-1)\}\cup\mathbb{1}[i=1]\{x_{ref}\}\cup\mathbb{1}[\ell>1]\{\pi(\ell,i),left(\cdot),right(\cdot)\}$ 转为掩码 $M^{SHAP}$;生成 KV 写入缓存 $C_s=C_{s-1}\cup\{(k_{\ell,i},v^{KV}_{\ell,i})\}$ 供后续层级按掩码检索,实现常数开销跨尺度信息流。
技术新颖性
技术新颖性体现在三处。其一,把‘层级潜空间’首次系统性地嵌入到流式自回归扩散中以解决多步推理,这与以往侧重 chunk 滚动、队列去噪、AR 引导扩散、蒸馏、滑窗 KV 加速等工程改进不同——HDR 不是加速而是为因果生成补上‘可修订的高层规划’。其二,‘去噪强度与层级匹配’这一调度原则新颖且理论扎实:作者用熵匹配推导 $K_\ell$(附录 C),证明在固定总预算下让粗层保留更高残差噪声能最大化假设熵,这为‘粗层装假设、细层装细节’提供了信息论依据,而非经验拼凑。其三,SHAP 是一种结构化的树坐标注意力掩码,把每行有效注意力降到常数级且天然支持跨层 KV 共享,使多尺度信息流不再依赖密集全序列注意力。这三点共同构成一个可解释、可消融的层级推理范式,并通过逐层消融(图5)证明每一层都贡献结构(从 1 层的 40.12 成功率单调升到 6 层的 60.29)。
实验结果
核心发现分四块。第一,主对比(Table 1):相比 CausalForcing,HDR 把总体成功率从 34.22 提升到 60.29(相对+76.2%),平均进度从 76.00 升到 89.56,且不用全时间注意力下超过满注意力双向扩散(60.00/87.13)与 VideoMAE(40.53);分任务上汉诺塔 58.75、迷宫 78.00、推箱子 78.33、倒水 43.33 领先。第二,流式效率(Table 2):每 streaming step 延迟仅 0.70s,与 CausalForcing 0.72s 持平,比双向扩散 37.92s 快 54.2 倍。第三,鲁棒性(图6):仅 1 步去噪时 HDR 仍有 34.72(57.6% 保留),远高于双向扩散 17.78(29.6%)与 CausalForcing 11.25(32.9%);仅 2% 数据时保留 82.9% 成功与 97.2% 进度,双向扩散仅 52.0%/89.5%。第四,物理迁移(图7/Table 3):仅 50 个真实视频微调,HDR 在 easy/medium/hard/OOD 均高成功率(OOD 20/80);RoboDojo 上 HDR-WAM 无预训练取得 5.47/3.00% 刷新无预训练 WAM SOTA,Long-Horizon 9.85/4.75%、Memory 6.65/4.67% 领先。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 六任务多步视频推理基准(总体成功) | Overall Success (%) | 60.29±7.04 | CausalForcing 34.22 / 双向扩散 60.00 / VideoMAE 40.53 | 相比 CausalForcing 绝对+26.07、相对+76.2%;并超过用满注意力的双向扩散 |
| 六任务多步视频推理基准(平均进度) | Overall Average Progress | 89.56±1.56 | CausalForcing 76.00 / 双向扩散 87.13 | 相比 CausalForcing +13.56,中间推理一致性显著增强 |
| 流式生成延迟 | Latency per latent (s) | 0.70 | CausalForcing 0.72 / 双向扩散 37.92 | 与 CausalForcing 持平,比双向扩散快 54.2 倍 |
| 数据效率(2% 训练数据) | Success 保留率 vs 全数据 | 82.9% | 双向扩散 52.0% | +30.9 个百分点,证明层级提供了可迁移规则的强归纳偏置 |
| 去噪步鲁棒性(仅 1 步) | Overall Success / 保留率 | 34.72 / 57.6% | CausalForcing 11.25(32.9%) / 双向扩散 17.78(29.6%) | 保留率约翻倍,证明粗层提供稳定全局引导 |
| RoboDojo 世界动作建模(无预训练平均) | Score / Success Rate | 5.47 / 3.00% | AHA-WAM 4.82/2.39% / Fast-WAM 3.48/2.03% | 刷新无预训练 WAM SOTA,Long-Horizon 维度达 9.85/4.75% |
| 层级消融(图5) | Overall Success 随层数 | 1层40.12→6层60.29 单调上升 | 1 层等价于 CausalForcing 34.22 | 每一层都贡献结构,6 层比 1 层绝对+20 |
局限与改进
作者承认的局限有三:一是评测基准为作者自建的六任务合成环境(370 个保留视频),虽含 OOD 样本但仍是受控合成任务,与开放世界视频推理复杂度有差距;二是 HDR-WAM 在 RoboDojo 整体成功率仅 3.00%、Long-Horizon 仅 4.75%,绝对值仍低,离实用尚远;三是真实机器人迷宫仅用 50 个视频微调,OOD 场景 20/80 仍偏低,对不规则块布局泛化有限。我额外观察到:所有基线都构建在同一 Wan2.2-5B-TI2V 上以保证可控,但 VideoGPT(17.57)等弱基线使对比含金量需谨慎看待,缺少与更强最新自回归视频模型(Veo3 级)的直接对比;熵匹配调度 $K_\ell$ 推导放附录 C,正文未给出各层预算具体数值与复杂度,复现门槛高;SHAP 把注意力严格限制为父节点及左右邻居,对需要远距离跨段信息的任务(如多阶段倒水)可能信息不足,论文未做与全局注意力的差距上限分析;滑动拼图 33.33、倒水 43.33 偏弱,整体成功率 60.29 意味着仍有近 40% 失败。
独立分析的弱点
独立分析有三类弱点及改进方向。弱点一,SHAP 的注意力上下文过于局部(只含同层前驱、父节点及左右邻居),对需要长距离跨段信息耦合的任务(如多阶段倒水、复杂汉诺塔)可能信息不足,倒水仅 43.33、滑动拼图仅 33.33 的低分印证了这点;改进方向是引入可学习的稀疏‘跳层’链接或动态注意力扩张,在保持常数开销的同时允许关键远距离查询。弱点二,层级树结构($L=6$、父映射 $p_\ell$、各层预算 $K_\ell$)是预设的固定几何结构,无法随任务自适应;改进方向是用可微分层级分配或强化学习搜索最优树结构,甚至让模型自己学习父-子对应关系。弱点三,整体成功率仍仅 60.29 且 RoboDojo 上 HDR-WAM 仅 3.00%,说明层级去噪的‘推理’能力在硬组合任务上仍偏弱;改进方向是把 HDR 与显式符号规划器或 LLM 式思维链结合,由符号层提供高层规划、HDR 负责视觉实例化,并加入 RLHF 或执行反馈式训练来收紧逻辑一致性。此外,方法目前只在首帧条件下评测,对文本到视频、多模态条件下的层级调度尚未充分探索。
未来方向
作者明确提出的方向包括:把层级去噪推广为物理世界建模的新范式,在更多真实机器人任务上验证迁移性;扩展到更长程、更开放的视频推理任务。基于成果可延伸的方向有四:第一,把熵匹配调度从离线推导升级为在线自适应,根据当前任务难度动态调整各层预算 $K_\ell$ 与残差噪声 $\rho_\ell$,以进一步提升延迟-精度权衡。第二,将 SHAP 推广到空间层级(不仅是时间层级),构建时空联合的层级潜空间,可能进一步提升空间推理(如物体遮挡、相对位置)能力。第三,结合近期‘扩散即推理’的研究,把 HDR 的中间层级假设显式解码为可读的思维链或候选规划,用于可解释推理与人在回路校正。第四,把 HDR-WAM 与真实机器人闭环部署结合,利用其 0.70s 低延迟特性做在线规划-执行循环,并研究层级假设在执行失败时的在线修订机制,使物理世界模型更接近实用。
复现评估
复现评估中等偏上。有利因素:论文给出较完整的数学定义(层级树 $T$、Flow Matching 速度目标 $u_{\ell,i}^t=\epsilon-v_{\ell,i}^0$、损失 $\mathcal{L}_{HDR}$、SHAP 上下文 $A^{SHAP}$ 与掩码 $M^{SHAP}$、展平映射 $\phi$、KV 缓存更新),主基线统一构建在 Wan2.2-5B-TI2V 上保证公平对比,训练集规模明确(18,000 个视频推理样本),评测含 370 个保留视频与六任务 Success/Average Progress 定义(附录 B)。不利因素:熵匹配推导与 $K_\ell$ 取值、各层 $N_\ell$、训练超参、数据生成脚本主要在附录 C/I;项目页提供演示但正文未明确代码与 checkpoint 开源时间表。算力上主模型基于 5B 参数 Wan2.2,需 18,000 视频 flow matching 训练加 3,000 虚拟迷宫预训练,门槛较高。综合:方法可理解、基准可重建,但完整复现主实验需较大算力与未公开细节,建议等待代码与 checkpoint 公开。
论文图表
该图对比四种视频生成范式:双向扩散、AR 扩散、纯自回归、以及 HDR。图中以‘速度、推理、生成质量’三个雷达维度展示:双向扩散推理强但速度慢;AR 扩散速度快但推理弱;HDR 通过‘在流式输出前先做层级去噪’同时兼顾三者——粗层维持高层假设、细层精炼为视觉状态,并用稀疏层级注意力保持高效生成。
这是理解论文动机最关键的一张图,直观展示了‘多步推理精度 vs 低延迟流式’这一核心张力,以及 HDR 用‘在因果生成前插入层级规划’来弥合张力的总体策略。不看此图难以把握全文定位。