ST-WAM:面向视觉分布偏移鲁棒操作的语义-时序世界动作模型 ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
用DINOv3语义表示从未来预测和历史检索双向增强WAM的操作鲁棒性。
前置知识
世界动作模型 (World Action Model, WAM)
联合建模'未来视觉状态'与'机器人动作'的一类策略范式。它借助大规模视频预训练获得的世界动力学先验,先把未来视觉状态预测出来(通常在 VAE 隐空间中),再据此生成动作,以区别于直接把观测映射为动作的 VLA 模型。代表方法包括 DreamZero、Fast-WAM、LingBot-VA、Motus 等,有的在部署时显式生成未来视频,有的省略以提升推理效率。
ST-WAM 正是 WAM 这条技术路线的改进工作,必须先理解 WAM '先想象未来再决定动作'的范式,才能理解作者为何要追问'未来究竟该用什么表示'这一核心问题。
训练分布幻觉 (Training-Distribution Hallucination)
本文首次命名的现象:当当前观测偏离训练分布(如背景纹理、光照、相机视角被扰动)时,video-generative WAM 预测的未来视频会渐进式地向训练域(如 LIBERO 风格)的内容漂移,而不是忠实反映当前场景。作者在 180 个预测样本上人工审计,发现 70.6% 明显出现该现象。
这是整篇论文的出发点与靶心,理解了'像素生成式未来监督会把动作相关转移与任务无关视觉内容纠缠在一起'这一症结,才能理解为什么作者不直接修正幻觉视频,而是改用语义-时序建模来增强动作鲁棒性。
DINOv3 与自监督视觉编码器
DINOv3 是 Meta 提出的大规模自监督视觉 Transformer(本文用 ViT-S/16),通过学生-教师蒸馏与自监督对比目标学习,其特征具有强语义结构:同一任务状态在视觉扰动下仍高度一致,不同任务状态则可清晰区分。本文将其冻结后同时用作未来预测目标与历史检索表示。
DINOv3 是 ST-WAM 的语义基石。作者用 290 个帧三元组的对照实验证明 DINOv3 同态余弦相似度 0.904(远高于 Wan-VAE 的 0.686),跨态区分正确率 95.2%(远高于 VAE 的 60.0%),这正是选择 DINOv3 而非 VAE 隐空间做语义表示的关键依据。
Flow Matching (流匹配)
一种生成式建模的训练目标:沿连接干净数据 $x$ 与高斯噪声 $\epsilon$ 的线性路径 $x_\tau=(1-\tau)x+\tau\epsilon$ 学习速度场 $u=\epsilon-x$,训练时回归目标速度 $u_\theta$,推理时从纯噪声反向积分得到样本。本文对 VAE 未来、DINO 未来、动作三条分支分别施加流匹配损失。
ST-WAM 的三个专家全部用 flow matching 联合训练,损失为 $\mathcal{L}=\lambda_v\mathcal{L}_v+\lambda_s\mathcal{L}_s+\lambda_a\mathcal{L}_a$(权重 1.0/0.02/1.0),并使用 shift=5.0 的偏移调度与 10 步积分。不理解流匹配就无法读懂训练目标与推理采样过程。
Mixture-of-Transformers (MoT) 与 Wan2.2 Video DiT
MoT 是一种稀疏可扩展的多模态 Transformer 架构,不同模态/任务各有独立参数与预测头,层内通过混合注意力相互精炼。本文构造了一个三分支 MoT:视觉未来 DiT(5B,复用 Wan2.2-TI2V-5B)、语义未来 DiT(1B)、动作 DiT(1B),后两者从 Wan2.2 预训练权重初始化。
三分支 MoT 是 DSFE(双空间未来专家)的载体,也是理解结构化跨分支注意力掩码、未来与动作解耦、推理时可省略未来分支的前提,没有这个架构概念就无法理解图 2 与图 3。
LIBERO 与 LIBERO-Plus 基准
LIBERO 是机器人操作的标准仿真基准,含 Spatial/Object/Goal/Long 四个套件、共 40 个任务、每任务 50 次评测 rollout。LIBERO-Plus 是其鲁棒性扩展,在背景纹理、光照、相机视角等 7 个扰动维度上构造了 10030 个测试用例,用于零样本评测 VLA/WAM 在视觉分布偏移下的表现。
论文几乎所有结论数字都落在这两个基准上:LIBERO 上比拼分布内性能(98.7%),LIBERO-Plus 上比拼鲁棒性(72.8% vs Fast-WAM 51.5%),加上 RoboTwin 2.0 双臂与五个真实任务,理解这些基准的协议才能判断提升幅度是否显著。
研究动机
video-generative WAM 凭借世界动力学先验取得了优异的分布内性能,但其未来监督根植于像素生成目标——这种以视觉重建为主要优化对象的表示,会把'动作相关的状态转移'与'任务无关的视觉内容'纠缠在一起,从而在面对视觉分布偏移时鲁棒性不足。作者用 LingBot-VA 与 Fast-WAM-Joint 两个仅训练于 LIBERO 的代表模型,零样本评测 LIBERO-Plus 时发现:它们对背景纹理、光照、相机视角三类扰动的预测视频会渐进式地向 LIBERO 风格漂移,作者把这一反复出现的现象命名为 Training-Distribution Hallucination。对 180 个预测(每类扰动 30 例)的人工审计显示 70.6% 明显呈现该幻觉;更严重的是,Fast-WAM 与 Fast-WAM-Joint 在 LIBERO 上的成功率 97.6% 和 98.5%,到了 LIBERO-Plus 直接崩塌到 51.5% 和 59.0%。这揭示出 video-generative WAM 在视觉分布偏移下存在明显的鲁棒性短板。
本文的目标是本文的具体目标是:在不依赖大规模具身预训练、多阶段训练或任务级语义标注的前提下,端到端地训练一个能同时保持分布内强性能、又在视觉分布偏移下显著提升鲁棒性的世界动作模型。作者明确把设计目标锁定在'如何更鲁棒地表示未来'而非'如何更精准地修正幻觉视频'——用一种对视觉偏移稳定、又能区分任务状态的语义表示来补充像素生成式动力学。最终在 LIBERO-Plus 上把紧邻基线 Fast-WAM 提升 21.3 个百分点(51.5%→72.8%),在五个真实任务上把偏移条件成功率从 25.8% 翻倍到 61.5%,同时把分布内 LIBERO 平均推到 98.7%、RoboTwin 2.0 推到 92.77%,并在推理时省略显式未来生成以保持亚秒级响应(756ms)。
与已有工作不同的是,作者的独特切入角度是把中心问题从'WAM 能否预测未来'转移到'未来应该用什么来表示才能支撑鲁棒控制'。通过 290 个帧三元组的对照诊断,他们给出关键证据:DINOv3 在同态帧间余弦相似度达 0.904,而 Wan-VAE 仅 0.686;在跨态区分上 DINOv3 以 95.2% 的三元组更接近状态匹配的干净帧,远高于 Wan-VAE 的 60.0%——即 DINOv3 同时具备'视觉偏移下的同态稳定性'与'任务状态的区分性'。与依赖大规模具身预训练或多阶段训练的 LaWAM、LDA-1B 等替代未来表示方法不同,ST-WAM 把 DINOv3 作为共享语义表示同时用于'前瞻的未来预测'和'回顾的历史检索',并保留细粒度 VAE 动力学,形成一种无需额外预训练即可端到端训练的互补式语义-时序建模。
核心方法
ST-WAM 的整体思路是'用 DINOv3 在两个互补的时序方向上增强世界动作模型'。直觉上:像素生成式未来在视觉偏移下不可靠,但动作真正关心的是任务状态的演进,而 DINOv3 这种自监督语义特征恰好对视觉扰动稳定、又能区分任务状态。于是作者让 DINOv3 同时承担两个角色:前瞻地,作为未来预测目标之一,监督任务相关的语义状态演进;回顾地,作为近期历史的表示,当当前帧线索因视觉偏移不可靠时,从历史中检索与当前任务相关的证据。技术上,DSFE(双空间未来专家)在一个三分支 Mixture-of-Transformers 中联合建模未来 VAE 隐空间与 DINO 语义空间,动作专家与两个未来专家通过层内混合注意力互相精炼;CAIR(当前锚定意图检索)用冻结的 Qwen3-VL 提取当前视觉-语言语义锚点,再去检索 DINO 历史特征,产出'意图 token'只注入动作专家。三条分支以联合 flow matching 训练,推理时未来分支可省略,退化为纯动作策略。编码侧用冻结的 Wan2.2 VAE 与 DINOv3,损失权重 $(\lambda_v,\lambda_s,\lambda_a)=(1.0,0.02,1.0)$。
核心创新点是把 DINOv3 这一'对视觉偏移稳定且对任务状态具区分性'的自监督语义表示,同时用作未来预测目标和历史检索键,在一个端到端 WAM 中沿'前瞻+回顾'两个互补时序方向统一语义建模。这与已有方法存在三处本质区别:第一,不是去修正幻觉化的未来视频,而是用语义线索直接增强动作鲁棒性;第二,不像 LaWAM/LDA-1B 那样完全用 DINO 替代 VAE 隐空间并依赖大规模具身预训练与多阶段训练,而是保留细粒度 VAE 动力学、只用 DINO 做互补监督;第三,CAIR 的'当前锚定'设计——用当前视觉-语言上下文(Qwen3-VL 特征经可学习查询压缩)作为查询,去检索 DINO 历史,而不是用无锚定的可学习查询或 VAE 历史——使检索能聚焦与当前任务状态相关的历史证据,对任务无关视觉变化不敏感。结构化跨分支注意力掩码则从架构上保证了'未来不泄漏进动作、动作不干扰未来'的解耦。
方法步骤详情
完整流程可拆为五步。第一步编码与划分:给定当前观测 $o_t$、本体感知 $s_t$、语言指令 $\ell$,用冻结 Wan2.2 VAE 编码为视觉隐变量 $z_v$、冻结 DINOv3 编码为语义特征 $z_s$,并各自切分为当前条件 token $z^{cur}$ 与未来预测目标 $z^{fut}$。第二步 DSFE:视觉未来用 5B Wan2.2 Video DiT 建模 $z_v^{fut}$,语义未来与动作用两个 1B DiT(从 Wan2.2 初始化)建模 $z_s^{fut}$ 与 $a_{t:t+H-1}$($H=32$,未来 horizon $K=8$),三分支组成 MoT。第三步结构化注意力掩码:当前 VAE/DINO token 跨空间互看但不读未来与动作(无泄漏锚点);两个含噪未来流互相 + 看当前锚点;动作 token 只看当前两路与自己,禁止读任一未来流。第四步 CAIR:冻结 Qwen3-VL 抽当前视觉-语言特征 $H^q_t$,$N_I=8$ 个可学习查询经注意力压成当前语义 token $U^0_t$;把 $M=4$ 帧($\{t-24,t-16,t-8,t-1\}$)DINO 历史线性投影并加时序 embedding 拼成历史序列 $R_t$,经 $L=2$ 个交叉注意力块检索,输出意图 token $I_t$ 仅并入动作专家上下文。第五步联合 flow matching:每分支采样 $\tau_r\in[0,1]$ 与 $\epsilon_r\sim\mathcal{N}(0,I)$,构造 $x^\tau_r=(1-\tau_r)x_r+\tau_r\epsilon_r$、目标速度 $u_r=\epsilon_r-x_r$,令 $\tau_v=\tau_s=\tau_f$ 同步、$\tau_a$ 独立,总损失 $\mathcal{L}=\lambda_v\mathcal{L}_v+\lambda_s\mathcal{L}_s+\lambda_a\mathcal{L}_a$,LIBERO 训 10 epoch、batch 128,RoboTwin 训 5 epoch、batch 1024,AdamW lr $10^{-4}$,shift 5.0,BF16。
技术新颖性
技术新颖性可归为四点。第一,首次系统命名并量化 Training-Distribution Hallucination(180 例中 70.6%),并通过 290 个帧三元组的对照诊断给出'DINOv3 同态稳定且跨态可分'的量化证据(0.904 vs 0.686,95.2% vs 60.0%),把问题从'预测准不准'升级到'表示对不对'。第二,把 DINOv3 在两个互补时序方向上统一使用:前瞻做未来语义监督、回顾做历史检索,且不放弃细粒度 VAE 动力学,这与 LaWAM/LDA-1B'全量替换 VAE + 依赖具身预训练/多阶段训练'的路线形成对照——ST-WAM 无需任何额外具身预训练即达到 98.7% LIBERO 与 72.8% LIBERO-Plus。第三,结构化跨分支注意力掩码是一个可证明解耦的设计:当前锚点无泄漏、未来流互精炼但隔离动作、动作流只读当前,从而允许未来分支在推理时被整体省略而保持纯动作策略(756ms/32 步,仅 1.24× 于 Fast-WAM)。第四,CAIR 的'当前锚定'检索是对历史利用方式的精细化——消融证明无锚定 Naive 检索只有 56.5%、用 Qwen 当前帧只有 62.3%、用 VAE 历史只有 64.7%,唯独'Qwen 当前锚点 + DINO 历史'达到 72.8%,把'如何检索历史'这个问题提升到与'如何预测未来'同等重要的高度。
实验结果
实验横跨 LIBERO、LIBERO-Plus、RoboTwin 2.0 与五个真实任务,核心发现分四层。第一层分布内性能:LIBERO 四套件 Spatial/Object/Goal/Long 分别 99.0/100.0/99.0/96.8,平均 98.7%,在无具身预训练的方法中最高,超过需要预训练的 Motus(97.7%) 与 LingBot-VA(98.5%);RoboTwin 2.0 双臂上 clean/random/avg 为 93.06/92.48/92.77,超过 LingBot-VA 的 92.20 与 Fast-WAM 的 91.83。第二层零样本鲁棒性(表 3):LIBERO-Plus 总体 72.8%,七类扰动中相机 55.4、机器人 60.1、语言 79.3、光照 93.0、背景 74.2、噪声 79.5、布局 74.3,相比 Fast-WAM 的 51.5 提升 21.3 个百分点,且在相机与传感器噪声两类上分别多出 39.0 和 41.8 个百分点,甚至超过依赖具身预训练的 OpenVLA-OFT(69.6%)、RIPT-VLA(68.4%)、X-VLA(71.4%)。第三层真实世界(表 4):nominal 79.3%(比 Fast-WAM/π0 高 14.6/32.0),视觉偏移 61.5%(高 35.7/28.7),复合偏移 48.0% vs Fast-WAM 15.3%;Fast-WAM 从 nominal 到 shifted 掉 38.9 个百分点而 ST-WAM 只掉 17.8,证明像素生成式未来对偏移更敏感。第四层效率与消融:推理 756.17ms(Fast-WAM 609.30ms,1.24×);消融(表 5)显示 DINO Future Only 仅 39.7%(低于 VAE 的 51.5%),DSFE 双空间达 66.4%,加 CAIR 达 72.8%;去掉语义未来专家降到 63.5%、去掉 CAIR 降到 43.7%(真实世界)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| LIBERO 分布内操作(四套件平均) | 成功率 (%) | 98.7%(Spatial 99.0 / Object 100.0 / Goal 99.0 / Long 96.8),无具身预训练 | Fast-WAM 97.6%、Motus 97.7%(有预训练)、LingBot-VA 98.5%(有预训练) | 在无具身预训练前提下达到最高平均,比 Fast-WAM 高 +1.1,并超过有预训练的 Motus/LingBot-VA |
| LIBERO-Plus 零样本视觉偏移鲁棒性 | 总体成功率 (%) | 72.8%(相机 55.4 / 机器人 60.1 / 语言 79.3 / 光照 93.0 / 背景 74.2 / 噪声 79.5 / 布局 74.3) | Fast-WAM 51.5%、Fast-WAM-Joint 59.0%、OpenVLA-OFT 69.6%、X-VLA 71.4%(均有具身预训练) | 比紧邻基线 Fast-WAM 提升 +21.3 个百分点,相机与噪声两类各 +39.0/+41.8,且无具身预训练即超过有预训练 VLA |
| RoboTwin 2.0 双臂操作(clean+randomized 混合训练) | 平均成功率 (%) | 92.77%(clean 93.06 / random 92.48),无具身预训练 | LingBot-VA 92.20%(有预训练)、Fast-WAM 91.83% | 无具身预训练即超过有预训练的 LingBot-VA +0.57、超过 Fast-WAM +0.94 |
| 真实世界五任务(nominal + 视觉偏移) | 成功率 (%) | nominal 79.3%,视觉偏移平均 61.5%,复合偏移 48.0%(nominal→shifted 仅掉 17.8) | Fast-WAM nominal 64.7%/shifted 25.8%/复合 15.3%(掉 38.9);π0 nominal 47.3%/shifted 32.8% | 偏移条件下比 Fast-WAM 高 +35.7 个百分点,真实成功率翻倍(25.8%→61.5%),衰减幅度约为 Fast-WAM 的一半 |
| DSFE+CAIR 组件消融(LIBERO-Plus) | 成功率 (%) | 完整 ST-WAM 72.8% | DINO Future Only 39.7;Dual-Space w/o CAIR 66.4;w/o 语义未来专家 63.5;Semantic Expert w/o Future Obj. 62.9;Naive 检索 56.5;Qwen 当前 62.3;VAE 历史 64.7 | 证明 VAE 与 DINO 互补不可替代,显式语义未来预测与当前锚定的 DINO 历史检索缺一不可 |
| 推理效率(A100-80GB, BF16, 10 步积分) | 32 步动作 chunk 推理时延 (ms) | 756.17 ms | Fast-WAM 609.30 ms | 1.24× 时延的适度开销换取鲁棒性大幅提升,仍保持亚秒级 |
局限与改进
作者在结论中明确承认的局限是:当前工作聚焦于视觉分布偏移,未来需要扩展到物理动力学变化与不同具身形态(embodiment)的变化——也就是说 ST-WAM 尚未验证在质量/摩擦等物理参数变化、或换用不同机械臂构型时的鲁棒性。基于通读我可以补充几点观察:第一,鲁棒性提升主要针对'外观级'视觉偏移(背景/光照/纹理/相机视角),对几何结构剧变或全新物体类别是否同样有效未被检验。第二,虽然消融证明 DINO 与 VAE 互补,但语义损失权重 $\lambda_s$ 仅 0.02,说明语义分支对动作的梯度贡献相对小,其在更复杂长程任务中的边际收益曲线未被刻画。第三,真实世界评估只在单臂(Agilex Piper 6-DoF)上做,每任务 50 演示、30 trials,样本规模有限,统计显著性边界较窄(如 Hang Mug 86.7% 与 Fast-WAM 73.3% 仅差几例)。第四,DINOv3、Qwen3-VL、Wan2.2 均为冻结大模型,整套系统对这三个上游模型的偏置高度敏感,作者未讨论上游模型自身的分布偏置是否会传递到策略。
独立分析的弱点
独立审视后,以下几点值得改进。第一,$\lambda_s=0.02$ 的语义损失权重在数值上看似很小,可能使语义未来专家对动作决策的实际梯度影响有限——消融中'Semantic Expert w/o Future Obj.'仍达 62.9%,提示语义分支更多通过架构耦合而非显式损失起作用;改进方向是用自适应权重或对比型语义损失增强其对动作的监督强度。第二,CAIR 固定从 $\{t-24,t-16,t-8,t-1\}$ 这 4 帧等距采样历史,对任务节奏差异大的场景(如长等待+快动作)不灵活;改进方向是根据当前意图动态选择历史窗口或引入可学习的时间权重。第三,所有评测都假设'视觉偏移但物理不变',对真实部署中常见的物理参数偏移(物体重量、摩擦、关节阻尼)未覆盖;改进方向是引入域随机化或物理一致性损失,把语义-时序建模延伸到动力学域。第四,真实世界每任务仅 30 trials/条件,复合偏移下 ST-WAM 48.0% 与 Fast-WAM 15.3% 的差距虽大但置信区间未报告;改进方向是扩大 trial 数并报告 bootstrap 置信区间与失败模式分析。第五,未来分支只在训练时存在、推理时省略,意味着训练-推理存在轻微分布不一致(训练时动作专家'看'到未来精炼信号、推理时没有);改进方向是引入一致性正则或可选的轻量未来蒸馏。第六,上游冻结模型(DINOv3 ViT-S/16、Qwen3-VL-4B)规模固定,对小物体或细粒度纹理的语义区分能力受限于 ViT-S 的容量;改进方向是对 ViT-L/B 做对照或对 DINOv3 做轻量 LoRA 微调。
未来方向
作者明确提出把 ST-WAM 从视觉分布偏移扩展到物理动力学变化与具身形态变化。基于其成果我认为可延伸出五条方向。(1) 物理域鲁棒性:把'同态稳定+跨态可分'的诊断框架迁移到物理参数空间,构造物理三元组(同任务不同质量/摩擦)来评测并改进策略。(2) 跨具身迁移:CAIR 的'当前锚定检索'天然适合多具身场景——用当前观测锚点检索不同具身的历史证据,探索一个策略在机械臂、灵巧手、人形之间的零样本迁移。(3) 在线自适应:把 DINO 历史检索从离线固定历史扩展为在线增长的情境记忆库,使策略能在部署中持续吸收新场景证据。(4) 与强化学习结合:意图 token $I_t$ 是'无标签的近期任务进展摘要',可作为 RL 的辅助状态或内在奖励,探索语义意图引导的策略优化。(5) 可解释性:图 5 显示动作对 DINO 的注意力更聚焦于操作物体,可把这种注意力图作为'模型关注哪里'的可解释载体,开发面向安全审计的可视化工具。此外,作者给出的项目主页 https://thu-wangmx.github.io/st-wam/ 可作为后续复现与扩展的入口。
复现评估
复现评估分四方面。开源情况:论文提供了项目主页 https://thu-wangmx.github.io/st-wam/,但正文未明确代码与权重的开源时点与许可证,复现需自行实现核心架构;上游依赖 DINOv3、Qwen3-VL-4B-Instruct、Wan2.2-TI2V-5B、T5 均为可获取的开源/开放权重模型,外部依赖充分。数据可获得性:LIBERO、LIBERO-Plus、RoboTwin 2.0 均为公开仿真基准且文档齐全,真实世界任务用 Agilex Piper 6-DoF 单臂,硬件为常见平台,50 演示/任务的数据规模在中等团队可承受范围内。算力需求:训练同时运行 5B 视觉未来 DiT + 两个 1B DiT + 冻结的 4B Qwen3-VL 与 ViT-S DINOv3,LIBERO 10 epoch / batch 128、RoboTwin 5 epoch / batch 1024,BF16,shift 5.0——单机 A100-80GB 推理即需满显存,完整训练预计需要多卡(8×A100/H100 量级),是一笔显著开销。复现难度:技术栈涵盖三分支 Mixture-of-Transformers、结构化跨分支注意力掩码、双空间 flow matching、CAIR 交叉注意力检索,每一项都有独立实现门槛;尤其'结构化掩码'与'未来分支推理省略'需要精细的工程,论文给出了关键超参($\lambda$、$H$、$K$、$M$、$N_I$、$L$、shift、积分步数),但 MoT 内部维度与混合注意力的精确实现细节需参照原始 MoT 论文与 Wan2.2 代码库,整体属中高难度复现。
论文图表
图分两部分:(a) 展示了在背景纹理、光照、相机视角三类视觉偏移下,video-generative WAM 预测的未来视频向 LIBERO 训练域内容漂移的三个典型案例,直观呈现 Training-Distribution Hallucination;(b) 用一个代表性帧三元组(同任务同状态不同视觉条件的两个初始帧 + 一个不同状态的终帧)比较 DINOv3 与 Wan-VAE 的余弦相似度,显示 DINOv3 在同态帧间相似度更高、对状态区分更好。
这是整篇论文动机的核心视觉证据——(a) 让读者直观看到'幻觉'问题,(b) 用对照诊断量化证明 DINOv3 优于 Wan-VAE,是后续选择 DINOv3 做语义表示的直接依据,没有这张图就没有 ST-WAM 的设计理由。