← 返回 2026-08-26

潜在动作即意图:为世界动作模型实现高效的未来想象 Latent Action as Intention Enables Efficient Future Imagination for World Action Models

Xiang Li, Yupeng Zheng, Songen Gu, Huailiang Ma, Feng Yu, Xian Nie, Shanshuai Yuan, Yujie Zang, Weize Li, Shuai Tian, Moyang Liu, Ya-Qin Zhang, Wenchao Ding 📅 2026-08-25 👍 1 2026-08-30 18:30
世界动作模型 动作无关预训练 机器人操作 流匹配 潜在动作

把未来想象压缩为潜在动作意图序列,性能追平 Joint-WAM 且延迟降低 42.9%

前置知识

世界动作模型(WAM)

在视觉运动策略之上引入预测建模的机器人控制框架:训练时耦合视频去噪分支,预测未来观测如何演变,让动作生成能感知任务进展与环境动态,代表工作有 Motus、DiT4DiT、Being-H0.7。按推理时是否保留未来预测可分为两类:Joint-WAM 式保留未来想象(效果好但迭代去噪未来观测延迟高)与 Fast-WAM 式在测试时砍掉未来视频分支(快但泛化差)。

论文的全部动机与方法设计都围绕'未来想象放在哪个空间、推理时保不保留'展开,不理解 WAM 的训练-推理结构差异,就看不懂 Fast-WAM/Joint-WAM/LAWA 三种范式的对比逻辑与延迟分析。

潜在动作与向量量化

把相邻帧之间的视觉变化压缩为离散 codebook 中的码字,作为'动作样'变量,从而在无动作标签的视频上做预训练。典型流程:编码每帧特征、帧间差分、空间压缩为少量 token,再按最近邻 $j^\star=\arg\min_j \|h_p-e_j\|_2^2$ 查表量化。LAPA、UniVLA、ViPRA、Motus 均属此类技术路线。

LAWA 的核心就是把这类别上的潜在动作序列当作未来意图使用,理解 tokenizer 的差分-压缩-量化机制,是读懂其两阶段训练目标与测试时'离散目标+连续松弛'设计的前提。

流匹配(Flow Matching)

一类生成式建模范式:把噪声到数据的插值路径定义为 $y_\tau=(1-\tau)y+\tau\epsilon$,网络学习预测速度场 $v=\epsilon-y$,推理时从高斯噪声出发迭代去噪得到样本。路径比扩散模型更直、采样步数更少,$\pi_0$ 等机器人基础策略广泛采用。

LAWA 的视频、潜在动作、动作三个专家分支全部用流匹配训练,损失 $\mathcal{L}^m=\mathbb{E}[w_m(\tau_m)\|\hat{v}^m_\theta-v^m\|_2^2]$ 与'迭代去噪产生延迟'的推理成本分析都建立在这一框架上。

多模型联合注意力与结构化掩码

让模态专属的 Transformer 分支(视频、潜在动作、动作)通过共享注意力交互,但用注意力掩码严格控制信息流:当前观测 token 看不到任何未来 token;带噪未来视频 token 可见全部视频 token;潜在动作 token 只见当前观测与自身序列;动作 token 可见当前观测、潜在动作序列与动作序列。训练与推理维护同一可见性掩码。

这是 LAWA 既让动作专家利用'演化中的未来意图'、又杜绝未来观测信息泄漏的关键机制,也是它区别于 Joint-WAM 信息流设计的核心,直接决定'保留未来想象但不看未来画面'如何实现。

SAM 2 自动掩码监督

用 SAM 2 在无标注视频上自动分割手、机械臂及其交互区域,生成掩码训练目标;tokenizer 的辅助掩码解码器以 detach 后的视觉重建 token 为图像输入、以潜在动作为 prompt,预测对应区域掩码,用 BCE+Dice+IoU 损失训练,实现无需人工标注的可扩展监督信号。

该目标给潜在动作注入'操作导向'的归纳偏置,使其偏向交互区域而非静态背景,是消融中比 Motus 光流监督更有效的辅助损失(掩码 +0.8/+1.5 点,光流反而 -1.3/-0.7 点),也是动作无关预训练成功的关键组件。

研究动机

世界动作模型(WAM)通过在训练中耦合视频预测分支,让动作生成感知场景如何演变,但推理时迭代去噪未来观测带来巨大延迟,妨碍真机控制。Fast-WAM 在测试时砍掉未来视频分支,把单次动作块预测延迟降到 196.5ms,但作者的匹配实现显示其泛化明显更差:RoboCasa 上 few-shot(每任务仅 10% 训练轨迹)平均成功率只有 56.0%,比保留未来预测的 Joint-WAM 的 64.1% 低 8.1 个百分点;LIBERO-Plus 零样本迁移上仅 60.0%,低于 Joint-WAM 的 70.4%,相机视角扰动下更是只有 24.9%。这说明未来建模的收益并非只来自视频协同训练,在演示稀缺与分布外场景中显式的未来表征依然关键;但保留观测空间的想象又要付出完整的视觉生成代价(Joint-WAM 延迟高达 593.1ms),形成泛化与延迟的两难。

本文的目标是本文目标是设计一种新的 WAM 架构 LAWA,把未来想象从观测空间搬到紧凑的潜在动作空间:在推理时保留显式的、时间结构化的'未来意图'表征以维持泛化,同时完全不生成未来观测,避免视觉去噪开销。具体量化目标是:在 RoboCasa 的 few-shot 与全量设定下显著超越匹配的 Fast-WAM 基线(提升 9.6 与 4.5 个百分点)并达到与 Joint-WAM 相当的成功率,同时把推理延迟相对 Joint-WAM 降低约 42.9%;再通过 LIBERO-Plus 零样本扰动测试与真机四任务(含长视野操作)验证泛化优势,最终给出'性能-泛化-延迟'三者兼得的 WAM 新范式,并证明动作无关自我中心视频预训练能持续放大这一优势。

与已有工作不同的是,现有工作在两条路线上二选一:Joint-WAM 类方法(Motus、DiT4DiT)在测试时生成未来观测,泛化好但慢;Fast-WAM 干脆去掉测试时未来分支,快但弱。而潜在动作文献(LAPA、UniVLA、ViPRA、Clam 等)只把潜在动作用于无动作标签视频的预训练表征、逆动力学策略或独立的世界建模,没有把它当作测试时的未来想象载体。LAWA 的独特切入是把时间结构化的潜在动作序列操作性地定义为'未来意图'——即动作专家在去噪过程中实际可用的转移目标序列,它编码'应该发生什么'而不重建未来视觉细节——并在推理时与可执行动作块联合去噪,开辟了介于快与强之间的第三条路线:未来想象被完整保留,只是被压缩。

核心方法

直觉上,策略需要的不是未来的画面本身,而是'接下来应该发生哪些任务相关转移'的紧凑表征。LAWA 据此分两步构建。第一步在动作无关视频(机器人数据+自我中心视频)上预训练离散潜在动作 tokenizer:DINOv2 提取每帧 patch token,非因果 Transformer 用分解式时空注意力得到 $F_k\in\mathbb{R}^{N\times d}$,帧间差分后空间压缩为 $L$ 个 token $h_k$,最近邻量化到 codebook $C=\{e_j\}_{j=1}^K$ 得到 $l_{k,p}=e_{j^\star_{k,p}}$;因果 forward decoder 用潜在动作从 $o_{k-1}$ 重建 $o_k$,并用 SAM 2 自动掩码做操作中心辅助监督。第二步冻结 tokenizer,用流匹配联合训练视频、潜在动作、动作三个专家,经结构化注意力掩码交互;推理时丢弃未来视频分支,只联合去噪潜在意图与动作块。最终全量数据下 RoboCasa 成功率 80.8%,延迟 338.5ms,比 Joint-WAM 的 593.1ms 低 42.9%。

核心创新是'潜在动作即意图'这一操作性定义:意图就是动作专家在多模型联合注意力中实际可用的、按时间排列的转移目标序列,只编码任务相关的转移而不重建任何视觉细节。与 Joint-WAM 的本质区别在于想象发生在潜在空间而非观测空间——Joint-WAM 迭代去噪未来观测 token,LAWA 只去噪锚定在离散 codebook 目标上的连续潜在状态(去噪时不做最近邻投影);与 Fast-WAM 的本质区别在于保留了显式的未来表征供动作专家逐步关注,而非只靠当前观测和视频协同训练的隐式收益;与 LAPA/UniVLA/ViPRA 的区别在于潜在动作不是预训练特征,而是在测试时在线预测、与动作块联合去噪的条件信号。机制验证很有说服力:推理时对潜在动作状态加 $\sigma=1.0$ 高斯噪声或时序打乱,成功率从 80.8% 跌到 52.2%/56.4%,证明该通路被功能性地使用。

方法步骤详情

方法分四个阶段。(1)tokenizer 预训练:输入动作无关的机器人与自我中心视频,经 DINOv2 编码、帧间差分、空间压缩与最近邻量化得到离散潜在动作,forward decoder 以 $o_{k-1}$ 的 patch token 加潜在动作重建 $o_k$,损失 $\mathcal{L}_{tok}=\mathcal{L}_1+\lambda_{perc}\mathcal{L}_{perc}+\lambda_{mask}\mathcal{L}_{mask}$(L1+LPIPS 重建、BCE+Dice+IoU 掩码),用噪声替代量化防 codebook 坍塌并刷新低使用率码字;按数据源做帧采样对齐运动速度,加权重采样使机器人视频约占 20%。(2)冻结 tokenizer,在线编码 $o_{t:t+H}$ 得到目标潜在动作 $l_{t+1:t+H}$。(3)流匹配策略训练:对视频、潜在动作、动作分支独立加噪,构造插值 $y^m_{\tau_m}=(1-\tau_m)y^m+\tau_m\epsilon^m$,学习 $v^m=\epsilon^m-y^m$,总损失 $\mathcal{L}_{LAWA}=\lambda_{vid}\mathcal{L}_{vid}+\lambda_{lat}\mathcal{L}_{lat}+\lambda_{act}\mathcal{L}_{act}$,各专家条件于语言与本体感知。(4)推理:只编码当前观测一次并缓存,丢弃未来视频 token,联合去噪潜在意图与动作块,可见性掩码与训练一致。

技术新颖性

技术新颖性有四点。一是范式层面:首次把'测试时未来想象'从观测空间重定位到紧凑潜在动作空间,用匹配实验证明未来表征的价值不依赖视觉生成——LAWA 以 338.5ms 达到 Joint-WAM 593.1ms 的性能水平。二是 tokenizer 设计:在 ViPRA 式离散转移量化之上引入 SAM 2 自动生成掩码目标的操作中心辅助监督,无需人工标注且把潜在动作偏向手部与交互区域,消融中优于 Motus 式光流监督(掩码 +0.8/+1.5 点,光流 -1.3/-0.7 点)。三是训练-推理一致性:两阶段使用同一结构化注意力掩码,潜在动作 token 只见当前观测与自身序列,从信息流上杜绝未来观测泄漏。四是数据层面:对动作无关预训练做运动速度对齐与加权重平衡,并证明 LAWA 从中获得的下游增益(+5.9/+4.5 点)远大于 Fast-WAM(+1.5/+1.7)与 Joint-WAM(+1.0/+0.5),且随视频语料从 10% 扩到 100% 持续提升(+4.0/+3.6 点),显示紧凑瓶颈减少外观捷径的独特价值。

Overview of our LAWA
Figure 2: Overview of our LAWA
Action-free egocentric pre-training pipeline of the latent action tokenizer
Figure 3: Action-free egocentric pre-training pipeline of the latent action tokenizer

实验结果

结果覆盖仿真、鲁棒性、真机与机制分析。RoboCasa 24 个任务上,LAWA 在 few-shot 与全量设定分别达到 65.6% 和 80.8% 平均成功率,超过匹配 Fast-WAM 的 56.0%/76.3% 达 9.6 和 4.5 点,与 Joint-WAM 的 64.1%/78.8% 相当且略高,并超过 DIAL(58.3/70.2)7.3 与 10.6 点。LIBERO-Plus 零样本迁移达 74.4%,比 Fast-WAM 的 60.0% 高 14.4 点、比 Joint-WAM 的 70.4% 高 4.0 点;相机视角扰动 69.2%(Fast-WAM 仅 24.9%,+44.3 点)、传感器噪声 85.5%(+27.5 点)。真机 xArm7 四任务上,25%/50%/100% 演示分别领先 Fast-WAM 31.2/36.3/33.8 点(40.0% vs 8.8%、56.3% vs 20.0%、67.5% vs 33.8%),25% 数据即超全量 Fast-WAM,长视野 Block 与 Laboratory 全量下各领先 45 点。延迟 338.5ms/动作块,比 Joint-WAM 低 42.9%。消融显示潜在动作分支贡献 +5.2/+1.7 点,ego 预训练再贡献 +5.1/+3.0 点,掩码监督优于光流;推理时扰动潜在动作状态使成功率从 80.8% 跌至 52.2%(高斯噪声)/56.4%(时序打乱),注意力图亦显示 LAWA 聚焦被操作物体。

Results on RoboCasa benchmark
Table 1: Results on RoboCasa benchmark
Zero-shot transfer results on LIBERO-Plus benchmark
Table 2: Zero-shot transfer results on LIBERO-Plus benchmark
Inference-time latent-action perturbation results
Table 3: Inference-time latent-action perturbation results
Egocentric pre-training effectiveness comparison
Table 4: Egocentric pre-training effectiveness comparison
End-to-end inference latency comparison
Table 5: End-to-end inference latency comparison
Component ablation results, including Latent Action (LA), Egocentric Pre-training (EP) and Auxiliary Loss (AL)
Table 6: Component ablation results, including Latent Action (LA), Egocentric Pre-training (EP) and Auxiliary Loss (AL)
Results on real-world tasks
Table 7: Results on real-world tasks
Action-to-vision attention map comparison
Figure 4: Action-to-vision attention map comparison
Egocentric pre-training scalability comparison
Figure 5: Egocentric pre-training scalability comparison
Real-world tasks
Figure 6: Real-world tasks
查看结构化数据
任务指标本文基线提升
RoboCasa few-shot(24 任务,每任务 10% 演示) 平均成功率 SR (%),每任务 50 次试验 65.6 Fast-WAM 56.0;Joint-WAM 64.1;DIAL 58.3 较 Fast-WAM +9.6 点,较 Joint-WAM +1.5 点
RoboCasa 全量数据(24,000 条轨迹) 平均成功率 SR (%) 80.8 Fast-WAM 76.3;Joint-WAM 78.8;DIAL 70.2 较 Fast-WAM +4.5 点,较 Joint-WAM +2.0 点
LIBERO-Plus 零样本迁移(7 种扰动微平均) 平均成功率 SR (%) 74.4 Fast-WAM 60.0;Joint-WAM 70.4;OpenVLA-OFT 69.6 较 Fast-WAM +14.4 点,较 Joint-WAM +4.0 点
LIBERO-Plus 相机视角扰动 成功率 SR (%) 69.2 Fast-WAM 24.9;Joint-WAM 47.2 较 Fast-WAM +44.3 点,较 Joint-WAM +22.0 点
推理延迟(单张 A800,每动作块) 延迟 338.5 Joint-WAM 593.1;Fast-WAM 196.5 较 Joint-WAM 降低 42.9%,代价是比 Fast-WAM 慢 142.0ms
真机四任务平均(100% 演示,每任务 200 条) 成功率 SR (%),每任务 20 次试验 67.5 Fast-WAM 33.8 +33.8 点;25% 数据时 40.0% vs 8.8%(+31.2 点),已超 Fast-WAM 全量的 33.8%

局限与改进

作者承认的局限:Fast-WAM 与 Joint-WAM 均为作者自建的匹配实现,与原方法可能存在偏差;LAWA 延迟 338.5ms 仍明显高于 Fast-WAM 的 196.5ms;无自我中心预训练时 LAWA 反而落后 Joint-WAM 3.4/2.0 点,说明优势依赖大规模动作无关数据;掩码目标只被解释为操作导向的归纳偏置,作者明确表示不以此证明 codebook 的语义。我的补充观察:LIBERO-Plus 语言扰动下 LAWA 仅 62.8%,显著低于 Joint-WAM 的 91.8% 与 OpenVLA-OFT 的 79.5%,潜在意图通路可能挤压了语言条件的作用;真机评估只有 4 个任务、每任务 200 条演示、各 20 次试验,样本量小;codebook 大小 $K$、压缩 token 数 $L$ 等关键超参的敏感性正文未报告;且全部实验限于单臂桌面操作,对双臂、移动操作等形态未验证。

独立分析的弱点

第一,语言鲁棒性短板:LIBERO-Plus 语言扰动下 62.8% 对 Joint-WAM 的 91.8%,差近 30 点,原因可能是潜在意图序列在注意力中主导动作生成、弱化指令跟随,改进方向是在联合注意力中显式增强语言-意图交互,或在意图空间加入指令对齐约束。第二,对自我中心预训练的强依赖:无 ego 预训练时落后 Joint-WAM 3.4/2.0 点,改进方向是研究更高效的动作无关数据选择与课程策略,或构建跨具身共享的 codebook 词汇以提升数据效率。第三,延迟仍比 Fast-WAM 高约 142ms:潜在动作专家的额外去噪步是主因,可探索意图与动作分支的去噪步数非对称分配、蒸馏到更少步数或投机解码。第四,tokenizer 冻结策略在下游分布与预训练分布差异大时可能造成目标错位,可尝试轻量微调或在线 codebook 适配。第五,真机任务全部是单臂桌面操作且试验次数少,长视野任务虽提升 45 点但置信区间宽,应在接触丰富任务、双臂协作与移动操作上检验意图表征的边界。

未来方向

作者方向上:把 LAWA 确立为可扩展的 WAM 范式,继续扩大动作无关视频语料——Figure 5 显示语料从 10% 扩到 100% 时 LAWA 还能涨 4.0/3.6 点且未饱和;并承诺开源代码与模型。可延伸的方向包括:(1)意图语义可解释性——分析 codebook 码字是否对应可命名的操作原语,用 VLM 给意图序列做字幕化,构建人类可监控的策略;(2)把掩码监督推广到 affordance、接触点等其他操作中心目标并系统比较,或与光流联合;(3)自适应延迟机制——低不确定性时走潜在路径、高不确定性时回退到 Joint-WAM 式观测生成,在两者间动态调度;(4)跨具身与跨域迁移:检验同一 tokenizer 对人手、双臂、移动操作视频的通用性;(5)与测试时搜索结合,把意图序列展开为可搜索的潜在轨迹实现推理时改进;(6)研究紧凑瓶颈作为外观捷径抑制器的理论解释,指导未来世界模型设计。

复现评估

论文承诺开源代码与模型('Code and models will be released'),复现基础较好但完整复现门槛不低。数据方面:RoboCasa 提供 24,000 条全量轨迹(每任务 1,000 条),LIBERO 与 LIBERO-Plus 公开可用,但自我中心预训练视频需要自行收集,并复现基于 SAM 2 的掩码自动标注流水线(含每源帧采样对齐与 20% 机器人视频重平衡);算力方面:延迟在单张 A800 上测得,但 tokenizer 预训练加三专家流匹配策略训练的总计算量正文未给出,估计需多卡数天;工程方面:噪声替代量化、低使用率码字刷新、两阶段训练调度等细节依赖附录。综合判断:仅复现仿真基准(RoboCasa + LIBERO-Plus)对有相关经验的团队是中等难度;完整复现含真机部分(xArm7 + RealSense D435 + 两个鱼眼腕部相机 + 每任务 200 条人工演示)成本最高,无真机条件的团队只能验证仿真部分。