潜在动作即意图:为世界动作模型实现高效的未来想象 Latent Action as Intention Enables Efficient Future Imagination for World Action Models
把未来想象压缩为潜在动作意图序列,性能追平 Joint-WAM 且延迟降低 42.9%
前置知识
世界动作模型(WAM)
在视觉运动策略之上引入预测建模的机器人控制框架:训练时耦合视频去噪分支,预测未来观测如何演变,让动作生成能感知任务进展与环境动态,代表工作有 Motus、DiT4DiT、Being-H0.7。按推理时是否保留未来预测可分为两类:Joint-WAM 式保留未来想象(效果好但迭代去噪未来观测延迟高)与 Fast-WAM 式在测试时砍掉未来视频分支(快但泛化差)。
论文的全部动机与方法设计都围绕'未来想象放在哪个空间、推理时保不保留'展开,不理解 WAM 的训练-推理结构差异,就看不懂 Fast-WAM/Joint-WAM/LAWA 三种范式的对比逻辑与延迟分析。
潜在动作与向量量化
把相邻帧之间的视觉变化压缩为离散 codebook 中的码字,作为'动作样'变量,从而在无动作标签的视频上做预训练。典型流程:编码每帧特征、帧间差分、空间压缩为少量 token,再按最近邻 $j^\star=\arg\min_j \|h_p-e_j\|_2^2$ 查表量化。LAPA、UniVLA、ViPRA、Motus 均属此类技术路线。
LAWA 的核心就是把这类别上的潜在动作序列当作未来意图使用,理解 tokenizer 的差分-压缩-量化机制,是读懂其两阶段训练目标与测试时'离散目标+连续松弛'设计的前提。
流匹配(Flow Matching)
一类生成式建模范式:把噪声到数据的插值路径定义为 $y_\tau=(1-\tau)y+\tau\epsilon$,网络学习预测速度场 $v=\epsilon-y$,推理时从高斯噪声出发迭代去噪得到样本。路径比扩散模型更直、采样步数更少,$\pi_0$ 等机器人基础策略广泛采用。
LAWA 的视频、潜在动作、动作三个专家分支全部用流匹配训练,损失 $\mathcal{L}^m=\mathbb{E}[w_m(\tau_m)\|\hat{v}^m_\theta-v^m\|_2^2]$ 与'迭代去噪产生延迟'的推理成本分析都建立在这一框架上。
多模型联合注意力与结构化掩码
让模态专属的 Transformer 分支(视频、潜在动作、动作)通过共享注意力交互,但用注意力掩码严格控制信息流:当前观测 token 看不到任何未来 token;带噪未来视频 token 可见全部视频 token;潜在动作 token 只见当前观测与自身序列;动作 token 可见当前观测、潜在动作序列与动作序列。训练与推理维护同一可见性掩码。
这是 LAWA 既让动作专家利用'演化中的未来意图'、又杜绝未来观测信息泄漏的关键机制,也是它区别于 Joint-WAM 信息流设计的核心,直接决定'保留未来想象但不看未来画面'如何实现。
SAM 2 自动掩码监督
用 SAM 2 在无标注视频上自动分割手、机械臂及其交互区域,生成掩码训练目标;tokenizer 的辅助掩码解码器以 detach 后的视觉重建 token 为图像输入、以潜在动作为 prompt,预测对应区域掩码,用 BCE+Dice+IoU 损失训练,实现无需人工标注的可扩展监督信号。
该目标给潜在动作注入'操作导向'的归纳偏置,使其偏向交互区域而非静态背景,是消融中比 Motus 光流监督更有效的辅助损失(掩码 +0.8/+1.5 点,光流反而 -1.3/-0.7 点),也是动作无关预训练成功的关键组件。
研究动机
世界动作模型(WAM)通过在训练中耦合视频预测分支,让动作生成感知场景如何演变,但推理时迭代去噪未来观测带来巨大延迟,妨碍真机控制。Fast-WAM 在测试时砍掉未来视频分支,把单次动作块预测延迟降到 196.5ms,但作者的匹配实现显示其泛化明显更差:RoboCasa 上 few-shot(每任务仅 10% 训练轨迹)平均成功率只有 56.0%,比保留未来预测的 Joint-WAM 的 64.1% 低 8.1 个百分点;LIBERO-Plus 零样本迁移上仅 60.0%,低于 Joint-WAM 的 70.4%,相机视角扰动下更是只有 24.9%。这说明未来建模的收益并非只来自视频协同训练,在演示稀缺与分布外场景中显式的未来表征依然关键;但保留观测空间的想象又要付出完整的视觉生成代价(Joint-WAM 延迟高达 593.1ms),形成泛化与延迟的两难。
本文的目标是本文目标是设计一种新的 WAM 架构 LAWA,把未来想象从观测空间搬到紧凑的潜在动作空间:在推理时保留显式的、时间结构化的'未来意图'表征以维持泛化,同时完全不生成未来观测,避免视觉去噪开销。具体量化目标是:在 RoboCasa 的 few-shot 与全量设定下显著超越匹配的 Fast-WAM 基线(提升 9.6 与 4.5 个百分点)并达到与 Joint-WAM 相当的成功率,同时把推理延迟相对 Joint-WAM 降低约 42.9%;再通过 LIBERO-Plus 零样本扰动测试与真机四任务(含长视野操作)验证泛化优势,最终给出'性能-泛化-延迟'三者兼得的 WAM 新范式,并证明动作无关自我中心视频预训练能持续放大这一优势。
与已有工作不同的是,现有工作在两条路线上二选一:Joint-WAM 类方法(Motus、DiT4DiT)在测试时生成未来观测,泛化好但慢;Fast-WAM 干脆去掉测试时未来分支,快但弱。而潜在动作文献(LAPA、UniVLA、ViPRA、Clam 等)只把潜在动作用于无动作标签视频的预训练表征、逆动力学策略或独立的世界建模,没有把它当作测试时的未来想象载体。LAWA 的独特切入是把时间结构化的潜在动作序列操作性地定义为'未来意图'——即动作专家在去噪过程中实际可用的转移目标序列,它编码'应该发生什么'而不重建未来视觉细节——并在推理时与可执行动作块联合去噪,开辟了介于快与强之间的第三条路线:未来想象被完整保留,只是被压缩。
核心方法
直觉上,策略需要的不是未来的画面本身,而是'接下来应该发生哪些任务相关转移'的紧凑表征。LAWA 据此分两步构建。第一步在动作无关视频(机器人数据+自我中心视频)上预训练离散潜在动作 tokenizer:DINOv2 提取每帧 patch token,非因果 Transformer 用分解式时空注意力得到 $F_k\in\mathbb{R}^{N\times d}$,帧间差分后空间压缩为 $L$ 个 token $h_k$,最近邻量化到 codebook $C=\{e_j\}_{j=1}^K$ 得到 $l_{k,p}=e_{j^\star_{k,p}}$;因果 forward decoder 用潜在动作从 $o_{k-1}$ 重建 $o_k$,并用 SAM 2 自动掩码做操作中心辅助监督。第二步冻结 tokenizer,用流匹配联合训练视频、潜在动作、动作三个专家,经结构化注意力掩码交互;推理时丢弃未来视频分支,只联合去噪潜在意图与动作块。最终全量数据下 RoboCasa 成功率 80.8%,延迟 338.5ms,比 Joint-WAM 的 593.1ms 低 42.9%。
核心创新是'潜在动作即意图'这一操作性定义:意图就是动作专家在多模型联合注意力中实际可用的、按时间排列的转移目标序列,只编码任务相关的转移而不重建任何视觉细节。与 Joint-WAM 的本质区别在于想象发生在潜在空间而非观测空间——Joint-WAM 迭代去噪未来观测 token,LAWA 只去噪锚定在离散 codebook 目标上的连续潜在状态(去噪时不做最近邻投影);与 Fast-WAM 的本质区别在于保留了显式的未来表征供动作专家逐步关注,而非只靠当前观测和视频协同训练的隐式收益;与 LAPA/UniVLA/ViPRA 的区别在于潜在动作不是预训练特征,而是在测试时在线预测、与动作块联合去噪的条件信号。机制验证很有说服力:推理时对潜在动作状态加 $\sigma=1.0$ 高斯噪声或时序打乱,成功率从 80.8% 跌到 52.2%/56.4%,证明该通路被功能性地使用。
方法步骤详情
方法分四个阶段。(1)tokenizer 预训练:输入动作无关的机器人与自我中心视频,经 DINOv2 编码、帧间差分、空间压缩与最近邻量化得到离散潜在动作,forward decoder 以 $o_{k-1}$ 的 patch token 加潜在动作重建 $o_k$,损失 $\mathcal{L}_{tok}=\mathcal{L}_1+\lambda_{perc}\mathcal{L}_{perc}+\lambda_{mask}\mathcal{L}_{mask}$(L1+LPIPS 重建、BCE+Dice+IoU 掩码),用噪声替代量化防 codebook 坍塌并刷新低使用率码字;按数据源做帧采样对齐运动速度,加权重采样使机器人视频约占 20%。(2)冻结 tokenizer,在线编码 $o_{t:t+H}$ 得到目标潜在动作 $l_{t+1:t+H}$。(3)流匹配策略训练:对视频、潜在动作、动作分支独立加噪,构造插值 $y^m_{\tau_m}=(1-\tau_m)y^m+\tau_m\epsilon^m$,学习 $v^m=\epsilon^m-y^m$,总损失 $\mathcal{L}_{LAWA}=\lambda_{vid}\mathcal{L}_{vid}+\lambda_{lat}\mathcal{L}_{lat}+\lambda_{act}\mathcal{L}_{act}$,各专家条件于语言与本体感知。(4)推理:只编码当前观测一次并缓存,丢弃未来视频 token,联合去噪潜在意图与动作块,可见性掩码与训练一致。
技术新颖性
技术新颖性有四点。一是范式层面:首次把'测试时未来想象'从观测空间重定位到紧凑潜在动作空间,用匹配实验证明未来表征的价值不依赖视觉生成——LAWA 以 338.5ms 达到 Joint-WAM 593.1ms 的性能水平。二是 tokenizer 设计:在 ViPRA 式离散转移量化之上引入 SAM 2 自动生成掩码目标的操作中心辅助监督,无需人工标注且把潜在动作偏向手部与交互区域,消融中优于 Motus 式光流监督(掩码 +0.8/+1.5 点,光流 -1.3/-0.7 点)。三是训练-推理一致性:两阶段使用同一结构化注意力掩码,潜在动作 token 只见当前观测与自身序列,从信息流上杜绝未来观测泄漏。四是数据层面:对动作无关预训练做运动速度对齐与加权重平衡,并证明 LAWA 从中获得的下游增益(+5.9/+4.5 点)远大于 Fast-WAM(+1.5/+1.7)与 Joint-WAM(+1.0/+0.5),且随视频语料从 10% 扩到 100% 持续提升(+4.0/+3.6 点),显示紧凑瓶颈减少外观捷径的独特价值。
实验结果
结果覆盖仿真、鲁棒性、真机与机制分析。RoboCasa 24 个任务上,LAWA 在 few-shot 与全量设定分别达到 65.6% 和 80.8% 平均成功率,超过匹配 Fast-WAM 的 56.0%/76.3% 达 9.6 和 4.5 点,与 Joint-WAM 的 64.1%/78.8% 相当且略高,并超过 DIAL(58.3/70.2)7.3 与 10.6 点。LIBERO-Plus 零样本迁移达 74.4%,比 Fast-WAM 的 60.0% 高 14.4 点、比 Joint-WAM 的 70.4% 高 4.0 点;相机视角扰动 69.2%(Fast-WAM 仅 24.9%,+44.3 点)、传感器噪声 85.5%(+27.5 点)。真机 xArm7 四任务上,25%/50%/100% 演示分别领先 Fast-WAM 31.2/36.3/33.8 点(40.0% vs 8.8%、56.3% vs 20.0%、67.5% vs 33.8%),25% 数据即超全量 Fast-WAM,长视野 Block 与 Laboratory 全量下各领先 45 点。延迟 338.5ms/动作块,比 Joint-WAM 低 42.9%。消融显示潜在动作分支贡献 +5.2/+1.7 点,ego 预训练再贡献 +5.1/+3.0 点,掩码监督优于光流;推理时扰动潜在动作状态使成功率从 80.8% 跌至 52.2%(高斯噪声)/56.4%(时序打乱),注意力图亦显示 LAWA 聚焦被操作物体。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| RoboCasa few-shot(24 任务,每任务 10% 演示) | 平均成功率 SR (%),每任务 50 次试验 | 65.6 | Fast-WAM 56.0;Joint-WAM 64.1;DIAL 58.3 | 较 Fast-WAM +9.6 点,较 Joint-WAM +1.5 点 |
| RoboCasa 全量数据(24,000 条轨迹) | 平均成功率 SR (%) | 80.8 | Fast-WAM 76.3;Joint-WAM 78.8;DIAL 70.2 | 较 Fast-WAM +4.5 点,较 Joint-WAM +2.0 点 |
| LIBERO-Plus 零样本迁移(7 种扰动微平均) | 平均成功率 SR (%) | 74.4 | Fast-WAM 60.0;Joint-WAM 70.4;OpenVLA-OFT 69.6 | 较 Fast-WAM +14.4 点,较 Joint-WAM +4.0 点 |
| LIBERO-Plus 相机视角扰动 | 成功率 SR (%) | 69.2 | Fast-WAM 24.9;Joint-WAM 47.2 | 较 Fast-WAM +44.3 点,较 Joint-WAM +22.0 点 |
| 推理延迟(单张 A800,每动作块) | 延迟 | 338.5 | Joint-WAM 593.1;Fast-WAM 196.5 | 较 Joint-WAM 降低 42.9%,代价是比 Fast-WAM 慢 142.0ms |
| 真机四任务平均(100% 演示,每任务 200 条) | 成功率 SR (%),每任务 20 次试验 | 67.5 | Fast-WAM 33.8 | +33.8 点;25% 数据时 40.0% vs 8.8%(+31.2 点),已超 Fast-WAM 全量的 33.8% |
局限与改进
作者承认的局限:Fast-WAM 与 Joint-WAM 均为作者自建的匹配实现,与原方法可能存在偏差;LAWA 延迟 338.5ms 仍明显高于 Fast-WAM 的 196.5ms;无自我中心预训练时 LAWA 反而落后 Joint-WAM 3.4/2.0 点,说明优势依赖大规模动作无关数据;掩码目标只被解释为操作导向的归纳偏置,作者明确表示不以此证明 codebook 的语义。我的补充观察:LIBERO-Plus 语言扰动下 LAWA 仅 62.8%,显著低于 Joint-WAM 的 91.8% 与 OpenVLA-OFT 的 79.5%,潜在意图通路可能挤压了语言条件的作用;真机评估只有 4 个任务、每任务 200 条演示、各 20 次试验,样本量小;codebook 大小 $K$、压缩 token 数 $L$ 等关键超参的敏感性正文未报告;且全部实验限于单臂桌面操作,对双臂、移动操作等形态未验证。
独立分析的弱点
第一,语言鲁棒性短板:LIBERO-Plus 语言扰动下 62.8% 对 Joint-WAM 的 91.8%,差近 30 点,原因可能是潜在意图序列在注意力中主导动作生成、弱化指令跟随,改进方向是在联合注意力中显式增强语言-意图交互,或在意图空间加入指令对齐约束。第二,对自我中心预训练的强依赖:无 ego 预训练时落后 Joint-WAM 3.4/2.0 点,改进方向是研究更高效的动作无关数据选择与课程策略,或构建跨具身共享的 codebook 词汇以提升数据效率。第三,延迟仍比 Fast-WAM 高约 142ms:潜在动作专家的额外去噪步是主因,可探索意图与动作分支的去噪步数非对称分配、蒸馏到更少步数或投机解码。第四,tokenizer 冻结策略在下游分布与预训练分布差异大时可能造成目标错位,可尝试轻量微调或在线 codebook 适配。第五,真机任务全部是单臂桌面操作且试验次数少,长视野任务虽提升 45 点但置信区间宽,应在接触丰富任务、双臂协作与移动操作上检验意图表征的边界。
未来方向
作者方向上:把 LAWA 确立为可扩展的 WAM 范式,继续扩大动作无关视频语料——Figure 5 显示语料从 10% 扩到 100% 时 LAWA 还能涨 4.0/3.6 点且未饱和;并承诺开源代码与模型。可延伸的方向包括:(1)意图语义可解释性——分析 codebook 码字是否对应可命名的操作原语,用 VLM 给意图序列做字幕化,构建人类可监控的策略;(2)把掩码监督推广到 affordance、接触点等其他操作中心目标并系统比较,或与光流联合;(3)自适应延迟机制——低不确定性时走潜在路径、高不确定性时回退到 Joint-WAM 式观测生成,在两者间动态调度;(4)跨具身与跨域迁移:检验同一 tokenizer 对人手、双臂、移动操作视频的通用性;(5)与测试时搜索结合,把意图序列展开为可搜索的潜在轨迹实现推理时改进;(6)研究紧凑瓶颈作为外观捷径抑制器的理论解释,指导未来世界模型设计。
复现评估
论文承诺开源代码与模型('Code and models will be released'),复现基础较好但完整复现门槛不低。数据方面:RoboCasa 提供 24,000 条全量轨迹(每任务 1,000 条),LIBERO 与 LIBERO-Plus 公开可用,但自我中心预训练视频需要自行收集,并复现基于 SAM 2 的掩码自动标注流水线(含每源帧采样对齐与 20% 机器人视频重平衡);算力方面:延迟在单张 A800 上测得,但 tokenizer 预训练加三专家流匹配策略训练的总计算量正文未给出,估计需多卡数天;工程方面:噪声替代量化、低使用率码字刷新、两阶段训练调度等细节依赖附录。综合判断:仅复现仿真基准(RoboCasa + LIBERO-Plus)对有相关经验的团队是中等难度;完整复现含真机部分(xArm7 + RealSense D435 + 两个鱼眼腕部相机 + 每任务 200 条人工演示)成本最高,无真机条件的团队只能验证仿真部分。
论文图表
三栏对比三种 WAM 范式的信息流:Fast-WAM 从当前观测直接生成未来动作(延迟低但 few-shot 可扩展性差);Joint-WAM 先预测未来观测再生成动作(性能好但延迟高);LAWA 从当前观测生成潜在意图再到未来动作。右侧配推理延迟与 RoboCasa 全量/few-shot 成功率的对比,以及 ego 预训练扩展性柱状图。
一图概括论文核心论点:未来想象不必丢弃,可以压缩到潜在动作空间。是理解三种范式取舍(性能-泛化-延迟三角)的最佳入口。