掩码视觉动作:面向统一世界建模的像素空间控制接口 Masked Visual Actions for Unified World Modeling
用像素空间掩码轨迹作为视频模型动作接口,单模型兼顾正/逆世界模型。
前置知识
掩码建模 (Masked Modeling) 与掩码图像提示
掩码建模源自 NLP 中的 MLM(如 BERT)与计算机视觉中的 MAE/掩码图像提示(如 In-context-MaRCo)。做法是把输入序列/图像的若干区域置为已知(reveal)或未知(mask),让模型学习在被遮蔽的条件下重建缺失部分。在本文中,掩码被用在像素空间的视频上:$M \in \{0,1\}^{T\times H\times W}$ 标记哪些时空像素被显式提供给模型($M_{t,h,w}=1$),哪些需要模型预测($M_{t,h,w}=0$)。模型接收 $M \odot V$ 与参考帧 $I_0$,学习条件分布 $p_\theta(V \mid M \odot V, I_0)$。
理解掩码建模是读懂本文核心机制的前提:掩码的本质是把“揭示不同实体”转化为“改变条件集 $S$”,从而用一个模型同时回答正向/逆向问题。若不理解 mask 与 reveal 在条件概率上的等价性,就无法理解为什么同一检查点能零样本切换方向。
视频扩散模型 (Video Diffusion) 与 Image-to-Video / Control 条件
视频扩散模型通过对 latent 或像素空间的视频加噪/去噪来建模 $p(V)$,$V \in \mathbb{R}^{T\times H\times W\times 3}$。Image-to-Video(I2V)模式以首帧 $I_0$ 为条件生成后续帧;可控视频生成(如 Wan-Fun-Control)则进一步通过 ControlNet 或通道拼接引入轨迹、姿态、mask 等条件信号。本文以 Wan-Fun-Control 2.2 14B 为骨干,用与输出视频空间对齐的拼接(concatenation)方式注入掩码条件视频。
本文的整个技术栈建立在预训练视频扩散模型之上:动作通过“掩码条件视频”以拼接方式进入去噪网络。不理解 I2V / 拼接条件的基本工作方式,就无法理解训练流程、LoRA 注入位置以及与 Ctrl-World、Wan-Move 等基线的差异。
正向/逆向动力学模型 (Forward/Inverse Dynamics) 与正逆世界模型
在感知运动控制中,正向模型预测给定动作后的感官后果 $p(\text{下一状态}\mid \text{状态}, \text{动作})$,逆向模型反推实现目标状态所需的动作 $p(\text{动作}\mid \text{状态}, \text{目标状态})$。在机器人世界模型中,正向=给定机器人动作预测场景响应;逆向=给定期望的物体运动反推机器人行为。本文把场景看作实体集合 $\{e_1,\dots,e_n\}$,正向对应条件集 $S=A$(激活实体),逆向对应 $S=P$(被动实体)。
“统一世界模型”的核心卖点正是同一检查点既能当正向动力学模型、又能当逆向动力学模型。如果分不清这两个方向及其在 robotics 中的用途(规划、策略评估 vs 动作提取),就无法理解论文三个应用的价值。
LoRA 高效微调
LoRA(Low-Rank Adaptation)在冻结的预训练权重旁注入一对低秩矩阵 $A \in \mathbb{R}^{r\times d}, B \in \mathbb{R}^{d\times r}$,使更新量 $\Delta W = BA$,从而只训练极少量参数即可适配下游任务。本文使用 rank $r=256$ 的 LoRA 微调 14B 参数的视频模型,仅在 8 张 H200 上训练约 4 天、10000 步,便可注入“掩码视觉动作”能力。
论文强调“仅用 15 小时数据 + LoRA”即可达成强泛化,这是方法实用性的关键。理解 LoRA 的低秩注入机制,才能判断作者为何选择拼接而非全量微调,以及为何能用这么少的数据完成适配。
模仿学习基线 (Diffusion Policy / ACT / SmolVLA) 与 Inverse Dynamics Model (IDM)
Diffusion Policy 把动作建模为扩散过程去噪出的轨迹;ACT(Action Chunking Transformer)用 Transformer 预测动作 chunk;SmolVLA 是小规模视觉-语言-动作模型。Inverse Dynamics Model(IDM)则从观测序列 $\{o_t, o_{t+1}\}$ 反推动作 $a_t$。本文在动作提取任务中,先用视频模型(逆向模式)从目标物体运动合成机器人视频,再用一个学习到的 IDM 从合成视频恢复可执行的低层动作序列。
论文第 5 节把本文方法与 DP/ACT/SmolVLA 在 COFFEE-SERVE-MUG 任务上对比,并要求读者理解 IDM 如何把“视频”翻译为“动作”。若不清楚这些基线与 IDM 的角色,就无法评估 90% 成功率的含金量。
Best-of-N 模型规划与 VLM 评判 (test-time scaling)
Best-of-N 是最简单的模型基规划:从随机策略采样 N 条候选动作轨迹,用一个世界模型在“想象中”分别 rollout,再用评判器选出最好的执行。本文用 Diffusion Policy 采样,视频模型做正向 rollout,用 Gemini 3.1 Pro 作为 VLM 评判器按任务成功度、交互保真度、物理真实度打分。这被视为 test-time scaling 的一种形式(生成器=策略+视频模型,验证器=VLM critic)。
规划实验(图 8)的全部收益都来自这一 Best-of-N + VLM 评判 pipeline。不理解这一机制,就看不懂为何“多采样几条轨迹并用视频模型打分”能带来 +7% 到 +26% 的成功率提升,以及它如何随 N 增长。
研究动机
视频模型在大规模自然视频上训练后,积累了关于运动、接触、形变、持久性的丰富先验,是构建机器人世界模型的理想基底。但一个根本难题是:如何把机器人的“动作”告诉这样一个在视觉空间里学习的模型?现有做法大多采用文本、轨迹点 tracks、接触力 forces、关键点 keypoints、关节向量或末端执行器位姿等控制信号——这些信号要么稀疏、要么与具身强绑定(如 7-DoF 关节向量只对某种机器人有效),要么与预训练视频模型的视觉表征错位。结果就是:模型很难把动作先验迁移到训练分布之外的具身(例如双臂机器人 R1-Pro)或自定义末端执行器上,且无法用同一套接口同时支撑“给定动作预测场景”(正向)和“给定目标反推动作”(逆向)两个方向。同时,现有的像素级条件工作(如 Action Images 的 Gaussian 热图、Mask2IV 的 mask 轨迹、URDF 渲染的 ControlNet)大多只把机器人当作训练时的主动实体、且只跑正向,无法用一个模型统一处理任意子集实体。
本文的目标是作者的目标是设计一种动作表示,使它(1)直接生在预训练视频模型的像素表征里,因而与具身无关(embodiment-agnostic)、原生支持视频、像素对齐;(2)能让同一检查点通过“揭示不同实体”而同时充当正向动力学模型(给定机器人运动预测场景响应)和逆向模型(给定目标物体运动反推机器人行为);(3)可以用极少量的真实+仿真数据(仅 15 小时)通过轻量适配(LoRA)注入到大型视频模型中。最终他们要在仿真(RoboCasa)和真实世界两类环境下,用同一个检查点验证策略评估、模型规划、逆向动作提取三项机器人操控应用。
与已有工作不同的是,本文的独特切入角度是把“动作”重新定义为“场景中某个实体的一段被部分揭示的时空轨迹”——一种像素空间的视觉原语。与 UVA/UWM/AIM/X-WAM 等通过在模态通道(动作向量 vs 视频)或扩散时间步上做 mask 来统一正逆方向的方法不同,这里的 mask 是空间性的:主动实体和被动实体生活在同一块像素画布上,因此同一个正逆切换不仅统一了功能,还天然跨越了具身鸿沟。更进一步,作者发现一个仅在“机器人(主动实体)mask”上训练的模型,竟可以零样本地推广到“物体(被动实体)mask”作为条件的逆向查询——这种零样本逆向能力是稀疏信号(关节向量、skeleton、末端执行器位姿)所达不到的,正是本文与已有像素级条件工作(ControlNet 渲染、mask 轨迹预测、热图编码)的根本区别。
核心方法
整体思路是把视频模型当作场景所有实体轨迹的联合分布建模器。作者把场景看作实体集合 $\{e_1,\dots,e_n\}$,视频模型隐式捕获联合分布 $p(V)=p(e_1,\dots,e_n)$;条件化于实体子集 $S$ 即得 $p(\{e_i\}_{i\notin S}\mid\{e_j\}_{j\in S}, I_0)$。改变被揭示的实体集合 $S$ 即可让同一模型回答不同问题:$S=A$(机器人等主动实体)为正向模型,$S=P$(被操纵物体等被动实体)为逆向模型。技术上用二值掩码 $M$ 标记被揭示的时空像素,模型输入为 $M\odot V$ 加参考帧 $I_0$,训练时学习 $p_\theta(V\mid M\odot V,I_0)$。骨干为 Wan-Fun-Control 2.2 14B,掩码视频用同一 autoencoder 编码并以通道拼接注入(缺失区域填灰),用 rank 256 LoRA、batch 4、8 张 H200、约 10000 步、4 天完成适配,仅在 DROID 与 RoboCasa 共 15 小时数据上训练。
核心创新是把“动作”重新定义为像素空间里“被部分揭示的实体轨迹”,并由此把正向/逆向世界建模转化为对同一视频模型的“互补条件预测问题”。与已有工作的本质区别有三点。其一,与基于模态通道 mask 的 UVA/UWM/AIM 等不同,本方法的空间性 mask 让主动与被动实体共享同一像素画布,因此“正逆切换”同时也“跨具身”。其二,与基于稀疏信号(末端执行器位姿、关节 skeleton)的方法(Ctrl-World、IRASim、VAP)不同,稠密、图像对齐的掩码条件让模型只需学习掩码输入与场景其余部分的交互,而不必显式学习稀疏动作到目标视频的对应关系,因而泛化更好。其三,作者观察到:一个只在“机器人 mask”上训练的模型,能零样本地把“物体 mask”作为条件做逆向建模,这意味着模型确实学到了交互先验本身,而非某个具身的特化——这是稀疏信号条件化无法实现的。
方法步骤详情
流程分数据构造、训练与三种应用。第一步数据构造用两种互补方式生成掩码条件。(a) 分割法:对 DROID 用 SegmentAnything(提示“robotic arm”)分割机器人得掩码,通用无需标定,但测试时难给精确 mask 且有信息泄露。(b) 渲染法:按机器人状态与相机标定渲染 URDF mesh 作掩码,仅渲染机器人、用半透明渲染避免自遮挡、夹爪手指设亮红色,支持推理时输入任意动作轨迹。第二步训练:基座 Wan-Fun-Control 2.2 14B,掩码视频经同 autoencoder 编码后与目标视频通道拼接(缺失区填灰),rank 256 LoRA、batch 4、8×H200、约 10000 步、4 天,模型只在主动实体 mask 上训练。第三步三种应用:(1) 正向→规划,从 Diffusion Policy 采样 N 条动作,视频模型正向 rollout,Gemini 3.1 Pro 评判挑最优执行(Best-of-N);(2) 正向→策略评估,把策略 rollout 成视频按 rubric 人工判进度,与真实成功率对比;(3) 逆向→动作提取,给定目标物体运动 mask 让模型合成机器人视频,再用 IDM 恢复可执行动作——视频模型从未在逆向样本上训练。
技术新颖性
技术新颖性体现在四个层面。第一,动作表示上首次提出“掩码视觉动作”这一像素空间控制接口,并用真实+仿真掩码示例给出高效适配配方,使动作与预训练视频模型的视觉表征完全对齐。第二,理论框架上把正向/逆向世界建模统一为对同一联合分布 $p(e_1,\dots,e_n)$ 的互补条件预测(条件集 $S=A$ 或 $S=P$),并把“主动/被动”重新定位为使用方式而非模型属性——模型本身只在 mask 视频补全上训练,无显式 agency 概念。第三,架构上采用空间对齐的通道拼接而非 ControlNet 或稀疏编码,使稠密条件可直接复用视频模型已学到的交互先验,缺失区域统一填灰简化训练。第四,实证上发现并量化了“零样本逆向”这一涌现能力:仅训练正向机器人 mask 的模型可被“物体 mask”直接条件化为逆向模型(COFFEE-SERVE-MUG 上 90% 成功率),这是同类稀疏信号方法做不到的,从根本上支撑了“统一世界模型”的论点。
实验结果
实验从可控视频生成与三类应用展开,结论扎实。可控生成(Table 1):DROID 上 LPIPS $0.0945$/PSNR $23.74$ 全面优于 Ctrl-World($0.362/18.15$)、Wan-Move($0.534$)、纯 I2V($0.521$);在完全未见的双臂具身 BEHAVIOR 上本方法 LPIPS $0.123$/PSNR $22.90$ 仍优于 Ctrl-World 的 $0.196/18.39$(后者输出静态/损坏视频)。消融(Table 2):训练域内位姿、skeleton 与掩码动作相近(LPIPS $0.0945$–$0.107$),但换到自定义末端执行器真实数据或 BEHAVIOR 时稀疏条件恶化到 $0.169$/$0.162$ 与 $0.183$/$0.171$,掩码动作保持 $0.148$/$0.123$。规划(图 8):Best-of-N 带来 close microwave $+24$%、open drawer $+26$%、open dishwasher $+21$%、close fridge $+11$%、coffee mug $+9$%,成功率随 $N$(1–10)单调上升。策略评估(图 9):视频 rollout 与 GT 成功率相关 $r=0.982$,真实世界(图 10)进度分布高度吻合但均有正向偏置。逆向动作提取(图 11):COFFEE-SERVE-MUG 上 $90\%$ 成功率超 DP/ACT/SmolVLA,且视频模型从未见过该任务。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| DROID 可控视频生成(训练域内) | LPIPS↓ / SSIM↑ / PSNR↑ | 0.0945 / 0.887 / 23.74 | Ctrl-World: 0.362 / 0.708 / 18.15 | LPIPS 降低约 74%,PSNR 提升 5.59 dB |
| BEHAVIOR 未见双臂具身视频生成(零样本泛化) | LPIPS↓ / SSIM↑ / PSNR↑ | 0.123 / 0.843 / 22.90 | Ctrl-World: 0.196 / 0.837 / 18.39 | LPIPS 降低约 37%,PSNR 提升 4.51 dB;Ctrl-World 在未见具身上失效 |
| RoboCasa Best-of-N 模型规划 | 任务成功率(绝对提升) | 规划后成功率(多任务) | 基础 Diffusion Policy | close microwave +24%、open drawer +26%、open dishwasher +21%、close fridge +11%、coffee setup mug +9% |
| RoboCasa 策略评估(视频 rollout 与 GT 一致性) | 成功率相关系数 r | r = 0.982 | — | 视频想象 rollout 可作为真实执行的有效代理 |
| COFFEE-SERVE-MUG 逆向动作提取(20 次试验) | 成功率 | 90% | DP / ACT / SmolVLA(图中对照,约 50% 水平) | 视频模型未训练该任务即超过专门训练的模仿学习基线 |
局限与改进
作者明确承认两类局限。其一,本模型与现有生成模型一样,学习到的是物体交互的相关性而非因果关系,因果世界建模仍是开放问题——这意味着模型可能在“看起来合理但物理上不可达”的轨迹上表现出正向偏置(实验中也观察到视频模型的任务进度系统性偏高)。其二,方法能力受限于基座视频模型本身:推理速度与可表达的动态范围都无法超越 Wan-Fun-Control,本质是“重新利用先验”而非“改造能力”。我的额外观察:渲染法依赖已知相机标定与 URDF,限制了在无标定真实环境下的直接应用;逆向动作提取依赖一个单独训练的 IDM,链条里任何一环误差都会累积;BEHAVIOR 等未见具身的 PSNR(22.90)虽优于基线但绝对值仍不算高,说明远超训练分布时的保真度仍有提升空间;规划的 $N=10$ 与单一 VLM 评判器(Gemini 3.1 Pro)使结论对采样预算和评判器偏好敏感。
独立分析的弱点
独立分析存在三个可改进的弱点。第一,正向偏置问题:策略评估中视频模型想象的任务进度系统性偏高,若直接用于规划选优会偏向“看起来更激进”的轨迹。改进方向是引入物理真实性约束或接触一致性 loss,或训练一个专门的校准头修正偏置。第二,逆向 pipeline 对外部 IDM 的依赖:动作提取需要先用视频模型合成机器人视频、再用单独 IDM 反解动作,两阶段误差累积且 IDM 需每具身重训。改进方向是把 IDM 能力蒸馏进同一掩码框架,实现端到端“物体 motion → 低层动作”。第三,渲染法对标定与 URDF 的强依赖使其难推广到无标定真实场景;分割法虽通用但测试时用户难给精确 mask 且有信息泄露。改进方向是训练一个从稀疏动作命令(关节/位姿)到 mask 视频的可微渲染或预测模块,或结合神经渲染在测试时自动对齐具身 mesh,从而兼顾通用性与可控性。此外,规划实验的 N 上限仅 10、任务数有限,缺少对推理时延与更难长程任务的刻画。
未来方向
作者提出的延伸包括把因果结构引入世界模型、以及突破基座视频模型在速度与表达力上的瓶颈(例如用更快的视频骨干或流匹配加速)。基于本文成果可进一步延伸的方向有:(1)扩展“实体子集条件化”到多智能体或多机器人协同,用不同子集揭示实现协作/对抗的统一建模;(2)把零样本逆向能力系统化为一种通用的“目标条件策略”范式,结合更强的 IDM 或 RL 微调逼近闭环最优;(3)将 mask 接口推广到可变形物体、流体等非刚性实体,验证交互先验的边界;(4)探索 test-time scaling 的极限——增大 $N$、用更强的 VLM/物理仿真评判器,并把视频 rollout 与真实闭环执行结合做在线修正;(5)研究如何用更少或纯仿真的 15 小时级数据获得同样的跨具身泛化,降低对 DROID 这类大规模真实数据的依赖。
复现评估
复现前景较好但算力门槛不低。作者承诺公开代码、数据与模型权重(论文 4.2 节明确 stated“we will release our code, data, and model weights”)。关键技术细节披露充分:基座为 Wan-Fun-Control 2.2 14B,用 rank 256 LoRA、batch size 4、8×H200、约 10000 步、4 天训练;数据来自公开的 DROID 与 RoboCasa,构造 mask 用 SegmentAnything 提示“robotic arm”和按 PointWorld 协议的 URDF 渲染。主要难点在于:(1)8 张 H200 对多数实验室是非平凡算力投入;(2)渲染法需要相机标定与 URDF 精细对齐(PointWorld 协议),对工程量要求高;(3)下游应用的评判器(Gemini 3.1 Pro)与 Diffusion Policy、IDM 等组件需各自复现。整体上,核心生成模型与 mask 数据管线可复现,但完整复刻规划/评估/逆向三个应用的全部数字需要相当的工程与算力投入。
论文图表
图以同一初始帧参考为底,并列展示了四种动作条件方式:低维关节角(紧凑但具身特定、与图像不对齐)、末端执行器位姿可视化、机器人 skeleton 可视化(更视觉但仍稀疏、需模型推断几何与接触),以及本文的掩码视觉动作(稠密、图像对齐)。
这张图直接回答了“为什么用 mask 而不用关节向量”的核心动机,是理解方法差异的关键视觉证据,对应 motivation 与方法选择。
图显示在训练域 DROID 内三种条件表现相近;但在自定义末端执行器真实数据上,skeleton/末端执行器条件会让模型把机器人扭曲回训练具身或凭空引入另一个机器人;在 BEHAVIOR 双臂上稀疏条件彻底崩溃,而掩码动作仍能优雅模拟开门等交互。
这张图直观解释了 Table 2 消融的定性原因——稀疏条件在分布外失败的核心机理,是理解“为什么稠密 mask 更好”的关键。