← 返回 2026-09-09

OpenWAM:迈向系统化世界-动作模型预训练的开放模块化探索 OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang, Weiyang Jin, Yue Chen, Xuemin Chi, Donghao Zhou, Qize Yu, Yu-Kai Wang, Yuhan Rui, Shenzhe Yao, Zhen Yuan, Zhenhao Shen, Kefei Zhu, Zijie Zhu, Ning Gao, Xiaowei Chi, Guanqi He, Shanghang Zhang, Hao Dong, Lin Shao, Hang Zhao 📅 2026-09-07 👍 70 2026-09-12 18:30
世界-动作模型 具身智能 具身预训练 机器人操作 流匹配 视频生成先验

开源模块化研究栈把世界-动作模型预训练变成受控实验,提炼三大准则并开源6400小时数据预训练模型

前置知识

世界-动作模型(WAM)

从视频生成模型出发构建的机器人策略模型:先继承视频生成模型对视觉世界如何随时间演化的生成先验(模型见过海量『世界会怎样变化』的视频),再通过机器人具身经验把这些预测能力转化为可执行的动作信号。与 VLA 从视觉-语言预训练继承语义知识不同,WAM 的起点是对物理动态的生成式建模,其核心假设是『预测世界』与『生成动作』可以相互促进。

本文的 Infra/Study/α 三个层次全部围绕 WAM 展开,分不清 WAM 与 VLA 的继承来源差异,就无法理解论文的研究动机、三个中心问题以及 VLA vs WAM 的对比实验。

流匹配与联合去噪

流匹配是一类生成式训练目标:把纯噪声($t=0$)与干净数据($t=1$)用线性插值 $z_t = tz + (1-t)\epsilon$ 连接,训练网络预测速度场,推理时用欧拉法逐步积分去噪。OpenWAM 给视频流和动作流各自独立采样噪声水平 $(t_v, t_a)$,从而覆盖整个二维联合噪声平面,任何推理调度都对应平面上的一条路径。

论文的核心损失函数(式2)、去噪调度消融(同步/方差偏移/线性偏移)和训练-推理一致性设计都建立在这个联合噪声平面上,是理解方法与 Finding 2 的数学基础。

DiT 与视频生成骨干

Diffusion Transformer(DiT)是当前视频生成模型的主流架构,用 Transformer 处理 VAE 压缩后的视频潜在帧并逐步去噪。本文比较五个不同规模的开源视频 DiT(从 Wan2.1-VACE-1.3B 到 Wan2.1-I2V-14B),其预训练权重蕴含视觉动态先验,是 WAM『继承世界知识』的直接来源。

问答 1(继承什么先验)直接以视频骨干规模为自变量,且 OpenWAM-α 的世界流就是从预训练 Wan2.2-TI2V-5B 初始化的,不懂 DiT 就无法理解架构与消融。

重建型与表征型视觉编码器

重建型编码器(如 Wan2.2-VAE)以像素重建为目标训练,潜在空间天然适合 DiT 重建但携带底层像素细节;表征型编码器(DINOv3 768 维、V-JEPA 2.1 1024 维)由自监督学习得到语义结构化特征,但维度高且不带时间压缩,需要 S-VAE 适配器压到 48 维才能供 DiT 高效使用。

问答 1 的第二组实验(Figure 7)比较这两类编码器,并得出『潜在空间是否紧凑且信息丰富比编码器类别更重要』的结论,这是 Finding 1 的后半句。

动作分块与 80 维统一动作空间

动作分块(action chunking)指一次推理预测未来 $H$ 步动作序列而非单步,减少推理次数并保证时序一致性。OpenWAM 定义 80 维统一动作空间:左右两个镜像 34 维手臂块(末端位置 3 维 + 6D 旋转 + 夹爪 1 维 + 灵巧手 24 维)加 12 个保留槽位;各数据集用索引映射 $\pi$ 把原生动作散射进对应槽位($u=\text{Scatter}_\pi(\text{Norm}(a))$),无效槽位由掩码 $m$ 屏蔽梯度。

这是跨本体(单臂/双臂/灵巧手/移动)联合预训练的关键接口,Figure 12d、评估协议和 21 种本体的数据整合都依赖它。

注意力掩码与跨模态信息流

通过控制注意力掩码 $M=(M^{V\leftarrow V},M^{V\leftarrow A};M^{A\leftarrow V},M^{A\leftarrow A})$ 可以精确规定视频流与动作流之间谁能看见谁:mutual 双向可见、action-sees-video 只有动作读世界、video-sees-action 反之、isolated 完全隔离。帧内注意力固定为『视频首帧因果 + 动作双向』。这把抽象的『信息流』变成可控实验变量。

训练期掩码消融(Table 2)得出『世界→动作信息流必需』,预训练后偏好反转为 mutual(Figure 11)是论文最有洞察力的发现之一。

VLA 与具身预训练、OOD 泛化

VLA(视觉-语言-动作模型)从视觉-语言预训练初始化,仅用动作监督训练;WAM 额外有视频潜在预测监督。具身预训练指在下游微调前先用大规模人类自我中心视频与机器人轨迹训练模型。OOD 泛化指在训练分布之外(如随机化场景、新扰动)的表现,常用 Clean2Random 协议(干净数据训练、随机化场景评测)来度量。

Finding 3『预训练主要提升 OOD』和 VLA vs WAM 各有优势区域(Figure 16)的论证完全建立在这组概念上。

研究动机

具身智能面临根本性的数据不对称:描述世界如何变化的视频海量存在,而带可执行动作标签的机器人轨迹相对稀缺。早期方法如 ACT 和 Diffusion Policy 只从机器人演示中同时学习视觉规律与控制;VLA 模型(OpenVLA、π0 等)从视觉-语言预训练继承语义知识,但对物理动态的理解仍主要靠机器人数据从头学。WAM 虽提供了视频生成先验这一更直接的起点,但现有系统都是单体式(monolithic)的:生成骨干、视觉表征、模型架构、信息流、推理过程和训练数据 tightly coupled——Cosmos Policy、DreamZero(单系统)、Fast-WAM、LingBot-VA(双系统)、Motus(三系统)各自为政、没有共享标准。这带来两个具体恶果:其一,代码库难以为他人扩展复用;其二,组件相互干扰,任何受控对比都无法归因——你分不清一个性能提升到底来自架构、数据配方还是采样调度,WAM 的设计空间因此缺乏可信的科学结论。

本文的目标是本文的目标是把世界-动作模型预训练从『一堆耦合的实现选择』改造成一个可控实验程序,并回答三个中心问题:(1)WAM 应该继承什么世界知识、如何继承最好?(2)如何在世界学习与动作学习之间建立协同?(3)这种协同如何跨域扩展?为此作者构建了开源研究栈 OpenWAM:Infra 层把设计空间分解为可组合模块,提供统一的训练器、策略服务器与评估协议;Study 层在 RoboTwin2.0 上做受控实验,把结论蒸馏成一条可执行的预训练配方;最后把配方放大成 OpenWAM-α——在 518.5M 帧(约 6,400 小时)自我中心人类视频与机器人数据上预训练的开放模型,在八个仿真基准(覆盖单臂、双臂、灵巧手、移动单臂、移动双臂五类本体)和三类真机平台上验证,并完整开源基础设施、评估协议、预训练权重与数据配方。

与已有工作不同的是,切入角度有三重独特性。第一,方法论上借鉴 Cambrian-1、《Towards Physics of Multimodal Pretraining》等『把模型设计当作实证科学』的路线,但首次系统应用于 WAM:骨干、编码器、架构家族(单/双/三系统共六变体)、注意力掩码、去噪调度、数据配比全部变成受控变量,且决策链有严格的先后依赖——每个决策都在前一个决策创造的条件下检验(例如信息流消融固定在已选定的双系统联合自注意力上),而非罗列独立最优超参。第二,生态位上,VLA 社区已有 OpenVLA、StarVLA、XPolicyLab 等开放生态,WAM 社区的开源研究生态几乎空白,OpenWAM 是第一个填补者。第三,论证视角上不止于刷榜,而是追问机制并用跨设置一致的证据支撑结论,例如『预训练把最优信息流从单向翻转为双向 mutual』这一反转现象在 RoboTwin2.0-Full 和 Clean2Random 的 ID/OOD 两种协议下同时出现,排除了域偏移或协议伪影的解释。

核心方法

整体直觉是『先搭积木系统,再做科学实验,最后把实验结论放大成模型』。技术上分三层。OpenWAM-Infra 把 WAM 形式化为组合 $C(E,S,M)$:视觉编码器 $E$(Wan2.2-VAE、FLUX.2-VAE、DINOv3、V-JEPA 2.1,可加 S-VAE 降维适配器);流骨干 $S$(视频流骨干:Wan2.1-VACE-1.3B、Cosmos-Predict2.5-2B、Cosmos3-Edge-4B、Wan2.2-TI2V-5B、Wan2.1-I2V-14B;动作流骨干:独立 ActionDiT 或共享视频骨干;可选 Qwen3-VL 理解流);可见性注意力掩码 $M$(mutual / action-sees-video / video-sees-action / isolated 四种模式)。组合规则组装出三大家族:单系统(Vanilla / MoE 硬路由)、双系统(联合自注意力 / 联合交叉注意力 / IDM 逆动力学)、三系统(加入只读 VLM 流)。所有架构共用一个训练器与联合流匹配目标:视频、动作两流噪声水平 $(t_v,t_a)$ 独立采样以覆盖整个联合噪声平面;部署由单一策略服务器承担,支持同步/异步推理与同步/方差偏移/线性偏移三类去噪调度;评估用 WebSocket 薄客户端协议接通八个仿真基准与真机。OpenWAM-Study 在此底座上依次做三组受控实验,最终把配方实例化为 OpenWAM-α。

核心创新是『把世界-动作建模变成受控实验程序』这一研究范式本身,以及由此得出的三条澄清性结论。与已有方法的本质区别:现有 WAM 把骨干、架构、信息流、推理调度、数据捆绑发布、无法归因;OpenWAM-Infra 用模块注册表 + 三段式执行契约(prepare → per-layer block step → finalize,注意力拆成 pre/post 两半以便跨流联合计算)保证任何架构组合都运行在同一个训练器、同一个策略服务器、同一套评估协议下,受控对比因此可信。三条关键发现:(1)上游知识继承取决于『足够强的生成骨干 + 紧凑且信息丰富的潜在空间』——表征编码器经 S-VAE 压到 48 维后可媲美重建编码器,打破『WAM 必须用 VAE 潜在空间』的隐含假设;(2)世界-动作协同不来自参数量或『联合预测』这个名义本身,而需要专用动作容量(双系统 92.36% vs 单系统 85.50%)、显式的世界→动作信息流(92.39% vs 隔离 87.41%)和推理时的同步联合去噪(93.0%,16 种异步调度全部更差)——支持『表征学习』假说而非『先规划后 IDM』的隐式计划假说;(3)具身预训练主要提升 OOD 泛化(+12.12pp)而非域内拟合(+0.68pp),且预训练会把最优信息流从单向翻转为双向 mutual。

方法步骤详情

方法步骤按 Study 的三个问题追踪。第一步(继承什么):固定双系统联合自注意力架构,只换视频骨干,在 RoboTwin2.0-Full 上测得平均成功率随参数单调上升(VACE-1.3B 90.14% → Predict2.5-2B 91.64% → TI2V-5B 92.39% → I2V-14B 93.79%),权衡效率后取 5B;再固定 Wan2.2-TI2V-5B 架构但权重随机初始化、只换编码器:无压缩的 DINOv3/V-JEPA 2.1 仅 76.42%/80.91%,经 S-VAE 压到 48 维后升至 90.18%/88.46%,接近 Wan2.2-VAE 的 90.30%。第二步(如何协同):对比七个架构配置,双系统联合自注意力 92.36% 显著超过单系统 Vanilla 85.50% 与 MoE 84.63%,三系统 92.60% 最佳但复杂,选双系统;训练期掩码消融显示 Isolated 87.41%、Video Sees Action 87.63%,而 Action Sees Video 92.39%、Mutual 92.15%——世界→动作信息流必不可少;推理期在 16 种异步调度(α∈{4,8,16,32},o∈{0.2,...,0.8},双向领先)上同步去噪 93.0% 全场最优。第三步(如何跨域):600 小时预算对比四种策略,Clean2Random 上 ID 仅 +0.68pp(87.00→87.68)而 OOD +12.12pp(14.50→26.62),ego+robot 一阶段共训(26.62%)最强,预训练后 mutual 在全部四个设置反超单向(OOD +0.72pp)。最终 OpenWAM-α 按配方组装:冻结 Wan2.2-VAE 因果编码 33 帧窗口(首帧独立、后续每 4 帧一组),预训练 5B 视频 DiT 与 1B ActionDiT 在全部 30 对层桥接做联合自注意力,80 维统一动作空间,以 $\lambda_v=\lambda_a=1$、钟形 $w(\cdot)$、timestep warp $\rho=5$ 的流匹配损失训练 155,862 步(1 epoch)。

技术新颖性

技术新颖性体现在四个层面。(1)架构抽象:可见性掩码 $M=(M^{V\leftarrow V},M^{V\leftarrow A};M^{A\leftarrow V},M^{A\leftarrow A})$ 把跨模态信息流形式化为可配置对象,跨模态四模式可插拔、帧内注意力固定(首帧因果 + 动作双向),这是 WAM 文献中首次对信息流的系统性参数化。(2)训练-推理一致性设计:由于训练在 $(t_v,t_a)$ 平面上独立采样,任何推理调度——方差偏移 $f_\alpha(s)=\alpha s/(1+(\alpha-1)s)$、线性偏移 $h_o(s)=\max\{s-o,0\}$——都在训练分布内,同步调度成为 $(\alpha,o)=(1,0)$ 的特例而非独立代码路径;这个『平面覆盖』思想优雅地统一了训练与部署,并使异步实验天然拥有对齐基线。(3)80 维统一动作空间用固定槽位语义 + 每数据集索引映射 + 有效性掩码,让 21 种本体共用一个动作头,未映射坐标零梯度、推理时走解析噪声路径。(4)工程新颖性:自包含 checkpoint(权重 + 完整重建配置 + 归一化统计)让评估无法静默更换编码器或动作布局;四项推理加速(prompt 嵌入缓存、控制路径跳过 VAE 解码、torch.compile+CUDA Graph、DiT 速度缓存)把 RTX 5090 上 5B 骨干各架构延迟压到 149–251ms(加速 2.01–2.63 倍),OpenWAM-α 实测约 170ms/动作块,满足实时控制。

OpenWAM Model Infra. Top: the three classes of interchangeable modules: the visual encoder E (left); the stream backbones S (middle); and the visibility attention mask M (right)...
Figure 2: OpenWAM Model Infra. Top: the three classes of interchangeable modules: the visual encoder E (left); the stream backbones S (middle); and the visibility attention mask M (right)...
Inference modes and denoising schedules of the deployment runtime. (a) Illustration of the synchronous and asynchronous inference modes. (b) Illustration of the three denoising schedules (variance shift, linear offset, and sync)...
Figure 3: Inference modes and denoising schedules of the deployment runtime. (a) Illustration of the synchronous and asynchronous inference modes. (b) Illustration of the three denoising schedules (variance shift, linear offset, and sync)...
Serving latency across architectures. Inference latency with Wan2.2-TI2V-5B as the video backbone on an RTX 5090...
Figure 4: Serving latency across architectures. Inference latency with Wan2.2-TI2V-5B as the video backbone on an RTX 5090...
Evaluation protocol of OpenWAM-Infra. Benchmarks connect to the policy server as thin clients over WebSocket...
Figure 5: Evaluation protocol of OpenWAM-Infra. Benchmarks connect to the policy server as thin clients over WebSocket...
Attention Masking Strategies. We control cross-modality information flow at training time via attention masking.
Figure 8: Attention Masking Strategies. We control cross-modality information flow at training time via attention masking.
Overview of OpenWAM-α. (a) The dual-system architecture...; (b) The pretraining mixture: 518.5M frames (6,369 hours)...; (c) Timestep sampling...; (d) The 80-D unified action space...
Figure 12: Overview of OpenWAM-α. (a) The dual-system architecture...; (b) The pretraining mixture: 518.5M frames (6,369 hours)...; (c) Timestep sampling...; (d) The 80-D unified action space...

实验结果

核心发现逐一分析。受控研究(RoboTwin2.0):骨干规模单调有益,平均成功率 90.14%→91.64%→92.39%→93.79%;紧凑潜在空间是关键——DINOv3 无压缩仅 76.42%,S-VAE 压到 48 维后达 90.18%;架构容量决定协同下限(单系统 Vanilla 85.50%、MoE 84.63%,双系统联合自注意力 92.36%,三系统 92.60%);训练期必须有世界→动作流(Action Sees Video 92.39% vs Isolated 87.41%,差约 5pp);推理期同步去噪 93.0% 最优,所有异步调度无增益;预训练收益集中在 OOD——Clean2Random 上 ID 仅 +0.68pp(87.00%→87.68%)而 OOD +12.12pp(14.50%→26.62%),共训(26.62%)优于仅机器人(23.80%)与仅 ego(26.50% 相当),且预训练后 mutual 掩码在全部设置反超(OOD +0.72pp)。OpenWAM-α 规模验证:LIBERO 99.3%(与最佳 ABot-M0.5 的 99.4% 仅差 0.1pp);EBench 49.4% SR / 64.7 Score 创 SOTA,领先 Qwen-RobotManip 约 4 分;RoboCasa-GR1 60.5% 榜首级;RoboTwin2.0-C2R 平均 69.0% 为最强 WAM(超 4D-WAM 7.3pp)但落后最佳 VLA Qwen-RobotManip 的 77.1%;RoboDojo 仿真 11.92% SR 为最强 WAM(VLA 最佳 DM0.5 为 19.34%);VLABench 58.9% 与顶尖持平。真机:单臂 Franka 六任务 99/120(82.5%),超 LingBot-VA 77.5% 与 π0.5 55.0%,其中两个抽屉任务 100%;RoboDojo 真机 18 任务 37.6 Score / 24.4 SR 登顶(π0.5 为 22.9/12.8);在预训练完全未见的灵巧手平台(Wuji 手 + Tianji 臂,9 维末端 + 21 自由度手)四个任务全面超过 π0.5,如 Put Away Clothes 的 OOD 成功率 85% vs 45%。异常点是 LIBERO-Plus 仅 69.2%(最佳 89.0%),失败集中在相机(33.8%)与噪声(39.8%)扰动,作者归因于单臂预训练数据稀少叠加像素级潜在空间对视觉扰动敏感。大结论:域内 WAM 拟合更好、OOD VLA 泛化更好,两种缺陷都可由数据弥补。

Architecture Ablation. Averaged success rates (%) on RoboTwin2.0-Full.
Table 1: Architecture Ablation. Averaged success rates (%) on RoboTwin2.0-Full.
Action learning requires access to world information. Success rates (%) on RoboTwin2.0-Full.
Table 2: Action learning requires access to world information. Success rates (%) on RoboTwin2.0-Full.
The recipe accumulated by OpenWAM-Study. Each evidence-backed choice becomes the default for OpenWAM-α.
Table 3: The recipe accumulated by OpenWAM-Study. Each evidence-backed choice becomes the default for OpenWAM-α.
The OpenWAM-α pretraining data...
Table 4: The OpenWAM-α pretraining data...
Evaluation Results on LIBERO-Plus. Bold denotes best values, underline second best.
Table 5: Evaluation Results on LIBERO-Plus. Bold denotes best values, underline second best.
Evaluation Results on Single-Arm Real-Robot Tasks. Bold denotes best values, underline second best.
Table 6: Evaluation Results on Single-Arm Real-Robot Tasks. Bold denotes best values, underline second best.
Evaluation Results on the Bimanual RoboDojo Real-World Track. Each cell reports Score / SR (%)...
Table 7: Evaluation Results on the Bimanual RoboDojo Real-World Track. Each cell reports Score / SR (%)...
Evaluation Results on Dexterous-Hand Real-Robot Tasks. Each cell reports Score / SR (%); the OOD column aggregates all variation settings...
Table 8: Evaluation Results on Dexterous-Hand Real-Robot Tasks. Each cell reports Score / SR (%); the OOD column aggregates all variation settings...
Pretraining configuration for OpenWAM-α.
Table 9: Pretraining configuration for OpenWAM-α.
Evaluation Results on LIBERO. Bold denotes best values, underline second best.
Table 13: Evaluation Results on LIBERO. Bold denotes best values, underline second best.
Evaluation Results on VLABench. Bold denotes best values, underline second best.
Table 14: Evaluation Results on VLABench. Bold denotes best values, underline second best.
Evaluation Results on RoboTwin2.0-Clean2Random. Bold denotes best values, underline second best.
Table 15: Evaluation Results on RoboTwin2.0-Clean2Random. Bold denotes best values, underline second best.
Evaluation Results on RoboTwin2.0-Full. Bold denotes best values, underline second best.
Table 16: Evaluation Results on RoboTwin2.0-Full. Bold denotes best values, underline second best.
Evaluation Results on RoboDojo. Bold denotes best values, underline second best.
Table 17: Evaluation Results on RoboDojo. Bold denotes best values, underline second best.
Evaluation Results on EBench. Bold denotes best values, underline second best.
Table 18: Evaluation Results on EBench. Bold denotes best values, underline second best.
Evaluation Results on RoboCasa365. Bold denotes best values, underline second best.
Table 19: Evaluation Results on RoboCasa365. Bold denotes best values, underline second best.
Evaluation Results on RoboCasa-GR1. Bold denotes best values, underline second best.
Table 20: Evaluation Results on RoboCasa-GR1. Bold denotes best values, underline second best.
WAM Performance with Different Video Backbone Size. With increasing video generation backbone size, performance of the resulting WAM consistently improves.
Figure 6: WAM Performance with Different Video Backbone Size. With increasing video generation backbone size, performance of the resulting WAM consistently improves.
Visual representation priors. We consider building WAMs with both reconstructive and representation encoders, and include a variant of representation encoders with S-VAE...
Figure 7: Visual representation priors. We consider building WAMs with both reconstructive and representation encoders, and include a variant of representation encoders with S-VAE...
Inference-time Information Flow via Denoising Schedule. Each curve traces action denoising progress against video denoising progress...
Figure 9: Inference-time Information Flow via Denoising Schedule. Each curve traces action denoising progress against video denoising progress...
Embodied Pretraining Primarily Improves OOD Generalization. Success rates on RoboTwin2.0-Clean2Random, ordered from lower to higher performance...
Figure 10: Embodied Pretraining Primarily Improves OOD Generalization. Success rates on RoboTwin2.0-Clean2Random, ordered from lower to higher performance...
Pretraining Changes the Preferred Information Flow. Central markers give the absolute success rate of Action Sees Video; arrows terminate at the matched Mutual result...
Figure 11: Pretraining Changes the Preferred Information Flow. Central markers give the absolute success rate of Action Sees Video; arrows terminate at the matched Mutual result...
Score comparison of OpenWAM-α against representative VLA and WAM baselines across the simulation benchmarks...
Figure 13: Score comparison of OpenWAM-α against representative VLA and WAM baselines across the simulation benchmarks...
OpenWAM-α against the best of each family, per benchmark, grouped by embodiment.
Figure 14: OpenWAM-α against the best of each family, per benchmark, grouped by embodiment.
ID and OOD comparisons between the two paradigms. (a) Fast-WAM versus StarVLA...(b) OpenWAM-α versus the three strongest VLAs on ID splits. (c) OpenWAM-α versus the three strongest VLAs on OOD splits.
Figure 16: ID and OOD comparisons between the two paradigms. (a) Fast-WAM versus StarVLA...(b) OpenWAM-α versus the three strongest VLAs on ID splits. (c) OpenWAM-α versus the three strongest VLAs on OOD splits.
Real-robot experimental setups across three embodiments. Top: the six single-arm tasks on the Franka-Research-3 platform...
Figure 17: Real-robot experimental setups across three embodiments. Top: the six single-arm tasks on the Franka-Research-3 platform...
查看结构化数据
任务指标本文基线提升
LIBERO(单臂桌面仿真) 平均成功率 SR (%) 99.3 ABot-M0.5 (WAM) 99.4;π0.5 (VLA) 96.9 与全场最佳仅差 0.1pp,超 π0.5 +2.4pp,稳居顶级
EBench(移动双臂仿真) SR (%) / Score 49.4 / 64.7 Qwen-RobotManip (VLA) 45.6 / 60.0 +3.8pp SR / +4.7 Score,刷新 SOTA
RoboCasa-GR1(灵巧手人形仿真) SR (%) 60.5 RLDX-1 (VLA) 58.7;PhysBrain 1.0 (VLA) 64.5 超 RLDX-1 +1.8pp,为 WAM 最佳、总榜前列
RoboTwin2.0-Clean2Random(双臂仿真,OOD 协议) 平均 SR (%)(Clean 89.4 / Randomized 48.7) 69.0 4D-WAM 61.7(最佳 WAM);Qwen-RobotManip (VLA) 77.1 超最佳 WAM +7.3pp;落后最佳 VLA 8.1pp
RoboTwin2.0-Full(双臂仿真,ID 协议) 平均 SR (%) 93.60 ABot-M0.5 (WAM) 94.10;StarVLA (VLA) 88.25 落后最佳 0.5pp,第二梯队前列
RoboDojo 仿真(双臂,含精度/长时程/记忆任务) 平均 SR (%) / Score 11.92 / 17.18 DM0.5 (VLA) 19.34 / 24.90;Fast-WAM (WAM) 2.03 / 3.48 最强 WAM(超 Fast-WAM 近 10pp),但与最佳 VLA 仍有差距
LIBERO-Plus(单臂 OOD 七类扰动) 平均 SR (%) 69.2(相机 33.8 / 噪声 39.8) Qwen-RobotManip (VLA) 89.0;同类 WAM ABot-M0.5 83.4 -19.8pp,全文最大短板,暴露数据覆盖与像素级表征缺陷
VLABench(语义理解型单臂仿真) 平均 SR (%) 58.9 Xiaomi-Robotics-1 (VLA) 59.1;Bridge-WA (WAM) 52.8 与最佳持平(-0.2pp),In-dist 分项 83.4 为最佳
单臂真机 Franka-Research-3(6 任务 × 20 次) 平均 SR (%) 82.5(99/120),两个抽屉任务 100% LingBot-VA (WAM) 77.5%;π0.5 (VLA) 55.0% +5.0pp / +27.5pp,全场最佳
RoboDojo 真机双臂(ARX X5 / Piper / Piper X,18 任务) SR (%) / Score 24.4 / 37.6(登顶) π0.5 (VLA) 12.8 / 22.9;InternVLA-A1 7.2 / 12.0 SR 接近翻倍(+11.6pp)
灵巧手真机(Wuji 手 + Tianji 臂,预训练未见本体,4 任务 OOD) SR (%)(以 Put Away Clothes OOD 为例) 85% π0.5 (VLA) 45% +40pp,四任务全部领先,验证跨本体适配能力

局限与改进

作者承认的局限(附录 A):研究集中在具身预训练阶段,post-training 与适配方法的作用机制未涉及;模态融合手段局限于交叉注意力与硬路由 MoE,未探索 tokenization 阶段早期融合或软路由 MoE;预训练数据不含 UMI 类手持采集数据(本可提供带动作标签的场景多样性);Wan2.2-VAE 这类像素重建编码器对视角、噪声、场景变化不够鲁棒,选择它只是『当前最优权衡而非最优解』。我自己的观察:(1)LIBERO-Plus 上 69.2% 的失败说明配方对数据覆盖高度敏感——单臂预训练数据仅 DROID(固定平台固定机位)加 InternData-A1 单臂部分时泛化骤降,这使 Finding 3 的『数据决定泛化』更像经验规律而非机制解释;(2)OOD 上系统性落后最佳 VLA(C2R 随机化 48.7% vs GigaBrain-0.7 的 67.9%,RoboDojo Open 分项仅 1.08% SR),长时程视频预测的误差累积问题被指出但未被解决;(3)自我中心视频无动作标签、只监督世界流,其 30% 数据份额对动作流的间接收益缺乏专门消融;(4)灵巧手真机实验只对比 π0.5 一个基线,跨本体结论的外部效度有限;(5)『预训练翻转信息流偏好』仅在 RoboTwin2.0 一个环境验证,普适性有待更多基准确认;(6)移动双臂(EBench 49.4%)与长时程任务的绝对性能仍低,离实用尚远。

独立分析的弱点

独立分析的弱点与改进方向。(1)像素级潜在预测的脆弱性:LIBERO-Plus 相机扰动 33.8%、噪声 39.8%,远低于语义级表征模型(Being-H0.7 用 V-JEPA 2.1 编码达 82.1%)。改进:训练对相机位姿/亮度/噪声增广等变的世界流;或推动带原生时间压缩的表征编码器(作者在 4.1.2 节亦呼吁),把鲁棒性从数据补偿转为结构保障。(2)单臂与特定机位数据稀少:ABot-M0.5/Being-H0.7 各有 8000+/5700+ 小时多样化单臂语料,OpenWAM-α 单臂来源贫乏。改进:纳入 OXE、Bridge 系列开源语料,或用 UMI/DexUMI 接口低成本采集带动作的单臂视频(作者已在局限中提出)。(3)长时程 OOD 误差累积:视频 rollout 越长误差越大,RoboDojo Open 任务 1.08% SR 几乎全败。改进:限制 rollout 时程并以动作流为主导;或在三系统中把只读 VLM 升级为可交互的分层规划流,实现『规划-生成-执行』闭环。(4)OOD 协议下与 VLA 的差距:可借鉴 VLA 社区的数据增广与正则化手段,或按 Takeaway 3 把两个范式的优势区(WAM 域内拟合、VLA 域外泛化)显式融合,例如双头蒸馏或视频监督退火。(5)信息流结论的外推风险:mutual 优势只在预训练后出现,说明存在『数据规模阈值』,应系统绘制掩码偏好随预训练数据量的缩放曲线,避免在中小数据集上误用结论。(6)真机基线覆盖不足:灵巧手实验仅对比 π0.5,应加入 LingBot-VA、ABot-M0.5 等同类 WAM 以支撑跨本体优势的主张。

未来方向

作者提出的方向(附录 A 与结论):系统研究 post-training 与适配方法对具身基座模型的作用机制与经验配方;探索更原生的模态融合(tokenization 阶段早期融合、软路由 MoE);纳入 UMI 类可执行动作数据共训,以及用仿真原生地按数量级扩展机器人数据;构建紧凑且对环境扰动鲁棒的视觉表征以替代像素重建编码器。基于本文成果可延伸的方向:(1)掩码缩放定律——既然预训练把信息流偏好从单向翻转为 mutual,可系统测量最优掩码随预训练规模/数据多样性的演化,甚至设计可学习或动态掩码;(2)把 Study 的受控方法迁移到 post-training 阶段(如 RL 微调后重新消融架构与调度),检验 Finding 1–3 是否在优化目标改变后依然成立;(3)VLA+WAM 融合——论文明确两范式优势互补且同为端到端,可让三系统中的 VLM 流从只读尾巴升级为双向交互的语义流,兼取 VLA 的泛化与 WAM 的拟合;(4)跨本体迁移与少样本新本体适配——灵巧手实验(80 维统一空间容纳未见过的 9+21 维动作布局)已显示可行性,值得系统研究零样本/少样本本体注册;(5)推理效率与控制质量的权衡——利用速度缓存等手段研究去噪步数 N、chunk 长度 H 与控制频率的 Pareto 前沿;(6)仿真数据规模化——InternData-A1 已占预训练 30%,探索仿真到真机的更优迁移配方。

复现评估

复现条件在同类工作中属于最好的一档。代码完整开源(github.com/OpenWAM-Official/OpenWAM),模型权重与数据配方在 HuggingFace 发布(huggingface.co/OpenWAM),项目主页 openwam-official.github.io。论文附录给出全部关键超参:预训练 16 节点 × 8 × H200(128 卡)约 7 天,AdamW,学习率 1e-4,cosine 调度(5% 预热、最低比率 0.01),权重衰减 0.01,全局 batch 3,072(每卡 24 clip),bf16,DeepSpeed ZeRO-2,155,862 步(1 epoch),输入 33 帧、384×320、多视角,$\lambda_v=\lambda_a=1$、warp $\rho=5$;每个基准的 SFT 配置(batch、步数、增广)逐项列出(如 LIBERO:batch 256、10 epochs / 10,690 步、无增广)。数据方面五个来源(自建 ego 数据 71.6K 条录像/3006 任务、AgiBotWorld-Beta、RoboCOIN、DROID、InternData-A1)均为公开或声明可发布,清洗规则写到了可操作的细节(信号完整性判据:幅值比 ≥3 倍且逐轴相关 <0.5 即剔除;状态优先空闲检测:p99.5 标定运动阈值 + 2cm/s、5°/s 确认;>70% 帧损失或 90% 冻结整段删除)。难点在于预训练本身:128 卡 H200 × 7 天是工业级算力,一般实验室难以复现预训练;但 Study 的受控实验(RoboTwin2.0 从头训练规模小得多)与下游 SFT/评测可从开源 checkpoint 出发,部署端单张 RTX 5090 约 170ms/动作块即可实时,复现门槛低。综合评级:评测与微调高度可复现,预训练需大工业资源,数据配方透明。