← 返回 2026-08-28

Zero-WAM:基于人类视频上下文的世界-动作建模与开放式任务泛化 Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu 📅 2026-08-26 👍 20 2026-09-01 18:30
上下文学习 世界动作模型 机器人操作 机器人数据集 视频生成 零样本泛化

以人类视频为上下文提示,让机器人零样本完成训练中从未见过的操作任务

前置知识

In-Context Learning(上下文学习,ICL)

大语言模型的核心能力:只把新任务的示例放进输入上下文,不做任何参数更新,模型就能照葫芦画瓢地解决新问题。泛化由此从「学会这个任务」变成「在上下文里规定这个任务」。本文把这一范式整体搬到机器人操作:人类演示视频就是放进上下文的示例,策略据其推断任务应如何演化并转成自己的可执行动作。

全文的立论基础。Zero-WAM 的目标就是把跨任务泛化重构为部署时的任务规约问题,理解 ICL 才能明白为什么全文强调「不更新参数、不收集新任务机器人数据」。

Flow Matching(流匹配)

一类生成模型训练方法:在干净样本 $x_0$ 与高斯噪声 $\epsilon$ 之间定义线性插值路径 $x_t=(1-t)x_0+t\epsilon$,网络学习目标速度场 $v^\star_t=\epsilon-x_0$,推理时从噪声出发积分回干净样本,比扩散模型目标更简洁。本文中机器人视频块与动作块都用 flow matching 目标训练,动作空间同样构造噪声与流时间的插值 $a^r=(1-r)a+u\epsilon^a$。

论文第 3 节所有训练损失(视频损失 $\mathcal{L}_{fm}$、动作损失、IFP 损失)全部建立在此之上,不懂 flow matching 无法读懂方法与训练目标。

因果视频-动作模型 / 世界动作模型(WAM)

一类机器人策略架构:把控制建模为因果(自回归)预测——给定任务条件与历史观测,先预测下一机器人视频块,再由逆动力学头从预测视频解码时间对齐的执行动作块,即 $p_\theta(x_{i+1},a_{i+1}|\cdot)=p^{vid}_\theta(x_{i+1}|\cdot)\cdot p^{act}_\theta(a_{i+1}|\cdot,x_{i+1})$。直觉是「先想象未来画面,再从画面提取动作」,因为已有研究表明正确预测的未来视频能解码出准确动作。

Zero-WAM 正是该架构的实例(基于 LingBot-VA 框架、从 Wan-2.2 改造而来),方法节所有公式都在这个「视频先行、动作随后」的分解上展开。

Mixture-of-Transformers(MoT)

一种多模态 Transformer 参数化方式:每种模态(此处为视频与动作)拥有完全独立的 QKV 投影、FFN 与输出头,但两类 token 仍在同一序列中、通过共享的注意力层交互,既保留模态专属容量又允许跨模态信息流动。本文中动作块表征被排在预测视频之后,使逆动力学解码能注意到未来视频。

Zero-WAM 的视频 Transformer 与动作 Transformer 正是用 MoT 连接的,看懂模型架构图和动作上下文 $C^{act}_i$ 的构造必须知道这一点。

RoPE(旋转位置编码)

通过在注意力打分前对 query/key 施加与位置相关的旋转变换来实现相对位置编码,广泛用于现代 LLM 与视频生成模型;视觉 token 上可对时间、高、宽三个轴分别赋予坐标 $(q,y,x)$。

本文的关键技巧之一:给 ICL 人类视频 latent 沿高度轴加偏移 $\Delta H=32$(大于多视角机器人视频的布局高度 $H_{mv}$),把人类视频与机器人视频在坐标空间中分开,防止共享同一 VAE 潜空间带来的表征混淆。

捷径学习与 Teacher Forcing

Teacher forcing 指训练时把真实历史前缀喂给模型、只监督下一步预测。其风险是捷径学习:模型只靠局部历史外推就能压低损失,绕过真正该学的条件信号。本文中「仅凭机器人历史 + 文本就能预测下一视频块」正是这样的捷径——它在已见任务上表现良好,却让模型完全无视上下文中的人类视频,到未见任务上恰恰失效。

IFP 训练目标的存在理由就是切断这条捷径。不看懂捷径问题,就无法理解为什么要把未来块预测设计成只能经主干表征间接访问人类视频。

RoboTwin 2.0 基准

面向双臂操作的仿真评测基准,含 50 个操作任务、每任务 50 条轨迹,支持大规模闭环 rollout。本文按任务级切分:43 个任务用于后训练,7 个任务(place object on scale、stamp seal、open microwave、move stapler to pad、place bread in basket、place empty cup、stack blocks three)整体留出作为未见评测集,严格衡量跨任务而非跨视觉条件的泛化。

主实验与全部消融都在此进行,文中核心数字(46.95% vs 17.45% 等)均来自其评测协议:3 个随机种子、每任务每次 100 次闭环 rollout 取宏平均。

研究动机

现有机器人操作策略(π0.5 等 VLA 模型、各类视频-动作模型)几乎都以语言指令作为任务接口,但语言描述操作任务时严重欠规定:空间约束、中间状态与时序结构很难用文字讲清,而且即使写出详细指令也不提供任何关于「场景应如何演化」的直接视觉证据,因此 VLA 式扩展始终没有弥合跨任务鸿沟——AGNOSTOS 的评测显示代表性 VLA 策略在零样本跨任务上全部失败。人类演示视频本是天然的任务规约,但大规模「人类视频-机器人动作」配对数据极难人工收集:MIME 只有 8.3K 样本/20 任务,EgoMimic 2.1K/3,BC-Z 18.7K/100,RH20T 110K/147,任务覆盖都太窄。更隐蔽的杀手是捷径学习:在已见任务上做 teacher-forcing 训练时,模型仅凭机器人历史和文本就能预测下一视频-动作块,于是学会无视上下文中的人类视频,测试到未见任务时恰恰失去最需要的信号。

本文的目标是本文要让机器人策略具备零样本跨任务泛化能力:不为新任务收集任何机器人数据、不更新任何参数,仅在部署时通过上下文给出任务规约即可执行。具体拆成三件事:第一,把 LLM 的 in-context learning 范式搬到操作领域,确立人类视频作为自然的任务规约接口,且单一策略同时支持语言指令与人类视频两种任务说明;第二,解决配对数据稀缺,用自动流水线生成 HumanGen 数据集——74.2K 个人-机 ICL 对、覆盖 8.6K 个任务,配合同样按任务平衡采样的 Task-diverse VA 预训练语料(6000+ 任务、每轮约 40 万条轨迹);第三,设计训练目标防止模型走捷径、真正依赖视频提示。量化目标上,作者在 RoboTwin 2.0 的七个未见任务上达到 46.95% 平均成功率,比最强视频-动作基线 LingBot-VA 高出 29.5 个百分点。

与已有工作不同的是,已有工作的切入各有短板:以 BC-Z 为代表的视频提示系统需要逐任务人工采集人类视频,任务规模难以扩展;AGNOSTOS 的补救方案要在测试时提供未见任务的机器人轨迹作为参考;WAM-TTT、RoboTTT 等测试时训练方法需要部署时更新记忆或快权重。本文的独特之处在于把方向反过来:不从「人类视频」出发找配对机器人数据,而是从任务级采样的机器人轨迹出发,用 VLM + 图像编辑 + 视频生成自动合成语义匹配的人类视频,把人-机对齐问题降维成语义级而非动作级对齐——人类视频只需传达「任务是什么、物体状态如何变化」,动作由机器人自己的本体完成。再配合 IFP 目标从训练机制上切断捷径,让模型在部署时纯前馈推理即可泛化,两件事缺一不可。

核心方法

方法由数据、模型、训练目标三部分组成。数据侧先做任务级重采样:把 AgiBot、InternData-A1、Open-X-Embodiment、RoboCOIN、RoboMIND 五个公开数据集按「动作+物体」重新划任务,得到 6000+ 任务、每 epoch 约 40 万条轨迹的 Task-diverse VA 语料;再用自动流水线把任务采样的机器人视频转成语义匹配的人类视频,构成 HumanGen(74.2K 人-机 ICL 对、8.6K 任务)。模型侧把 Wan-2.2-TI2V-5B 双向视频生成模型改造成因果视频-动作策略:视频与动作两个 Transformer 采用 Mixture-of-Transformers 设计(各自独立的 QKV/FFN/输出头、共享注意力),自回归地预测下一视频块与时间对齐的动作块。视频与动作均用 flow matching 训练:$x_t=(1-t)x_0+t\epsilon$、$v^\star_t=\epsilon-x_0$,损失 $\mathcal{L}_{fm}=\mathbb{E}\,\|v_\theta(x_t,t,c)-v^\star_t\|_2^2$;联合预测分解为 $p_\theta(x_{i+1},a_{i+1}|\cdot)=p^{vid}_\theta\cdot p^{act}_\theta(a_{i+1}|\cdot,x_{i+1})$,动作头充当逆动力学模型,从预测的未来视频解码可执行动作。ICL 样本的条件为 $c=\{h,\ell\}$,人类视频 $h$ 作为前缀记忆拼在机器人轨迹之前。

核心创新有三。第一,人类视频作为部署时的 in-context 任务规约:视频上下文为 $C^{vid}_i=[[h,x_{\le i}],a_{\le i},\ell]$,模型必须从 $h$ 推断任务演化并映射到自身本体,学的是任务级对应而非动作 copying;由于人类视频与多视角机器人视频共享同一 VAE 潜空间,作者沿高度轴给人类视频 latent 加 RoPE 偏移 $\Delta H=32>H_{mv}$,在坐标空间中把两种视觉来源分开。第二,In-context Future Chunk Prediction(IFP):把主视频 Transformer 的 $M$ 个中间层特征经 MLP 融合为 $\phi_{i+1}=P_{fuse}(\text{Concat}(\{r^{i+1}_m\}))$,$K=4$ 个 IFP 模块以 stride $s=2$ 平行预测未来 4 个视频块(目标索引 $j_k=(i+1)+1+(k-1)s$,损失权重 0.5/0.25/0.15/0.15)。关键设计是 IFP 模块不直接看人类视频 $h$、只能经 $\phi_{i+1}$ 间接获取任务信息,逼迫主干把 $h$ 的语义编码进当前表征;IFP 仅训练期使用,推理时移除、零开销。第三,任务级平衡采样证明预训练数据的任务多样性比原始轨迹数量更决定跨任务泛化。

方法步骤详情

第一步,任务级重采样:对五个公开数据集按「操作动作+物体」划分任务(元数据缺失则从轨迹解析),依任务内多样性设定采样上限,得 6000+ 任务、每 epoch 约 40 万条轨迹。第二步,人类视频生成:VLM(Gemini 3.1 Pro 或 Qwen3.6-Plus)解析机器人视频,抽取任务名与初始/终态物体状态,产出图像编辑提示;图像编辑模型(Nano Banana 2 或 Qwen-Image-2.0)把首帧改绘为人类操作初始观察,注入背景/视角/物体实例变化;VLM 据编辑图生成视频提示;视频模型(Wan 2.7 或 Kling AI 3.0)合成人类操作视频;VLM 对语义与物理合理性打分(5/3/1),合格者与原机器人轨迹配成 ICL 对。第三步,组装 HumanGen:External ICL 5062 任务/41188 对、In-house ICL 3522 任务/30247 对、Simulation ICL 2500 样本(43 任务训练、7 任务留作评测)、Real-world ICL 252 对。第四步,训练:VA:HumanGen=1:5 混采,损失为视频 flow matching + 动作损失 $\lambda_a$ + IFP 损失 $\lambda_{ifp}$;ICL 样本以 0.1 概率丢人类视频 latent、语言 dropout 提至 0.4;AdamW 学习率 $1\times10^{-4}$,预训练 15360 GPU 时。第五步,RoboTwin 后训练:64 卡 4000 步,三类数据按 2:10:3 混采。第六步,推理:纯语言模式(视频 CFG=5)或 ICL 模式(人类视频编码一次缓存为前缀记忆,ICL CFG=5),先生成视频块再解码对齐动作块。

技术新颖性

与已有工作的本质区别有四。其一,BC-Z、MIME 等视频提示系统靠人工采集逐任务扩展,HumanGen 用「机器人轨迹→合成人类视频」的反向流水线实现数据自动扩产,且刻意注入背景、视角、物体实例、摆放的视觉失配,迫使模型学语义级对应而非像素级模仿——这正是能泛化到未见任务的根本原因;对照表 1,HumanGen 是唯一多源、自动生成、覆盖 45+ 本体、74.2K 样本/8.6K 任务的数据集。其二,AGNOSTOS 测试时要喂未见任务的机器人轨迹、WAM-TTT 要测试时更新快权重,Zero-WAM 把泛化能力全部前移到预训练,部署时纯前馈推理。其三,IFP 的条件化设计在「辅助损失」与「强迫主干编码」之间建立了因果链:若直接让 IFP 模块看 $h$,辅助分支会自学成独立的人类视频预测器,主干一无所获,而推理时辅助分支被删掉,部署策略毫无收益——只经 $\phi_{i+1}$ 间接访问 $h$ 才保证监督信号作用在主干表征上。其四,RoPE 高度轴偏移以近乎零成本解决同潜空间下两种视觉来源的混淆,比引入独立编码器优雅得多。

Overview of Zero-WAM
Figure 1: Overview of Zero-WAM
Data construction and in-context human video generation
Figure 2: Data construction and in-context human video generation

实验结果

仿真主实验在 RoboTwin 2.0 七个未见任务上进行,每任务 3 seeds×100 次闭环 rollout。Zero-WAM 平均成功率 46.95±0.72%,比 LingBot-VA(17.45±1.40%)高 29.50 个百分点,比 WAN-Action(10.98±1.07%)高 35.97 个百分点,且七个任务全部领先:place empty cup 84.87%、move stapler to pad 69.14%、open microwave 59.00%、stamp seal 47.00%、place bread in basket 35.00%、place object on scale 24.67%;最难的长时序任务 stack blocks three 上 Zero-WAM 是主对比中唯一非零者(9.00%)。真机实验(双臂 Franka,每任务 30 次试验):物体入容器 53.3% vs LingBot-VA 43.3%;三物体顺序长时序操作 33.3% vs 10.0%;双桌腿精细插入 16.7% vs 0.0%。消融把收益拆成三份:仅加人类视频提示(无大规模预训练)就把 WAN-Action 从 10.98% 提到 36.36%,并超过有机器人预训练的 LingBot-VA(17.45%);IFP 把 28.55% 提到 46.95%,并把 stack blocks three 从 0.00% 拉到 9.00%;掩掉人类视频的 text-only 变体仍有 39.44%,说明任务平衡预训练本身即带来 +21.99 个百分点。

Comparison with existing task-level paired human-robot datasets
Table 1: Comparison with existing task-level paired human-robot datasets
Zero-shot cross-task results on seven unseen RoboTwin tasks
Table 2: Zero-shot cross-task results on seven unseen RoboTwin tasks
Real-world unseen-configuration evaluation
Table 3: Real-world unseen-configuration evaluation
Unseen tasks in RoboTwin 2.0 simulation
Figure 3: Unseen tasks in RoboTwin 2.0 simulation
Effect of in-context human video prompts on RoboTwin unseen tasks
Figure 5: Effect of in-context human video prompts on RoboTwin unseen tasks
Ablations of task-balanced robotic pre-training and in-context future chunk prediction on RoboTwin unseen tasks
Figure 6: Ablations of task-balanced robotic pre-training and in-context future chunk prediction on RoboTwin unseen tasks
查看结构化数据
任务指标本文基线提升
RoboTwin 2.0 七个未见任务零样本跨任务(宏平均) 任务成功率(3 seeds×100 次闭环 rollout) 46.95±0.72% LingBot-VA 17.45±1.40%;WAN-Action 10.98±1.07% +29.50pp(对 LingBot-VA)/ +35.97pp(对 WAN-Action)
真机:物体入容器放置(未见物体/容器组合) 30 次真实机器人试验成功率 53.3% LingBot-VA(语言指令)43.3% +10.0pp
真机:三物体顺序长时序操作(任意顺序、未见物体) 30 次真实机器人试验成功率 33.3% LingBot-VA 10.0% +23.3pp
真机:双桌腿精细插入(指定颜色桌腿插入指定孔) 30 次真实机器人试验成功率 16.7% LingBot-VA 0.0% +16.7pp
仿真:stack blocks three(未见长时序任务) 任务成功率 9.00±2.16% LingBot-VA 0.00%;WAN-Action 0.00% 主对比方法中唯一非零,+9.0pp
消融:IFP 目标的作用 七任务平均成功率 46.95%(含 IFP) Zero-WAM w/o IFP 28.55% +18.40pp
消融:任务平衡预训练的作用(掩掉人类视频的 text-only 变体) 七任务平均成功率 39.44% LingBot-VA 17.45% +21.99pp

局限与改进

作者承认的局限:实验基本限于静止桌面操作,未覆盖移动操作、动态非结构化环境和真正长时序任务。我自己的观察有五点。第一,绝对成功率仍有明显空间:最难的 stack blocks three 仅 9.00%,精细插入只有 16.7%,说明长时序规划与毫米级接触任务仍是短板。第二,数据流水线重度依赖闭源/商用模型(Gemini 3.1 Pro、Nano Banana 2、Wan 2.7、Kling AI 3.0),VLM 打分虽过滤语义与物理缺陷,但生成视频的质量上限受制于生成模型本身。第三,仿真评测的 7 个未见任务与 43 个训练任务同源(同一 RoboTwin 资产库、场景与物体族),且 stamp seal 与 move stapler 的成功判据被作者自行修改,跨基准的严格零样本性打了折扣。第四,推理时模型是否真的在参考人类视频没有任何机制保证——IFP 只存在于训练期,部署后策略注意力漂移的行为不可控。第五,部署时需要为每个新任务准备人类视频演示,对最终用户仍构成使用门槛。

独立分析的弱点

第一,生成数据的「语义对齐」牺牲了运动细节:桌腿插入这类任务需要精确的接触与对位信息,而人类视频(尤其换过背景/视角后)只保留任务语义,这直接解释了插入类任务绝对成功率低。改进方向:对高精度任务补充运动级重定向数据或触觉/力反馈条件。第二,闭源生成模型依赖使流水线不可复现、成本高且有许可风险;可替换为开源 VLM 与视频生成模型,并加入人工抽检回路控制数据质量。第三,IFP 仅训练期生效,推理时缺乏注意力监控;可引入轻量探针在线检测视频提示的注意力占比,过低时自动放大 ICL classifier-free guidance 或触发重规划。第四,人类视频接口仍要求用户现场演示,没有利用互联网规模的第一视角人类视频;可把 egocentric 视频库检索或文本到视频生成作为指令来源,进一步逼近开放式任务规约。第五,仿真评测仅 7 个未见任务且与训练共享仿真资产,应在外部真实场景做第三方评测以检验泛化声明;IFP 的 K=4、stride=2 等超参也未做敏感性分析。

未来方向

作者提出的方向:把范式扩展到移动操作、更动态的非结构化环境以及大幅拉长的任务时域;利用可大规模收集的第一视角人类视频,通过语义级(而非运动级)的人-机对应,让机器人从人类经验中获取任务知识、只依赖少量机器人数据学可执行动作。基于本文成果还可延伸:其一,把 HumanGen 流水线反着用——从海量 ego 视频自动挖掘任务并合成对应机器人轨迹,形成「人类视频⇄机器人数据」的双向飞轮;其二,在线 ICL:把机器人自己过往的成功执行视频作为上下文提示,实现自我改进与技能复用;其三,多模态指令融合,语言+人类视频+语音标注意图并研究冲突消解;其四,用世界模型 rollout 做测试时规划搜索,弥补长时序任务(stack blocks three 仅 9%)上的失败;其五,HumanGen 已覆盖 45+ 本体,可系统研究 ICL 提示能否隐式指定目标本体的行为风格,实现跨 embodiment 迁移。

复现评估

复现难度:高。有利条件:基座模型 Wan-2.2-TI2V-5B 公开;五个预训练数据源(AgiBot、InternData-A1、Open-X-Embodiment、RoboCOIN、RoboMIND)与评测基准 RoboTwin 2.0 均公开;项目页 robbyant-research.github.io/Zero-WAM/ 提供方法概览与真机演示;超参披露完整(学习率 $1\times10^{-4}$、chunk 采样 1–4、RoPE 偏移 $\Delta H=32$、IFP 权重 0.5/0.25/0.15/0.15、混采比 1:5 与 2:10:3)。不利条件:HumanGen 生成流水线依赖 Gemini 3.1 Pro/Qwen3.6-Plus、Nano Banana 2/Qwen-Image-2.0、Wan 2.7/Kling AI 3.0 等闭源或商用模型,提示词细节与打分过滤阈值未必全部公开;预训练需 15360 GPU 时(每 GPU 打包至 160K token),后训练另需 64 卡×4000 步;真机评测需要双臂 Franka 平台并自采演示数据。合理路径是复用其数据构建思想,在开源模型栈上做小规模验证。