← 返回 2026-08-25

WorldToken:面向机器人模仿学习的时间优先序列建模 WorldToken: Time-First Sequence Modeling for Robotic Imitation Learning

Chunkai Yang, Andong Yang, Chao Gao 📅 2026-08-23 👍 1 2026-08-30 18:30
Transformer 序列建模 扩散策略 机器人模仿学习 缩放定律 长时程记忆

每时间步压缩为一个世界token、以物理时间为轴的因果序列机器人模仿学习策略

前置知识

行为克隆

行为克隆(BC)是最直接的模仿学习范式:把专家演示中的观测-动作对当作监督数据,训练策略 $\pi_\theta(a|o)$ 最小化预测动作与专家动作的差异(MSE 或扩散噪声预测损失)。它不需要奖励函数,但存在协变量偏移问题:策略一旦偏离专家轨迹,会进入演示未覆盖的状态且缺乏恢复能力。

本文所有实验都是动作-only 的行为克隆,WorldToken 的扩散动作头、holdout RMSE 指标以及第 6 节讨论的 RMSE–SR 差距都建立在这一范式及其固有局限之上。

因果 Transformer

因果自注意力规定位置 $t$ 的表示 $h_t$ 只能访问 $z_{\le t}$ 而不能看到未来 token,这是 GPT 类解码器的核心约束。训练时用因果掩码并行处理序列窗口,推理时逐 token 追加。本文时序主干采用 Qwen2 解码器架构从头初始化,一维 RoPE 沿世界 token 序列编码物理时间。

WorldToken 的时序主干就是一个因果 Transformer,理解因果掩码与训练-推理一致性是读懂架构设计和历史截断实验的前提。

扩散动作头(DDPM/DiT/adaLN-Zero)

扩散模型通过逐步去噪生成数据:训练时对真实动作块加噪 $A_t^{(k)}=\sqrt{\bar\alpha_k}A_t+\sqrt{1-\bar\alpha_k}\epsilon$,网络学习预测噪声;推理时从高斯噪声出发迭代去噪。DiT 是用 Transformer 实现的去噪网络,通过 adaLN-Zero 调制把条件信息(历史表示 $h_t$、扩散步 $k$)注入每个块。

WorldToken 用 DiT 作为动作解码器,动作分布的多模态建模能力来自它;附录 E 还对比了高斯/GMM 直接解码头与扩散头的成败差距(47.48% vs 26.09%/44.00%)。

RoPE 旋转位置编码

RoPE 把位置信息编码为注意力中的相对旋转:query 和 key 各按自身位置旋转后,注意力得分只依赖二者的相对距离,不含绝对位置表。因此序列前端 token 被逐出窗口、其余 token 连续重编号后,相对时间几何完全不变。

论文的历史截断与滑动窗口实验正是利用 RoPE 的相对性:改变可见上下文长度只影响可见历史 token 的范围,不引入位置失真,使干预实验的解释非常干净。

闭环成功率与离线 RMSE

闭环成功率(SR)让策略在自身动作驱动的状态演化中完成任务,是二值任务级指标;离线 holdout RMSE 则在留出专家轨迹的固定观测历史上度量动作复现误差,是稠密连续指标。二者相关但不等价:RMSE 无法覆盖策略自诱导状态与恢复行为,动作误差小也可能因执行或判定细节而失败。

论文同时报告这两个指标,并用整个第 6 节与附录 F 分析其关系(全局 Spearman $\rho=-0.980$ 但局部不一致);不理解两者差别就读不懂实验结论的分寸。

策略时间步与动作块执行

策略时间步指一次观测-决策-重规划事件,可对底层控制步(本文 20 Hz)降采样(每 4 步一次,即 5 Hz)。动作块指一次预测的 $H=10$ 步动作序列;滚动时域执行只执行前 $H_{exec}=4$ 步便重新观测再规划,兼顾一定开环一致性与反应性。

本文的时间轴、上下文长度 $C$ 的单位(世界 token 数,0.24 秒/token)都以策略时间步定义;不明确这一概念就无法理解 145.92 秒上下文、一个交换周期约 116 个 token 这类数字。

研究动机

机器人策略正从短时程反应式控制走向大规模视觉-语言-动作序列建模,但对一个最基本的建模问题——序列中每个 token 应该代表什么——现有方法没有统一答案。RT-1 用 TokenLearner 把每帧压缩成多个视觉 token,使一个观测占据多个顶层位置;ICRT 把视觉与本体重组为状态 token 并与动作特征交错;GR-1 让语言、图像序列、机器人状态和未来图像预测共享一条 GPT 式序列;另一派则用循环隐藏态(BC-RNN)、显式记忆库(MemoryVLA、Mem-0)或检索机制携带历史。这些设计都能利用时间信息,但顶层序列位置混杂了模态、空间来源与生成角色,时间轴的物理粒度随设计漂移,不同架构之间的行为对比因此被混淆。与此同时性能门槛不断抬高:RoboCasa 上从零训练的官方 BC-Transformer 在 Gen-300 数据上仅 35.0%(本文复现 31.28%),而已公开的带大规模预训练的系统报告约 50–79% 成功率,大多需要 2–10B 参数骨干。

本文的目标是本文的目标是构造并系统刻画一个把物理时间放在第一位的策略实例 WorldToken:每个策略时间步——一次观测-决策-动作-再观测的闭环事件——在时间建模之前先把多视角图像、本体感知和语言条件融合成单个世界 token,使顶层因果序列的长度恰好等于策略决策数,与感知 token 数量完全解耦。围绕这一固定实例,论文回答三个经验问题:其一,仅用目标域数据、除冻结 CLIP 文本编码器外完全从零训练,能否学到有效的多任务控制,并随数据量与模型容量系统地缩放(23 个 RoboCasa 任务,5×5×2 因子扫描);其二,训练好的策略是否真的依赖它接收到的近期历史;其三,扩展可见上下文能否改善长时程的持续有序行为(RMBench Blocks Ranking 案例)。

与已有工作不同的是,独特之处在于把序列组织本身当作可干预的研究对象,而不是做组件消融式的性能竞赛。作者提出把 time-first 组织当作稳定接口:当顶层位置的语义固定为策略时间步时,感知压缩、时序计算和动作生成成为三个可分离的设计层,改动一层不会同时改变历史位置的含义,为受控归因提供干净基础。第二,论文严格区分了经常被混用的三个概念——历史可用性(架构能否接收历史)、历史必要性(任务是否部分可观测)与历史利用率(训练好的策略行为是否真的依赖历史):大输入窗口只证明可用性;同检查点截断(固定权重只改可见历史长度)测利用率;单独训练短上下文策略测适应性与必要性。第三,把缩放研究当作架构探针,用完整的 5×5×2(数据×模型×种子)因子扫描在单一从头训练的家族内刻画缩放行为,这种不挑最好看数字的完整因子设计在机器人学习文献中相当少见。

核心方法

WorldToken 的直觉是:机器人与物理世界的交互天然以时间为主线,正如文本 token 是语言序列的基本单位,策略时间步就是具身序列的基本单位。技术上策略分解为三个串联模块:$z_t=E_\theta(o_t)$ 把当前多模态观测压缩为一个世界 token;$h_t=T_\phi(z_{\le t})$ 用因果 Transformer 汇总历史得到历史条件表示;$A_t\sim D_\psi(\cdot|h_t)$ 由扩散头生成长度 $H=10$ 的动作块。输入为三个 128×128 相机视图、16 维本体感知和冻结 CLIP 文本编码器(768 维)给出的任务嵌入;环境以 20 Hz 控制,策略每 4 个控制步(5 Hz)决策一次。时序主干基于 Qwen2 解码器架构从头初始化,沿世界 token 序列加一维 RoPE,默认上下文 $C_{train}=10$ 个世界 token;超出后滑动淘汰最旧 token,RoPE 的相对位置特性保证重编号无失真。整个系统只对动作生成施加监督,不预测未来观测。

核心创新是『一个时间步一个 token』的时间优先组织:异构性在每个时间步内部解决(多模态融合严格发生在时间建模之前),顶层序列因此具有固定的物理粒度——长度等于策略决策数,与相机数、patch 数或模态特征数解耦。这与 RT-1/GR-1 等把模态特定 token 直接放进顶层序列、顶层位置混杂时间与模态结构的做法有本质区别;也不同于 BC-RNN/Chronos 把历史折叠进循环隐藏态,或 Mem-0/MemoryVLA 引入专门记忆子系统——WorldToken 没有记忆库、没有检索或更新规则,历史就是可直接注意的世界 token 序列。另一个反直觉选择是动作不入列:执行过的动作不写入序列,其效果只通过后续图像和本体感知回流($o_{t+1}\leftarrow\text{EnvStep}(\hat A_t^{exec})$ 供给 $z_{t+1}$),如同环境而非模型产生下一个输入。这一分解使感知压缩、时序建模、动作生成成为可独立替换的层,为受控归因提供接口。

方法步骤详情

完整流程四步。第一步,时间步内多模态编码:每相机 128×128 图像经五阶段 CNN stem(5×5 卷积,通道 96/144/192/384/768,各阶段 2×2 最大池化+GroupNorm+SiLU,输出 4×4×768 网格)变为视觉 patch token,加空间位置、视图、模态嵌入;本体感知与任务条件投影为 $u_t^{prop}$、$u_t^{task}$;拼接为时间步内序列 $X_t$,再附加 $R=4$ 个可学习读出 token,注意力掩码规定观测 query 不可关注读出 key、读出 query 可关注全部 key,读出 token 只聚合不干扰观测表示;最后 $z_t=W_z\,\text{RMSNorm}([r_t^1;\dots;r_t^4])$ 是唯一传入时序主干的 token。第二步,因果时序建模:Qwen2 架构主干处理 $z_1,\dots,z_t$,一维 RoPE 编码策略时间,因果掩码保证 $h_t$ 只依赖 $z_{\le t}$;窗口上限 $C$ 之外最旧 token 被淘汰并连续重编号。第三步,生成式动作解码:训练时加噪 $A_t^{(k)}=\sqrt{\bar\alpha_k}A_t+\sqrt{1-\bar\alpha_k}\epsilon$,DiT 去噪器以 $h_t$ 和扩散步 $k$ 经 adaLN-Zero 调制预测噪声,损失 $\mathcal{L}_{act}=\mathbb{E}_{t,k,\epsilon}\|\epsilon-\epsilon_\psi(A_t^{(k)},k,h_t)\|_2^2$;推理用 20 步余弦 DDPM 随机采样。第四步,滚动时域执行:每次规划只执行前 $H_{exec}=4$ 步,然后重新观测、追加世界 token、再规划。训练用 AdamW($\beta=(0.9,0.95)$,零权重衰减)、BF16、全局 batch 192、约 100 epoch(按 $D$ 从 5k 到 280k 步);编码器/时干学习率按容量从 $6.0\times10^{-4}$ 降到 $5.0\times10^{-5}$,动作头恒为 $3.0\times10^{-4}$。

技术新颖性

技术新颖性体现在四层。其一,序列组织层面:『一时间步一 token』把多模态融合限制在时间步内部,给出可直接用策略步数和秒数解释的上下文轴,这不同于 Decision Transformer/Gato 的 return-to-sequence 或跨具身序列化,也不同于把动作 token 插入序列的 ICRT。其二,历史处理层面:与循环压缩、显式记忆、检索三类设计相比,WorldToken 是最朴素的显式序列上下文,正是这种朴素性使同检查点截断实验干净可行——不改变任何机制,只改可见 token 范围。其三,与预测式世界模型的界限:world token 是物理时间对齐的策略表示而非预测状态,论文明确不用 $p_\omega(o_{t+1}|o_{\le t},A_t)$ 之类的未来预测定义表示,但指出附加预测目标是兼容扩展。其四,实证方法层面:完整 5×5×2 因子扫描、50 个策略、172,500 次闭环评估;把离线 RMSE 与闭环 SR 的分歧当作研究对象而非噪声;附录 G 逐结果标注 recovered-exact/repair-log/archived-only 的来源审计——这种系统性和透明度在机器人论文中罕见。

Detailed WorldToken architecture.
Figure 2: Detailed WorldToken architecture.

实验结果

(1)多任务控制:23 个 RoboCasa 家务任务上,85.3M 策略在每任务 2,900 条生成演示下取得两种子平均 59.45% 闭环成功率(最佳单次 60.1%),218.8M 达 60.26%(最佳单次 62.0%,即 713/1150);除冻结 CLIP 文本编码器外全部从零训练,进入十亿级预训练系统的公开成绩区间(约 50–79%)。同数据量 D=300 时 85.3M 达 46.83%,比官方代码复现的 BC-Transformer(31.28%)高 12–16 个百分点。任务级差异大:最佳运行中 TurnOffMicrowave 100%、CloseDrawer 96%,而 PnPCabToCounter 仅 18%。(2)数据缩放:40 个相邻数据增量配对全部同时改善 holdout RMSE 与闭环 SR;D 从 50 到 2900 使 RMSE 下降 47.0–56.8%、SR 上升 32.7–39.3 个百分点;RMSE 服从幂律 $\text{RMSE}_P(D)\approx a_P D^{-\alpha_P}$,$\alpha_P\in[0.151,0.211]$、$R^2\ge0.990$;但 D=1000→2900 时 RMSE 平均再降 17.10% 而 SR 只升 3.39 个百分点,闭环收益趋于饱和。(3)容量缩放:可靠收益集中在 44.3M→218.8M,648.9M 与 1.49B 不再一致超越;容量带来的 RMSE 收益随数据从约 5% 增至约 23%,类似语言模型的协调缩放。(4)历史利用:同检查点截断使全部 50 个策略在可见 1/2 步时下降(最小降幅 3.5/1.4 个百分点),5 步时 47/50 个策略与 10 步差距小于 2 个百分点;而单独训练 C=1 的策略达 46.75%/47.68%,几乎追回全部损失,且匹配上下文时 SR 在 C=5 反而最高(51.48%/50.00%),说明历史依赖主要是对训练上下文的适应而非任务内在需求。(5)长上下文案例:Blocks Ranking 上同一检查点可见历史从 608 降到 32 个世界 token(145.9s→7.7s),成功率从 95% 单调降至 28%;单交换任务 24/24 完全不受影响,5 交换任务在 C=64/32 全部失败;压力测试 9 条轨迹中 5 条在窗口开始滑动后继续正确执行,最长完成 31 次有序交换、最后一次正确交换在 856.44 秒,远超演示上限(最多 5 次交换)与单个上下文窗口(145.92 秒)。

Holdout stochastic RMSE and closed-loop SR when training and evaluation context lengths match.
Table 1: Holdout stochastic RMSE and closed-loop SR when training and evaluation context lengths match.
Blocks Ranking outcomes stratified by the number of swaps S in the reference solution.
Table 2: Blocks Ranking outcomes stratified by the number of swaps S in the reference solution.
Nine exploratory Blocks Ranking stress trajectories continued beyond first success.
Table 3: Nine exploratory Blocks Ranking stress trajectories continued beyond first success.
RoboCasa model configurations, parameter counts, and learning rates.
Table 5: RoboCasa model configurations, parameter counts, and learning rates.
RoboCasa training and closed-loop execution recipe.
Table 6: RoboCasa training and closed-loop execution recipe.
Per-task success of the best individual execution in the main RoboCasa sweep.
Table 12: Per-task success of the best individual execution in the main RoboCasa sweep.
Selected public RoboCasa Kitchen performance-scale reference.
Table 14: Selected public RoboCasa Kitchen performance-scale reference.
Temporal-placement diagnostic at D = 300, C = 10.
Table 15: Temporal-placement diagnostic at D = 300, C = 10.
Single-seed token-granularity diagnostic at the 85.3M-parameter, D = 300, C = 10 anchor.
Table 18: Single-seed token-granularity diagnostic at the 85.3M-parameter, D = 300, C = 10 anchor.
Single-seed action-decoder diagnostic at the 85.3M-parameter, D = 300 anchor.
Table 20: Single-seed action-decoder diagnostic at the 85.3M-parameter, D = 300 anchor.
Complete 5 × 5 RoboCasa sweep over dataset size and model size.
Figure 3: Complete 5 × 5 RoboCasa sweep over dataset size and model size.
Scaling of holdout stochastic RMSE on logarithmic axes.
Figure 4: Scaling of holdout stochastic RMSE on logarithmic axes.
History truncation of the same trained policy.
Figure 5: History truncation of the same trained policy.
Holdout RMSE during training and final closed-loop performance under different context lengths.
Figure 6: Holdout RMSE during training and final closed-loop performance under different context lengths.
One episode under two visible-history lengths.
Figure 7: One episode under two visible-history lengths.
Holdout stochastic RMSE versus closed-loop SR for all 50 trained policies.
Figure 8: Holdout stochastic RMSE versus closed-loop SR for all 50 trained policies.
查看结构化数据
任务指标本文基线提升
RoboCasa 23 任务闭环控制(D=2900,从零训练) 任务平均闭环成功率 59.45%(85.3M,两种子均值)/ 60.26%(218.8M),最佳单次 62.0% 本地复现 BC-Transformer(官方代码,D=300)31.28%;带大规模预训练的公开系统约 50–79%(协议不一) 同数据量(D=300)超 BC-Transformer 基线 12–16 个百分点;85M 从零训练进入预训练大系统性能区间
RoboCasa 数据缩放(5 个数据量 × 5 个模型 × 2 种子) holdout stochastic RMSE / 闭环 SR 40/40 个相邻数据增量配对同时改善;D 50→2900 时 RMSE 降 47.0–56.8%,SR 升 32.7–39.3 个百分点;幂律指数 $\alpha$=0.151–0.211($R^2$≥0.990) D=50 起点各配置 数据增益方向完全一致;但 D=1000→2900 段 RMSE −17.10% 仅换来 SR +3.39 个百分点
RoboCasa 模型容量缩放 holdout RMSE / 闭环 SR 44.3M→218.8M 在所有数据量下降低 RMSE(D=2900 时收益约 23%);648.9M/1.49B 无一致增益 44.3M(每数据量下最小模型) 可靠的容量收益集中在 44.3M–218.8M 区间;更高容量回报消失
RoboCasa 同检查点历史截断(50 个策略) 闭环 SR 变化(相对 C_test=10) C_test=1/2 时全部 50 个策略下降,最小降幅 −3.5/−1.4 个百分点;C_test=5 时 47/50 个策略差距 <2 个百分点 C_test=10(训练上下文) 证明近期历史被所有策略系统性使用,且约 5 个策略步即可捕获大部分闭环收益
RMBench Blocks Ranking(100 回合,同一检查点) 评估器成功率(可见历史 C 变化) C=608/288/128/64/32 对应 95%/92%/59%/38%/28%;单交换任务 24/24 全部成功 C=32(7.68 秒可见历史)28% C=608(145.92 秒)相对 C=32 提升 67 个百分点,收益集中在多交换有序任务
Blocks Ranking 长时程压力测试(9 条轨迹,越过首次成功继续) 连续正确有序交换次数 最长 31 次交换(其中 26 次在窗口滑动后),最后一次正确交换于 856.44 秒 训练演示最多 5 次交换;C=608 上下文跨度仅 145.92 秒 行为持续时程约为上下文窗口的 5.9 倍,说明策略学到周期性规则而非记忆轨迹前缀

局限与改进

作者明确承认的边界:所有证据来自仿真和纯动作模仿学习;主缩放研究只在单一 WorldToken 家族内进行,扩展上下文证据集中在 Blocks Ranking 一个案例;实验未隔离各组件贡献,也未在完全匹配条件下与替代序列组织比较;未测试真机不确定性、显式动作历史、预测目标或系统级效率;结果只支持『完整实例在测试配方下可行』,不支持时间优先原则本身相对其他组织的优越性。我的补充观察:Blocks Ranking 的 95/100 是开发注册表结果——检查点在该注册表上选择,并非独立留出测试;该任务 13/100→95/100 的跃升依赖一个专为按钮按压深度定制的训练损失(沿左臂下降方向设 1.5–4mm 零损失走廊),属于任务特定工程;本地 BC-Transformer 基线非配方匹配(优化器、50 万步、观测与执行节奏均不同),『进入十亿级区间』只是规模参照而非受控对比;SR 的固定种子重复绝对幅度最大 4.09 个百分点、跨种子最大 24.78%,许多小差异无法统计分辨;单 token 压缩可能是信息瓶颈——附录 E 的 K=50 诊断(55.31× FLOPs)单种子下同时更低 RMSE(0.13230 vs 0.13680)和更高 SR(49.57% vs 47.48%);扩散头每次规划需 20 次前向,论文未测延迟与内存。

独立分析的弱点

独立分析的弱点:(1)单 token 瓶颈。每步压成一个 $d$ 维向量对多视角视觉输入是激进压缩,K=50 单种子诊断提示保留更多 token 可能有益;改进方向是可学习的自适应压缩率或层级 token 预算,让信息密集的时间步保留更多内容。(2)动作不入列。默认模型假设观测足以恢复动作影响,但接触事件、遮挡下的自身运动等动作信息未必可从观测推断;改进方向是把执行动作作为辅助 token 显式入列(论文自己也列为扩展)。(3)离线-闭环转换不均。RMSE 持续下降而 SR 饱和(D=1000→2900:RMSE −17.10% vs SR +3.39 个百分点),说明行为克隆缺少策略自诱导状态下的恢复数据;改进方向是引入失败状态演示、在线交互或 DAgger 式校正采集。(4)二值成功判定脆弱。Blocks Ranking 标准损失策略在 99/100 回合都能排出正确顺序,却因按钮按压差不到 5mm(最深 −4.65mm,中位 −0.54mm)而 87 次失败,需定制损失才到 95/100,暴露评测判定与行为质量的错位;改进方向是把执行精度纳入目标或改用更丰富的连续评分。(5)实证范围窄。仅两个仿真基准、一个长时程案例、基线非严格匹配,时间优先相对替代组织的优势仍是开放问题;改进方向是在匹配数据与算力下与多 token/记忆式设计做受控缩放对比。(6)推理成本。每次规划 20 步 DDPM 加时序前向,每 4 个控制步一次,实时性与延迟未经测量;可考虑步数蒸馏或一致性模型加速。

未来方向

作者提出或暗示的方向:把时间优先序列同时作为未来观测生成建模 $p_\omega(o_{t+1}|o_{\le t},A_t)$ 的条件结构,使世界 token 升级为预测式世界模型状态;联合设计时间压缩与主动感知——具身智能体能通过动作和视角重新获取所需视觉细节,因此不必为整个历史保留高带宽表示,紧凑时间表示与按需感知可以协同设计;显式加入执行动作历史;在完全匹配条件下与替代序列组织做比较研究;把缩放研究扩展到更大数据、模型、上下文和任务时程;真机验证与不确定性量化。基于本文成果可延伸的:利用因果前缀在 20 个去噪步间共享 KV 缓存以加速推理;把 Blocks Ranking 的周期行为外推现象(31 次交换、856 秒)作为『策略学到规则而非记忆轨迹』的范例,研究上下文记忆与参数化技能的组合机制;在 RMBench 等记忆依赖基准上系统扫描上下文长度与数据量的交互,量化『多长的物理时间上下文值多少成功率』;在该接口上接入 RL 微调,在世界 token 序列上做策略改进;以及探索单 token 与多 token 粒度的混合调度,验证 K=50 诊断的初步信号。

复现评估

复现评估:论文承诺公开训练与评估代码、物化的运行配置、冻结的评估注册表、图表重建脚本及归档构建值,但截至成文代码尚未释出,需关注后续发布。数据完全公开:RoboCasa 官方基准(每任务 50 条人类演示引导 MimicGen 生成约 3,000 条演示)与 RMBench 均为公开资源。算力需求高:主扫描训练 50 个策略(44.3M–1.49B),每数据规模约 100 epoch(5k–280k 步),使用两台单机服务器(8×A100-80GB 与 8×H100-80GB),闭环评估共 172,500 回合;但复现单个 85.3M 策略单节点即可。主要开销在评测:每个检查点需 3 次 × 1,150 回合闭环评估。工程注意点:作者记录了实验服务器被攻破、主运行存储被删除后从离线副本重建归档的全过程(附录 G 逐项标注 recovered-exact/repair-log/archived-only),个别单元格(如 seed-1、D=2900、1.49B 的 RMSE)只有归档值;附录 B 公开了超参数的单次校准来源。总体复现难度中等偏高:架构与配方描述完整、协议明确,但完整复刻 5×5×2 扫描与 17 万次仿真评估需要相当大的算力和时间。