WorldDiT:面向世界建模与动作建模的统一扩散架构 WorldDiT: A Unified Diffusion Architecture for World and Action Modeling
统一扩散Transformer融合动作生成与未来视觉预测,无需大型VLM即可达LIBERO前沿
前置知识
扩散策略(Diffusion Policy)
扩散策略是一种将机器人动作建模为去噪过程的生成式控制方法。它从一个高斯噪声样本出发,通过学习到的去噪网络逐步推断出一段连续动作(称为action chunk),而不是逐个token自回归地生成离散动作。其优势在于能建模多模态的动作分布、生成平滑且鲁棒的运动,并天然支持chunk级别的轨迹规划。WorldDiT使用其变体——流匹配(flow matching)来训练连续动作生成。
WorldDiT的核心是用一个共享的扩散Transformer同时生成动作chunk和视觉patch,理解扩散策略才能理解它的动作路径如何在20个Euler步内从噪声积分出7步动作。
流匹配(Flow Matching)
流匹配是扩散生成的一种简洁数学形式:定义从噪声到数据的直线路径 $x_ au=(1-\tau)\boldsymbol{\epsilon}+\tau y$,其中$\tau\in[0,1]$,并训练网络$v_\theta$去回归这条直线的速度$y-\boldsymbol{\epsilon}$。采样时从噪声出发用ODE积分器(如Euler)沿学到的速度场前进即可生成样本。相比传统DDPM,流匹配目标更简单、训练更稳定、易于用少量步数采样。
WorldDiT的动作和RGB patch都使用同一套流匹配目标 $\mathcal{L}_{flow}=\mathbb{E}\|v_\theta(x_\tau,\tau,c)-(y-\boldsymbol{\epsilon})\|_2^2$,掌握这个公式才能看懂损失如何统一。
视觉-语言-动作模型(VLA, Vision-Language-Action Model)
VLA指一类以大型预训练视觉-语言模型(VLM,如PaLI、GPT-4V级别模型)为骨干,附加动作生成头(通常是自回归token生成)的机器人策略。代表方法有OpenVLA、$\pi_0$、GR00T N1等。它们通过继承VLM的感知与语言理解获得强泛化,但参数往往达到数十亿,部署计算开销大,且难以分离骨干与架构各自的贡献。
WorldDiT的全部动机就是质疑'必须用大型VLM做动作骨干'这一范式,并证明399M参数的非VLM模型可以站上Pareto前沿。看懂VLA才能理解本文的对照系。
LIBERO操作基准
LIBERO是机器人操作的标准仿真benchmark,包含四个下游任务套件:libero_spatial(空间泛化)、libero_object(物体泛化)、libero_goal(目标泛化)、libero_10(又称LIBERO Long,长程多阶段任务),以及一个大任务量多任务预训练分割libero_90。每个套件由语言指令、多视角RGB、机器人状态和动作轨迹组成。报告时常用四套件的平均成功率作为综合指标。
本文全部定量结果都在LIBERO上,且Long是公认最难的套件,WorldDiT在Long上的91.8%与对比方法形成鲜明差异,理解LIBERO才能解读Table 1。
动作分块与退避视野控制(Action Chunking & Receding Horizon Control)
动作分块指一次生成多步动作(chunk)而非一步,可降低决策频率并提升轨迹平滑性。退避视野控制(MPC风格)指执行chunk的前几步、再用新观测重新规划。WorldDiT一次生成$H=7$步动作chunk,但只执行前3步,然后用更新的3步上下文重新采样,并对重叠时间段做时序集成(temporal ensembling)。
理解这套'生成7步/执行3步/重规划'的部署节奏,是看懂WorldDiT推理效率和94.9%成功率如何被实测出来的关键。
Diffusion Transformer(DiT)与AdaLN-Zero
DiT是用Transformer替代U-Net作为扩散去噪骨干的架构,通过patch化输入、AdaLN-Zero(自适应LayerNorm且输出投影初始化为零)做条件注入,在大规模图像视频生成中表现优异。WorldDiT骨干为depth 4、hidden 1024、16 heads、4 register tokens,每个token用AdaLN-Zero调制。
WorldDiT的主体就是这个小型DiT,理解AdaLN-Zero和register token才能看懂Figure 3的架构图与为何能在135M可训练参数下收敛。
研究动机
近年来大量机器人策略都沿袭语言建模的套路:把动作生成挂到一个大型预训练视觉-语言模型(VLM)上,例如OpenVLA、$\pi_0$、$\pi_0.5$、GR00T N1、MMaDA VLA等,参数量动辄数十亿(如$\pi_0$约3B以上)。这种范式虽然带来了广泛的感知与语言理解,但带来一个根本性困难:当策略包含数十亿参数时,强控制能力究竟来自动作设计、预训练骨干还是二者组合,几乎无法分离。这意味着'架构本身是否有效'被规模掩盖,难以指导紧凑、可部署系统的设计。Table 1中可以看到,无大型VLM骨干的方法(如Diffusion Policy 72.4%、Octo 75.1%、DiT Policy 82.4%)平均成功率普遍明显低于VLA方法,似乎暗示必须堆叠参数。
本文的目标是本文目标是构建一个统一的扩散Transformer架构WorldDiT,把连续动作生成与未来视觉世界预测耦合在同一个骨干里,验证在完全不使用大型预训练VLM作为动作骨干的前提下,能否在LIBERO基准上达到强控制性能、并落在'总参数量-平均成功率'的Pareto前沿上。具体地,作者希望给出一个亚十亿(sub-billion)参数的可复现基线,为后续的规模化研究提供清晰对照点,而非声称发现了某种缩放规律。
与已有工作不同的是,WorldDiT的独特切入角度有三点。第一,与依赖大型VLM自回归生成离散动作token的近期world-action模型不同,WorldDiT用单一共享DiT骨干同时建模连续动作和归一化RGB patch,二者共享同一流匹配公式。第二,未来RGB patch目标只在训练时提供辅助监督,部署时完全走纯动作路径,RGB token和RGB预测头不在推理计算图内——这是'训练用世界、部署只动'的关键不对称设计。第三,它把'世界-动作联合建模'作为紧凑架构的基底,而非把世界建模留给巨型VLM,从而在399M总参数(135M可训练)上挑战VLA的统治地位。
核心方法
WorldDiT的直觉很简单:让一个模型同时学会'下一步该做什么动作'和'动作执行后世界长什么样',后者为前者提供更密集的监督。技术路线上,给定语言指令$\ell$、时间排序的多视角观测(主相机图$I_i^p$、腕部相机图$I_i^w$)和机器人状态$s_i$,先用冻结MAE图像编码器、共享Perceiver Resampler、冻结CLIP文本编码器和可训练机器人状态编码器把每个时间步编码为token序列(每slot 34视觉+1语言+1状态=36个clean token)。训练窗口$N=10$步:前$C=3$步作观察上下文,再预测$H=7$步动作chunk $A_i\in\mathbb{R}^{7\times7}$,并在最后slot预测来自第$i+H$帧主/腕相机的128个归一化RGB patch目标 $Y_i^{rgb}\in\mathbb{R}^{128\times768}$。所有目标token加上高斯噪声和流时间,喂给深度4、hidden 1024、16 heads、4 register tokens的统一DiT骨干,用AdaLN-Zero调制,输出每token的流速度。
核心创新是'未来RGB patch作辅助训练信号、推理时缺席'的不对称设计。训练时,DiT对动作token和RGB patch token用同一套流匹配目标预测速度 $\mathcal{L}_{total}=w_{action}\mathcal{L}_{action}^{flow}+w_{rgb}\mathcal{L}_{rgb}^{flow}$,权重取$w_{action}=0.1$、$w_{rgb}=0.001$,使世界预测目标起到正则化与表征塑形作用。部署时只有动作token进入骨干:从高斯噪声 $x_{t,0}^{act}\sim\mathcal{N}(0,I)$ 出发,沿学到的速度场 $v_\theta^{act}$ 用20个Euler步积分到 $\hat{A}_t=x_{t,1}^{act}$,解码出7步动作。这与OpenVLA式自回归VLA有本质区别——WorldDiT不产生任何离散token、推理时完全不需要RGB预测头。另一关键设计是严格block-causal注意力:动作query不能读取被噪声污染的RGB目标token,避免未来视觉信息泄露到动作生成,而clean context token始终不被破坏。
方法步骤详情
完整流程分四步。第1步构造训练窗口:把原始示范转换为定长$N=10$窗口,含3步clean context、7步动作chunk和1个未来RGB patch目标;CLIP预处理把224×224帧切成16×16 patch(768维),每个patch用自身均值方差归一化,每相机保留64个均匀分布patch,两相机共128个目标token。第2步多模态编码:冻结MAE+Perceiver Resampler生成34视觉token、冻结CLIP生成1语言token、可训练编码器把arm和gripper分量分别编码后拼成1状态token,每slot共36个clean token;动作与RGB目标用可训练线性投影映射到hidden维。第3步流匹配训练:$\boldsymbol{\epsilon}\sim\mathcal{N}(0,I)$,$\tau\sim U[0,1]$,构造 $x_\tau=(1-\tau)\boldsymbol{\epsilon}+\tau y$,骨干回归速度$v_\theta$,目标速度$y-\boldsymbol{\epsilon}$;总损失为动作与RGB加权之和,损失只施加在最终时间slot。先在libero_90多任务分割预训练30 epoch(per-GPU batch 40、梯度累积2、lr $1\times10^{-4}$余弦+1 warmup),再在8卡RTX Pro 6000上对每个下游suite独立微调(有效batch 512、bf16)。第4步推理:从噪声出发生成7步动作chunk,执行前3步、滑动上下文、重规划,并对重叠绝对时间动作做时序集成,共20 Euler步、headless EGL渲染,每suite 500 episode。
技术新颖性
技术新颖性集中在四点。其一,首次把'未来归一化RGB patch预测'作为辅助监督显式接入一个共享DiT骨干,并通过严格block-causal注意力保证动作query无法窥视未来视觉token,使世界目标不退化成捷径。其二,'训练有世界、推理无世界'的不对称设计让辅助目标不增加任何推理开销,RGB预测头在部署图中被剔除,这是与DreamVLA、WorldVLA等必须保留世界解码的方法的关键区别。其三,把动作与视觉统一到同一流匹配公式与同一骨干,二者共享AdaLN-Zero调制和register token,无需为世界分支另设网络。其四,在超亚十亿参数尺度(399M总、135M可训练)上系统对照24种方法(含大量VLA),并明确报告其位于参数-成功率Pareto前沿,为'是否必须用大型VLM做动作骨干'提供了清晰的负面反例。
实验结果
核心结果:WorldDiT用399.084M总参数(含推理必需的冻结模块)和135.107M可训练参数,在四个LIBERO suite上各跑500 episode,取得Spatial 98.0%、Object 97.0%、Goal 92.8%、Long 91.8%,平均成功率94.9%。Long suite最困难,符合其长程多阶段任务要求,而WorldDiT在Long上的91.8%大幅高于多数VLA(如$\pi_0$ FAST仅60.2%、CoT VLA 69.0%、WorldVLA 59.0%、SpatialVLA 55.5%、OpenVLA 53.7%)。Figure 1显示WorldDiT点位于报告的Pareto前沿:在所有报告四suite均值的方法中,每个成功率高于94.9%的方法都用了更多总参数(如ACoT VLA 98.5%、MMaDA VLA 98.0%、VLANeXt 97.4%均含大型VLM骨干),而每个总参数$\le$399M的方法成功率都更低。作者特别说明94.9%聚合含每suite 300个用于staged checkpoint选择的episode,并非完全held-out的无偏估计。Table 1按'是否用大型预训练VLM作动作骨干'分组,WorldDiT是无VLM组唯一站上94%的方法,紧随其后的DreamVLA为92.6%、FlowVLA 88.1%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| LIBERO Spatial(空间泛化) | 500 episode成功率 | 98.0% | OpenVLA 84.7%,Diffusion Policy 78.3% | 比OpenVLA高13.3个百分点,且参数少一个量级以上 |
| LIBERO Object(物体泛化) | 500 episode成功率 | 97.0% | Octo 85.7%,DiT Policy 96.3% | 与最强无VLM方法DiT Policy相当,但在其余三suite更均衡 |
| LIBERO Goal(目标泛化) | 500 episode成功率 | 92.8% | Diffusion Policy 68.3%,FlowVLA 91.6% | 略高于FlowVLA,显著高于Diffusion Policy(+24.5) |
| LIBERO Long(长程多阶段) | 500 episode成功率 | 91.8% | $\pi_0$ FAST 60.2%,CoT VLA 69.0%,WorldVLA 59.0% | 相对VLA在Long上的普遍短板表现尤其突出(+22~33个百分点) |
| 四suite平均成功率 | mean success | 94.9%(399M总参数) | OpenVLA 76.5%(更大),$\pi_0$ 94.2%(更大) | 在亚十亿参数下站上Pareto前沿,超越$\pi_0$且参数少数倍 |
局限与改进
作者自己承认的局限有四点。第一,94.9%聚合包含每suite 300个用于checkpoint选择的episode,因此不是完全held-out的无偏测试估计,不应解读为通用上界。第二,由于对照方法的模型权重和训练代码未完整公开,作者无法在共享协议下复现它们,只能采用各报告的引用分数,参数量也多为重建的近似值。第三,论文只评估单一WorldDiT配置,目的是提供基线而非声称缩放规律。第四,结论限于LIBERO仿真。我自己观察到更多局限:(1)完全未在真实机器人上验证,仿真到实机的sim-to-real差距未知;(2)RGB patch损失权重($w_{rgb}=0.001$)相对动作($w_{action}=0.1$)极小,且未做消融,'世界建模到底带来多少增益'缺乏直接证据;(3)冻结MAE+CLIP意味着继承其数据偏置,且依赖CLIP预处理(224×224、16×16 patch),高分辨率细节丢失;(4)'执行前3步、重规划'的节奏与20 Euler步是否对实时控制够快未给出延迟数据。
独立分析的弱点
第一个弱点是辅助世界目标的有效性未被消融验证。$w_{rgb}=0.001$极小,作者未报告'去掉RGB分支'或'改变权重'的对照,读者无法判断94.9%中有多少来自世界建模而非DiT骨干本身;改进方向是给出系统消融,并尝试动态权重或多阶段课程。第二个弱点是仅在LIBERO仿真评估,且用300 episode选checkpoint引入乐观偏差;改进方向是在真实机器人平台验证,并用严格held-out episode重测。第三个弱点是冻结编码器(MAE、CLIP)的选择可能限制泛化;改进方向是评估不同冻结编码器或部分解冻以适配机器人数据分布。第四个弱点是上下文仅$C=3$步、动作chunk $H=7$步、执行3步,对长程记忆可能不足,Long仍是四者最低也印证此点;改进方向是引入显式记忆机制或增大上下文。第五个弱点是部署效率数据缺失——20 Euler步与动作集成在真实控制频率下的延迟未报告;改进方向是给出推理时延并探索少步蒸馏以降低积分步数。
未来方向
作者明确提出的未来方向有二:一是研究归一化未来RGB目标如何塑造控制行为,以及相同的参数-成功率权衡在更大规模上是否仍然成立;二是由于动作与视觉目标共享流匹配公式,WorldDiT可支持分解为独立训练的专家(如Paris、Paris 2.0思路),适配异构硬件与算力受限的机器人平台。基于成果可延伸的方向包括:将world-action联合建模迁移到真实机器人并测试sim-to-real;把未来视觉目标从patch级扩展到更结构化的潜在表示以提升监督密度;用更大规模真实操作数据做缩放研究;探索少步蒸馏或一致性模型把20 Euler步压到1-4步以提升实时性;研究把世界分支用于不确定性估计、安全约束或模型预测控制(MPC)式规划;以及把同一统一骨干推广到双臂、灵巧手或全身控制等多自由度场景。
复现评估
复现性中等偏弱。论文详细给出架构(depth 4、hidden 1024、16 heads、4 register tokens、每slot 36 token)、训练窗口($N=10,C=3,H=7$)、目标构造(224×224、16×16 patch、每相机64 patch共128 patch)、损失权重($w_{action}=0.1,w_{rgb}=0.001$)、优化与调度(lr $1\times10^{-4}$余弦+1 warmup、per-GPU batch 40、梯度累积2、bf16)、预训练(libero_90多任务30 epoch)和评估协议(20 Euler步、执行3步重规划、temporal ensembling、每suite 500 episode、headless EGL),硬件为单节点8×RTX Pro 6000,算力门槛明确。但代码与权重未在论文中给出公开链接(作者坦言'模型权重和训练代码公开不完整'),冻结MAE/CLIP检查点、Perceiver Resampler与状态编码器实现细节、checkpoint选择阈值也未完全披露;对照方法采用各报告引用分数而非统一复现,参数量为重建近似值。整体上凭论文可大致复现主流程,精确复现94.9%需补齐未公开细节。
论文图表