DyPES-VLA:学习共享动力学先验与本体特化控制的跨本体机器人操作 DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation
用未来预测学共享动力学先验,MoE动作头生成各本体原生动作,单一检查点跨三类机器人
前置知识
视觉-语言-动作模型(Vision-Language-Action, VLA)
VLA 模型建立在预训练视觉语言模型之上,将视觉观测、自然语言指令作为输入,输出可执行的动作序列,从而实现机器人操作。其核心思想是把大规模预训练带来的语义理解能力迁移到具身决策上。代表性工作如 RT-2、π0、OpenVLA 等。VLA 通常以端到端方式训练,把感知、理解和控制压缩进单一神经网络,相较于传统模块化方案(感知→规划→控制)具有更强的泛化性和更少的工程开销。
本文正是 VLA 范式下的工作,理解 VLA 如何把多模态输入映射为动作,是理解 DyPES-VLA 把观测、指令、本体元数据映射为各本体动作这一整体设计的基础。
跨本体(Cross-Embodiment)学习
跨本体学习指用一个策略同时控制结构、自由度、动作空间都不同的多种机器人(如单臂、双臂、人形)。难点在于:不同本体的动作维度(如 7-DoF 单臂、14-DoF 双臂、29-DoF 人形)和控制语义各异,传统做法需通过坐标变换或逆运动学把异构动作手动对齐到统一格式。关键问题是:哪些知识应该跨本体共享,哪些必须保持本体特化。Open X-Embodiment 数据集正是为这一方向提供大规模异构数据。
跨本体是本文的核心问题域,作者的全部方法(共享动力学先验 + 本体特化 MoE 动作头)都是为了回答『跨本体时什么该共享、什么该特化』,不懂这个概念就无法理解动机和方法。
混合专家网络(Mixture-of-Experts, MoE)
MoE 是一种条件化计算结构,它维护多个并行的『专家』子网络(如前馈网络),并由一个路由器根据输入选择激活其中一部分。这样可以在不显著增加推理计算量的情况下扩大模型容量。本文采用的是静态路由:路由索引由本体元数据确定性给出 $r(e) \in \{1,\ldots,K\}$,每个本体对应一个固定的编码器、前馈专家和解码器,而注意力层在所有本体间共享。这种『共享注意力 + 路由专家』的分工直接对应了『共享时序结构 + 本体特化控制语义』的设计思想。
MoE 动作头是本文三大组件之一,也是实现本体特化控制的关键机制。理解 MoE 的路由与专家分工,才能理解作者如何避免把异构动作强行统一,同时又不让不同本体互相干扰。
流匹配(Flow Matching)与扩散Transformer(DiT)
流匹配是一种生成建模方法,把生成过程视为从噪声分布到数据分布的连续流。对于目标样本 $z$ 和噪声 $\epsilon$,构造线性插值 $z_\tau = \tau z + (1-\tau)\epsilon$,模型学习预测指向数据的速度向量 $z - \epsilon$,损失为 $\|\hat{V} - (z-\epsilon)\|_2^2$。DiT(Diffusion Transformer)是把 Transformer 用作去噪骨干的架构,通过自适应层归一化(AdaLN)把流时间步 $\tau$ 作为条件注入。相比高斯扩散,流匹配目标更简洁、训练更稳定,且可用少数欧拉步采样。本文用 Beta 调度 $\tau=s(1-u), u\sim\text{Beta}(1.5,1.0)$ 让采样质量集中在高噪声端。
本文的未来生成头和动作头都是流匹配 DiT,动作头更是 16 层 DiT 从零训练。理解流匹配的损失形式和时间步采样,才能看懂公式 $\mathcal{L}_{\text{future}}$ 和 $\mathcal{L}_{\text{action}}$,也才能理解为何推理只需 4 步欧拉积分。
未来预测监督与查询令牌(Query Tokens)
未来预测监督指让模型从当前观测生成未来帧,从而迫使内部表示编码物体运动、接触、场景演化等动力学规律。本文引入一组可学习查询令牌 $Q \in \mathbb{R}^{N\times d_{\text{VLM}}}$($N=96$),拼接到多模态序列末尾经 VLM 单次前向得到查询状态 $Z$。关键设计是:未来生成头只条件于 $Z$(不给当前观测),因此合成未来所需的信息必须全部经由 $Z$ 流过,这把 $Z$ 变成『共享动力学先验』的载体,也是未来预测与动作生成之间的共享接口。推理时未来生成头被丢弃,$Z$ 直接喂给动作头。
查询令牌 + 未来预测监督是本文最核心的创新,是『共享动力学先验』的物理实现。理解这一点才能区分 DyPES-VLA 与世界-动作模型(WAM)的本质不同:本文只用未来预测学习表示,把动作生成留给专用动作头。
研究动机
训练一个能控制异构机器人的通用策略是机器人学习领域的开放难题。现有跨本体 VLA 方法存在两个具体局限。第一,它们几乎只把动作预测作为唯一监督信号,导致『共享动力学先验』只能从动作标签中学到,严重浪费了海量人类操作视频和机器人交互视频中反复出现的物体运动、接触、场景演化规律。第二,许多方法在动作层面共享信息,需要通过坐标变换或逆运动学把异构控制手动映射成统一动作格式(如共享末端执行器坐标系)。这种预处理虽然能粗略捕捉轨迹,却把本该分离的两件事纠缠在一起——跨本体共享的交互规律 与 各机器人独有的控制语义——而且随机器人形态增多扩展性很差。结果是单一策略在 LIBERO(7-DoF 单臂)、RoboCasa-GR1(29-DoF 人形)、RoboTwin 2.0(14-DoF 双臂)这类差异巨大的本体之间难以同时表现优异。
本文的目标是本文的目标是提出一套跨本体学习范式,用一个协同训练的单一检查点,同时控制单臂、双臂、人形三类机器人,且各机器人使用其原生动作空间、无需手动对齐到统一格式。具体地,作者希望把『跨本体共享的交互规律』与『各本体独有的控制语义』在架构上解耦:前者通过一个与本体无关、可从无动作视频中学到的共享表示来承载;后者通过本体特化的动作解码模块来生成各机器人的原生动作块。同时要验证:在 LIBERO、RoboCasa-GR1、RoboTwin 2.0 三个仿真基准和 FR3 单臂、COBOT Magic 双臂、Unitree G1 人形三个真实平台上,单一检查点能否达到或超过专门训练的专家策略。
与已有工作不同的是,本文的独特切入角度是:把共享接口从『动作层面』上移到『未来预测监督的查询状态层面』,并让动作生成保持本体特化。与把异构动作统一到公共动作空间的方法不同,DyPES-VLA 不做动作对齐;与世界-动作模型(WAM,如 UWM、LDA-1B、Fast-WAM)把未来预测与动作生成耦合不同,DyPES-VLA 仅用未来预测来正则化共享查询表示 $Z$,把动作生成完全交给一个本体特化的 MoE 动作头,推理时丢弃未来生成头。这种『共享注意力层捕捉通用时序结构 + 静态路由的本体专家解析各自运动学约束』的分工,本质上对应了跨本体应共享什么、应特化什么这一核心问题的清晰回答。
核心方法
DyPES-VLA 的直觉是:物体如何运动、何时接触、场景如何演化这类规律跨本体通用,应用与动作无关的监督信号学习;而每个机器人如何把意图变成关节/末端指令则高度本体特化,应由专用模块解析。技术路线上模型含三组件:(1) 预训练 VLM(Qwen3-VL-2B)把观测 $o_t$、指令 $\ell$、本体元数据 $m_e$ 与 96 个可学习查询令牌 $Q$ 拼接,单次前向得查询状态 $Z$,作为两头的共享接口;(2) 未来生成头(SANA-600M)只条件于 $Z$ 合成未来帧,迫使 $Z$ 编码物体运动、接触、场景变化等动力学先验;(3) 本体特化 MoE 动作头(16 层流匹配 DiT,$K{=}3$ 专家)把 $Z$ 解码为各本体原生动作块。训练分两阶段:先在无动作视频上用未来预测目标预训练,再在带标签多本体演示上联合优化,总损失 $\mathcal{L}{=}\mathcal{L}_{\text{action}}{+}\lambda_w\mathcal{L}_{\text{future}}$,$\lambda_w{=}0.05$,推理丢弃未来头。
核心创新点有三。其一,把跨本体『该共享什么』的位置从动作层上移到查询状态层:用未来预测监督(而非动作标签)驱动一组共享查询令牌承载动力学先验,因此可以从无动作的人类与机器人视频中学习,突破了『只能从动作标签学共享知识』的瓶颈。其二,把『该特化什么』交给静态路由的 MoE:注意力层全本体共享以捕捉通用时序动作结构,而前馈专家、编码器、解码器按本体索引 $r(e)$ 路由,直接在各本体原生动作空间生成动作,无需统一动作格式。其三,与世界-动作模型(WAM)的本质区别在于解耦——WAM 把未来预测与动作生成耦合在一个流中,而 DyPES-VLA 让未来预测只负责塑造 $Z$,动作生成由独立动作头完成,推理时丢弃未来生成头,从而避免把视觉生成质量与控制精度纠缠。
方法步骤详情
**阶段一(动力学先验预训练,100k 步):** 输入为无动作视频(EgoDex 50% + 三个仿真基准 20/20/10%)。VLM 编码 $[\phi_v(o_t),\phi_\ell(\ell),\phi_\ell(m_e),Q]$ 得 $Z$($N{=}96$);冻结自编码器把未来帧 $x_{t+\Delta_e}$ 编为潜变量 $z$($\Delta_e$ 随本体地平线 $H_e$ 变化);SANA 头经投影 $p_\omega(Z)$ 条件化,整流流损失 $\mathcal{L}_{\text{future}}{=}\mathbb{E}\|g_\psi(z_\tau,\tau,p_\omega(Z))-(z-\epsilon)\|_2^2$,$z_\tau{=}\tau z+(1-\tau)\epsilon$。**阶段二(跨本体协同训练,200k 步):** 输入为带标签演示(RoboTwin/RoboCasa/LIBERO = 40/40/20%)。动作头把噪声块 $A_e^\tau{=}\tau A_e+(1-\tau)\epsilon$ 经本体编码器送入 16 层 DiT,每块执行共享注意力 $\bar{X}{=}X{+}\text{Attn}(\text{AdaLN}(X,\tau);Z)$ 与路由 FFN $X'{=}\bar{X}{+}\text{FFN}^{(r(e))}(\text{AdaLN}(\bar{X},\tau))$,本体解码器输出速度 $\hat{V}$,损失 $\mathcal{L}_{\text{action}}{=}\mathbb{E}\|\hat{V}-(A_e-\epsilon)\|_2^2$,时间步 Beta 调度 $\tau{=}s(1-u), u{\sim}\text{Beta}(1.5,1.0)$。两头联合优化,有效批 512,16×H100,AdamW。**推理:** 单次 VLM 前向得 $Z$,动作头从高斯噪声用 4 步欧拉积分输出原生动作块。真实部署再联合微调 1800 条三本体演示 5000 步。
技术新颖性
技术新颖性体现在四个层面。第一,共享接口位置上移:以往跨本体工作在动作层(统一动作空间)或软提示/单头层面共享,而 DyPES-VLA 在未来预测监督的查询状态层共享,使共享知识可来自无动作视频。第二,解耦的未来预测:区别于 UWM/LDA-1B/Fast-WAM 等把视频扩散与动作扩散耦合的 WAM,本文把未来预测严格限定为表示正则项,动作生成交给独立动作头,推理时丢弃未来头——这是一个清晰的概念分工。第三,静态路由 MoE 与共享注意力的分工直接映射到『时序通用 vs 控制特化』的归纳偏置,每个本体拥有自己的编码器/FFN 专家/解码器($K=3$),避免了公共动作空间带来的『共享与特化纠缠』。第四,本体元数据被文字化(如 data_source、robot_type、control_freq、action_dim、action_space)作为显式上下文喂给 VLM,消融显示其对消解本体与数据源歧义有 0.5 个点的一致提升。整体是『可扩展到任意本体』的范式,论文在三类本体上实例化验证。
实验结果
**Q1 单一检查点跨基准:** RoboTwin 2.0(14-DoF 双臂)平均 89.02%(clean 88.78%/randomized 89.26%),超通才 Qwen-VLA(86.65%)2.37 个点、专家 ABot-M0(85.50%)、π0.5(79.75%);RoboCasa-GR1(29-DoF 人形)59.25%,超 ABot-M0(58.3%)0.95 个点、WAM 基线 LDA-1B(55.4%)3.85 个点、Qwen-VLA(56.7%)2.55 个点;LIBERO(7-DoF 单臂)98.0%,超 Fast-WAM(97.6%)0.4 个点、OpenVLA-OFT(97.1%)0.9 个点,仅落后精调 X-VLA(98.1%)0.1 个点。**真实世界:** 单一联合微调检查点跨 FR3/COBOT Magic/G1 三本体平均 75.6%,超 GR00T-N1.6(59.6%)16.0 个点、ACT(32.4%)43.2 个点;最难人形倒水从 32% 升到 52%。**消融(Table 5):** 去未来预测在 RoboTwin 掉 2.35、RoboCasa 掉 2.5 个点;共享稠密头替 MoE 在 RoboTwin 掉 1.17、RoboCasa 掉 2.08 个点;去本体元数据最多掉 0.5 个点。**未来接触探针(Table 6):** 完整模型起始 AUROC 97.3%(基线 95.2%)、起始 AUPRC 86.3%(70.8%)、释放 AUPRC 72.8%(64.8%),证明未来监督把接触动力学信息显式注入查询状态。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| RoboTwin 2.0 双臂多任务操作(clean+randomized 平均) | 成功率% | 89.02 | Qwen-VLA 86.65 / ABot-M0 85.50 / π0.5 79.75 | 较 Qwen-VLA +2.37 个点 |
| RoboCasa-GR1 人形厨房操作 | 成功率%(50 rollouts/任务平均) | 59.25 | ABot-M0 58.3 / LDA-1B 55.4 / Qwen-VLA 56.7 | 较 ABot-M0 +0.95 个点,较 LDA-1B +3.85 个点 |
| LIBERO 桌面单臂操作(四套件平均) | 成功率% | 98.0 | Fast-WAM 97.6 / OpenVLA-OFT 97.1 / X-VLA 98.1 | 较 Fast-WAM +0.4 个点,仅落后 X-VLA 0.1 个点 |
| 真实世界三本体×三任务平均 | 成功率%(每任务 25 rollouts) | 75.6(单一联合微调检查点) | GR00T-N1.6 59.6 / ACT 32.4 | 较 GR00T-N1.6 +16.0 个点 |
| 未来接触探针(接触起始 AUPRC) | AUPRC%(线性探针) | 86.3(完整模型) | 70.8(无未来预测) | +15.5 个点 |
局限与改进
作者承认的局限主要有三方面。其一,真实世界评估范围有限:仅三个桌面任务(放猕猴桃入篮、倒水、放书上架)、每本体每任务 25 次试验、三本体共 1800 条遥操作演示用于微调,规模偏小,是否能泛化到更长地平线、更复杂接触或非桌面场景未验证。其二,三类本体虽涵盖单臂/双臂/人形,但每个家族仅实例化一到两个机器人,且真实部署时各本体复用了仿真阶段训练的专家(如 COBOT Magic 复用 RoboTwin 2.0 的 14-DoF 专家、G1 复用 RoboCasa-GR1 的 29-DoF 专家),对全新动作维度/形态的本体尚未验证『范式可扩展到任意本体』这一更强主张。其三,本体特化 MoE 的专家数固定为 $K=3$,超出三类本体后路由与专家设计如何演进未讨论。我自己的观察是:阶段一预训练的消融提升相对温和(LIBERO 仅掉 1.3 个点),未来预测的收益在 RoboTwin 与 RoboCasa 上更显著,暗示其作用与数据/本体复杂度相关;且模型不使用本体感知(proprioception),仅靠视觉,这对快速运动或遮挡场景可能是隐患。
独立分析的弱点
第一个弱点是真实世界规模与多样性不足。三任务×三本体、每任务 25 次试验、1800 条微调演示,统计上仍较窄,难以证明对任意家庭/工业场景的鲁棒性;改进方向是扩展到更多任务类别、更长地平线任务(如多步组装)、非桌面环境,并报告方差与失败模式分析。第二个弱点是『可扩展到任意本体』的主张未真正验证。MoE 仅 $K=3$ 专家,新增第 4 类本体需新增专家并重新训练,文中没有给出增量学习或零样本迁移到未见本体的实验;改进方向是引入动态路由(如 top-k 软路由)或本体嵌入,使新本体可通过少量演示激活组合专家,而非硬扩 $K$。第三个弱点是放弃本体感知。策略完全靠视觉,对快速运动、关节遮挡、精度要求高的任务(如人形精细手指操作)可能受限;改进方向是把本体感知作为可选条件接入查询令牌,或引入触觉/力觉模态。第四个弱点是计算成本高。16 张 H100、两阶段共 30 万步、批大小 512,对学术组复现门槛高;改进方向是探索蒸馏、参数高效微调或更小的 VLM 主干以降低成本。
未来方向
作者明确提出的方向是:把范式扩展到任意本体与异构数据,并继续在真实部署上验证。基于本文成果可延伸的方向包括:第一,把静态路由 MoE 升级为软路由或基于本体嵌入的可微分路由,支持新本体的零样本/少样本迁移,真正兑现『任意本体』主张;第二,探索未来预测监督与强化学习结合——既然查询状态已编码动力学先验,可将其作为模型基强化学习的想象空间,做规划或反事实评估;第三,把共享接口从图像级未来预测扩展到更丰富的多模态未来(如点云、接触图、语言描述的子目标),增强先验的语义性;第四,研究阶段一预训练视频配比的自动搜索或课程学习,因为消融显示其收益与本体复杂度相关;第五,将 DyPES-VLA 与大规模自监督视频预训练(如通用世界模型)结合,进一步降低对标注演示的依赖。
复现评估
复现性中等偏上但有门槛。论文给出大量关键细节:VLM 为 Qwen3-VL-2B,未来头为 SANA-600M(预训练权重初始化),MoE 动作头为 16 层 DiT 从零训练、$K{=}3$ 专家、$N{=}96$ 查询令牌;视角 resize 到 256×256,无本体感知,动作按维度 min-max 归一化;动作地平线单臂 8、人形 16、双臂 50;阶段一 100k 步、阶段二 200k 步,有效批 512,16×H100,AdamW,$\lambda_w{=}0.05$,推理 4 步欧拉;两阶段数据配比(50/20/20/10 与 40/40/20)均给出。训练数据用公开 EgoDex 与三个仿真基准,可获取。短板是:未提供代码/检查点开源链接(仅项目页 https://livfour.github.io/DyPES-VLA_RELEASE/),未给学习率、权重衰减、warmup、SANA 具体超参及各本体编解码器维度;16×H100 算力对学术组偏高。综合看方法描述足以理解原理,但完整端到端复现需相当工程投入与算力。
论文图表