Hydra-0:面向通用世界建模与控制的动作流 Hydra-0: Action Flow for Generalist World Modeling and Control
以像素级动作流为共享接口,统一跨本体世界建模、开环策略评估与逆向机器人控制
前置知识
世界模型(World Model)
能预测环境在动作作用下如何演化的生成式模型:给定当前观测 $o_0$ 与候选动作序列,模型想象出未来观测或其隐状态序列 $\hat{o}_{1:H}$。在机器人领域常用动作条件视频生成模型实现——输入首帧图像加动作条件,输出未来数秒的视频,相当于一个可交互的神经模拟器。
Hydra-0 本身就是一个动作条件世界模型;全文的表示设计、训练目标与四类实验(预测保真度、数据效率、策略评估、逆向控制)都建立在预测动作后果这一能力之上。
动作流与点轨迹
图像平面上稀疏点随时间的运动轨迹:对第 $n$ 个跟踪点,记录各时刻的像素坐标 $(u_{n,t}, v_{n,t})$ 与可见性 $m_{n,t}\in\{0,1\}$。它既可由机器人状态经相机投影精确算出,也可用点跟踪器(如 AllTracker)从任意视频估计,因此不依赖本体元数据。
动作流是本文的核心表示:前向模式用它条件化视频预测,逆向模式用它表达任务意图,理解轨迹、可见性与 latent 网格对齐是读懂方法节的前提。
流匹配与 DiT 视频生成
DiT(Diffusion Transformer)是以 Transformer 为骨架的扩散视频模型;流匹配是其训练目标:模型学习速度场 $v_\theta(Z_t, t, c)$ 拟合加噪 latent 与干净数据之间直线路径的速度 $v_t^\star$,损失为 $\mathbb{E}\,\|v_\theta - v_t^\star\|_2^2$。生成时从噪声出发沿学到的速度场积分到数据分布。
Hydra-0 在 Wan2.2 与 Cosmos 2.5 两个流匹配视频骨架上做 LoRA 中训练,公式(5)的训练目标、后续的自回归转换与 DMD2 蒸馏全部基于该框架。
相机投影与机器人运动学
相机内参矩阵 $K$ 与外参 $T_{CW}$ 把三维点投影为像素坐标;机器人正运动学给出关节配置 $q_t$ 下各连杆的位姿变换 $T_{\ell(n)}(q_t)$。两者串联即可把机器人表面点随时间的 3D 运动确定性地投影为图像平面轨迹,形成与可执行命令一一对应的视觉条件。
部署时 Hydra-0 依靠 Isaac Lab 执行命令、连杆变换、公式(1)投影这条链路把候选命令转成动作流,这正是 kinematically grounded 一词的确切含义。
LoRA 参数高效微调
冻结预训练权重,只为部分矩阵学习低秩增量 $\Delta W = BA$(秩 $r$ 远小于原维度)的微调方法,大幅降低可训练参数与显存。本文在视频骨架上训练 rank-64 LoRA(q/k/v/o 注意力投影与两个 FFN 投影),世界动作模型阶段用 rank-32,另加零初始化 patch 投影与轻量读出头。
论文的训练配方与算力开销(32×H100、5 天、4 万步)以及动作流接口可移植的说法都依赖 LoRA 式微调,评估复现成本时需要它。
开环策略评估
评估机器人策略时不让其在闭环中重新决策,而是把策略已记录的动作序列回放给模拟器或世界模型,用生成结果判断任务成败并聚合出成功率,从而比较不同策略优劣。理想的神经模拟器应在成功率及其排序上与真实环境高度相关。
这是 Hydra-0 前向模式的核心应用:在 RoboLab 上对 5 个策略、6 个任务共 300 回合做回放评估,得到 Pearson $r=0.96$ 的关键结果。
研究动机
现有动作条件世界模型与动作条件视频模型大多被绑定在训练本体上,难以跨本体、跨任务、跨环境迁移。根源在于它们以原生机器人命令作为条件:关节空间命令直接编码了特定机器人的结构,而同一条末端执行器(EE)命令作用在不同运动学的机器人上会产生完全不同的关节轨迹与可见连杆运动;无论哪种表示都没有直接说明画面里会怎么动,视频模型必须为每一种本体重新学习一个从命令到视觉动力学的映射。于是在 DROID 单臂 Franka 上训练的世界模型无法服务双臂平台、手持 UMI 夹爪或人类手部视频,所谓基础世界模型始终停留在单本体。另一方面,评估机器人策略通常要在真实环境逐回合执行,代价高、有风险且难复现,缺乏可信的开环神经评估器。
本文的目标是本文要构建一个能从异构交互数据中学习的通用世界模型,并让同一个动作表示同时支撑三种用途。其一是前向的运动学接地视频预测:给定任何可执行的候选命令,预测它在真实世界中的视觉后果;其二是用该模型做开环策略评估,替代昂贵的真实环境回放;其三是把接口取逆得到世界动作模型:只给定期望的物体运动(例如从人类演示中提取的物体流),推断出兼容的机器人运动并解码为可执行动作,且不需要任务专属的专家机器人演示。最终目标是让动作流成为共享控制接口,把任务指定与执行学习解耦,连接异构训练数据、开环评估与真机控制。
与已有工作不同的是,本文的独特切入是把机器人动作条件运动学接地到图像平面,构成双向接口。训练时动作流可直接从交互视频跟踪恢复,不需要 URDF 或相机标定,从而把几何感知数据与纯视频数据统一成同一种张量;部署时则把候选命令送入 Isaac Lab 的控制器与物理仿真,用机器人几何和相机标定把可见机器人表面点轨迹投影到图像平面(公式(1)),得到既指定画面里机器人该怎么动、又保留该本体运动学约束的视觉条件。相比 ATI、Wan-Move 等轨迹条件视频生成中用户手绘的轨迹,这里的轨迹由可执行命令因果推导,天然可执行;相比 Cosmos 2.5 的原生 6D EE 条件,它与本体解耦。更进一步,作者把同一接口反向使用:不复制任务级行为,而是用包含成功与失败的配对真实 rollout 学习从机器人运动到动作的读出,实现逆向控制。
核心方法
直觉上,无论什么本体,动作的后果最终都体现在相机画面里:用像素运动描述动作,就把单臂、双臂、UMI 夹爪、人手放进同一坐标系。形式化地,编码器 $e_\varphi$ 把首帧观测映为空间隐状态 $s_0=e_\varphi(o_0)$,动力学模型 $g_\theta$ 以动作流 $\mathcal{F}$ 为条件预测未来隐序列 $\hat{s}_{1:H}=g_\theta(s_0,\mathcal{F})$,解码器 $d_\psi$ 还原 RGB 序列;其中 $\mathcal{F}=\{\tau_n\}_{n=1}^N$、$\tau_n=\{(x_{n,t}, m_{n,t})\}_{t=0}^H$ 是 $N$ 条可见点轨迹。训练语料覆盖 7 个来源、178,187 回合、过滤后 1,565,634 个 81 帧(约 5 秒)窗口、共 2,201.7 小时。骨架采用 Wan2.2 I2V-A14B、Wan2.2 TI2V-5B 与 Cosmos 2.5:动作流轨迹与 latent 时间轴对齐后,双线性采样首帧特征并沿轨迹高斯传播,连同存在门控组成运动条件 $C_{\text{motion}}=(M,g)$ 注入 DiT,训练目标是标准流匹配损失 $\mathcal{L}(\theta)=\mathbb{E}\,\|v_\theta(Z_t,t,c,C_{\text{motion}})-v_t^\star\|_2^2$。部署时命令经 Isaac Lab rollout 与投影公式变成动作流,配合自回归分块生成与 DMD2 四步蒸馏实现高效长时序 rollout。
核心创新是把动作条件重构为运动学接地的图像平面动作流,并让它在前向与逆向两个方向上复用。与已有方法的本质区别有三。其一,相对 Cosmos 2.5 等以原生相对 6D EE 命令为条件的方式,动作流直接指定图像平面运动,本体无关;同时因为由控制器与物理 rollout 投影而来而保留了可执行的运动学约束——本体无关与可执行这两个此前互斥的属性被同时满足。其二,相对 ATI、Wan-Move 等运动控制视频生成中用户手绘轨迹的条件,本文的轨迹在部署时由可执行命令因果推导(训练时也可从视频跟踪恢复),首帧特征沿 latent 轨迹传播加存在门控的注入方式便于跨骨架移植,论文在 Cosmos 2.5 与 Wan2.2 两个家族上复现了收益。其三,相对单向条件生成,同一接口可以取逆:只给物体流、不给夹爪流时,latent 动力学中编码了兼容的机器人运动,轻量动作头从 DiT token 读出可执行命令,且训练只需配对真实 rollout(成功与失败样本皆可),不需要任务专属专家演示。
方法步骤详情
第一步,构建动作流。几何感知路线在可见机器人表面采样点,用连杆变换传播后按 $x_{n,t}=\pi\left(K\,[I_3\ 0]\,T_{CW}T_{\ell(n)}(q_t)\,\bar{X}_n\right)$ 投影(部署时 $q_t$ 来自 Isaac Lab 执行候选命令,训练时来自录制机器人状态),可见性要求正深度、在图像内、且与渲染深度缓冲在 1.2 cm 内一致;视频路线用 AllTracker 在 128×128 查询网格稠密跟踪,再用 SAM 3 掩码把轨迹归为 embodiment、object 与未指派。第二步,训练时每步从 None、Embodiment、Object、All 四种条件模式按 0.05、0.40、0.40、0.15 的概率采样,Embodiment 与 Object 各采 1–128 条、All 采 256–1024 条轨迹,并过滤静态窗(90 分位轨迹长低于 50 像素)、冻结夹爪窗与无内容字幕窗。第三步,条件注入与训练:轨迹池化到 latent 帧,按高斯权重 $\tilde{w}_{n,k}=\tilde{m}_{n,0}\tilde{m}_{n,k}\exp(-\beta\|\tilde{p}-\tilde{x}_{n,k}\|^2)$($\beta=220$,Top-2)传播首帧特征得到 $M_k$,权重和截断为门控 $g_k$;冻结骨架,rank-64 LoRA 训练 4 万步、5 天、32 块 H100。第四步,高效部署:LongLive-2.0 式 7-latent 分块自回归(KV cache、绝对偏移切片)加 DMD2 四步蒸馏。第五步,逆向模式:rank-32 LoRA 后训练动作与状态读出头,损失为 $\mathcal{L}_{\text{WAM}}=\mathcal{L}_{\text{flow}}+0.1(\mathcal{L}_{\text{act}}+\mathcal{L}_{\text{state}}+0.1\,\mathcal{L}_{\text{vel}})$。
技术新颖性
技术新颖性体现在五个层面。表示层:运动学接地的图像平面动作是新的条件化方式,同时满足本体无关与可执行两个此前互斥的属性——手绘轨迹可执行性差、关节命令本体相关,动作流经由物理仿真投影把两者统一。训练层:把需要标定的几何路线与不需要元数据的纯视频路线统一为同一 $\mathcal{F}$ 表示,四模式概率采样让模型在不同应用间切换运动线索,并在语义 grounding 不完整时保留近似运动对应。架构层:动作流被证明是便携接口而非骨架特有技巧——在 Cosmos 2.5(17 通道 side input 加零初始化 patch 投影)、Wan2.2 I2V-A14B(走原生视觉条件通道并配合 MoE 双专家调度)、TI2V-5B(49 通道 side input)上以三种不同注入方式均获得收益。应用层:前向支持基于达成轨迹回放的开环评估(成败皆可监督),逆向构成从视频 latent 直接读出动作的世界动作模型新范式。系统层:自回归转换与蒸馏把 81 帧 480×832 生成从 20.92 秒压缩到 1.31 秒(62.0 FPS),使世界模型落入机器人交互预算。
实验结果
实验一(Table 2,5 个留出集各 100 段验证片段):最佳配置 Ours (Wan2.2 A14B 4-step) 平均 PSNR 21.84 dB、SSIM 0.830、物体 EPE 5.27 px、夹爪 EPE 3.29 px、FID 18.7、FVD 155.9、VLM 4.23,全面优于动作条件 Cosmos 2.5 基线(15.62 dB、0.668、13.23 px、34.28 px、39.1、405.8、3.88),即机器人运动误差降低 90.40%、物体运动误差降低 60.16%;关键对照是把同骨架 Cosmos 2.5 的原生相对 6D EE 动作换成动作流后,各数据集全部指标占优,说明增益来自条件表示本身。零样本的 ATI 与 Wan-Move 表现非平凡,但物体 EPE 与 FVD 仍明显落后。实验二(Fig 7,IWS 六任务数据效率):多本体中训练的 Ours (MT) 在 0% 任务数据时 LPIPS、物体流 EPE、FVD 全面领先所有基线;收益在 20% 数据处接近饱和(20% 到 100% 之间各指标变化不超过 3.4%、6.7%、6.8%)。实验三(Table 3,推理速度):自回归教师 12.48 秒/clip(1.68 倍),四步蒸馏学生 1.31 秒/clip、62.0 FPS(16.0 倍,仅生成环节)。实验四(Fig 8,RoboLab 开环策略评估):5 策略×6 任务×10 回合共 300 集,回放与真实成功率的 Pearson $r=0.96$、Spearman $\rho=0.93$、MAE 5.7 个百分点,并保持全部 5 个策略的排序;真实布料折叠回放定性一致(Fig 9)。实验五(Fig 10):仅凭留出人类演示提取的物体流,模型生成兼容的机器人运动,动作头解码后在柔性弯管任务上真机执行成功。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 多本体动作条件视频预测(5 个数据集平均) | 夹爪 EPE(像素,越低越好) | 3.29 | 34.28(Cosmos 2.5 原生 6D EE 动作) | 降低 90.40% |
| 多本体动作条件视频预测(4 个可评测数据集平均) | 物体 EPE(像素,越低越好) | 5.27 | 13.23(Cosmos 2.5) | 降低 60.16% |
| 多本体视频预测保真度(5 个数据集平均) | PSNR(dB,越高越好)/ FVD(越低越好) | 21.84 / 155.9 | 15.62 / 405.8(Cosmos 2.5) | PSNR +6.22 dB,FVD 降低约 61.6% |
| RoboLab 开环策略评估(5 策略×6 任务×10 回合) | 回放-真实成功率 Pearson 相关系数 | r = 0.96(Spearman 0.93,MAE 5.7 个百分点) | 参考为真实模拟器回放结果 | 保持全部 5 个策略的成功率排序 |
| 长视频生成效率(81 帧 480×832,单张 H100) | 秒/clip 与 FPS | 1.31 s/clip,62.0 FPS(四步蒸馏学生) | 20.92 s/clip,3.87 FPS(双向教师) | 16.0 倍生成加速 |
| IWS 六任务数据效率(0%–100% 嵌套子集) | 达到近饱和性能所需任务数据比例 | 约 20% 任务数据后指标基本收敛(LPIPS 变化 ≤3.4%),0% 数据零样本即领先 | Ours (PT) 无中训练版本与 IWS 从头训练模型 | 显著降低任务专属数据需求 |
局限与改进
作者承认的局限:世界动作模型存在厘米级抓取误差,作者猜测源于深度感知不足;生成 rollout 中抓取与接触状态存在歧义,例如难以判断物体是否已被成功握住;腕部相机实验只是 DROID 上的定性概念验证,未做系统评估;评估仅覆盖开环,闭环评估留作未来工作。我的补充观察:第一,前向部署仍需机器人几何、相机标定与 Isaac Lab rollout,这与训练时视频无需元数据的优势不对称,接入新本体仍要完整的标定管线;第二,主要领域是可变形物体交互,刚体精细操作、移动操作与广角多相机场景未验证;第三,保真度绝对值不高(平均 PSNR 21.84 dB),FVD 每点仅用 40 段估计、方差大,作者也承认 20% 数据之后的非单调波动不能证明严格收敛;第四,VLM 判分(Gemma 4 31B,1–5 分)与运动跟随度相关性弱、结论混杂;第五,逆向模式仅有单一柔性弯管任务的定性演示,没有成功率统计,也没有与 FlowWAM、NovaFlow 等同类方法的定量对比;第六,EPE 类指标同时依赖 AllTracker 的跟踪质量,跟踪误差会同时污染训练条件与评测基准。
独立分析的弱点
弱点一:部署侧的几何特权。动作流前向构建依赖 URDF、相机内外参与物理仿真,新机器人或新相机需要重新标定,削弱了通用接口的落地速度。改进方向:用可微渲染或视觉里程计在线估计投影,或训练轻量的命令到流网络替代 Isaac Lab rollout。弱点二:逆向模式能力边界未刻画。仅一个任务、无统计成功率与基线对比,厘米级抓取误差提示 2D 流缺少 3D 几何与接触信息。改进方向:引入深度、触觉或力觉作为辅助条件,在多任务基准上与同类世界动作模型定量比较。弱点三:评估统计强度不足。FVD 每点 40 段、开环评估 300 集,均未报告置信区间;VLM 评分与运动误差脱节。改进方向:扩大样本量并报告区间估计,把 VLM 评分与 EPE 联合校准。弱点四:复现资产不明。正文未给出代码或权重链接,约 1.56M 窗口的稠密跟踪与 SAM 3 标注流水线成本高。改进方向:发布预计算轨迹与标注,或提供小规模训练子集。弱点五:长时程稳定性未量化。速度测试只覆盖 24 latent 帧(3 个 chunk)的短视界,KV cache 复用下的长 rollout 漂移没有实验支撑。改进方向:补充分钟级 rollout 的误差累积分析。
未来方向
作者提出的方向:以深度、触觉、力觉等额外模态条件化世界模型以消除抓取与接触歧义;把腕部相机实验系统化,覆盖腕部仿真、移动操作与大范围相机运动;把策略评估从开环扩展到闭环;继续降低世界动作模型的抓取误差。基于其成果可自然延伸:第一,把 Hydra-0 接入 VLA 策略闭环——用其 rollout 作为策略的想象模块做候选动作筛选与排序,甚至生成策略改进数据,衔接 Ctrl-World 与 IWS 的路线;第二,把逆向模式扩展到双臂、移动底盘与灵巧手,让人类视频到机器人技能成为常规数据引擎,并配合物体流条件实现任务目标指定与规划;第三,与 MoRight、RealWonder 等物理动作条件方法互补,统一主动与被动轨迹的推理;第四,在 Cosmos 3 等更大的世界模型骨架上验证动作流接口的规模效应;第五,探索物体流条件与流中心规划(如 FLIP)结合,形成规划、想象、执行的完整闭环。
复现评估
项目页为 nvidia-isaac.github.io/video_to_data/hydra-0/,截至本论文版本正文未明确给出代码与权重开源声明,复现主要依赖公开组件自行搭建。数据侧:7 个训练来源全部公开——DROID 70,339 回合(CC-BY-4.0)、ABC-130k 54,961 回合(Apache-2.0)、MolmoAct2 7,723 回合(Apache-2.0)、EgoDex 41,888 回合(CC-BY-NC-ND,注意非商业)、Deform360 1,714 回合(MIT),另有 XVLA-Soft-Fold 与 H1-Fold-Clothes,合计 178,187 回合、2,201.7 小时、过滤后 1,565,634 个窗口。工具链:AllTracker(稠密跟踪)、SAM 3(掩码)、Wan2.2 与 Cosmos 2.5(骨架)、LongLive-2.0(自回归转换)、DMD2(蒸馏)、Isaac Lab(命令 rollout)均有公开实现,但 128×128 网格跟踪加掩码分类加 VAE 预计算的流水线需处理约 188 万个窗口,预处理开销不小。算力:主力 Wan2.2 A14B 训练为 32 块 H100 跑 5 天、4 万步,5B 与 Cosmos 版本资源需求更低;推理端四步学生单张 H100 达 62 FPS。真机部分需要标定好的机械臂平台与 RoboLab 环境。综合判断:具备大规模算力与机器人平台的团队可以复现,中小团队建议先在 5B 骨架或小子集上验证,总体难度高,瓶颈在数据流水线与真机环节。
论文图表
总览图。上方展示多本体训练数据:自我中心人类演示、UMI 手持夹爪、双臂与单臂机器人;中间把可见本体运动统一表示为图像平面的动作流轨迹,构成与本体无关的共享空间;下方分两路——前向模式用夹爪流条件化未来场景预测并支持开环策略评估(含成功与失败样本),逆向模式从人类演示提取物体流,诱导兼容的机器人运动并经动作头解码执行。
一图看懂全文框架:动作流既是多本体训练的统一条件,又是前向预测与逆向控制的共同接口,是理解论文动机与四项贡献的最佳入口。