← 返回 2026-08-14

DreamX-Phi 1.0:面向机器人操作的动作条件视频世界模型 DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation

DreamX Team, Rui Chen, Xiangxiang Chu, Geng Li, Jifan Li, Qingfeng Shi, Datao Tang, Jing Tang, Jun Wang, Pengfei Zhang 📅 2026-08-13 👍 96 2026-08-19 18:30
SE(3)几何 世界模型 动作条件控制 扩散模型 机器人操作 知识蒸馏 视频生成

SE(3) 几何感知的动作条件视频世界模型,登顶 WorldArena 2.0 预测赛道

前置知识

SE(3) 刚体变换

SE(3) 是特殊欧氏群,描述三维空间中的刚体运动,由旋转矩阵 $R \in SO(3)$ 和平移向量 $p \in \mathbb{R}^3$ 组成,常写成 4×4 齐次矩阵 $G = \begin{pmatrix} R & p \\ 0 & 1 \end{pmatrix}$。两个 SE(3) 元素相乘表示变换的复合,求逆表示反向变换。机器人末端执行器的位姿(三维位置加姿态四元数)天然是一个 SE(3) 元素,一条运动轨迹就是按时间排序的 SE(3) 序列,这正是本文动作表示的数学基础。

本文把双臂指令表示为 SE(3) 轨迹,并对其做归一化、求逆后注入注意力机制,第 4.2 节的公式 (2)(3)(4) 全部建立在这一表示之上,不懂 SE(3) 的乘法与逆就无法读懂动作编码流程。

PRoPE(投影相对位置编码)

PRoPE(Projective Relative Positional Encoding)是一种几何感知的注意力机制:把已知的相对变换(原设计中是多视角相机的外参)构造成矩阵 $D_i$,分别以 $D_i^\top$、$D_i^{-1}$、$D_i^{-1}$ 作用于注意力的 $Q$、$K$、$V$,输出再乘 $D_i$。这样任意 token 对 $(i,j)$ 的耦合只依赖相对变换 $D_i D_j^{-1}$,对全局坐标系的选择保持不变,同时影响注意力权重和值的聚合。

DreamX-Phi 的核心创新就是把 PRoPE 从相机场景改造成双臂 SE(3) 轨迹的编码接口,用 $D_i = I_{d_h/4} \otimes A_k^{n(i)}$ 的克罗内克积形式按臂分组作用于注意力头,不理解 PRoPE 就无法理解论文方法的骨架。

流匹配与视频扩散 Transformer

流匹配(Flow Matching)训练生成模型拟合一条把噪声分布搬运到数据分布的速度场,逐 token 的流匹配损失 $\ell_{\mathrm{FM}}$ 通常写成预测速度与目标速度的均方误差。Wan2.2-TI2V-5B 是基于该目标训练的图生视频扩散 Transformer:视频先经 VAE 压缩到 latent 空间,首帧 latent 作为条件,Transformer 负责去噪生成未来帧 latent。DreamX-Phi 在此基础上引入动作、深度和物体监督。

本文的骨干网络、训练目标、深度损失(latent 空间 MSE)都定义在这套框架里,公式 (1) 的条件分布建模和公式 (7)(8) 的损失都依赖对 latent 扩散与流匹配的理解。

DMD 分布匹配蒸馏

Distribution Matching Distillation(DMD/DMD2)把多步扩散或流生成器蒸馏成少步学生:用一个冻结的教师评分和一个在线的 fake-score 去噪器分别刻画真实分布与模型输出分布,最小化二者的条件 KL 散度 $\mathcal{L}_{\mathrm{DMD}} = \mathbb{E}[D_{\mathrm{KL}}(q_{\eta,\tau} \parallel p_{\mathrm{data},\tau})]$,通常再叠加非饱和 GAN 对抗损失提升细节真实感,最终学生用固定 $N$ 步完成采样。

论文 4.5 节用 DMD 加对抗训练把多步教师压缩为少步学生以便部署,且其条件 $y=(x_0, a_{1:T}, c)$ 同时包含观测帧与动作轨迹,判别头改在去噪器瓶颈特征上,是与图像蒸馏设定的关键差异点。

V-JEPA 与特征关系监督

V-JEPA 是视频联合嵌入预测架构,其编码器能把视频映射到包含物体身份、形状与运动状态的语义特征空间。本文冻结一个 V-JEPA 教师作感知监督:把学生模型隐藏层特征插值到教师掩码 token 坐标处,投影归一化后不直接对齐特征坐标,而是对齐两者的 Gram 矩阵 $\ell_{\mathrm{JEPA}} = \frac{1}{M_b}\| S_b S_b^\top - Q_b Q_b^\top \|^2$,使学生不被绑定到教师的特征基上。

这是论文保证被操作物体在抓取过程中不漂移、不变身的关系型监督信号,公式 (9)(10) 的门控与损失只有理解 Gram 矩阵对齐的动机后才能读懂。

世界模型与 WorldArena 基准

世界模型指能根据当前观测和候选动作序列预测环境未来演化的生成模型,用于在物理执行前于想象中评估动作。WorldArena 基准基于 RoboTwin 2.0 构建评测集:Track 1 评测条件视频预测,用视觉质量、运动、内容一致性、物理 adherence、3D 精度、可控性共 15 项分量合成为 EWMScore-P;Track 2 把参赛世界模型当作策略训练的 rollout 环境,用 π0.5 策略在 held-out 的 Adjust Bottle 任务上的成功率衡量模型作为训练环境的可用性。

论文全部实验指标(EWMScore-P 60.65、Adjust Bottle 成功率 67.19% 等)都定义在该评测协议上,不清楚两个赛道分别测什么,就无法正确解读第 5 节的结果表。

研究动机

现代视频生成器(如 Wan、Cosmos 3)拥有强大的外观与运动先验,但视觉逼真不等于对条件动作的忠实:给定同一初始画面和两条不同的指令轨迹,模型应当让机器人做出对应的运动并正确改变物体状态,同时保持与动作无关的背景内容不变。现有动作条件世界模型大多把动作压缩成低维 token 或特征调制信号注入视频生成器(如 IRASim、Vid2World、HMA),这种接口虽然通用,却有两个具体缺陷:其一,隐式地丢掉了末端执行器轨迹的刚体几何结构,模型难以分辨该动左臂还是右臂、也无法保持刚体运动的连续性;其二,无法指明指令运动应当出现在画面中的哪个位置。后果是 rollout 可以看起来很逼真却移动了错误的手臂、夹爪错过或穿透目标物体、把抓握和释放混淆、物体被抓起后形状状态突变。在双臂操作场景下这类错误尤其致命:机械臂和被操作物体往往只占画面很小比例,均匀的生成损失会被静态背景主导,接触局部的物理错误在整体损失里几乎不可见。

本文的目标是本文的目标是构建一个几何感知的动作条件视频世界模型 DreamX-Phi 1.0:给定单帧 RGB 观测 $x_0$、语言指令 $c$ 和外部规定的双臂动作序列 $a_{1:T}$(每臂的末端执行器位姿加夹爪开合状态),建模条件分布 $p_\theta(x_{1:T} \mid x_0, a_{1:T}, c)$,预测未来 RGB 视频。具体要求包括三个层面:预测必须逐臂忠实跟随指令的 SE(3) 轨迹,正确区分左右臂并保持刚体运动结构;场景几何(表面次序、物体尺度、接触几何)与被操作物体的视觉身份和状态要在整段 rollout 中保持一致,物体运动必须与手臂接触耦合;推理开销要足够低,使模型能作为策略训练的 rollout 环境使用。最终目标是在 WorldArena 1.0/2.0 两个版本的基准上可量化地超越 Alpha-World、FlowWAM、UNIS 等现有世界模型。

与已有工作不同的是,本文的独特切入是把'动作如何注入'与'动作后果如何监督'拆成两个互补问题分别求解。在动作注入端,作者没有沿用通用 token 接口,而是注意到末端执行器指令天然构成有序的 SE(3) 群作用序列,因此把原本用于多视角相机的 PRoPE 投影相对位置编码改造成双臂轨迹的注意力接口:所有臂统一到共享坐标系、每臂在注意力头中保留持久的分组、夹爪标量与 SE(3) 变换分离注入,并以零初始化残差分支的形式叠加到预训练生成通路上。在监督端,作者的核心论断是'动作控制正确只是必要条件'——预测保真度还取决于场景几何与被操作物体的演化,于是叠加三路正交信号:轻量深度分支约束 3D 结构、SAM3 掩码对 RGB 流匹配损失做物体区域重加权以放大接触局部误差、冻结 V-JEPA 教师以 Gram 矩阵对齐约束物体时空演化。这种'保留指令的刚体结构 + 单独监督其视觉物理后果'的组合是与 token 型、骨架渲染型(OSCAR)和光流型(FlowWAM)接口的本质区别。

核心方法

DreamX-Phi 1.0 以 Wan2.2-TI2V-5B 视频扩散 Transformer 为骨干,在 VAE latent 空间用流匹配目标学习未来帧,整体框架分三部分(对应 Figure 2)。第一部分是动作条件视频预测:除常规 RGB 生成通路外,增加一条并行的几何注意力分支,把按手臂分组的 PRoPE 变换和夹爪偏置注入自注意力,同时用仅含机器人区域的机器人光流作为图像平面的运动线索,两路条件互补。第二部分是训练监督:复制 RGB Transformer 尾部 $M$ 个块构成轻量深度分支,用 Depth Anything 3 深度图在 latent 空间做回归;离线运行的 SAM3 物体掩码对逐 token 流匹配损失重加权;冻结的 V-JEPA 教师提供物体关系损失。第三部分是少步后训练:DMD 分布匹配加对抗蒸馏把多步迭代生成压缩为固定 $N$ 步的学生模型用于部署。训练语料覆盖约 3700 小时自我中心视频(Ego4D)、约 2900 小时真机数据(AgiBot World 1900 小时、RoboCOIN 618 小时、DROID 350 小时)和 25,000 条经 DreamX-Refiner 超分的 RoboTwin 双臂片段,动作无关预训练与动作条件微调两阶段使用。

核心创新是把动作条件从'压缩嵌入'升级为'群作用几何注意力'。论文注意到机械臂末端指令天然构成有序 SE(3) 轨迹,于是借用 PRoPE 机制:对第 $t$ 帧第 $k$ 臂构造齐次坐标系 $G_k^t$,用第一臂初始位姿归一化 $\bar{G}_k^t = (G_1^1)^{-1} G_k^t$,按整段轨迹运动幅度 $\gamma = \max_{k,t}\|\bar{p}_k^t - \bar{p}_k^1\|_2$ 缩放平移,取逆得 $A_k^t$ 并对齐 VAE latent 帧。注意力头按臂分成连续组,token $i$ 的变换 $D_i = I_{d_h/4} \otimes A_k^{n(i)}$ 分别以 $D_i^\top$、$D_i^{-1}$、$D_i^{-1}$ 作用于 $Q/K/V$、输出再乘 $D_i$,使任意 token 对通过相对运动 $D_i D_j^{-1}$ 耦合、与全局坐标系无关。夹爪标量无法表示为 SE(3),就在逆映射后按臂加偏置 $b_k^t = W_g g_k^t + b_g$。整个分支零初始化、残差式叠加,训练前不扰动预训练通路。与 token/调制式接口的本质区别在于:刚体结构与运动的空间位置被显式编码进注意力的相对耦合之中。

方法步骤详情

方法分六步。第一步数据策划:汇集 Ego4D、AgiBot World、InternData-A1、DROID、RoboCOIN、RoboTwin 2.0 六个数据源,剔除移动底盘、灵巧手与静止片段(AgiBot 子集过滤后剩 178.7 小时,刻意保留失败轨迹),统一到 LeRobot v2.1 表示,RoboTwin 的 25,000 条双臂片段先用 DreamX-Refiner 超分。第二步动作表示:把位置、四元数、夹爪值组装成 $G_k^t$,经第一臂初始位姿归一化、运动幅度缩放、取逆、对齐 latent 帧,得到 $A \in \mathbb{R}^{2\times T_{lat}\times 4\times 4}$ 与 $g \in \mathbb{R}^{2\times T_{lat}}$,缺臂用单位阵和 0 填充。第三步几何注意力:每个块加带独立 $Q/K/V/O$ 投影的并行分支,按公式 (4) 做 $D_i$ 变换,夹爪按公式 (5) 加逐臂偏置,输出零初始化后残差叠加到主自注意力。第四步深度监督:复制 RGB 尾部 $M$ 个块构成辅助分支,单向 cross-attention 读取同层 RGB 特征,latent MSE $\mathcal{L}_{depth} = \frac{1}{|z_d|}\|\hat{z}_d - z_d\|_2^2$,推理时可整体摘除。第五步物体监督:SAM3 离线掩码投影到 latent 网格,权重 $w_i = 1 + (\lambda_m - 1)m_i$ 归一化后重加权流匹配损失;同时按公式 (9)(10) 对齐冻结 V-JEPA 教师的 Gram 矩阵,带 $M_{min}$ 与 $\sigma_{max}$ 门控。第六步少步蒸馏:按公式 (11)-(13) 用 KL 分布匹配加 GAN 损失训练 $N$ 步学生,梯度只穿过采样步。

技术新颖性

技术新颖性体现在四处。其一,PRoPE 的跨域迁移:原设计针对多视角相机外参,作者做了三处必要改造——所有臂统一到共享坐标系、每臂在注意力表示中保留持久头组、夹爪标量与 SE(3) 变换分离注入——并证明末端执行器不必是相机也能受益于群作用注意力,这是对 PRoPE 适用边界的实质拓展。其二,非对称深度分支:深度通路单向读取 RGB 而从不被 RGB 读取,主生成路径的前向计算完全不变,深度预测成为可训练可拆卸的辅助任务,且直接在 latent 空间回归而非再跑一套扩散序列,比 X-WAM 式改造更轻量。其三,物体一致性的两级设计:掩码重加权解决'接触局部误差被背景淹没'(回答在哪里重要),V-JEPA Gram 矩阵对齐解决'帧级误差掩盖时间漂移与抓握状态不一致'(回答如何演化),二者互补而非重复,且掩码只在监督期使用、推理零成本。其四,把 DMD 从文本条件图像生成搬到条件含观测帧与动作轨迹的视频设定,对抗分类头改在 fake-score 去噪器的瓶颈特征上操作。相比渲染运动骨架的 OSCAR、用光流表示动作的 FlowWAM——二者能定位运动却无法保留连续刚体轨迹——本文恰好占据了'结构化 + 连续 + 可微'的接口空档。

Overview of DreamX-Phi 1.0, an action-conditioned video world model that predicts future observations from a single frame and prescribed bimanual actions.
Figure 1: Overview of DreamX-Phi 1.0, an action-conditioned video world model that predicts future observations from a single frame and prescribed bimanual actions.
Overview of the DreamX-Phi 1.0 framework: (1) action-conditioned video prediction, (2) training supervision, (3) few-step post-training.
Figure 2: Overview of the DreamX-Phi 1.0 framework: (1) action-conditioned video prediction, (2) training supervision, (3) few-step post-training.

实验结果

论文以 checkpoint DreamX-Phi-1.0-FDM-0730 评测(2.0 取 8 月 12 日快照 cb8f9c2,1.0 取 7 月 15 日快照 483dfcc)。WorldArena 2.0 Track 1(1000 episodes,31 支队伍):EWMScore-P 60.65 第一,领先 Alpha-World(60.13)0.52 分、FlowWAM-FiveAges(59.72);优势集中在 Depth Accuracy 98.55、Semantic Alignment 90.53、Trajectory Accuracy 57.15(Alpha-World 49.22)与 Interaction Quality 57.36,但 Image Quality 63.25 略低于 Alpha-World 的 64.59。Track 2:以世界模型为 rollout 环境训练 π0.5 策略,held-out Adjust Bottle 成功率 67.19%,与 Lute 并列第二,WOVR-PLUS 以 68.75% 居首,明显高于 CtrlWorld 62.50%、IRASim 61.33%。WorldArena 1.0 离线评测:EWMScore-P 76.88,比官方榜首 UNIS(73.64)高 3.24 分,Depth Accuracy 93.17、Depth Perspectivity 96.30、Flow Score 100.00 突出,但 Interaction Quality 77.90 低于 UNIS 的 87.30、Instruction Following 84.92 低于其 93.86。Figure 3 显示模型在标准与域随机化场景下均能保持双臂、夹爪与物体的连贯。

Data sources used to construct the curated corpus.
Table 1: Data sources used to construct the curated corpus.
WorldArena 2.0 Track 1 leaderboard comparison at the August 12, 2026 snapshot.
Table 2: WorldArena 2.0 Track 1 leaderboard comparison at the August 12, 2026 snapshot.
WorldArena 2.0 Track 2 results at the August 12, 2026 snapshot. Values are Adjust Bottle success rates (%).
Table 3: WorldArena 2.0 Track 2 results at the August 12, 2026 snapshot. Values are Adjust Bottle success rates (%).
WorldArena 1.0 Track 1 comparison (offline evaluation alongside the official leaderboard, July 15, 2026 snapshot).
Table 4: WorldArena 1.0 Track 1 comparison (offline evaluation alongside the official leaderboard, July 15, 2026 snapshot).
Qualitative WorldArena 2.0 Track 1 rollouts from DreamX-Phi 1.0. (a) Standard RoboTwin 2.0 scenes. (b) Domain-randomized scenes with varied backgrounds, textures, lighting, and distractor objects.
Figure 3: Qualitative WorldArena 2.0 Track 1 rollouts from DreamX-Phi 1.0. (a) Standard RoboTwin 2.0 scenes. (b) Domain-randomized scenes with varied backgrounds, textures, lighting, and distractor objects.
查看结构化数据
任务指标本文基线提升
WorldArena 2.0 Track 1 条件视频预测(1000 episodes,31 支队伍) EWMScore-P(15 项分量均值,0-100) 60.65(第一名) Alpha-World 60.13;FlowWAM-FiveAges 59.72;Ctrl-World 56.24;IRASim 44.97 较最强对手 +0.52;Trajectory Accuracy 57.15 对 Alpha-World 49.22(+7.93)
WorldArena 2.0 Track 2 世界模型作为策略训练环境(Adjust Bottle) π0.5 策略在 held-out episode 上的成功率 (%) 67.19%(并列第二) WOVR-PLUS 68.75(第一);Lute 67.19;CtrlWorld 62.50;IRASim 61.33 较 CtrlWorld +4.69 个百分点,距第一名差 1.56 个百分点
WorldArena 1.0 Track 1 离线评测(Clean-50:50 任务 × 10 episodes) EWMScore-P 76.88(离线评测,非榜单提交) UNIS 73.64;SisyphusWorld 73.06;BWM-Fast 72.71 比该快照官方最高分 +3.24
WorldArena 1.0 Track 1 分量指标:Depth Accuracy / Depth Perspectivity 0-100 93.17 / 96.30 UNIS 85.25 / 98.84;CtrlWorld 93.25 / 83.66 深度精度居首,与 UNIS 在深度透视上互有胜负

局限与改进

作者承认三点局限:评测只覆盖 WorldArena 和 RoboTwin,Track 2 只测 Adjust Bottle 一个任务,对其他任务、其他本体和真机的泛化未经验证;排行榜评估完整系统,无法隔离 PRoPE、深度分支、物体监督各自贡献;模型是 FDM,只从外部动作预测视频而不生成动作,Track 2 证明它能当策略训练的 rollout 环境,但未评测其作为闭环控制器的能力。我补充几点观察:其一,Track 1 外观类指标(Image Quality 63.25、Photometric Consistency 14.29)落后于对手,暗示几何精度可能部分以牺牲外观保真为代价,论文未讨论这一权衡;其二,WorldArena 1.0 上 Interaction Quality 与 Instruction Following 均明显低于 UNIS,语言条件通路基本沿用骨干而未强化;其三,少步学生的步数 $N$、推理延迟与显存占用均未报告,部署效率只有定性叙述;其四,物体监督依赖离线 SAM3 掩码质量,掩码缺失时公式 (8) 退化为均匀权重、监督静默失效;其五,权重要等 WorldArena 2.0 IROS 挑战赛结束后才开源,短期内第三方无法独立复核分数。

独立分析的弱点

第一,缺乏组件级消融是最明显的科学性短板:PRoPE、深度分支、SAM3 重加权、V-JEPA 损失、DMD 蒸馏五项设计叠加,去掉任何一项掉多少分都未知,0.52 分的领先无法归因,改进方向是逐组件加减的 matched ablation 并报告方差。第二,评测面窄:所有结果都在 RoboTwin 仿真及其衍生基准上,双臂设定也只来自 RoboTwin,改进方向是补充真机评测(如 AgiBot World 真实任务)和更多物体类别、更长时域。第三,外观与几何的权衡未被讨论:Image Quality 与 Photometric Consistency 落后于 Alpha-World 和 FlowWAM,可分析权重比 $\lambda_m$ 等损失系数对外观指标的影响。第四,语言条件薄弱:WorldArena 1.0 的 Instruction Following 84.92 明显低于 UNIS 的 93.86,可加强指令-动作联合编码。第五,物体监督对 SAM3 离线掩码敏感,遮挡、反光或新物体下掩码错误会使重加权与关系损失同时失真,可用在线伪掩码或置信度加权。第六,归一化因子 $\gamma$ 取整段轨迹最大位移,对离群帧敏感、静止段退化为 $s_\gamma=1$,其鲁棒性缺乏压力测试。

未来方向

作者在结论与未来工作部分明确计划把 FDM 扩展为联合世界动作模型(World Action Model):同时生成未来视频和机器人动作轨迹,期望联合训练能让每个候选动作与其预测的视觉后果对齐,并从视频质量、动作精度、动作-视频一致性、闭环任务成功率四个维度评测。基于本文成果还可自然延伸出几条路线。其一,闭环控制评测:用 DreamX-Phi 做 MPC 式滚动预测,在想象中筛选动作后再执行,这是世界模型最初的价值主张,也是 FDM 设定下尚未验证的能力。其二,长时域一致性:现有时程受限于训练片段长度,可把深度分支升级为显式 3D 场景表示(如 3D Gaussian 或神经场)以支撑更长 rollout 的漂移抑制。其三,监督信号的扩展:Gram 矩阵对齐目前只作用于被操作物体的掩码区域,可延伸到机械臂自身、接触区乃至全场景,并把教师特征作为 rollout 与真值一致性的评估器。其四,数据维度:DreamX-Refiner 目前只用于 RoboTwin 超分,若对全部真机数据统一做增强,可能进一步缩小仿真到真实的域差距。其五,效率维度:Track 2 用多步教师做训练环境,若改用少步学生做 rollout 可大幅提升策略训练吞吐,两者下游收益的对比值得量化。

复现评估

复现难度中等偏上。开源:权重与推理代码承诺在 WorldArena 2.0 IROS 挑战赛结束后公开(github.com/AMAP-ML/DreamX-Phi),写作时点尚未发布。数据:六个训练源全为公开数据集(Ego4D 3700 小时、AgiBot World 1900 小时、DROID 350 小时、RoboCOIN 618 小时、InternData-A1、RoboTwin 2.0 25,000 条片段),评测集由官方发布,但清洗规则只有定性描述,复刻语料需要大量工程。依赖明确可得:Wan2.2-TI2V-5B、SAM3、Depth Anything 3、V-JEPA、π0.5 均有公开权重。算力:骨干为 5B 视频扩散 Transformer,语料约 8,000 小时视频,训练还需同时挂载深度分支与 V-JEPA 教师,多卡成本未披露,独立完整复现不现实;权重发布后做蒸馏或推理复核榜单的门槛会低得多。公式 (2)-(13) 推导完整,但 $M$、$\lambda_m$、$M_{max}$、$M_{min}$、$\sigma_{max}$、$N$ 等超参数数值未给出,需等代码。