DreamTraj:从视频扩散模型未渲染潜变量中生成6自由度物体轨迹 DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents
仅用一张RGB图与指令,从冻结视频扩散中间特征直接读出6-DoF物体轨迹。
前置知识
6-DoF位姿与SE(3)/SO(3)流形
6自由度位姿描述刚体在三维空间的位置(3维平移)和朝向(3维旋转),常用4×4齐次变换矩阵表示,全体构成李群SE(3),纯旋转部分构成SO(3)。旋转常用6维连续表示(Zhou et al. 2019)以避免欧拉角奇异性或四元数不连续。两个旋转之间的误差用测地角 $\theta = \arccos((\mathrm{tr}(R_{pred}^\top R_{gt})-1)/2)$ 度量。
本文的输出就是一串相对9-D位姿token(2维方位+1维对数深度比+6维旋转),评估指标也建立在SE(3)/SO(3)几何之上,不懂这套表示就无法理解方法的输出空间和损失设计。
图像到视频扩散模型(I2V Diffusion)
给定一张图(和文本条件)生成未来视频帧的扩散模型,由噪声到清晰视频的逐步去噪过程驱动。本文用的是Wan2.2-I2V-A14B,一个40层、40头、宽度5120的双专家混合专家(MoE)扩散Transformer,去噪采用FlowUniPCMultistep采样器,共40步、guidance 3.5、shift 5.0。其内部有'高噪声专家'和'低噪声专家',在t=900附近切换。
DreamTraj的核心就是把I2V扩散当成'可查询的运动先验黑盒',在它去噪到第16步(t≈882,刚跨过专家切换点)时偷看中间特征。不理解扩散去噪过程就抓不到'未渲染即可读'的关键洞察。
流匹配(Flow Matching)
一种生成式建模框架,通过回归把噪声分布映射到数据分布的速度场来训练(Lipman et al. 2023)。相比经典扩散,它直接学习连续概率路径的常微分方程速度。推理时从噪声出发按欧拉法积分若干步得到样本。本文的Reader用条件流匹配在速度场上训练,推理时20个显式欧拉步积分出13个位姿token。
Reader是一个7.1M参数的流匹配DiT,是论文唯一训练的组件;训练目标、损失项(端点项、SO(3)弦距离项、平滑项)和推理过程都基于流匹配,是方法的核心机器学习工具。
第一人称视角(egocentric)操作数据
由穿戴式相机(如AR眼镜、头戴装置)拍摄的第一视角手-物交互视频,捕捉人手如何操作物体。代表性语料包括Ego4D、EPIC-KITCHENS、HOI4D、HOT3D等。这类数据天然贴近机器人将看到的视角,但获取逐帧6-DoF物体位姿昂贵,需深度传感器、CAD模型或多视角装置。
Move数据集正是一个egocentric 6-DoF操作语料,从6个源语料精选并补充细粒度语言指令;论文要解决的部署场景就是egocentric视角下单图+指令预测物体轨迹。
Diffusion Transformer(DiT)与注意力机制
DiT用Transformer替代U-Net做扩散主干(Peebles & Xie 2023),通过自注意力建模长程依赖,用AdaLN-Zero做条件注入。query-key注意力图刻画每个query patch与所有key patch的相似度,已被证明在图像/视频扩散中天然编码语义对应和点跟踪(Tang 2023;Nam 2025)。本文从Wan2.2的(block 28, head 32)注意力单元读出物体4个几何标量。
DreamTraj的两条信号通道之一就是q·k注意力图作为隐式点跟踪器,且Reader本身是一个4层DiT。理解注意力如何编码运动对应是理解'读潜变量'可行性的前提。
研究动机
现有6-DoF物体轨迹预测方法存在两大类未解难题。第一类直接从交互数据学习动力学,但依赖的egocentric操作语料要么是大规模自动伪标注(用数量换质量,继承挖掘管线的累积噪声),要么手工整理但规模小;其语义标注还非常粗糙(只有verb-noun标签),不足以学习细粒度、语言条件的物体运动。更致命的是这类方法需要特权输入:ObjectForesight需要多帧视觉上下文+物体CAD网格+3个真值上下文位姿,EgoScaler需要深度图+物体初始6-DoF位姿,这些在野外场景几乎无法满足。第二类把想象力外包给视频生成(RIGVid等):先用视频生成器合成完整未来视频,再跑分割→点跟踪→深度估计→位姿拟合的四模型感知级联从像素提取轨迹——虽然利用了视频大模型的丰富运动先验,但完整视频生成+像素空间提取带来巨大推理成本(实测348s/clip)。更根本地,获取可信6-DoF标注本身就极昂贵,需深度传感器、CAD、多视角装置或marker,远比2D标注昂贵,而2D观测和自然语言任务描述却廉价易得。
本文的目标是本文目标是仅凭单张RGB图像 $I_0$ 和一个语言指令 $\ell$,预测被操作物体未来49帧(约2秒)的6-DoF轨迹(在 $I_0$ 相机坐标系下),推理时完全不需要视频、深度或CAD。具体目标三方面:其一,构建高质量监督数据集Move,提供5,038条人工核验的物体中心egocentric 6-DoF轨迹,每条配细粒度自然语言指令(如'pick up the kettle and pour water into the mug on the right')而非粗糙verb-noun标签,弥补语言到运动的监督缺口;其二,设计一种既不需要特权几何输入、又能直接利用视频扩散模型运动先验的方法,把接口压到最小(单RGB帧+指令);其三,在保持甚至提升精度的前提下,避免'先生成再提取'管线的高昂推理成本,实现4.6倍以上端到端速度提升。
与已有工作不同的是,本文独特切入角度在于'未渲染即可读'的洞察:物体运动信息在视频扩散模型完整去噪/解码之前,就已经在中间特征中以可解码的形式存在。不同于RIGVid类方法需把视频完全生成出来再从像素反推,DreamTraj在40步去噪的第16步(t≈882,恰好跨过Wan2.2双专家MoE的高噪声→低噪声专家切换点)就冻结读取内部特征——query-key注意力图作为隐式点跟踪器提供物体运动,anchor池化隐状态提供场景几何,从而跳过后续24步去噪、VAE解码和感知级联。这与既有的'图像扩散特征已含语义对应'、'视频扩散注意力支持零样本点跟踪'等发现相呼应,但首次将该洞察用于直接解码6-DoF轨迹而非在已观察/已生成视频上做点跟踪。位姿参数化也刻意设计为尺度无关(每通道都是差或比值,如 $s_t=\log(z_t/z_0)$ ),让Reader从不被要求预测绝对尺度,米制单位仅在输出端由单帧深度恢复。
核心方法
整体直觉是:把视频扩散模型当作一个'已经学过互联网规模运动先验'的可查询黑盒,在它'想到一半'时偷看它的中间表示就能拿到运动计划,而不必等它把视频'画完'。技术路线分三阶段:第一阶段,将单张RGB图 $I_0$ 和指令 $\ell$ 送入完全冻结的Wan2.2-I2V-A14B扩散Transformer(40层、40头、宽度5120,832×480分辨率),让其朝想象的未来去噪;第二阶段,在第16步(共40步)从该潜变量中读出两类互补信号——query-key注意力轨迹(隐式点跟踪)和anchor池化中间隐状态(场景级几何);第三阶段,用仅7.1M参数的轻量流匹配DiT Reader把这些粗运动信号解码为13个相对9-D位姿token,最后用一个单帧深度估计把无尺度的输出锚定到米制单位。整个骨干保持冻结,动力学知识来自互联网规模视频预训练而非从小交互数据重新学习;因读取发生在早期去噪步,没有任何视频被完整合成或解码,这就是轨迹读取比生成+解析全视频快数倍的根本原因。
核心创新是'从冻结视频扩散模型的内部表示直接解码物体6-DoF轨迹,而非从已生成的像素提取'。与已有方法的本质区别:生成-再提取类把视频扩散当像素合成器,知识先合成成像素再被感知模块二次提取,存在信息冗余和高成本;DreamTraj发现扩散模型中间特征已显式编码运动计划——query-key注意力图天然就是隐式点跟踪器(论文引证Nam/Son/Tang等2023-2025工作),池化隐状态携带几何。通过在去噪早期步骤截断读取,避免后续24步去噪和VAE解码以及整套感知级联,使推理只需18次(共80次CFG分支)前向而非80次,速度提升4.6倍。第二个关键创新是位姿参数化为尺度无关:每通道都是差或比值($\delta u_t, \delta v_t$ 方位差、$s_t=\log(z_t/z_0)$ 对数深度比、6-D相对旋转 $r_t$ 对应 $R_0^\top R_t$),Reader从不被要求预测绝对尺度,米制单位仅在输出端由单帧深度恢复。这使得Reader可以专注于学相对运动结构,把绝对尺度这个单目歧义问题留到输出端。
方法步骤详情
①输入:单张RGB帧 $I_0$ 和语言指令 $\ell$。②物体接地:用GroundingDINO+SAM2在 $I_0$ 上检测分割物体一次,得query patch。③骨干想象:将 $I_0$、$\ell$ 送入冻结Wan2.2-I2V-A14B,按FlowUniPCMultistep、guidance 3.5、shift 5.0、seed 0去噪;采用stride-2流缓存(算一步复用一步)约减半前向;在第16步(共40步,$t\approx882$)停止,不继续后续24步、不做VAE解码。④读出运动信号:从固定(block 28, head 32)注意力单元读出物体4个标量通道——质心方位 $(\delta u_t,\delta v_t)$、对数散布比 $\log(\sigma_0/\sigma_f)$ 作深度线索、由2×2互协方差极分解得的面内旋转角;同时从blocks 0/19/39隐状态在4×4 anchor网格均值池化、经PCA降到128维,组成13×132序列作Reader上下文。⑤Reader解码:7.1M参数流匹配DiT(4层8头宽256)将带噪13×9位姿token联合去噪,AdaLN-Zero注入 $\tau$、768-D SigLIP2指令嵌入、2-D域标志;推理积分20个Euler步;训练用条件流匹配,固帧0锚、加端点项(0.1)、SO(3)弦距离项(0.1)、平滑项(0.05)。⑥米制锚定:将13个尺度无关token重采样到49帧,用 $I_0$ 物体深度 $z_0$(传感器或Depth Anything V2单目估计)恢复绝对尺度,内参 $K$ 恢复米制位置——深度仅在输出端进入。
技术新颖性
技术新颖性体现在三处。第一,'读潜变量而非生成像素'是范式级创新:据作者所知,这是首个直接从冻结视频扩散中间表示解码6-DoF物体轨迹(而非生成像素再提取)的方法,回答了'运动计划何时在扩散潜空间中可解码'这一未解问题,并用置换控制的边距 $m=\rho(a_i,g_i)-\mathbb{E}_{j\neq i}\rho(a_i,g_j)$ 严谨证明信号是per-sample的而非共享群体先验(裸相关0.43也会假阳性)。第二,读出步骤的'断点'发现:margin在 $k=14$ 到 $k=16$ 跃升48%(配对 $t=12.6$,955 clips)后立即饱和,恰好落在Wan2.2双专家MoE的高/低噪声专家切换点($t=900$),说明运动可解码性与专家激活强相关,这是对视频扩散可解释性的实证贡献。第三,跨域训练设计:部署时特征来自生成视频,但可信6-DoF监督只在录制视频;用单一共享权重集+域标志 $d$ 吸收差异,在B域(生成)上预热40 epoch后再混入60% A域(录制),同时下加权B域噪声更大的通道——把'师生域鸿沟'显式建模的工程创新。第四是数据集创新:Move是首个5,038条人工核验+细粒度指令的egocentric 6-DoF语料,填补了语言到运动监督的空白。
实验结果
精度(Table 1):EgoScaler原生2.0s协议(真GT n=537)上DreamTraj达ADE 3.04cm/FDE 4.71cm/Rot 7.9°/Rot-final 12.9°,对比EgoScaler(额外吃深度图+初始位姿)7.52/10.71/28.6/45.6——平移精度约2.5倍、旋转误差降约3.6倍;ObjectForesight原生1.17s短窗(n=593)1.97/3.32/6.5/10.5对比其2.71/4.58/7.8/11.1(它吃多帧上下文+CAD+3个GT位姿)仍全面胜出;扩展到整段动作(n=594)差距急剧拉开(10.29/12.74/29.8/30.2 vs 6.76/8.39/18.2/20.4)。该lead经受两压力测试:对基线扫5种输入约定取最优、在DreamTraj原生时间戳打分。部署版Reader在5,038样本整体6.4cm/9.5cm/24.6°。效率(Table 2):端到端76s vs 生成-提取348s,4.6倍加速(18/80 vs 80/80 CFG前向,无VAE解码、无感知级联)。消融(Table 4):去q·k轨迹ADE最差(+0.71cm,唯一跟随物体);去池化隐状态端点和深度相关性最差(0.640→0.565);去指令主要伤旋转(Rot 24.63→26.20)。读出步骤(Table 3):$k=16$ 后margin几乎不动(0.191→0.197)、ADE也饱和于7.89。泛化(Sec.5.5):50个分布外场景(40真实+10游戏),10位标注者判定,80%成功执行指令。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| egocentric 6-DoF轨迹预测(EgoScaler原生2.0s窗口,真GT,n=537) | ADE / FDE (cm) / Rot / Rot-final (°) | 3.04 / 4.71 / 7.9 / 12.9 | EgoScaler 7.52 / 10.71 / 28.6 / 45.6(额外吃深度图+初始位姿) | ADE降低59.6%,旋转误差Rot降低72.4%(约2.5×平移精度,约3.6×旋转精度) |
| 6-DoF轨迹预测(ObjectForesight原生1.17s短窗,真GT,n=593) | ADE / FDE (cm) / Rot / Rot-final (°) | 1.97 / 3.32 / 6.5 / 10.5 | ObjectForesight 2.71 / 4.58 / 7.8 / 11.1(吃多帧上下文+CAD网格+3个GT位姿) | ADE降低27.3%,且输入更少 |
| 6-DoF轨迹预测(ObjectForesight扩展到整段动作,真GT,n=594) | ADE / FDE (cm) / Rot / Rot-final (°) | 6.76 / 8.39 / 18.2 / 20.4 | ObjectForesight 10.29 / 12.74 / 29.8 / 30.2 | ADE降低34.3%,长程优势更显著 |
| 端到端推理效率(49帧轨迹,单RTX PRO 6000) | 总推理时间(s) / CFG前向次数 | 76s / 18-of-80,无VAE解码、无感知级联 | Generate-then-extract 348s / 80-of-80,含280s生成+68s感知 | 4.6×端到端加速 |
局限与改进
作者承认的局限:论文未在真实机械臂上闭环部署,作者明确写'从预测轨迹驱动真实操作臂是自然的下一步',目前仅是开环预测评估。泛化测试80%成功率意味着20%失败,且基于10位标注者的主观判断而非定量GT(因分布外无真值)。整动作扩展块旋转误差仍很高(真GT 18.2°、生成-GT 33-41°),远超短窗的6.5-10.5°,说明长程旋转预测仍是难题。我的观察:①语义覆盖窄,仅14类物体、11个动词、92个物体-动词对,难推广到开放世界;②深度估计是单瓶颈,依赖Depth Anything V2单目估计,深度相关性median仅0.640,长程深度漂移会累积;③76s生成49帧不可实时,无法用于闭环控制,仅适合离线规划;④整个动力学知识完全借自冻结骨干,Reader仅7.1M参数在5,038小数据上训练,若骨干先验不覆盖的场景(罕见物体、非刚性、双臂协同)将系统性失败;⑤只处理刚性物体,对称物体需把旋转投影到可观测子空间,处理偏ad-hoc;⑥基线重训需修复多个bug(附录C详述EgoScaler归一化泄漏、自回归KV缓存缺失、ObjectForesight锚对齐问题),说明第三方严格复现存在坑。
独立分析的弱点
弱点1:实时性不足。76s/49帧约1.5s等效每帧吞吐,无法支撑闭环控制。改进方向:进一步压缩去噪步数(已用stride-2缓存),探索CFG蒸馏、一致性模型或更激进步数压缩;用更小蒸馏骨干或激活量化。弱点2:长程旋转误差大。整动作块Rot-final达20-41°。改进方向:引入旋转SO(3)流匹配专用参数化、多尺度时间注意力、在Reader中显式加入角动量/物理约束、或对长程采用层级化预测。弱点3:语义覆盖窄(14类11动词)。改进方向:扩展数据源到Ego-Exo4D等更多egocentric语料、引入开放词汇物体检测、用LLM合成更丰富指令模板。弱点4:深度依赖单目估计且correlation仅0.640,是端点误差主要来源。改进方向:联合训练深度头、在骨干内读取已有几何先验、测试时深度细化或采用立体/主动深度。弱点5:域鸿沟用单一2-D域标志吸收偏简陋。改进方向:引入对抗域对齐、特征归一化适配器、或更细粒度域混合策略(如按生成质量加权)。弱点6:仅评估离线预测,未验证闭环机器人执行。改进方向:在真机上集成运动控制器做grasp/place闭环验证,量化任务成功率而非轨迹误差。
未来方向
作者明确提出的:在真实机械臂上从预测轨迹驱动操作('Driving a real manipulator from the predicted trajectory is the natural next step')。基于成果可延伸的方向:①把'读潜变量'范式推广到其他运动接口——人体姿态、手部动作、场景流、关节式物体;②将该洞察用于视频扩散模型自身的可解释性研究(哪些注意力单元编码何种运动、专家切换如何影响可解码性);③结合大语言模型做任务分解后的多步轨迹规划;④扩展到非刚性物体和双臂协同操作;⑤探索在线闭环控制,将Reader轻量化到实时;⑥将Move数据集扩展到更多物体类别和动词,引入开放词汇设置;⑦研究骨干选择对效果的影响(不同I2V模型的运动可解码性差异、是否更大骨干margin更高);⑧把readout步骤选择做成可学习或自适应,而非固定k=16。
复现评估
复现评估较好但仍有限制。开源情况:论文声称fold分配文件随代码补充发布,项目页 https://whathappen0.github.io/DreamTraj/ ,但v1版本时具体代码与checkpoint发布状态需关注。数据:Move数据集基于6个公开语料(HOI4D/TACO/HOT3D/OakInk2/H2O/FPHA)构建,需各自许可;标注管线(GroundingDINO+SAM2/FoundationPose/SpatialTracker v2/DA3/SAM 3D Objects)论文给出每步细节,且明确指出对生成视频必须用DA3度量深度(而非相对深度)和SAM 3D Objects网格(而非CAD)这两个关键改动。算力:所有实验在单张RTX PRO 6000上完成,5折Reader训练仅16分钟,骨干前向预处理是一次性成本不在推理预算内。难度:中等偏高——骨干是14B参数的Wan2.2-I2V-A14B,需足够显存做推理;置换控制、专家切换点定位等关键超参需仔细复现。附录给出完整配置(Table 5-11,含采样器FlowUniPCMultistep、guidance 3.5、seed 0、q·k cell为block 28/head 32等),理论上可复现。基线重训需修复多个bug(附录C详述EgoScaler归一化泄漏、自回归解码KV缓存缺失、ObjectForesight锚对齐问题),提示第三方严格复现存在坑。
论文图表
四个面板:(a)按源语料分布、(b)动作动词、(c)物体类别,各拆分为录制与生成两半;(d)所有5,038条轨迹的每clip平移与旋转幅度的联合分布。
揭示两个关键属性:①生成增强是'深化而非扩展'覆盖(保持14类物体/11动词/92物体-动词对,只在每格塞更多轨迹);②平移和旋转幅度仅松耦合(既含近平纯平移如搬运,也含小位移大旋转如倒水/检查),故方法无法用一个预测另一个作弊。这是数据集质量的证据。