← 返回 2026-07-21

HarmoHOI:外观与3D运动协同的多视角手物交互合成 HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis

Lingwei Dang, Juntong Li, Zonghan Li, Hongwen Zhang, Liang An, Wei Min, Yebin Liu, Qingyao Wu 📅 2026-07-19 👍 11 2026-07-25 18:30
3D运动生成 几何感知生成 多视角视频生成 手物交互 扩散Transformer 视频扩散模型

首个单图驱动的多视角手物交互视频与3D运动联合扩散生成框架

前置知识

视频扩散Transformer (Video DiT)

用 Transformer 替代 U-Net 作为扩散模型骨干,将视频切成 token 序列,通过自注意力建模长程时空依赖。本文基于预训练的 WAN 2.1-1.3B-T2V,它含 30 个 DiT 模块、12 个注意力头、隐藏维 1536,用校正流(Rectified Flow)做噪声调度。

本文所有创新都在这套视频 DiT 之上扩展,不懂 DiT 就无法理解双分支、视角间几何注意力、跨分支调制等核心模块。

校正流 / 流匹配 (Rectified Flow)

一种扩散训练范式:在干净潜变量与高斯噪声间线性插值构造 $z_t$,模型预测连接两者的速度场 $v_t=z_1-z_0$,用均方误差训练,推理时按 $z_{t-1}=z_t+\Delta t\cdot\hat{v}_\Theta$ 迭代去噪。SD3、WAN 等均采用。

HarmoHOI 两个网络 $M^2$DiT 与 GloMAD 都沿用这套速度场预测与去噪流程,损失函数 $\mathcal{L}_{M^2DiT}$、$\mathcal{L}_{GloMAD}$ 的形式都建立在它之上。

变分自编码器 (VAE) 与潜空间扩散

VAE 把原始视频压缩到紧凑潜空间,扩散只在潜空间进行以降算力。WAN 2.1 的 VAE 时空压缩比为 $(8\times8\times4)$,分词器再 2× 下采样。本文额外训练一个与原视频 VAE 同构的「运动 VAE」来编码 3D 点轨迹伪视频。

「让 3D 运动和 RGB 共享相似的潜空间」是本文最关键的设计,理解 VAE 才能明白运动伪视频为何能复用预训练先验、为何能规避 2D-3D 域差导致的训练崩溃。

对极几何与 Plücker 坐标

多视角几何中,同一 3D 点在不同视图的投影服从对极约束。Plücker 坐标用 (方向, 矩) 6 维参数表示空间直线(相机射线)。本文把每个目标相机相对参考帧的位姿转成 Plücker 射线图作为相机条件嵌入,并基于参考深度做对极渲染生成多视角参考图。

对极渲染与 Plücker 射线图是注入相机条件的核心机制,视角间几何注意力(inter-view geometric attention)也依赖多视角几何,是「几何感知」落地的关键。

3D 点轨迹 (Point Tracks)

记录场景中若干点随时间在三维空间运动的轨迹 $\boldsymbol{M}\in\mathbb{R}^{V\times T\times K\times 3}$,相比 2D 光流能保留跨帧对应关系,相比 3D 关键点更稠密、更具泛化性。本文选它作为 3D 运动表示。

论文专门论证了为何选点轨迹而非光流(VideoJam)或稀疏关键点(SViMo):它兼顾跨帧对应与 3D 几何信息,是「全局对齐三维运动」的载体,也是评估运动精度(Chamfer/RPE/PI)的对象。

多视角一致性 (Multi-view Consistency)

指同一动态场景从不同视角同时观察时在像素、语义、几何上的对齐程度。本文用 Matching Pixels(经 GIM 匹配)与 CLIP-Views 两类指标量化,并用运动的多视角 RPE/PI(重投影后)衡量三维一致性。

多视角一致性是本文要解决的核心问题,也是它区别于单轨迹渲染、单目重建、纯表观同步三类已有方法的根本目标,理解它才能看懂 Table 1 的 Mat.Pix. 与 Table 2 的 MV 指标。

研究动机

手物交互(HOI)合成是动画制作和具身智能的基石任务,但它与普通视频生成有本质不同:涉及精细的手指运动、频繁且极端的自我遮挡与相互遮挡、复杂的局部形变。作者实测发现,即便是顶级的 Seedance 2.0 也会凭空幻觉出本不存在的锤子(指令跟随弱)、WAN 2.7 会对木质材质产生不合理扭曲(物体形状一致性弱)。更关键的是,现有三类把视频模型用于新视角/多视角生成的方法都存在硬伤:相机控制单轨迹渲染类(如 DaS、Uni3C、MV-Custom)本质是沿单条相机路径的生成式渲染,无法保证同一动态场景在同时观察的其他视角下几何一致;单目视频生成式重建类(如 SV4D 2.0、MV-Performer)从单个视频中挖掘多视角三维信息,病态且易错,而本文任务只有一张参考图、不确定性更高;直接同步多视角生成类(如 SynCamMaster、CAT4D)只做数据驱动的表观同步,缺乏显式三维几何与运动建模,在面对 HOI 的精细运动和复杂遮挡时力不从心(见补充 Tab.4 的对比)。

本文的目标是本文目标是:仅凭单张参考图像 $I$、多视角目标相机位姿 $\Pi=\{\pi_v\}_{v=1}^{V}$ 和一段文本提示 $P$,就能同时合成视觉真实、运动合理、跨视角几何一致的同步多视角手物交互视频 $\boldsymbol{V}\in\mathbb{R}^{V\times T\times H\times W\times 3}$,以及与之对应的全局对齐、度量尺度的 3D 点轨迹 $\boldsymbol{M}\in\mathbb{R}^{V\times T\times K\times 3}$。换言之,输入端只需一张图加相机位姿(而非已有视频),输出端要同时拿到 2D 外观与 3D 运动,并保证二者在去噪过程中相互促进、共同演化,最终在视觉质量、运动合理性和多视角几何一致性三个维度同时达到 SOTA。

与已有工作不同的是,本文的独特切入点是「2D 视频只是 3D 物理世界的投影快照」——真正的多视角一致性根源在于全局对齐的三维几何与运动感知。不同于把 3D 信号当作外部控制条件(如 Uni3C、DaS)或依赖事后视频重建(如 SV4D 2.0、MV-Performer)的做法,HarmoHOI 首次在统一的扩散管线内同时建模 2D 外观与 3D 运动的一致性,并在去噪过程中显式学习多视角对极几何的同步。关键技术缺口在于如何让 3D 几何信号与视频基础模型的 2D 潜空间对齐:作者通过把点轨迹表示成「运动伪视频」让 3D 与 RGB 共享相似潜空间,从而最小化 2D-3D 域差、复用预训练先验,并通过闭环反馈让两个模态在线协同。

核心方法

HarmoHOI 是一个端到端的联合扩散框架,基于预训练文本到视频基础模型 WAN 2.1-1.3B-T2V 扩展而来。直觉上:既然 2D 视频是三维世界的投影,那就让模型在生成像素的同时也「画出」每个点的三维轨迹,并用相机几何把不同视角绑在一起。技术上由两个网络组成:一是混合多视角扩散 Transformer($M^2$DiT),在视频 DiT 之上构建双分支结构,同步生成多视角 RGB 视频、3D 点轨迹的运动伪视频以及全局度量尺度;二是全局运动对齐扩散(GloMAD),把 $M^2$DiT 产出的粗糙、未定标的多视角点轨迹精修成全局对齐的度量尺度三维轨迹。两者共享扩散流程,构成去噪过程中的「闭环互促」:$M^2$DiT 的输出作为 GloMAD 的粗糙运动条件,GloMAD 的对齐点又反投影成运动伪视频去引导 $M^2$DiT 的下一步去噪。训练上采用混合数据渐进式课程学习,从单视角外观-几何对应逐步过渡到多视角对极一致性,再到统一的外观-几何学习。

核心创新在于「把 3D 点轨迹伪装成视频」。直接从头训练 3D 点轨迹生成模型需要海量三维数据且难泛化,直接微调视频基础模型做运动生成又会因 2D-3D 域差而训练崩溃。作者的解法是把 3D 点轨迹经归一化、颜色映射转成与 RGB 视频同构的「运动伪视频」,用与原视频 VAE 相同架构的运动 VAE 编码到与 RGB 对齐的潜空间——预训练视频模型的表征与生成先验从一开始就能被复用,2D 与 3D 模态共享相似潜空间从而便于一致性学习。第二个关键创新是闭环互促的联合扩散:不同于把 3D 当外部条件或事后重建,HarmoHOI 让 2D 外观与 3D 运动在扩散去噪的每一步相互调制、协同演化,并引入可学习的尺度 token 回归全局度量尺度——这是把各视角局部点轨迹统一到全局对齐三维轨迹的关键。

方法步骤详情

完整流程分三步。第一步多视角条件准备(Alg.1):把各相机坐标系的 3D 点反投影到世界系再重投影到参考相机,提取深度后用 $\boldsymbol{d}^{norm}=1-\text{MinMaxNorm}(\boldsymbol{d},\boldsymbol{s})$ 归一化并 colormap 成 RGB 写入伪视频,目标位姿转 Plücker 射线图,基于参考深度做对极渲染得多视角参考图。第二步 $M^2$DiT 联合扩散:把渲染图、相机 token、文本 token 与两分支噪声潜变量拼接,每个 DiT 块依次做视角内时空注意力、视角间几何注意力、跨分支双向调制、文本交叉注意力与 FFD,输出视频、运动、尺度的潜速度场并以三者 MSE 之和优化(含全局尺度 $\hat{\boldsymbol{s}}$)。第三步 GloMAD 精修:把运动伪视频反归一化、反投影成粗糙点轨迹作为条件,经 Point Transformer V3 稀疏卷积做条件生成,输出全局对齐三维轨迹,损失为速度 MSE 加 $\mathcal{D}_{chamfer}$,推理时两网络逐步互促。

技术新颖性

技术新颖性体现在五点。第一,首个同步多视角的 HOI 视频+运动联合扩散框架,填补了多视角几何感知生成的空白(见 Tab.4 中唯一同时满足高生成能力、显式 2D-3D 建模、严格全局对齐三性的方法)。第二,运动伪视频表示让 3D 与 RGB 共享 VAE 与潜空间,规避了 2D-3D 域差导致的训练崩溃,也免去了从零训练运动骨干。第三,可学习的尺度 token 机制——运动伪视频归一化丢失了尺度信息,通过两个 token 回归全局度量尺度 $\\hat{\\boldsymbol{s}}$,这是把多视角局部轨迹统一成全局对齐三维轨迹的前提。第四,$M^2$DiT 与 GloMAD 共享扩散流程构成的闭环互促,在推理(Alg.2)中每一步去噪都让 2D 与 3D 互相增强,区别于一切单阶段或事后对齐的方法。第五,混合数据三阶段课程学习——用大规模野外单视角数据保视觉泛化、用 UE5 合成数据学跨视角一致性、用实验室高精数据学统一外观-几何。

HarmoHOI 框架总览:$M^2$DiT 与 GloMAD 双网络及闭环互促
Fig. 2: HarmoHOI 框架总览:$M^2$DiT 与 GloMAD 双网络及闭环互促
混合数据渐进式课程学习:单视角几何感知 → 多视角外观同步 → 统一外观-几何
Fig. 3: 混合数据渐进式课程学习:单视角几何感知 → 多视角外观同步 → 统一外观-几何

实验结果

实验评估视频质量与 3D 运动。视频质量(Table 1):本文多视角一致性最佳,Matching Pixels 535.8(SynCamMaster 仅 410.4)、CLIP-Views 83.18、单视角 Subject Consistency 0.9342 均最高;WAN 2.1 因失真仅 0.5408。DaS 高分源于其相机控制偏弱。3D 运动(Table 2):本文全面领先,Chamfer Distance 0.0097(次优 DA3 0.0241,低约 60%)、单视角 RPE 14.8 / PI 98.6%;多视角 RPE 仅 34.7、PI 34.24,而 Geo4D/GeoCrafter/DA3 仅 2.89/5.64/11.05,存在严重层间错位,凸显联合生成对逐视角重建的优势。合理性上 Penetration 0.0571、Non-contact 0.12 均最低。消融(Table 3):去多视角跌到 335.1、去 $M^2$DiT 跌到 438.4、去 GloMAD 运动 RPE 恶化到 47.6、去混合数据为 522.5/38.4,每组件都不可或缺。

视频质量对比(单视角/多视角)
Table 1: 视频质量对比(单视角/多视角)
3D 运动定量对比
Table 2: 3D 运动定量对比
关键组件消融:多视角、$M^2$DiT、GloMAD、混合数据
Table 3: 关键组件消融:多视角、$M^2$DiT、GloMAD、混合数据
不同方法生成多视角视频的可视化对比
Fig. 4: 不同方法生成多视角视频的可视化对比
多视角 3D 点轨迹可视化
Fig. 5: 多视角 3D 点轨迹可视化
野外单视角泛化演示:生成 2D 视频、运动伪视频与 3D 点轨迹
Fig. 6: 野外单视角泛化演示:生成 2D 视频、运动伪视频与 3D 点轨迹
野外多视角泛化演示:「切红辣椒」HOI 案例
Fig. 7: 野外多视角泛化演示:「切红辣椒」HOI 案例
多视角手物交互视频及对应全局对齐 3D 点轨迹
Fig. 8: 多视角手物交互视频及对应全局对齐 3D 点轨迹
对未见 HOI 任务的泛化:多视角同步 2D 视频与 3D 点轨迹生成
Fig. 9: 对未见 HOI 任务的泛化:多视角同步 2D 视频与 3D 点轨迹生成
查看结构化数据
任务指标本文基线提升
多视角视频像素一致性 Matching Pixels (MV, ↑) 535.8 SynCamMaster 410.4 / SV4D 2.0 446.8 较最强多视角基线 SynCamMaster 提升约 30.6%,绝对值 +125.4
多视角视频语义一致性 CLIP-Views (↑) 83.18 DaS 83.01 / SynCamMaster 78.97 最优,较 SynCamMaster +4.21
单视角外观时间一致性 Subject Consistency (↑) 0.9342 WAN 2.1 0.5408 / SViMo 0.8872 最优,较 WAN 2.1 +0.3934
单视角 3D 运动几何精度 Chamfer Distance (SV, ↓) 0.0097 Depth Anything 3 0.0241 / Geo4D 0.0352 较次优 DA3 降低约 60%
多视角 3D 点轨迹精度 RPE (MV, ↓) 34.7 Depth Anything 3 61.9 / GeoCrafter 68.2 较 DA3 降低约 44%,凸显联合生成的全局对齐优势
多视角点轨迹内点率 Percentage of Inliers (MV, ↑) 34.24 Depth Anything 3 11.05 / Geo4D 2.89 约为 DA3 的 3.1 倍、Geo4D 的 11.9 倍
手物交互物理合理性 Penetration / Non-contact Rate (↓) 0.0571 / 0.12 DA3 0.0847 / 0.16;Geo4D 0.1275 / 0.19 两项均最低,穿透率较 Geo4D 降约 55%

局限与改进

作者明确承认:配对的多视角 2D 视频与 3D 运动数据极度稀缺,即便是目前少数同时提供多视角视频与高质量 3D 标注的 TACO 数据集也只有 12 个视角,密度不足以训练能在任意视角渲染的 4D 高斯表示。我额外观察到几点:一是视频分辨率仅 49×256×384(受算力限制),帧数与分辨率都偏低,长序列或高分辨率细节难以保证;二是评估视角固定在 6 个,对极稀疏或极端视角外的泛化未充分验证;三是合理性指标(穿透率 0.0571、非接触率 0.12)虽然最低但仍非零,说明手物接触的物理精度仍有提升空间,且依赖数据先验而非物理引擎;四是对 unseen 物体/动作的定量泛化指标在正文缺失,主要靠定性图(Fig.9)展示;五是闭式循环推理会带来每步额外开销,影响推理速度。

独立分析的弱点

弱点一:分辨率与时长的算力瓶颈。49 帧、256×384 的设定来自显存限制,难以满足实际动画/具身任务对长视频高清的需求,改进方向是用更高效的潜空间压缩、流式生成或扩散蒸馏。弱点二:评估视角有限且固定为 6 个,相机位姿分布外的泛化(如稀疏、极端俯仰)未量化验证,可引入随机视角采样与位姿增强。弱点三:合理性依赖数据先验而非物理引擎,穿透率/非接触率非零,可像 PhysHOI 那样耦合物理仿真器后处理或把物理约束写进损失。弱点四:单图输入带来高不确定性,对严重遮挡或极端姿态的初始帧生成可能失败,可加入多图条件或运动先验。弱点五:闭环推理带来额外每步开销,推理速度受损,可研究一步对齐或一致性蒸馏。弱点六:unseen 泛化缺定量指标,仅定性展示。

未来方向

作者提出的方向是采集或合成更稠密的多视角 HOI 数据,训练 4D 高斯表示从而支持任意视角渲染,缓解 12 视角的密度限制。基于本成果可延伸:一是把闭环互促机制推广到人体全身交互(目前 UniMo 仅单视角人)与双手协作(bimanual);二是与物理仿真或可微渲染结合,把合理性指标作为硬约束;三是把运动伪视频思想迁移到其他 3D 信号(法向、占用场、高斯),统一更多几何模态;四是用于具身操作的策略学习——同步多视角视频加 3D 轨迹可作为机器人演示数据增广,呼应 Gen2Act 等视频驱动的机器人学习;五是扩展到实时、任意视角的 4D 世界模型,呼应作者「为物理感知视频世界模型提供洞见」的愿景。

复现评估

复现度中等偏上。优势:明确基于开源 WAN 2.1-1.3B-T2V,给出了完整架构细节(30 个 DiT 模块、12 头、隐藏维 1536、运动 VAE、Point Transformer V3)、训练超参(8×A100 80GB、DeepSpeed ZeRO-3、梯度检查点、混合精度、10% HOIGen1M 预热 5K 步)、三个数据集(HOIGen1M、SynCamVideo、TACO)均公开或可复现,损失函数与 Alg.1/Alg.2 伪代码完整,并附项目主页与补充视频。困难点:三阶段课程的数据配比与各阶段时长未完全披露;GloMAD 的点云序列化/稀疏化细节较省略;闭环推理的具体去噪步数耦合关系需仔细实现;8 卡 A100 训练成本对个人研究者较高。整体而言,熟悉视频扩散与点云 Transformer 的团队能够复现。