跨形态运动迁移:基于抽象运动表示自举的两阶段视频运动迁移框架 Motion Beyond Morphology: Bootstrapping Cross-Category Motion Transfer from Abstract Motion Representations
用抽象运动视图自举跨类别配对,再内化为端到端视频运动迁移。
前置知识
视频运动迁移 (Video Motion Transfer)
给定一段参考视频 $V_r$ 和一个目标条件 $c_t$(含目标文本描述和可选的参考图像),合成目标视频 $\hat{V}_t = G(V_r, c_t)$,使其复现参考视频中的运动动态,但外观、形态和场景内容由 $c_t$ 决定。当源与目标类别结构兼容(如人到人)时,常用骨骼/姿态作为运动信号;当跨类别(如袋鼠到台灯)时,固定结构对应失效,需要更抽象的运动表征。
整篇论文的核心任务就是视频运动迁移,作者进一步把它推广到跨类别的开放场景,理解这个基本定义才能区分 I2V 与 T2V 两种设置以及为何需要打破固定结构对应。
流匹配 (Flow Matching) 与扩散去噪
流匹配是一种连续生成目标:学习时变速度场 $u_\theta(z_\tau, \tau, \cdot)$,沿连接噪声隐变量 $z_0$ 与数据隐变量 $z_1$ 的路径把样本从噪声运送到数据,训练损失形如 $\mathcal{L} = \mathbb{E}[\|u_\tau - u_\theta(z_\tau, \tau, \cdot)\|_2^2]$,采样时从高斯噪声反向积分 ODE。本文的 MMDiT 骨干基于此目标,速度场以条件(运动视图/参考视频+目标条件)作为额外输入。
Stage I 和 Stage II 的两个损失 $\mathcal{L}_{S1}$、$\mathcal{L}_{S2}$ 都写成流匹配形式,只是条件不同:前者是抽象运动隐变量 $z_m$,后者是参考视频隐变量 $z_r$。不懂流匹配就读不懂训练目标和条件注入接口。
多粒度抽象运动视图 (Multi-Granularity Abstract Motion Views)
作者用一组互补的运动抽取器把视频转成视频化的抽象条件:(1) 语义运动学,用 ViTPose++ 抽动物关键点并渲染骨架;(2) 深度感知全局轨迹,以前景掩码稳定中心点配前景平均深度画深度圆序列;(3) 稠密点轨迹,用 TAPNext++ 追踪像素级局部运动;(4) 6-DoF 轴,用 SpaTrackerV2 的 3D 轨迹估计逐帧刚体变换并画坐标轴;(5) 前景 Canny 边缘。每种只在抽取可靠时使用,经扰动后统一成视频形态。
Stage I 的全部输入就是这五种视图,它们既是构造跨类别监督的中间接口,也是消融实验(仅轨迹/仅轨迹/仅边缘)的对照对象,理解其互补性是看懂方法与消融的前提。
MMDiT 与因果 3D VAE
MMDiT(Multimodal Diffusion Transformer)是本文图像到视频扩散骨干,通过原生的条件接口把文本、图像、运动/视频条件注入去噪过程,而非为每种条件单独设计控制分支。因果 3D VAE 把 121 帧、约 480×854 像素的视频压成隐空间表示,文本走文本编码器,图像/视频走 3D VAE 编码。
Stage I 能让单一生成器学习异构运动视图,正是依赖 MMDiT 的统一条件接口(把不同运动视图都编码成视频化隐变量后塞进去),而 Stage II 把抽象条件换成参考视频也复用同一接口,这是两阶段能平滑过渡的工程基础。
HMF 指标与 Gemini 评分
HMF(Hybrid Motion Fidelity,源自 MT-Bench)同时度量全局轨迹与局部运动动态的一致性,在 Same/Near/Far 三个分裂上分别报告。G-Mot. 与 G-Leak 是基于 Gemini 大模型给出的运动保持度与源泄漏度主观评分,G-Leak 越低越好(表示生成视频越少继承源的外观/结构/背景)。DINO-I 与 CLIP-T 分别衡量 I2V 中目标图像相似度和 T2V 中文本对齐度。
论文的核心结论(在 HMF-All、G-Mot.、G-Leak、目标保真度上全面领先)几乎全部建立在这套度量上,理解 HMF 的 Same/Near/Far 分裂与 G-Leak 的泄漏含义才能判断“跨类别迁移质量”究竟提升了多少。
研究动机
现有视频运动迁移方法几乎都建立在固定的结构对应上:人与角色动画依赖姿态/骨骼序列(如 MagicAnimate、Animate Anyone),要求源与目标有可比的铰接结构与运动学布局;其他领域则用为特定结构或运动类型定制的表征,如轨迹只捕捉全局平移(DragNUWA、MotionCtrl)、稠密点轨迹缺乏语义与拓扑(Motion Prompting、TrackGo)、姿态只适合铰接主体。一旦源与目标在形态、铰接或形变机制上差异巨大(例如袋鼠跳落到台灯、蜻蜓翅膀到花瓣、水母到降落伞),固定结构对应就变得病态。即便最近基于扩散的隐式方法(MotionClone、DiTFlow、DeT、DisMo)从参考视频直接抽运动、类属更广,却仍可能保留源特定的形状、布局或外观。同时,大规模互联网视频很少提供跨形态运动等价的配对样本,缺少直接监督。
本文的目标是作者提出 Motion Beyond Morphology 视角:运动迁移不应依赖固定的结构模板,而应让模型自适应地决定哪些运动因子在源与目标间保持耦合(语义、姿态、拓扑、轨迹、节律、局部形变),哪些应根据结构兼容性解耦(源特定的外观、形态、场景)。为此目标,本文要训练一个单一模型,能直接从原始参考视频读出可迁移运动,按目标条件(文本+可选图像)生成目标视频,推理时无需骨架抽取、轨迹指定、点追踪或逐视频优化,并在跨类别的 Same/Near/Far 场景上同时取得高运动保真度、高目标保真度、低源泄漏。同时建立首个开放类别、实例级运动等价的训练集 OpenVMT-Dataset 与系统评测 OpenVMT-Bench。
与已有工作不同的是,独特切入角度是“用异构运动抽象作为构造跨类别监督的中间工具,而不是作为最终推理表征”。以往工作要么把某一种运动表征(姿态/轨迹/点轨迹)当作最终推理输入,要么用隐式注意力/运动流直接迁移。本文反过来:先用多种互补的抽象运动视图“自举”出形态不同但运动等价的视频对(Dboot),作为难以从真实视频直接获得的监督;再在 Stage II 用原始参考视频替换抽象条件,迫使模型在“源外观不再可靠预测目标”的跨类别对上学到“哪些动态跨类别仍信息丰富”。这种“先显式抽象建监督、再内化为隐式端到端”的两阶段范式,是区别于 DisMo/DeT/FlowMotion 等单阶段方法的关键。
核心方法
整体思路是“显式抽象自举 → 隐式内化”。直觉上,跨类别运动等价配对在真实数据中几乎不存在,但单种运动抽象(骨架、轨迹、点轨迹、6-DoF、边缘)可以可靠地把运动从外观里剥离;于是可以先用这些抽象当“翻译中介”,在不同目标条件下生成形态不同却共享同一运动属性的视频对,再让模型把这种运动等价性学进去,最终丢弃抽象、直接吃原始参考视频。技术路线是两阶段:Stage I 学习多粒度抽象运动条件下的视频生成,并据此自举出经过质量过滤的跨类别配对 Dboot;Stage II 从 Stage I 初始化,把抽象运动条件替换为原始参考视频,在 Dboot 上继续训练,使模型学会从 RGB 观测直接推断可迁移运动。骨干是 MMDiT 图像到视频扩散模型配因果 3D VAE,按流匹配目标优化,121 帧片段压到约 480×854 像素,全局 batch size 128,Stage I 训 15K 步、Stage II 训 4K 步,Adam 优化器。
核心创新是把“运动抽象”从“最终推理表征”降格为“构造监督的脚手架”,并由此设计自举—内化两阶段闭环。这与已有方法本质不同:DisMo/DeT/FlowMotion 都在推理时仍依赖某种(隐式或显式)运动表征,因此会保留源特定信息或只捕捉运动某一侧面;本文让 Stage I 把可抽取但表征受限的抽象视图先固化进模型,Stage II 用跨类别配对($V_r$ 与 $\tilde{V}_t$ 外观/形态差异大但共享 Stage I 传过来的运动)迫使“源外观/结构不再一致预测目标”,而“共享时序动态仍跨类别信息丰富”,从而鼓励模型直接从 RGB 提取可迁移运动、抑制形态捷径。其次,跨类别性是内化能否成功的关键——消融证明把 Dboot 换成同类别配对会让 HMF-All 从 0.7707 跌到 0.7588、G-Mot. 从 3.976 跌到 3.436。
方法步骤详情
完整步骤如下。Step 1 构建抽象运动视图:对参考视频按抽取可靠性选用五种互补视图(骨架、深度圆轨迹、稠密点轨迹、6-DoF 轴、前景边缘),扰动后统一为视频形态,得 $D_{abs}=(M_i^k,c_i,V_i)$,覆盖 100+ 类别、每段采样一种。Step 2 Stage I 落地:$c_i$ 取 $V_i$ 首帧及 VLM 字幕,运动视图与首帧经 3D VAE 编码、字幕经文本编码器,注入带噪隐变量 $z_\tau$,按流匹配最小化 $\mathcal{L}_{S1}=\mathbb{E}[\|u_\tau-u_{\theta_1}(z_\tau,\tau,z_m,c_i)\|_2^2]$ 重建 $V_i$($z_m=E(M_i^k)$)。Step 3 跨类别自举:抽 $M_r^k=\Phi_k(V_r)$,配不同类别目标条件 $c_t$,生成 $\tilde{V}_t=G_{\theta_1}(M_r^k,c_t)$,得三元组 $(V_r,c_t,\tilde{V}_t)$。Step 4 按运动/目标保真、参考泄漏、视频质量四项质控过滤得 Dboot。Step 5 Stage II 内化:$\theta_2\leftarrow\theta_1$,把抽象条件换成原始参考视频 $z_r=E(V_r)$,对 $D_{boot}$ 优化 $\mathcal{L}_{S2}=\mathbb{E}[\|\tilde{u}_\tau-u_{\theta_2}(\tilde{z}_\tau,\tau,z_r,c_t)\|_2^2]$。Step 6 推理 $\hat{V}_t=G_{\theta_2}(V_r,c_t)$,从高斯噪声迭代去噪,全程无需运动抽取或测试时优化。
技术新颖性
新颖性体现在五点。其一,把异构运动抽象统一为“视频化条件”,借助 MMDiT 原生接口让单一生成器学习 5 种视图,无需表征特定控制分支,区别于 VideoComposer 等为每种条件单独建模的混合方法。其二,提出“抽象作监督而非推理”的范式,Stage I 建监督、Stage II 内化掉抽象,使推理端干净(不依赖任何运动抽取器),与 MotionClone/DiTFlow/DisMo 形成根本路线差异。其三,跨类别配对构造本身是创新:通过“抽运动视图→换类别目标条件→生成→四项质控”得到 10K 对运动等价样本,这是首个开放类别、实例级运动等价的训练数据。其四,自适应耦合的思想被显式化为训练信号——同类别时姿态/拓扑/轨迹都有用,类别间距增大时可迁移信息转向轨迹/节律/局部形变,模型从数据中学会这种切换。其五,配套 OpenVMT-Bench 用 Same/Near/Far 渐进分裂系统量化“类别鸿沟”这一此前难以度量的维度,填补了 MotionBench/MT-Bench 缺乏结构鸿沟控制与目标图像策划的空白。
实验结果
核心发现分四层。第一,OpenVMT-I2V(表1)本文全指标夺冠:HMF-All 0.7505 优于 DisMo 0.7412、Wan-Move 0.7349、Tora 0.7262;HMF 从 Same(0.7435) 到 Far(0.7446) 一路领先,类别鸿沟越大优势越明显;G-Mot. 3.575 远高于 DisMo 2.811(感知运动保持度差距最大);DINO-I 0.9058 最高、G-Leak 1.000 最低、平滑度 0.9651 最佳,证运动提升不以时序质量为代价。第二,OpenVMT-T2V:HMF-All 0.7707、G-Mot. 3.976、CLIP-T 0.2677、G-Leak 1.067 均第一;仅 HMF-F(0.7688 略低于 DisMo-T2V 0.7742)与平滑度(0.9122)不占优,但作者指出 DisMo-T2V 较高 HMF-F 伴随更低目标对齐与更高泄漏。第三,人类 GSB(表2):12 位评估者配对比较,I2V 整体偏好率 93.0%、胜率 97.3%,T2V 整体偏好率 97.3%、胜率 98.7%,三维度全面领先。第四,消融(表3):Stage II 跨类别自举换同类别后 HMF-All 0.7707→0.7588、G-Mot. 3.976→3.436,证形态多样监督关键;Stage I 单视图均低于全模型。训练数据约 1.6M 视频。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| OpenVMT-I2V 图像到视频运动迁移(综合运动保真度) | HMF-All(跨 Same/Near/Far 平均) | 0.7505(HMF-S 0.7435 / HMF-N 0.7617 / HMF-F 0.7446) | DisMo 0.7412,Wan-Move 0.7349,Tora 0.7262 | HMF-All 比 DisMo +0.0093,比 Tora +0.0243;在 Far 分裂上 +0.0244 领先 DisMo,类别鸿沟越大优势越大 |
| OpenVMT-I2V 感知运动保持度 | G-Mot.(Gemini 运动保持评分,越高越好) | 3.575 | DisMo 2.811,Tora 2.377,Wan-Move 2.019 | 比最强基线 DisMo 高 +0.764(相对约 +27%),是所有指标中差距最大的领先 |
| OpenVMT-I2V 目标保真度与源泄漏 | DINO-I / G-Leak | DINO-I 0.9058,G-Leak 1.000 | DisMo DINO-I 0.8587 / G-Leak 1.182,Wan-Move 0.8849 / 1.128 | DINO-I 比 DisMo +0.0471;G-Leak 比 DisMo 低 -0.182,目标外观保持更好且源污染更少 |
| OpenVMT-T2V 文本到视频运动迁移(综合运动保真度) | HMF-All | 0.7707 | DisMo-T2V 0.7696,FlowMotion 0.7387,DeT 0.7428 | 比 DisMo-T2V +0.0011,比 FlowMotion +0.0320;G-Mot. 3.976 领先所有 T2V 基线约 1.0 分 |
| 人类偏好 GSB 评测 | 整体偏好率 Pref.(G+0.5S)/(G+S+B) | I2V 93.0%,T2V 97.3%(胜率 I2V 97.3%、T2V 98.7%) | I2V 对照 DisMo,T2V 对照 FlowMotion | 12 位评估者配对比较,运动/目标/整体三维度全面领先,主观验证了量化指标结论 |
| Stage II 监督来源消融(OpenVMT-T2V) | HMF-All / G-Mot. | 跨类别自举 全模型 0.7707 / 3.976 | 同类别自举 in-category 0.7588 / 3.436 | 跨类别监督使 HMF-All +0.0119、G-Mot. +0.540,证明形态多样配对是内化成功的必要条件 |
局限与改进
作者承认的局限:(1) OpenVMT-Dataset 与 OpenVMT-Bench 计划论文被接收后才发布,文中只给规模(10K 对,4K Same/4K Near/2K Far;评测 123 个 I2V + 166 个 T2V 案例),尚不可复现构造细节;(2) 自动指标不能完全捕捉感知差异,故补 GSB 人类研究,但样本仅 12 位且每赛道只与最强基线配对;(3) 类别鸿沟 Same/Near/Far 划分依赖主观策划,连续性未被建模。我自己观察:(1) 训练依赖约 1.6M 互联网视频与多个第三方抽取器,Stage I 监督质量受其误差与覆盖限制,对流体、烟雾等无关键点又难追踪的非刚性大形变可能没有可靠适用视图;(2) 推理端运动来源完全隐式,缺乏“保留节律不要姿态”这类显式可控性;(3) 与商业系统(Seedance-2.0、Kling Motion Brush、Kling Omni3)只做定性比较,缺公平量化基准。
独立分析的弱点
弱点一:跨类别配对的覆盖率受抽取器限制。Stage I 的五种视图分别针对铰接/全局平移/局部形变/刚体/结构,但当参考运动是流体、烟雾、爆炸这类既无关键点又难以稳定追踪的非刚性现象时,可能没有任何视图可靠适用,导致该类运动在 Dboot 中欠采样。改进方向是引入光流场或频域/谱运动视图,或用自监督学习从视频直接学一种不依赖手工抽取器的抽象。弱点二:推理端缺乏显式可控性。模型自适应决定耦合/解耦,但用户无法干预——例如“只迁移节律不迁移姿态”。改进方向是在 Stage II 引入条件化的耦合权重或指令化的耦合控制(如文本提示“保留节奏、忽略结构”)。弱点三:自动指标与人类偏好仍有差距,HMF 侧重轨迹与局部动态一致性,对“运动语义/意图”的迁移(如“挥手告别”的语义而非手部轨迹)不敏感。改进方向是引入语义运动度量。弱点四:与商业系统仅定性比较,缺乏公平量化基准;建议补充在统一分辨率/帧率/时长下的量化指标。弱点五:训练成本较高(两阶段、约 1.6M 视频、Stage I 15K + Stage II 4K 步、batch 128),对学术复现不友好,可探索蒸馏或单阶段简化。
未来方向
作者提出的方向:在论文被接收后正式发布 OpenVMT-Dataset 与 OpenVMT-Bench,推动开放类别运动迁移的社区研究;扩充 Same/Near/Far 三级鸿沟划分,提供更细粒度的类别拓扑度量。基于本文成果可延伸的方向:(1) 把“抽象作监督、内化掉抽象”的两阶段范式推广到其他需要跨域等价监督的任务(如跨域风格迁移、跨物种行为迁移、跨模态动作到音乐生成);(2) 引入显式的耦合控制接口,让用户通过文本/滑块指定保留哪些运动因子(节律/轨迹/形变),实现可控自适应耦合;(3) 探索流体、烟雾等极端非刚性场景,开发不依赖关键点/轨迹的新抽象视图(频谱运动、物理参数);(4) 与物理引擎或可微仿真结合,为运动等价提供更硬的物理监督;(5) 用本文 Dboot 数据微调通用视频扩散模型,提升其跨类别运动理解能力,作为基础模型增强。
复现评估
复现中等偏难。有利因素:骨干(MMDiT 图像到视频扩散+因果 3D VAE)、超参(Adam、全局 batch 128、Stage I 15K 步、Stage II 4K 步、121 帧、480×854 像素)、五个视图抽取器(ViTPose++、TAPNext++、SpaTrackerV2、Canny、前景掩码)、损失 $\mathcal{L}_{S1}$/$\mathcal{L}_{S2}$、四项配对质控标准均已写明,且有项目页 https://miniz233.github.io/MotionBeyondMorphology/。不利因素:关键训练数据(约 1.6M 互联网视频、10K 对 OpenVMT-Dataset)目前未公开,后者明确要等接收后才发布;OpenVMT-Bench 的 Same/Near/Far 划分与 123+166 测试案例尚未释出;第三方抽取器(如 TAPNext++、SpaTrackerV2)部分是 2026 年新作需自行复现或获取权重;跨类别配对过滤启发式细节仅指向补充材料。整体看方法路线可复现,但完整复现 SOTA 数字需相当算力与数据工程投入。
论文图表
图示跨大形态鸿沟的运动迁移案例:全局铰接运动(袋鼠跳跃落地→台灯)、细粒度非刚性运动(蜻蜓翅膀开合→花瓣)、可形变非刚性运动(水母收缩扩张→降落伞)。每个案例给出参考运动、生成视频,并用黄色箭头可视化迁移后的动态,标注三种运动机制(全局铰接/细粒度非刚性/可形变非刚性)。
这张图是全文动机与能力的直观宣言,一眼说明了“为什么固定结构对应会失败”以及本文能做到的迁移跨度(袋鼠到台灯这种弱/无部件对应),是理解 Motion Beyond Morphology 视角的最佳入口。