BLARM:混合潜在刚性运动基元实现视频驱动的三维物体动画 BLARM: Animating 3D Objects from Video via Blending Latent Rigid Motion Primitives
用少量时变刚性运动分量加时不变蒙皮权重,从单目视频前馈生成网格动画
前置知识
线性混合蒙皮(LBS)
经典动画技术:网格上每个顶点绑定到若干骨骼(或变形 handle),每块骨骼带有随时间变化的刚性变换,顶点最终位置是各骨骼变换后位置的加权和,权重非负且和为 1,公式形如 $\hat{x}=\sum_i w_i(R_i x + t_i)$。它用少量控制点驱动上万顶点,紧凑、可编辑,是主流 DCC 工具与游戏引擎的标准做法。
BLARM 生成动画的式 (1) 正是 LBS,只是把人工设计的骨骼换成了学到的潜在刚性分量,并要求权重非负归一化;不理解 LBS 就无法理解其表示设计的出发点以及为什么顶点对应能按构造保留。
刚性变换与 SE(3)/SO(3)
刚体运动由旋转加平移组成,属于特殊欧氏群 $SE(3)$,纯旋转属于特殊正交群 $SO(3)$。神经网络回归旋转需要连续且无歧义的参数化,直接回归 9 个矩阵元素无法保证正交归一;本文采用 6D 连续旋转表示,取旋转矩阵前两列,经 Gram-Schmidt 正交化映射回合法旋转矩阵。
本文每个运动 latent 解码为一个 $(R_{t,i}, t_{t,i}) \in SE(3)$,6D 旋转表示与 Gram-Schmidt 正交化是理解刚体变换解码头如何输出合法旋转的关键细节。
DETR 式可学习查询与交叉注意力
DETR 提出用一组可学习的 query 向量,通过交叉注意力从图像特征中聚合信息,输出固定数量的目标 token,从而把变长输入压缩成固定容量的表示。本文沿用该策略,把网格表面采样的数千个稠密点特征压缩成 $J$ 个几何感知的变形 latent,$J$ 远小于顶点数 $N_v$。
几何编码(式 2)和蒙皮权重预测(式 7)都建立在这一查询-交叉注意力机制之上:前者压缩几何、后者让顶点'认领'运动分量,是读懂架构的前提。
因子化时空注意力
对 $T$ 帧 × $J$ 个 token 做全自注意力的开销是 $O((TJ)^2)$;因子化做法改为帧内空间自注意力 + 跨帧时间自注意力,复杂度降为 $O(TJ^2)+O(JT^2)$,同时保留帧内运动分量之间协同、跨帧每个分量保持身份一致这两种动画必需的交互,牺牲的表达力很小。
这是 BLARM 运动编码器的核心结构,也是其效率声明(附录 Table 6 运行时间)的来源;不掌握因子化的动机与代价模型,就难以理解第 3.2 节为什么如此组织注意力。
InfoNCE 对比学习与 Bhattacharyya 系数
对比学习把相似样本拉近、不相似样本推远,InfoNCE 用温度 $\tau$ 的 softmax 交叉熵实现:锚点与正样本的相似度要在负样本集合中胜出。Bhattacharyya 系数 $\sum_i \sqrt{p_i q_i}$ 度量两个离散分布的重叠程度,本文用它衡量两个顶点的蒙皮权重分布有多相似,作为对比损失中的相似度函数。
式 (10) 的运动感知对比损失正是靠这两个工具实现无监督蒙皮结构发现:正负样本对由真值轨迹相似度构造,它是三大训练目标中促成'运动相似顶点共享权重'的关键。
研究动机
创建动态 4D 资产是图形学与内容创作的核心需求:生成式模型已能产出高质量静态 3D 物体,但让网格按视频动起来仍然困难。现有路线各有痛点。其一是学习式 rigging 方法(如 Xu et al. 2020、Zhang et al. 2025b),从几何或类别先验推断骨架、关节或 handle,结构一旦确定就固定了,无法适配具体视频中的运动,遇到与几何无关的序列特异变形就会失效。其二是前馈顶点空间方法(ActionMesh、Mesh4D、Motion3-to-4),直接回归逐帧顶点位移或变形网格,维度极高、缺乏部件协同运动的归纳偏置,定量上表现为时序伪影严重:在 ActionBench 上三者 CD-Motion 分别高达 9.24、10.31、11.12,FVD 分别高达 787.38、1270.80、1126.90,定性上常见单帧合理但整体抖动、部件畸变。其三是逐帧生成 3D 形状再配准的流水线,对应关系恢复昂贵且引入时序不一致。传统手工绑定骨架和 cage 的流程则依赖大量人工标注,无法规模化。
本文的目标是本文目标是构建一个前馈的、视频驱动的三维网格动画模型:给定一段展示物体运动的单目视频和一个静态 canonical 网格(可直接提供带纹理的网格,或用现成图像转 3D 模型如 Trellis2 从视频首帧重建),直接输出与视频运动一致、时序连贯的动画网格。方法需同时满足多个约束:训练与推理都不需要骨架、cage、蒙皮权重或任何 rig 标注;变形空间保持低维,使大片顶点作为部件协同运动,天然利于时序一致;保持固定网格的顶点对应关系,兼容现有渲染、仿真与动画管线;并在几何精度(CD-3D/CD-4D/CD-Motion)和渲染外观(LPIPS/CLIP/FVD/DreamSim)上全面超越三个前馈基线。
与已有工作不同的是,本文的独特切入是在'几何驱动的显式 rig'与'高维直接顶点回归'两个极端之间引入一个中间表示:用少量可学习的时变潜在刚性运动分量描述'物体怎么动',用时不变的顶点到分量蒙皮权重描述'每个分量作用在哪里'。与 rigging 方法不同,运动分量及其变换是从输入视频经注意力条件化推断的,属于运动条件化变形表示,能适配每个序列的具体动作;与顶点空间方法不同,变形被约束在 $J$ 维刚性混合子空间内,紧凑、可解释、结构上保证时序一致。这一分解既不需要离散部件标注或预定义关节类型(可绕开 revolute/prismatic 关节模型的假设),又能通过混合逼近多样的关节或可变形运动,把子空间动画的效率与视频条件前馈预测的灵活性首次结合到同一框架。
核心方法
BLARM 是一个前馈网络:输入 canonical 网格顶点 $X=\{x_n\}_{n=1}^{N_v}$ 和 $T$ 帧单目视频,输出动画 $\hat{X}_{1:T}$。直觉是物体运动本质上低维——相邻表面点往往共享相似轨迹,大块关节区域跟随同一刚体运动;因此无需为每个顶点独立预测轨迹。模型每帧预测 $J$ 个运动 latent($J \ll N_v$),每个解码为刚性变换 $(R_{t,i}, t_{t,i}) \in SE(3)$,第一个分量固定为描述全局运动的 root;每个顶点预测定义在 canonical 网格上、跨时间固定的非负归一化权重 $w_n=\{w_{n,i}\}_{i=2}^{J}$,决定如何混合各分量。动画由线性混合蒙皮得到:$$\hat{x}_{t,n} = R_{t,1}\Big(\sum_{i=2}^{J} w_{n,i}\,(R_{t,i}x_n + t_{t,i})\Big) + t_{t,1}$$ 先在 root 局部系内混合非 root 变换,再施加全局变换。时间变化由变换承担,空间结构由权重承担,二者分离,网络只需端到端输出这两组量。
核心创新是把动画表示分解为两个正交因子:时变潜在刚性变换负责'何时怎么动',时不变顶点-分量蒙皮权重负责'谁跟着动'。与已有方法的本质区别有三。第一,rigging 方法从纯几何推断骨架或 handle,结构无法响应具体视频;BLARM 的运动分量是候选变形区域经 DINOv3 视频特征交叉注意力条件化后推断的,天然适配序列特异运动。第二,ActionMesh 等直接在 $O(N_v)$ 维顶点空间预测,缺少部件协同的归纳偏置,时序易抖动;BLARM 把变形约束在 $J$ 维 LBS 混合空间,时序一致性由结构保证,且顶点对应关系按构造保留。第三,蒙皮权重完全无监督:熵正则促使每个顶点只依赖少数分量(像传统 rigging 的一顶点少骨),运动感知对比损失促使运动相似的顶点共享权重,二者结合使模型在没有任何 rig 监督的情况下自发涌现与真实运动部件对齐的可解释分解。
方法步骤详情
第一步几何编码:从网格采样 $N$ 个带法线表面点,经冻结 TripoSG 编码器得稠密特征 $\{g_k\}$,再用 $J$ 个可学习查询经 DETR 式交叉注意力压缩为 $J\times D$ 变形 latent $\{h_i\}$。第二步运动编码:latent 沿时间广播为 $Z^{(0)}\in\mathbb{R}^{T\times J\times D}$ 并加时间嵌入 $\theta_t$;$B$ 个编码块依次做对当帧 DINOv3 token $\tilde{d}_{t,k}$ 的交叉注意力、latent 间空间自注意力、跨帧时间自注意力,复杂度 $O(TJ^2)+O(JT^2)$ 而非 $O((TJ)^2)$。第三步刚体解码:6D 旋转表示经 Gram-Schmidt 正交化得 $R_{t,i}\in SO(3)$,MLP 头回归平移 $t_{t,i}$。第四步蒙皮预测:顶点正弦编码 $p_n$ 拼接冻结 PartField 特征 $s_n$ 得 $q_n$,与时间平均 latent $\bar{z}_i$ 交叉注意力后经 MLP 与 softmax 输出非 root 权重 $w_n$。第五步训练:focal 加权轨迹重建(式 8)、熵正则(式 9)、基于轨迹描述子与 Bhattacharyya 系数的 InfoNCE 对比损失(式 10),权重 $\lambda_{rec}=3$、$\lambda_{ent}=0.001$、$\lambda_{con}=0.3$。
技术新颖性
技术新颖性体现在四个层面。表示层:首次在前馈视频驱动设定下提出'时变刚性 latent + 时不变蒙皮'分解,兼具子空间动画的紧凑可解释与视频条件的自适应,无需骨架、部件标签或关节类型假设,与显式关节物体建模(如 Goyal et al. 2025 的机械关节估计)形成互补路线。架构层:因子化的'视觉交叉注意力-空间自注意力-时间自注意力'三重设计,让同一 latent 索引跨帧保持一致身份、帧内分量间协调运动,计算量从 $O((TJ)^2)$ 降到 $O(TJ^2)+O(JT^2)$。监督层:蒙皮权重无任何直接监督,熵正则 + 运动感知对比损失(正负样本由真值轨迹相似度构造,正样本偏向空间邻近、负样本含远处简单负例与近处困难负例)的组合是弱监督结构发现的新应用。训练层:focal 式重加权(式 8)抑制静态区域对损失的支配,迫使模型解释关节与变形区域。相比之下,基线要么结构固定不随运动适配,要么在顶点空间失去全部结构先验。
实验结果
在 ActionBench(128 条 16 帧序列)上 BLARM 全面领先:CD-3D 1.71(Mesh4D 2.57、Motion3-to-4 2.49、ActionMesh 3.30)、CD-4D 3.07(基线 5.01–5.61)、CD-Motion 7.15(基线 9.24–11.12),相对最强基线改善约 31%/39%/23%;外观指标 LPIPS 0.05、CLIP 0.96、DreamSim 0.05、FVD 426.72,而三个基线 FVD 为 787.38–1270.80,降幅超 45%,说明时序伪影显著减少。在 Motion80(80 条变长序列)上:CD-3D 1.93、CD-4D 3.46、CD-Motion 8.72、LPIPS 0.06、CLIP 0.97、FVD 482.50,CD-4D 相对 Motion3-to-4 的 5.89 降低约 41%,长序列优势更大。在 Consistent4D in-the-wild(附录 B.3)上先用 Trellis2 从首帧重建 canonical 网格再驱动,仍取得最佳平均表现。定性上(Figure 2),基线单帧合理但整体抖动、部件畸变,BLARM 更好保持结构;Figure 3 显示蒙皮权重自发对齐鞋弯曲部、羽毛组等运动部件,验证无监督结构发现可行。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ActionBench 网格动画(几何) | CD-3D ↓ | 1.71 | Mesh4D 2.57 / Motion3-to-4 2.49 / ActionMesh 3.30 | 相对最强基线降低约 31% |
| ActionBench 网格动画(几何) | CD-4D ↓ | 3.07 | Mesh4D 5.01 / Motion3-to-4 5.34 / ActionMesh 5.61 | 相对最强基线降低约 39% |
| ActionBench 网格动画(时序) | CD-Motion ↓ | 7.15 | Mesh4D 9.24 / Motion3-to-4 10.31 / ActionMesh 11.12 | 相对最强基线降低约 23% |
| ActionBench 渲染外观 | FVD ↓ | 426.72 | Mesh4D 787.38 / Motion3-to-4 1270.80 / ActionMesh 1126.90 | 降低约 46%,时序伪影显著减少 |
| Motion80 网格动画(几何) | CD-4D ↓ | 3.46 | Motion3-to-4 5.89 / ActionMesh 5.48 / Mesh4D 11.13 | 相对最强基线降低约 41% |
| Motion80 网格动画(时序) | CD-Motion ↓ | 8.72 | Motion3-to-4 13.00 / ActionMesh 12.78 / Mesh4D 24.26 | 相对最强基线降低约 32% |
| Motion80 渲染外观 | FVD ↓ | 482.50 | Motion3-to-4 735.57 / ActionMesh 791.80 / Mesh4D 1517.45 | 降低约 34% |
| Consistent4D in-the-wild(Trellis2 重建网格) | 三基准平均表现 | 最佳平均(附录 B.3) | ActionMesh / Mesh4D / Motion3-to-4 | 野外数据上仍保持领先 |
局限与改进
作者承认两点局限:其一,困难情形下蒙皮权重可能次优,邻近或外观相似的区域被分到错误分量,导致动画不连贯;其二,方法假设输入 canonical 网格的拓扑足以支撑目标运动,违反时预测变形会出现伪影(详见附录 B.4)。我的补充观察:LBS 混合刚性变换天然难以表达拓扑变化或极端非刚性效果(液体、布料撕裂、大幅剪切),这是表示容量的上界;蒙皮权重时不变意味着部件归属关系无法随时间改变,对抓握、自遮挡等接触场景可能受限;方法级联依赖 DINOv3、TripoSG、PartField、Trellis2 四个冻结大模型,上游误差与偏差会向下游传递,任一组件升级都可能需要重新校准;单目视频中不可见区域(遮挡、出画)的运动只能靠先验补全;评估仅对比前馈基线,未与逐序列优化的子空间方法正面比较,运行时间分析也只放在附录 Table 6,效率优势缺乏正文级别的量化论证。
独立分析的弱点
第一,线性混合蒙皮在大角度旋转时会出现 candy-wrapper 收缩伪影,论文自己也指出可换用对偶四元数蒙皮(DQS),这是低风险的直接改进。第二,$J$ 是固定容量,当目标运动复杂度超过分量数时只能靠密集混合近似,可引入自适应分量数、层级式分量或残差分量机制。第三,蒙皮权重由时间平均 latent $\bar{z}_i$ 预测且跨时间固定,对运动过程中部件结构改变(如抓握、分离)表达不足,可研究分段时变或慢变权重。第四,几何编码只采样表面点与法线,缺乏体积感知;focal 加权虽缓解但仍可能让静态大区域主导几何 latent,可引入运动先验引导的采样。第五,所有评测集(ActionBench、Motion80、Consistent4D)均为渲染数据,真实拍摄视频中的光照变化、运动模糊、遮挡下的鲁棒性未验证,建议补充真实视频基准并加入不确定性估计与测试时自适应。第六,in-the-wild 设定中 Trellis2 重建误差与动画误差未解耦分析,难以判断失败归因于重建还是动画。
未来方向
论文未专设未来工作章节,但从成果可自然延伸。一是把学到的刚性分量显式转换为可编辑 rig(骨架 + 蒙皮权重)导出到 DCC 工具,实现'视频一键绑骨',直接服务动画生产流程。二是引入用户交互:artist 编辑分量轨迹或权重后由前馈模型即时传播,形成可控动画编辑器。三是将 DQS 或更丰富的变形基元(含缩放、剪切)纳入解码,覆盖非刚性效果。四是与文本、音频、音乐等条件结合做生成式 4D 内容创作,呼应 4D 生成方向对动态资产的需求。五是扩展到多物体场景级动画,推理物体间接触与因果运动。六是在重建-动画管线中端到端联合训练,让 Trellis2 的重建目标与动画损失共同优化,缓解误差级联。七是把轨迹描述子与对比学习框架推广到大规模无标注视频的自监督预训练,习得更通用的运动先验,降低对 Objaverse 动画数据的依赖。
复现评估
论文未提及开源代码或模型权重,目前需从头实现。有利因素:训练数据公开且构建流程清晰——基于 Liang et al. 2024 策展的 Objaverse-1.0 划分,剔除评测重叠后约 1 万个形状,按首帧归一化到单位包围盒并以 512×512 渲染单目视频;评测集 ActionBench(128 条 16 帧序列)与 Motion80(80 条变长序列)均公开,指标遵循 ActionMesh 协议;附录 C/D 提供架构与对比采样细节,附录 A 有消融,Table 6 有运行时间。不利因素:依赖四个预训练模型(TripoSG、DINOv3、PartField、Trellis2),版本与接口需对齐;约 1 万条动画序列、$T\times J$ token 的三重注意力训练需要多卡 GPU 数天量级;正文与摘要均未给出完整超参数(学习率、batch、$J$、$B$、$N$ 的具体值需查附录)。综合评估:复现难度中高,适合有 3D 视觉与动画研究经验、具备多卡算力的团队。
论文图表
在 Motion80(80 条变长序列)上的同套指标对比。BLARM CD-3D 1.93、CD-4D 3.46、CD-Motion 8.72、LPIPS 0.06、CLIP 0.97、FVD 482.50、DreamSim 0.05,全面领先;基线中 CD-4D 最优的 Motion3-to-4 为 5.89,Mesh4D 的 CD-Motion 高达 24.26、FVD 1517.45。
验证方法优势不局限于固定 16 帧的短序列,在更长、更复杂、长度可变的动画上依然成立,且长序列上领先幅度更大,补全了主实验的说服力。