从视频中自监督学习结构化动态表示 Self-Supervised Learning of Structured Dynamics from Videos
在冻结图像骨干特征上学习主/残差结构化运动 token,自监督分离相机与物体动态
前置知识
冻结图像骨干特征(Frozen Backbone Features)
指在大规模图像数据上自监督预训练的视觉Transformer(如DINOv2)在微调时其权重被完全冻结,仅作为固定的特征提取器使用。本文使用冻结的 DINOv2-B/14 with registers,提取全部 12 个 transformer block 的 patch 特征并按通道拼接,再经两层 MLP 投影到 D=768 维。这种做法的好处是预训练特征已蕴含丰富的语义与几何结构,无需昂贵标注即可作为后续运动建模的原材料。
本文的核心问题就是探究仅靠冻结图像特征能否支撑显式的动态结构化,理解'冻结骨干'这一前提才能理解方法为何能在极弱监督下成立。
自监督未来特征预测(Self-Supervised Future-Feature Prediction)
一种不以显式标签训练的范式:模型预测当前帧冻结特征 $f_{t-1}$ 将如何变为下一帧特征 $f_t$,用 MSE 重建损失自我监督。与像素级生成或显式动作标注不同,它在冻结特征空间中学习'变化'本身,从而把运动信息压缩进紧凑的运动 token。本文在此基础上引入主/残差两阶段结构,使预测具有可解释的物理分解。
理解未来特征预测的目标函数才能明白 SDM 如何在无标注真实视频上学到运动表示,以及弱监督为何只是辅助。
线性探针评估(Linear Probing)
冻结待评估的特征后,仅训练一个单层线性分类器/回归器去读出某种目标(如 6-DoF 相机位姿、2D 物体位移、动作类别)。它衡量特征中线性可分的运动信息含量,避免端到端微调带来的混淆。本文的 ProbeMotion 套件统一用线性探针比较各方法,并报告探针训练中验证集上的最佳指标以降低对优化超参的敏感度。
论文所有结论(SDM 优于 CLS/AVG/DeltaTok、可比拟 VGGT)都建立在线性探针之上,理解该协议才能正确解读这些数字的强弱边界。
相机运动与物体运动的纠缠(Camera vs Object Motion Entanglement)
视频中相邻帧的变化同时受两类来源驱动:相机自身运动(egomotion,使整个场景全局移动)和场景中物体的独立运动。自然视频中两者紧密耦合且难以分别标注。将二者分离对学习鲁棒运动表示至关重要——它使表示围绕可解释的物理因子组织,而非把所有变化混进单一隐变量。
这是论文要解决的根本难题,也是 SDM 设计'主 token + 残差 token'两阶段分解的动机来源。
潜动作 / 世界模型(Latent Action / World Models)
一类从视频学习的方法,通过预测未来帧或未来特征来避免稠密标注,常用单个紧凑的潜动作 token 表示帧间变化(如 DeltaTok)。其局限在于单一 token 必须解释从外观依赖的特征变化到低维运动因子的所有来源,把主导全局变化与残差物体动态混在一起。SDM 与之最接近,但显式把运动结构化为主/残差分量而非单一潜动作。
DeltaTok 是论文最强自监督基线,理解这类方法才能体会 SDM 的核心创新——结构化分解相对单 token 的本质区别。
研究动机
视频的帧间变化同时纠缠两类动态来源:相机运动和物体运动。这种分解在表示学习中长期被忽视,原因在于二者在自然视频中紧密耦合,且极难分别施加监督。尽管 DINOv2、AIM、MAE 等自监督图像骨干已能捕获丰富的语义与几何结构,但它们并不直接暴露时间或运动结构。而那些成功建立在自监督骨干之上的 3D 感知与重建系统,往往在适配阶段仍依赖大量监督——例如 VGGT 在 17 个标注数据集上训练,使用 3D 标注、运动恢复结构伪真值或其他几何标签;DUSt3R、CUT3R、Pi3X 等同样需要相机位姿、深度或点云等稠密几何监督。另一方面,许多潜动作或世界模型用单个潜 token 概括场景变化,把主导全局变化(相机)与残差物体中心动态混在一起。这种缺乏可解释结构的现状,阻碍了围绕可解释物理因子组织运动表示的研究,留下一个关键开放问题:究竟能否在不依赖稠密监督的前提下,仅从通用预训练视觉特征中恢复场景动态的结构?
本文的目标是本文的目标是研究:能否直接从冻结的预训练图像视觉 Transformer 特征中恢复出结构化的运动表示。具体而言,作者希望在不端到端训练视频模型、不使用稠密 3D 或几何监督的前提下,用一个搭建在冻结骨干之上的轻量模型,把时间变化组织成可解释的主导运动分量和残差运动分量,并使二者能根据每段视频的主导变化来源自适应特化。训练只使用两类极弱监督:合成 Kubric 数据上的二元场景级标注(仅指示相机或场景是否静止),以及未标注真实视频上的自监督未来特征预测。最终目标是证明这样得到的结构化运动 token 既优于朴素的全局 CLS / 平均池化特征描述子,又能在仅用约 215M 参数(含 87M 冻结骨干)和极弱监督的情况下,与 VGGT-1B、Depth Anything 3、Pi3X 等约 1B 参数的强监督几何模型保持竞争力。
与已有工作不同的是,本文的独特切入角度是把图像骨干彻底冻结,把它的特征视为待重新组织的原材料,而非端到端训练视频编码器或依赖稠密几何监督。这与'训练视频编码器'和'用强监督适配骨干'两条主流路线都不同。相对于用单一潜动作 token 概括全部变化的潜动作/世界模型,SDM 采用迭代式粗到精补偿设计,把运动显式分解为 primary token 和 residual token:残差阶段被显式条件于主阶段未解释的失配上,从而鼓励它只建模剩余动态。同时,作者巧妙利用两类廉价弱标注(static scene / static camera)对不同样本选择性施加不同的损失公式,为分解的对齐提供恰到好处的归纳偏置,而无需昂贵几何标签。最后,作者贡献 ProbeMotion 评测套件,首次系统覆盖合成与真实、相机/物体/混合动态场景,填补了'结构化运动表示'缺乏统一探针基准的空白。
核心方法
整体直觉是:视频中大部分时间变化由作用于高维视觉特征之上的低维动力学主导,因此可以把这些低维因子显式提取出来。SDM 保留冻结图像编码器 $E$(DINOv2-B/14 with registers),对每帧提取空间特征图 $f_t = E(x_t) \in \mathbb{R}^{H\times W\times D}$,拼接全部 12 层 patch 特征并经两层 MLP 投影到 D=768。然后 SDM 通过两段顺序补偿阶段,从 $f_{t-1}$ 预测 $f_t$:主阶段解释主导变化(如相机运动),产生中间预测 $f_t^{>}$(读作 f modified once);残差阶段解释剩余动态(如物体运动),把 $f_t^{>}$ 精炼为最终预测 $f_t^{>>}$。模型在循环运动 token 上自回归、但在时间上非因果——目标 $f_t$ 可用于提取预测它所需的迁移 token,从而获得更干净的信号。最终预测被线性投影回拼接多层特征空间后再计算损失。训练混合 Kubric(带弱场景级标签)、未标注 SSv2 与 DL3DV,用选择性损失对齐分解语义,整个流程在 4 张 H100 上约 11 小时完成。
核心创新是把运动显式结构化为一个 primary token $p_t$ 和一个 residual token $r_t$,通过冻结特征空间中的未来特征预测学习,并以迭代式粗到精补偿落地。主提取器读取帧对更新循环主 token:$p_t = \phi_p(p_{t-1}; f_{t-1}, f_t)$,主预测器据此补偿源特征图:$f_t^{>} = \psi_p(f_{t-1}; p_t)$。随后残差提取器读取 $f_t^{>}$ 与 $f_t$ 之间的失配:$r_t = \phi_r(r_{t-1}; f_t^{>}, f_t)$,残差预测器精炼:$f_t^{>>} = \psi_r(f_t^{>}; r_t)$。与已有潜动作模型的本质区别在于:不是用单一 token 解释所有变化,而是让残差阶段被显式条件化于主阶段遗留的失配上,从而鼓励它只建模未被解释的动态。配合三类样本选择性损失(静态场景绕过残差直接监督 $f_t^{>}$;静态相机正则 $f_t^{>}\to f_{t-1}$;其余只监督 $f_t^{>>}$),用极廉价弱标注就把架构分解与预期语义对齐。
方法步骤详情
步骤1 特征提取:冻结 DINOv2-B/14 with registers 提取全部 12 个 block 的 patch 特征,拼接后用两层 MLP 投影到 D=768,得 $f_t$。步骤2 主运动提取:提取器 $\phi_p$(4-block transformer decoder,4 个 register,3D RoPE 基底 100)从帧对 $(f_{t-1},f_t)$ 与上一 token 更新 $p_t$,初始 $p_0\sim\mathcal{N}(0,0.022)$。步骤3 主补偿:预测器 $\psi_p$(2-block decoder,2D RoPE)用 $p_t$ 补偿源特征图得 $f_t^{>}$。步骤4 残差提取:$\phi_r$ 从 $f_t^{>}$ 与 $f_t$ 的失配更新 $r_t$。步骤5 残差补偿:$\psi_r$ 把 $f_t^{>}$ 精炼为 $f_t^{>>}$,再线性投影回拼接多层特征空间计算损失。步骤6 选择性损失:动态视频 $L=L_{MSE}(f_t^{>>},f_t)$;静态场景绕过残差 $L=L_{MSE}(f_t^{>},f_t)$;静态相机 $L=L_{MSE}(f_t^{>>},f_t)+\lambda_{reg}L_{MSE}(f_t^{>},f_{t-1})$。训练:minibatch 按 0.5/0.25/0.25 混合 Kubric/SSv2/DL3DV,每片段采 5 帧 2fps、resize 224×224,AdamW 200k 步,batch 128,lr 6.25e-5 带 1k warmup,$\lambda_{reg}=0.5$,4×H100 约 11h。
技术新颖性
技术新颖性体现在五个方面。第一,'冻结骨干 + 重塑其特征为结构化运动 token'是全新框架——把预训练图像特征当原材料重新组织,而非微调或重新训练,回答了'多少场景动态能从通用冻结特征中恢复'的开放问题。第二,两阶段 primary/residual 分解配合顺序条件化在架构上区别于单 token 潜动作模型和空间稠密迁移 token。第三,巧妙利用二元弱场景标注(static scene / static camera)对不同样本选择性施加不同损失公式,提供廉价却有效的特化归纳偏置,避免稠密几何监督。第四,自回归但非因果的设计让运动 token 累积时间上下文,同时每次更新只比较相邻帧;token 间循环使长片段扩展自然。第五,ProbeMotion 评测套件本身是一项贡献:首次用单一协议横跨合成与真实、相机/物体/混合动态,包含 Kubric、DL3DV、CameraBench、静态 DAVIS2017、静态 YouTubeVOS、SSv2-110k 六类数据,并给出静态相机子集的 VGGT 位姿估计 + mask 质心位移构造流水线,为'结构化运动表示'提供了标准化探针基准。
实验结果
SDM 在 ProbeMotion 上几乎全面优于朴素冻结骨干描述子(CLS/AVG-pool),唯一例外是静态 DAVIS2017。Kubric 相机运动上 SDM 取 0.16 MSE,远低于 CLS 的 1.16、AVG-pool 的 0.96;Kubric 物体运动达 0.19,胜过 DeltaTok 的 0.35 与 AVG-pool 的 0.93。DL3DV 上 SDM(0.59)已逼近 VGGT 平均特征(0.56)与相机 token(0.53)。CameraBench 分类达 85.3%。最引人注目的是 SSv2-110k 动作识别:SDM 达 23.1%,超 CLS(14.9%)8.2pp、AVG-pool(2.3%)20.8pp、DeltaTok(13.5%)9.6pp,甚至比最佳强监督描述子 Pi3X(19.8%)高 3.3pp,且探针输入维度仅为其一半。SDM 在 7 个任务中的 5 个上胜过训练 8 倍迭代的 DeltaTok。时间上下文分析显示 SSv2-110k 准确率从 T=2 的 16.7% 单调增至 T=7 的 23.1%(超出训练范围 T=5);最大上下文基线仍低于 SDM 单帧对(T=2)结果,说明增益非来自更多帧。token 交换实验证实特化:动相机数据上 p 胜 r 做相机运动,Kubric 物体运动上 r 最佳。骨干消融证明 SDM 可迁移到 MAE/SigLIP/DINOv3/DINOv2r,DINOv2/3 系整体最强。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Kubric 相机运动回归(6-DoF 位姿 delta) | 归一化 MSE(越低越好) | 0.16±0.0 | CLS 1.16,AVG-pool 0.96,DeltaTok 0.29 | 相对 AVG-pool 降低约 83%,相对 DeltaTok 降低约 45% |
| Kubric 物体运动回归(3D 平移) | 归一化 MSE(越低越好) | 0.19±0.0(探针 r) | CLS 0.78,AVG-pool 0.93,DeltaTok 0.35,VGGT cam.token 0.43 | 相对最强基线 DeltaTok 降低 0.16,优于所有强监督 3D 模型 |
| DL3DV 真实相机运动回归 | 归一化 MSE(越低越好) | 0.59±0.0 | VGGT cam.token 0.53,CLS 1.09,AVG-pool 1.04 | 逼近 1B 参数强监督 VGGT,且远超自监督/朴素基线 |
| CameraBench 相机运动分类 | Top-1 准确率(%) | 85.3±1.7 | AVG-pool 67.0,CLS 68.6,DeltaTok 89.6,VGGT cam.token 88.7 | 相对 CLS 提升 16.7 个百分点 |
| SSv2-110k 动作语义分类 | Top-1 准确率(%) | 23.1±1.3(探针 p) | CLS 14.9,AVG-pool 2.3,DeltaTok 13.5,Pi3X avg.feat 19.8 | 相对 CLS +8.2pp,超最佳强监督描述子 +3.3pp |
局限与改进
作者承认若干局限。运动外推(反复施加最后观察到的运动 token)只能在短时域产生合理的特征外推,长时域会漂移,说明 token 稳定捕获局部时间动态,但不支持可靠的长程外推,需要新观测来纠正。潜在运动交换(把源片段 token 迁移到目标片段)同样在长时域质量下降。静态 DAVIS2017 是例外——AVG-pool 在 2D 物体位移回归上反而最佳,作者归因于该数据集小而精选、且图像平面位移预测相对简单。时间上下文增益在更复杂运动的数据集上不那么单调(附录 B.3)。从我的观察补充:SSv2-110k 的 23.1% 绝对值仍不高,说明结构化 token 对细粒度动作语义的刻画有限;评测仅用单层线性探针并报告验证集最佳指标,可能放大表现;构造静态相机子集与分析相机运动都依赖 VGGT,存在对强监督模型的循环依赖;分解是二元的(主/残),假设干净两因子切分,未处理关节式、可变形等多因子复杂动态。
独立分析的弱点
第一个弱点是细粒度动作语义绝对性能偏弱(SSv2-110k 仅 23.1%),说明结构化 token 对复杂动作刻画有限;改进方向是采用更深的探针头或下游任务微调,或把 token 喂给时序模型做端到端动作识别。第二个弱点是运动外推迅速漂移,限制其作为生成式世界模型的用途;改进方向是引入不确定性建模、周期性用真实观测重新接地、或采用 token 的自回归预测以延长预测地平。第三个弱点是方法对 VGGT 的依赖(用其估计相机运动来过滤静态子集、分析 SSv2 相机运动),存在评价循环;改进方向是开发自包含的运动幅度估计器替代 VGGT。第四个弱点是分解为二元主/残,假设干净两因子切分,难以表达多相互作用动态因子(关节运动、可变形物体、多物体交互);改进方向是扩展为层次化或多因子分解,使用超过两个 token。第五个弱点是评测局限于单层线性探针,可能低估或扭曲表示质量;改进方向是在动作识别、视频物体分割、机器人模仿学习等下游任务上做完整微调评测,相机/物体运动分离在这些任务中有实际价值。
未来方向
作者指出的方向:残差补偿这一归纳偏置呼应了光流估计与扩散模型中粗到精细迭代的有效性,提示其更广适用性。基于本文成果可延伸的方向包括:其一,把分解从两因子推广到层次化多因子结构化动态,以处理关节式、可变形、多物体场景;其二,改进长时域运动外推,朝世界模型应用迈进,可结合 token 自回归预测与不确定性;其三,把 SDM token 应用到下游任务而非仅探针——动作识别、视频物体分割、机器人从演示学习等,相机/物体运动分离在这些任务中很有价值;其四,扩展到更大骨干(DINOv3 等)和更长时序上下文,本文已验证跨骨干可迁移性;其五,将静态相机子集构造流水线(VGGT 位姿估计 + mask 质心位移)完善并作为社区资源发布;其六,结合生成式解码,实现显式相机/物体运动可控的视频生成。
复现评估
复现性中等到良好。作者提供项目主页(https://lukasknobel.github.io/projects/StructuredDynamics)并给出详尽实现规范:冻结 DINOv2-B/14 with registers,拼接 12 层特征投影到 D=768;$\phi_p,\phi_r$ 为 4-block transformer decoder 含 4 个 register、3D RoPE 基底 100;$\psi_p,\psi_r$ 为 2-block decoder、2D RoPE;训练 200k 迭代、batch 128、AdamW、学习率 6.25e-5 带 1k warmup、权重衰减 0.05、$\lambda_{reg}=0.5$;每片段采 5 帧 2fps、resize 224×224、无额外增广;4 张 H100 约 11 小时;SDM 共 215M 参数(含 87M 冻结骨干)。数据集均为标准公开资源(Kubric、SSv2、DL3DV、DAVIS2017、YouTubeVOS、CameraBench)。但正文未明确确认完整代码/权重是否开源;合成 Kubric 需自建生成流水线(180k 序列、三种受控设置);ProbeMotion 划分细节部分位于附录。算力门槛(4×H100×11h)对学术实验室可达但非平凡。整体而言,论文提供足够细节复现核心结果,但完整复现需相当工程投入与中等规模算力。
论文图表
图展示运动外推:在 DAVIS2017 测试片段上,用 SDM 从观测帧提取运动 token,然后反复施加最后观察到的运动 token 预测未来特征图,并用 PCA 投影到 RGB 可视化。黑色框标记最后观察到的物体位置(对外推帧重复)。外推的物体特征在短时域内跟随物体运动,但长时域会漂移。
这张图揭示了 token 既稳定捕获局部时间动态,又暴露长程外推会漂移的局限,对理解模型能力边界很重要。