DistillAlign:协调自回归视频蒸馏中的模态覆盖与模态寻优 DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation
用分布对齐视角重做自回归视频蒸馏,联合DMD与CD损失。
前置知识
分布匹配蒸馏 (DMD, Distribution Matching Distillation)
DMD 把多步教师蒸馏成几步生成器 $G_\theta$,目标是最小化噪声层 $t$ 上生成分布与教师分布之间的反向 KL 散度:$\mathcal{L}_{DMD}(\theta) = \mathbb{E}_t[w(t) \mathrm{KL}(p_{\theta,t} \| p_{teacher,t})]$。其梯度可写成 score-difference 更新 $\nabla_\theta \mathcal{L} = \mathbb{E}[w(t)(s_{fake}(x_t,t) - s_{teacher}(x_t,t)) \partial x_t / \partial \theta]$,其中 $s_{teacher}$ 由冻结教师提供,$s_{fake}$ 由在线 critic 估计。
DMD 的反向 KL 目标本质是模态寻优(mode-seeking),会把学生坍缩到教师的高概率模态上而牺牲覆盖与多样性。本文全部论证都建立在这一性质之上:解释为何初始化必须有足够的模态覆盖、为何纯 DMD 后期会分布漂移。
一致性蒸馏 (CD, Consistency Distillation)
CD 在离散时间 $0=t_0<\cdots<t_N=1$ 上用一步教师 ODE 估计 $\hat{x}_{t_n} = x_{t_{n+1}} + (t_n - t_{n+1}) v_\phi(x_{t_{n+1}}, t_{n+1})$,再让学生满足相邻步的局部一致性 $\mathcal{L}_{CD}(\theta) = \mathbb{E}[\|f_\theta(x_{t_{n+1}},t_{n+1}) - f_{\theta^-}(\hat{x}_{t_n}, t_n)\|_2^2]$。它把学生回归到教师 ODE 端点,因而表现出模态覆盖(mode-covering)行为:保住广覆盖但牺牲锐度。
本文的联合蒸馏把 DMD 的模态寻优与 CD 的模态覆盖绑定在一起 $\mathcal{L}_{joint} = \mathcal{L}_{DMD} + \lambda \mathcal{L}_{CD}$。理解 CD 的模态覆盖性质,才能看懂为何加 CD 约束能抑制 DMD 后期的分布漂移、保住覆盖与多样性。
Flow Matching 与反向 PF-ODE
Flow matching 在简单噪声 $x_1$ 与数据 $x_0$ 之间定义线性插值路径 $x_t = (1-t)x_0 + t x_1$,目标速度 $x_1 - x_0$,训练损失 $\mathcal{L}_{FM}(\theta) = \mathbb{E}\|v_\theta(x_t,t,c) - (x_1 - x_0)\|_2^2$。推理时从 $t=1$ 反向积分 ODE 到 $t=0$ 生成样本。$\Psi_{s \to r}$ 表示从时刻 $s$ 到 $r$ 的流映射。
Wan2.1 系列教师以 flow matching 训练,本文的 ODE 蒸馏、CD、teacher-normalized 重噪协议全部建立在这条线性路径上。重噪公式 $z_{\theta,\rho} = (1-\rho)z_{\theta,0} + \rho\epsilon$ 正是这条路径的沿伸,是评估协议的关键。
自回归视频扩散蒸馏流水线 (Causal/Self Forcing 等)
这类方法把双向视频扩散教师蒸馏成几步因果(autoregressive)生成器,常见三阶段:先用 teacher forcing 训因果模型,再用 ODE 或 CD 压成 few-step 学生,最后做 DMD 精炼。Self-Forcing 用 ODE 初始化 + DMD;Causal Forcing 用因果模型 + CD 初始化 + DMD;CausVid 用 ODE 初始化 + DMD。
DistillAlign 直接构建在 Causal Forcing 的三阶段流水线之上。本文的核心批判正是这些流水线把"初始化"与"DMD 精炼"当成追求不同目标分布的两个独立阶段、且仅用 VBench 评判中间学生,这是全文论证的起点。
Precision / Coverage 与 k-NN 支撑估计
把样本投射到归一化特征空间后,用每个教师特征 $v_j$ 到其第 $k$ 近邻的距离 $r_k(v_j)$ 定义自适应局部半径。Precision $= \frac{1}{N}\sum_i \mathbf{1}[\exists j: \|u_i - v_j\| \le r_k(v_j)]$ 衡量学生样本落入教师支撑的比例;Coverage $= \frac{1}{M}\sum_j \mathbf{1}[\min_i \|v_j - u_i\| \le r_k(v_j)]$ 衡量被学生触及的教师邻域比例。两者互补:高 Precision 不等于广 Coverage。
本文提出的 teacher-normalized 分布评估协议,本质就是把这套 Precision/Coverage 放到 V-JEPA2 特征空间里。论文所有反直觉结论(高 VBench 初始化未必好、DMD 后期覆盖下降)都依赖这两个统计量来量化。
V-JEPA2 与 Vendi 多样性分数
V-JEPA2 是自监督视频表征模型,本文用其 token 级均值与标准差拼出 2560 维、$\ell_2$ 归一化的视频描述子。Vendi 分数则是这些描述子构成的特征矩阵 $U$ 上、基于平移余弦核 $\bar K$ 的特征值熵 $\mathrm{Vendi}(U) = \exp(-\sum_q \lambda_q \log \lambda_q)$,本质是"有效秩"式的多样性度量。
全文所有分布指标都在 V-JEPA2 空间算,多样性用 Vendi 报告。读懂表 4–9 必须先理解这些指标是"相对教师支撑"的条件统计量,跨教师的数值不能直接当作绝对刻度比较。
研究动机
主流做法把双向视频扩散教师蒸馏成 few-step 因果生成器,如 Self-Forcing(ODE+DMD)、Causal Forcing(因果模型+CD+DMD)、CausVid(ODE+DMD)。它们有两个具体问题:(1)把 pre-DMD 初始化与 DMD 精炼视为追求不同目标分布的两个独立阶段——前者可能基于 base 模型样本或外部视频,后者可能换更强的扩散教师——两阶段目标分布常对不上;(2)中间学生只用 VBench 这类视觉打分评判,隐含假设"初始化分数越高最终越好"。但 DMD 的反向 KL 是模态寻优:初始化没覆盖到的目标模态,DMD 给的是无支撑梯度,导致覆盖坍缩与次优精炼。作者用对照实验坐实这点:在 Causal Forcing 流水线上做目标分布交换,Wan-14B 数据+Wan-14B 教师(对齐)得 84.74,而 Wan-1.3B 数据+Wan-14B 教师(错配)只有 83.89,弱数据+弱教师(Wan-1.3B 配 Wan-1.3B)的 84.50 反而强于强数据+弱教师(84.16),证明最终性能不只由教师容量或数据质量决定。
本文的目标是本文的具体目标有三个:第一,提出一套 teacher-normalized 分布评估协议,把初始化学生样本先经过固定的重噪-去噪规范化(用 Wan2.1-14B 归一化教师、噪声层 $\rho=0.9$、Flow-UniPC 22 步),再投射到 V-JEPA2 特征空间,用 k-NN($k=5$)支撑估计算出 Precision 与 Coverage,从而把"初始化到底覆盖了多少目标模态"量化出来;第二,用这套协议重新审视现有的多阶段蒸馏流水线,解释为何高 VBench 初始化(Causal DMD Init)并不带来最好的最终结果;第三,针对纯 DMD 即使在分布对齐的情况下仍会出现后期漂移的问题,提出联合蒸馏 $\mathcal{L}_{joint} = \mathcal{L}_{DMD} + \lambda \mathcal{L}_{CD}$,在精炼高质量模态的同时用 CD 的模态覆盖约束抑制漂移,从而在质量、覆盖、多样性三个维度同时取得改进,并用一个 Wan-1.3B DMD 教师的弱版本去挑战 Wan-14B 教师的强基线。
与已有工作不同的是,已有蒸馏工作的视角几乎全部停留在"教师越强、数据越好、VBench 越高 = 最终越好"。作者的独特切入角度是把"分布对齐"提升为第一性原理:初始化阶段的质量不应用视觉锐度衡量,而应用"它对目标 DMD 教师的模态覆盖"来衡量;DMD 精炼阶段不应用反向 KL 无监督地跑到底,而应在跑的过程中始终被一个 CD 的模态覆盖约束锚住。这种"先看分布、再看视觉"的视角在两个层面区别于以往工作——既有 Causal Forcing/Self-Forcing 即便提出对齐也只换更强的初始化教师,没有量化分布覆盖;而 (f)-Distill、rCM、ADM/DMDX 等做法要么改散度族、要么加对抗、要么加 score 正则,本文则在"同一目标分布下用 CD 当 distributional anchor"这一思路上提供了一种轻量且直接组合的解法。
核心方法
整体思路是把自回归视频蒸馏重表述为"分布对齐 + 模态协调"问题,而非"更高 VBench = 更好"。路线分三块。第一是分布评估:因不同初始化器低层保真度差异会淹没语义分布差异(如 ODE 初始化视觉模糊却覆盖广),作者提出 teacher-normalized 重噪协议——把学生样本加噪到 $\rho=0.9$ 后用固定 Wan2.1-14B 归一化教师去噪,再在 V-JEPA2 特征空间用 $k=5$ 邻域半径算 Precision/Coverage。第二是流水线选择:对比 5 条流水线(Bidirectional/AR/Causal DMD/ODE/Causal CD Init)+ DMD,证明 Causal CD Init 覆盖最优。第三是联合蒸馏:把 DMD 模态寻优与 CD 模态覆盖以 $\mathcal{L}_{joint} = \mathcal{L}_{DMD} + \lambda \mathcal{L}_{CD}$($\lambda = 0.01$)组合训练 1.5K 步。基础模型 Wan2.1-T2V-1.3B,生成 81 帧 832×480 视频。
核心创新有两条本质区别于以往工作。第一条是"分布对齐决定蒸馏上限"的诊断视角:作者用一个对照目标分布交换实验(Table 1)证明,强教师配错初始化(83.89)不如弱教师配对初始化(84.50),并通过重算覆盖率(Table 3)说明对齐的优势来自初始化对教师模态的更好覆盖,而非教师容量或数据质量本身。这与既有流水线"教师越大越好"的直觉相反。第二条是"联合蒸馏"这一具体机制:纯 DMD 在对齐情况下仍会后期漂移(表 2 显示 VBench 从 82.60→84.74→83.90,多样性 Vendi 从 1.319 持续跌到 1.272),作者直接把同一目标分布下的二阶段 CD 损失作为 distributional anchor 加进去,使学生在被 DMD 锐化的同时仍被 CD 拽回广覆盖区域。这区别于 (f)-Distill 改散度族、rCM 加 score 正则、ADM/DMDX 引对抗等思路——它不改 DMD 本身,而是用一个轻量约束项把模态覆盖这一性质"钉"在训练过程中。
方法步骤详情
方法分评估协议与蒸馏流水线,蒸馏基于 Causal Forcing 三阶段。评估协议:初始化器产出 $z_{\theta,0}$,按 $z_{\theta,\rho} = (1-\rho)z_{\theta,0} + \rho \epsilon$($\rho=0.9$,噪声种子跨初始化器固定)重噪,用 Wan2.1-14B 归一化教师去噪得 $\tilde{x}^{(\rho)}_\theta$;前 5 秒 81 帧取 8 帧送 V-JEPA2,拼接并 $\ell_2$ 归一化得 $u_i$;教师参考集用 25 步 $T_{ref}$ 采样得 $v_j$;以 $k=5$ 近邻半径算 Precision/Coverage,多样性用 256 样本原始 Vendi 报告。蒸馏:Stage 1 在采样数据上做 5K 步 teacher-forcing 训练得因果模型;Stage 2 做 2.5K 步一致性蒸馏得 few-step 学生;Stage 3 做 1.5K 步联合 DMD-CD 训练,DMD 教师匹配数据源、CD 教师沿用 Stage 2 因果教师、$\lambda = 0.01$。
技术新颖性
技术新颖性体现在四点。第一,teacher-normalized 重噪协议把"低层保真度"这一混淆变量从初始化比较中剥离:表 7 显示 ODE 初始化原始覆盖率只有 0.020(因为视觉模糊),但重噪后覆盖率升到 0.326,与它 DMD 后覆盖率 0.484 的排序一致,证明原始覆盖率被去噪状态主导,重噪协议更能反映可被 DMD 精炼的语义支撑。第二,Coverage 统计量明确只用教师半径定义支撑(式 17),不沿用 improved-precision-recall 那种"用生成样本构邻域"的做法,避免孤立学生异常点制造过大区域、保证跨方法的目标支撑固定。第三,联合蒸馏把模态寻优与模态覆盖绑定在同一目标分布下,而非像 HiAR/BiWM 那样再加 forward-KL 或 GAN 正则,路径更直接。第四,作者把"教师容量"与"初始化分布"这两个在 DMD 类自回归蒸馏中长期被混淆的因素明确解耦(表 4 同时报告 DMD 教师与初始化分布),并用弱教师 Wan-1.3B(84.54)反超所有 Wan-14B 教师基线,提供了一个"分布对齐可以匹敌教师规模"的有力证据。
实验结果
分四层。第一,分布对齐决定上限(Table 1):Wan-14B×Wan-14B(对齐) 84.74、Wan-1.3B×Wan-1.3B(对齐) 84.50,均强于错配的 84.16/83.89;表 3 显示对齐设置 DMD 前后覆盖都更高(0.648→0.527 vs 0.453→0.435)。第二,纯 DMD 后期漂移(Table 2):VBench 82.60→84.74→83.90, 1.319→1.272。第三,主对比(Table 4):Ours(full) 用 14B 教师达 84.83/0.69/1.304,优于 Causal-Forcing(84.38/0.29)、Self-Forcing(84.21/0.53)、CausVid(83.03/0.21); Ours(weak) 用 1.3B 教师仍得 84.54/0.59,反超所有 14B 教师基线,证明分布对齐可匹敌教师规模。第四,消融(Table 5/6):$\lambda=0.01$ 最佳(84.83/0.69),纯 DMD 覆盖仅 0.53;联合蒸馏各训练步覆盖更高(1500 步 0.69 vs 0.55)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 文本到视频生成 (VBench 总分) | VBench Total | 84.83 (full, Wan2.1-14B 教师);84.54 (weak, Wan2.1-1.3B 教师) | Causal-Forcing 84.38, Self-Forcing 84.21, CausVid 83.03, LTX Video 81.37 | full 比最强蒸馏基线 Causal-Forcing +0.45;weak 用 1.3B 教师反超所有 14B 教师基线 +0.16 |
| 教师分布覆盖 | Coverage (V-JEPA2, k=5, 256 样本) | 0.69 (full);0.59 (weak) | Causal-Forcing 0.29, Self-Forcing 0.53, CausVid 0.21 | full 比 Causal-Forcing 提升 +0.40,相对提升约 2.4 倍覆盖 |
| 样本多样性 | Vendi 分数 (raw, V-JEPA2) | 1.304 (full) | Causal-Forcing 1.250, Self-Forcing 1.269, CausVid 1.223 | 比 Causal-Forcing +0.054,比 CausVid +0.081 |
| 联合损失权重消融 | VBench 总分 / Coverage | $\lambda=0.01$: 84.83 / 0.69 | $\lambda=0$(纯DMD): 84.74 / 0.53;$\lambda=1$: 84.18 / 0.71 | $\lambda=0.01$ 在 VBench 上最优,覆盖接近 $\lambda=1$ 的上界,验证模态协调的甜点 |
局限与改进
作者承认的局限包括:所有结论只在 Wan2.1-1.3B/14B 这一对教师、VBench+V-JEPA2 这一组合评估上验证,是否迁移到其他视频扩散族(如 Sora 类闭源模型)或其他表征(如 DINOv2/VideoMAE)未经验证;联合蒸馏的 $\lambda=0.01$ 是经验调出的甜点,虽在 1.3B 弱设置(表 8)上结论一致,但缺乏原则化的自适应调度;分布评估协议用前 5 秒 8 帧这一短窗口,对长视频动力学覆盖的刻画有限。我自己观察到的局限还有三点:第一,Coverage 只用教师半径定义支撑、是"相对教师"的条件统计量,跨教师数值不可直接比较,表 4 中不同 DMD 教师的覆盖列其实处于不同刻度,读者容易误读为同一绝对轴;第二,弱教师反超强教师这一结论依赖 25K 样本与 1.3B/14B 这一特定规模比,是否能外推到更大教师尚未验证;第三,联合蒸馏引入的 CD 项在弱教师 1.3B 设置下覆盖提升(0.59)显著但绝对值仍不算高,说明 CD 锚的强度与教师容量有关,未来或需更强或自适应的锚。
独立分析的弱点
第一个弱点是分布评估对 V-JEPA2 表征与 8 帧短窗口高度敏感:V-JEPA2 偏语义/外观,可能低估运动多样性,若换 DINOv2/VideoMAE 覆盖排序可能改变;改进方向是多表征交叉验证或在轨迹/光流空间补一份覆盖统计。第二个弱点是联合蒸馏把 CD 项作为静态锚($\lambda$ 恒定),但 DMD 漂移是非平稳的(早期需 DMD 锐化、后期需 CD 抑制漂移),固定 $\lambda=0.01$ 难以同时最优化两阶段;改进方向是引入随训练步变化的 $\lambda(t)$ 或基于实时覆盖率的自适应调度。第三个弱点是 teacher-normalized 重噪依赖固定 Wan2.1-14B 归一化教师,当目标教师本身较弱时(纯 1.3B 设置)会引入额外教师偏置;改进方向是归一化教师随目标教师自适应或改用无条件去噪。第四个弱点是覆盖统计增量粒度仅 1/256≈0.0039,对接近的教师-学生对区分度有限,且 $k=5$ 全局固定从不调;改进方向是给置信区间或 bootstrap 显著性。
未来方向
作者明确提出的方向是"分布对齐在自回归视频蒸馏中的重要性"这一原则可推广到更长时序、更强控制、更低延迟的后续工作(Rolling Forcing、Self-Forcing++、Context Forcing、MotionStream、HiAR、BiWM 等),尤其 HiAR 已显式加 forward-KL 正则、BiWM 已加 GAN 与 mass-covering forward-KL,本文的联合蒸馏提供了一个轻量替代。基于本成果可延伸的方向至少还有四条:(1)把 teacher-normalized 评估协议推广为标准工具,用于任何多阶段蒸馏流水线的初始化选型;(2)研究 $\lambda(t)$ 的自适应调度,甚至用强化学习/贝叶斯优化在线调节模态寻优与覆盖的权衡;(3)把覆盖统计从 V-JEPA2 扩展到运动/物理一致性表征,对长视频与交互式生成的动力学覆盖给出更贴切的度量;(4)验证"分布对齐匹敌教师规模"是否在更大教师比(如 14B vs 30B)上仍成立,若成立则可大幅降低蒸馏成本。
复现评估
复现评估整体较好但需大量算力。有利因素:附录 A 给出评估协议全部细节——固定 16 提示×16 种子网格(种子列出)、$\rho=0.9$、归一化教师 Wan2.1-14B + CFG 5.0、Flow-UniPC 1000 训练步、22 步去噪、V-JEPA2 facebook/vjepa2-vith-fpc64-256、token 均值+标准差拼接、$\ell_2$ 归一化、$k=5$;附录 C 列出全部 prompt;基础模型 Wan2.1-T2V-1.3B、VidProM 提示集、V-JEPA2、Flow-UniPC 均公开。不利因素:论文未公开代码与权重(主要作者来自 Riemann Dynamics,部分模型可能受限);蒸馏数据每套 25K 样本需自行复跑采样;训练规模为 Stage 1 5K + Stage 2 2.5K + Stage 3 1.5K 联合训练,加上 5 条流水线初始化对比与多个 $\lambda$ 消融,整体需多卡 H100/H20 级资源;评估端每个检查点要做 256 次去噪+抽特征。难度评级:评估协议中等偏易、完整流水线复现偏难。
论文图表
图示分两列对比"初始化"与"DMD 后":左侧学生初始化覆盖若干模态,右侧 DMD 后这些模态发生坍缩;并示意教师 A 与教师 B 两种目标分布下学生分布的不同走向,直观说明当初始化与 DMD 目标分布不一致时,DMD 会把学生推向其覆盖范围之外的目标模态,导致覆盖坍缩与次优精炼。
这张图是全文第一个核心假设的直觉载体,奠定"分布对齐决定蒸馏上限"这一中心论点,看懂它才能理解后续 Table 1 的目标分布交换实验为何重要。
图示学生在初始化后与教师分布对齐,但经过纯 DMD 长期训练后概率质量被推向教师的高概率区域(漂移),伴随覆盖与多样性下降。配合 Table 2 展示这一漂移过程。
这张图支撑全文第二个核心假设——即便分布对齐,纯 DMD 的反向 KL 仍会在训练后期导致漂移。这直接引出联合蒸馏的动机。