重新审视策略内扩散蒸馏中的无分类器引导 Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
揭示CFG组合OPD的分支歧义缺陷,提出分支感知的PDM目标稳定跨尺度蒸馏
前置知识
Classifier-Free Guidance (CFG, 无分类器引导)
CFG是现代扩散模型推理的标准组件:模型在正向分支(目标文本条件)和负向分支(空文本或负文本条件)各评估一次,再把两者按引导尺度组合,得到去噪速度 $\hat{v} = \gamma v_+ + (1-\gamma) v_-$,其中 $\gamma > 1$ 通常在推理时调节。它无需额外分类器即可放大条件信号、提升样本质量。
本文核心论点正是围绕CFG的分支结构展开——把正负两个分支的错误如何组合、能否相互抵消作为分析对象。不懂CFG的分支定义就读不懂分支歧义与NBA。
On-Policy Distillation (OPD, 策略内蒸馏)
OPD让学生模型用自身当前策略生成去噪轨迹,访问到的每个含噪状态 $x_t^S \sim p_\theta$ 上同时评估教师与学生,并要求学生匹配教师在学生访问状态下的局部速度,目标可化简为 $\mathcal{L}_{OPD} = \mathbb{E}[w(t)\|v_T(x_t^S,t,c_T) - v_S(x_t^S,t,c_S)\|_2^2]$。状态覆盖随策略演化、每步密集监督,是离线蒸馏与标量奖励优化的有力替代。
本文方法建立在分支保留的OPD框架上(教师和学生各自保持正负双分支),所有实验设计、损失推导、K步监督截断都基于OPD范式,必须先理解OPD才能理解PDM的提出动机。
Velocity Prediction (速度预测参数化)
扩散/流模型可用噪声、分数、流或速度等多种参数化。本文统一采用速度预测 $v(x_t, t, c)$,描述在给定含噪状态下的去噪方向;CFG组合后的速度 $\hat{v}$ 才是实际用于采样的去噪向量。相同推导对等价的噪声/分数/流参数化同样适用。
论文所有公式(如 $e_+ = v_T^+ - v_S^+$、$d^M = v_+^M - v_-^M$)都基于速度量;理解速度参数化是理解分支误差、条件方向等概念的数学基础。
Privileged vs Shared Negative Conditioning (特权 vs 共享负条件)
在文本渲染蒸馏中教师与学生在负分支共享同一空文本条件 $c_-^T = c_-^S = \emptyset$;而在参考条件蒸馏或稠密-稀疏视频控制中,教师负分支仍接收参考图或稠密控制信号(学生看不到),即 $c_-^T$ 含特权信息。这是判别分支歧义是良性还是有害(NBA)的关键。
本文最重要的判别依据:共享负条件下分支歧义良性,特权负条件下歧义恶化为NBA。没有这个区分就无法解释两组对照实验的截然结果。
LoRA Adapter (低秩适配器)
LoRA在冻结的基座权重旁引入低秩矩阵 $W + BA$,仅训练 $A,B$ 两个小矩阵(如rank=32、$\alpha=64$),极大降低可训练参数量。本文所有实验(SD3.5-Medium、FLUX.2-klein-4B、Wan2.1-VACE-1.3B)都用LoRA做学生与教师适配器。
理解实验设置(基座冻结、仅LoRA可训、教师EMA更新)才能正确复现;也意味着所有发现的局限可能部分受LoRA容量限制。
Dense-to-Sparse Video Control (稠密-稀疏视频控制)
教师接收逐帧稠密控制信号(pose/depth/scribble),学生只在稀疏关键帧(如像素位置 {0, 20, 40, 60})接收控制,需要从稠密知识蒸馏到稀疏条件。基于Wan-VACE的MV2V接口构造。
这是论文核心应用场景,NBA的后果在这里体现为不同推理引导尺度下控制保真度的剧烈退化;PDM在此取得主要定量收益。
研究动机
分支保留的OPD自然把速度匹配扩展到CFG组合预测,目标 $\mathcal{L}_{naive} \propto \|\gamma e_+ + (1-\gamma) e_-\|_2^2$,其中 $e_+ = v_T^+ - v_S^+$、$e_- = v_T^- - v_S^-$。该目标在分支层面欠定:只要 $\gamma e_+ + (1-\gamma) e_- = 0$,即 $e_+ = \frac{\gamma-1}{\gamma} e_-$,就存在无穷多非零 $(e_+, e_-)$ 对,两支误差可相互补偿而不改变组合预测。作者用两组对照定位何时歧义变有害:文本渲染蒸馏(SD3.5-Medium+OCR教师,共享负条件 $c_-^T=c_-^S=\emptyset$)中两支误差同时下降,良性;参考条件蒸馏(FLUX.2-klein-4B-base,教师负分支保留参考图特权信息)中朴素匹配降正误差的同时持续抬升负误差,呈对抗式动力学,作者命名为负分支不对称(NBA)。可观测后果是引导尺度敏感性:训练尺度 $\gamma_{train}$ 下两误差抵消看似正常,推理换尺度后分支被重新组合、学到的补偿失效,学生显著偏离教师。
本文的目标是本文目标是(1)系统分析CFG组合OPD在分支层面的欠定问题,并明确判别何时歧义是良性的、何时恶化为NBA;(2)提出分支感知的OPD目标,在CFG组合之前分别监督正分支预测与CFG条件方向,消除跨分支误差补偿的自由度,恢复可辨识的密集监督;(3)将分支感知监督应用于稠密-稀疏视频控制,证明它不仅修正离尺度过拟合,还能在训练尺度本身改善知识迁移的保真度与跨推理尺度的鲁棒性。最终通过图像域(共享 vs 特权负条件)两个对照案例验证NBA的诊断特征——即学生相对教师或分支感知对照在换尺度时的过度退化,而非绝对的无CFG性能下降。
与已有工作不同的是,已有分支保留OPD工作(DiffusionOPD、Flow-OPD、D-OPSD)几乎全部在文本到图像设置下研究,且默认教师与学生共享同一空文本负条件,因此负分支误差虽不必为零,却能被联合降低,从未暴露补偿自由度的危害。把CFG内化为单预测的方法(LCM、DMD、DanceOPD)则不再保留正负双分支,回避了问题但牺牲了推理时换引导尺度的灵活性。本文的独特切入点正是研究被遗漏的特权负条件机制:当教师负分支携带参考图或稠密控制等学生无法访问的信息时,共享条件假设被打破,分支歧义从潜在风险变为实际NBA。这是首次系统刻画该机制并提出在组合前监督的分支感知目标,填补了分支保留OPD理论中关于条件对称性的关键空白。
核心方法
核心直觉是“在组合之前监督”而非“在组合之后匹配”。对模型 $M\in\{T,S\}$,定义其CFG条件方向 $d^M = v_+^M - v_-^M$,主目标Positive-Direction Matching (PDM) 为 $\ell_{PDM} = \|e_+\|_2^2 + \lambda \|d_T - d_S\|_2^2 = \|e_+\|_2^2 + \lambda\|e_+ - e_-\|_2^2$。第一项锚定正预测,第二项保持CFG条件方向;零PDM损失要求 $e_+ = e_- = 0$,彻底消除组合匹配的补偿自由度。整体OPD目标仍按 $\mathcal{L}_{OPD}[\ell] = \mathbb{E}_{x_t^S\sim p_\theta, t}[w(t)\ell(x_t^S,t)]$ 在学生访问状态上取期望。作者还设计基线Independent Branch Matching (IBM):$\ell_{IBM} = \gamma^2\|e_+\|_2^2 + (\gamma-1)^2\|e_-\|_2^2$,保留朴素目标展开后的每支权重却删除跨支交互项,用于把“分支级监督的好处”与“PDM特定设计的好处”解耦。两者在 $\gamma>1$ 下都有唯一分支级零损失解。
本质区别在于监督施加的时机与结构:朴素CFG-OPD只约束组合预测 $\gamma e_+ + (1-\gamma) e_-$,允许两支误差互相补偿,在特权负条件下恶化为NBA;PDM则在CFG组合之前分别约束(i)正分支预测 $\|e_+\|_2^2$ 与(ii)条件方向 $\|d_T - d_S\|_2^2$。条件方向 $d = v_+ - v_-$ 编码了CFG所放大的“条件-无条件”对比信息,是决定推理时如何被重新加权的核心量;保持它就锁定了在任意引导尺度下的相对行为。与IBM直接匹配两支不同,PDM把正预测当作锚、把方向当作约束,使监督信号对引导尺度变化更鲁棒——这也是表3中PDM在跨尺度时优于IBM的潜在原因。直觉上PDM“保护正分支、稳定方向”,而非平均压两支。
方法步骤详情
完整流程:(1)学生以当前策略从高斯噪声启动去噪轨迹,用自身CFG组合速度在 $\gamma_{train}$ 下推进;(2)对学生访问的每个含噪状态 $x_t^S$,教师与学生各自构造正负分支预测,教师按原生CFG schema接收特权条件(参考图/稠密控制);(3)计算 $e_+ = v_T^+ - v_S^+$、$e_- = v_T^- - v_S^-$ 与方向差 $d_T-d_S = e_+-e_-$;(4)施加PDM损失 $\|e_+\|_2^2 + \lambda\|e_+-e_-\|_2^2$(参考条件蒸馏与视频默认 $\lambda=1$,文本渲染 $\lambda=2$);(5)按 $w(t)$ 加权在受监督时间步上取期望并反向更新LoRA学生;(6)视频采用K步截断:50步UniPC schedule中只对前 $K=8$ 个学生访问状态计算教师监督(消融显示 $K=8$ 兼顾质量与效率,每步约132秒 vs 全轨迹 $K=50$ 约790秒);(7)教师LoRA按EMA decay 0.9999更新。推理时丢弃教师与特权条件,学生仅用稀疏控制+文本,可用任意 $\gamma$。
技术新颖性
新颖性体现在三点。第一,首次形式化“CFG组合OPD在分支层面欠定”并证明它由条件 $\gamma e_+ + (1-\gamma) e_- = 0$ 给出无穷多非零解;第二,首次界定歧义何时良性(共享负条件 → 联合下降)何时恶化为NBA(特权负条件 → 对抗动力学),并用“相对教师/分支感知对照的过度退化”而非“绝对无CFG性能下降”作为NBA诊断特征,避免把教师本身对CFG的内在依赖误判为蒸馏失败;第三,提出PDM这一参数化形式(正预测+条件方向)并配IBM作解耦基线,使“分支级监督的好处”与“PDM特定设计的好处”可分离评估。此外,稠密-稀疏视频控制中独立发现的K步监督截断(8-of-50)是工程上有价值的效率贡献。理论局限是PDM与IBM共享同一分支级零损失解,PDM的优势目前仅经验性,作者在结论中明确承认这一点。
实验结果
结果三块。**何时NBA出现**:文本渲染(共享负条件、$\gamma_{train}=4.5$、1018测试提示)中教师/朴素/PDM的OCR奖励随 $\gamma$ 几乎同步($\gamma=1$:75.24/73.87/74.48),歧义良性;参考条件蒸馏中正-只训练降正误差却大幅抬升负误差,朴素同样对抗,PDM抑制负误差增长,且 $\gamma=1$ 时PDM紧贴教师而朴素出现形变与漂移。**稠密-稀疏视频主结果(表2,$\gamma=5$)**:PDM姿态Key-MPJPE 2.83(朴素3.14)、PCK@0.1 Key 91.03、FVD 62.77;深度CORR Key 97.13、SI-RMSE Key 5.68均最优;涂鸦F1 Key 93.03(朴素90.99)。IBM多数指标也优于朴素,验证“去补偿”本身有用。**跨尺度泛化(表3)**:训练 $\gamma=5$,测试 $\gamma\in\{5,3,1\}$。朴素在 $\gamma=1$ 退化剧烈:MPJPE 8.98、FVD 507.70;PDM稳定:MPJPE 4.48、FVD 60.97,几乎不漂移。**消融**:$\lambda=1$ 最佳(Key-MPJPE 2.75);$K=8$ 在质量与成本间最优。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 稠密-稀疏姿态控制 (Key-MPJPE ↓) | MPJPE (归一化坐标,越低越好) | PDM 2.83 | 朴素OPD 3.14;SFT 3.31;Off-policy 3.44 | 相对朴素Key-MPJPE降约10%,逼近教师2.82 |
| 稠密-稀疏姿态控制 (Key-PCK@0.1 ↑) | PCK@0.1 (阈值0.1,越高越好) | PDM 91.03 | 朴素OPD 89.35;Off-policy 87.48 | +1.68点,接近教师92.23 |
| 稠密-稀疏深度控制 (Key-CORR ↑) | Pearson相关 | PDM 97.13 | 朴素OPD 96.56;SFT 96.17 | +0.57,逼近教师97.58 |
| 稠密-稀疏涂鸦控制 (Key-F1 ↑) | 线条F1 (膨胀容差2像素) | PDM 93.03 | 朴素OPD 90.99;Off-policy 91.60 | +2.04,逼近教师94.81 |
| 跨尺度姿态控制 ($\gamma=1$, MPJPE ↓) | MPJPE 在离训练尺度 | PDM 4.48 | 朴素OPD 8.98 | 降幅约50%,NBA得到抑制 |
| 跨尺度姿态控制 ($\gamma=1$, FVD ↓) | FVD 在离训练尺度 | PDM 60.97 | 朴素OPD 507.70 | 降幅约88%,几乎消除敏感度 |
局限与改进
作者明确承认:PDM与IBM在非退化权重下共享同一分支级零损失解,因此PDM的经验优势目前没有理论保证,二者的优化行为差异仍未完全理解;NBA分析只覆盖CFG机制与其他若干教师-学生条件不对称,扩展性未知。我的额外观察:(1)所有实验都用LoRA(rank 32~64)+ 冻结基座,未在全参微调或更大模型上验证,PDM增益是否随容量缩放未知;(2)参考条件蒸馏为定性案例研究(6风格×4演示=24条,12测试提示),作者明确声明不作为聚合性能估计,NBA在图像域的定量证据其实较弱;(3)$\lambda$ 与 $K$ 这两个关键超参仅在姿态单模态消融,未在深度/涂鸦验证;(4)稠密-稀疏 benchmark 基于OpenHumanVid单一人体数据集,是否迁移到非人场景未知;(5)负分支定义依赖模型原生CFG schema,schema选择本身可能影响NBA是否触发,论文未做敏感性分析。
独立分析的弱点
**弱点一:理论与经验脱节**。PDM与IBM共享零损失解,PDM的优势(如表3跨尺度更稳)缺乏优化几何解释。改进方向:从Hessian/梯度协方差分析为何“正预测+方向”参数化比“双分支直接匹配”在非凸LoRA轨迹下更稳,可能导出 $\lambda$ 的自适应调度。**弱点二:负分支schema的脆弱性**。NBA是否触发取决于教师负分支是否保留特权信息,而这是模型原生CFG接口决定的;不同基座(如负分支送空 vs 送负提示)会改变结论。改进方向:把“特权度量”量化(如教师负分支与学生负分支输出的KL或特征距离),据此自动选择朴素或PDM。**弱点三:超参与模态耦合**。$\lambda$、$K$ 仅在姿态模态消融,深度/涂鸦直接复用可能次优。改进方向:按模态/难度桶自适应 $K$(论文已按运动分6桶,可结合)。**弱点四:图像域证据偏定性**。改进方向:为参考条件蒸馏设计可控合成特权信息(如人为遮蔽学生负分支的部分条件)以获得定量NBA曲线。
未来方向
作者提出的方向:(1)从理论上刻画PDM与IBM的优化行为差异,把经验优势转为定理;(2)把NBA分析扩展到其他引导机制(如引导蒸馏、对抗引导)与更一般的教师-学生条件不对称。基于成果可延伸的方向:(3)将分支感知思想迁移到CFG之外的多分支组合(如负提示池、多概念引导),那里的补偿自由度可能更严重;(4)把K步监督截断与PDM结合用于长视频(>81帧)或实时控制,进一步压低算力;(5)研究NBA在RLHF式奖励微调中的表现——分支误差补偿可能让奖励信号被“假性满足”;(6)把“特权负条件”框架用于蒸馏闭源教师API(教师负分支schema不可见),评估黑箱蒸馏的风险。
复现评估
复现度较高。基座SD3.5-Medium、Wan2.1-VACE-1.3B与benchmark OpenHumanVid(约91K片段)均公开,评估器DWPose/DPT-Hybrid/VACE scribble/PaddleOCR/clean-fid/I3D公开。FLUX.2-klein-4B-base属Black Forest Labs商用许可。论文给出详尽超参(表7:LoRA rank32 $\alpha$32,AdamW lr $10^{-4}$,2000步,8 GPU DDP,bf16,UniPC 50步 shift=16,$\gamma=5$,480×832×81帧,关键帧{0,20,40,60};文本渲染8×H100,lr $3\times10^{-4}$,1000步,$\gamma_{train}=4.5$;参考条件lr $10^{-4}$,2000步,$\gamma_{train}=2$,30步grid)。难点:(1)算力门槛高,视频实验需8 GPU,全轨迹 $K=50$ 每步约790秒;(2)6个参考风格[A]-[F]的演示来源未公开,参考条件蒸馏难精确复现;(3)600测试clip的难度分桶采样需重建流水线;(4)文中仅给项目页 rethinking-cfg-opd.github.io,代码/权重开源情况未明示。综合:方法超参可复现,端到端复现需可观工程与算力。
论文图表
上半部分图示朴素CFG-OPD:仅匹配组合预测 $\hat{v}=\gamma v_+ + (1-\gamma)v_-$,导致 $\gamma e_+ + (1-\gamma)e_-=0$ 有无穷多 $(e_+,e_-)$ 退化解,分支误差可互相抵消;下半部分图示PDM:分别约束 (1) 正预测匹配 $\|v_T^+ - v_S^+\|_2^2$ 与 (2) CFG方向匹配 $\|d_T-d_S\|_2^2$,恢复可辨识监督。右侧曲线显示朴素OPD对引导尺度 $\gamma$ 高度敏感,PDM保持稳定。
这是全文的直觉入口,一图说清“为什么分支歧义有害”与“PDM如何修复”,是理解motivation与方法核心的最关键图。