揭秘在线策略蒸馏:角色、病理与调控 Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations
系统揭示OPD的探索催化本质,诊断信号失真病理,用零开销信号调控修复训练不稳定
前置知识
在线策略蒸馏(On-Policy Distillation, OPD)
OPD 是一种让强教师 $\pi_T$ 对学生 $\pi_\theta$ 自己采样的轨迹提供 token 级监督的训练范式。其目标是最小化从学生到教师的反向 KL 散度:$\mathcal{L}_{OPD}(\theta)=KL[\pi_\theta\|\pi_T]=-E_{x,y\sim\pi_\theta}\left[\frac{\pi_\theta(y|x)}{\pi_T(y|x)}\log\pi_T(y|x)\right]$。由于期望在学生自己的样本上取,信号直接评估学生真实生成的序列,规避了离线蒸馏的分布失配。展开序列级 KL 可得逐 token 对数比 $\Delta\ell_t=\log\frac{\pi_T(y_t|y_{<t},x)}{\pi_\theta(y_t|y_{<t},x)}$,它被当作 per-token 优势喂入策略梯度。
本文的研究对象就是 OPD,理解其目标函数、per-token 优势定义以及「学生自己采样」这一关键特性,是把握后续所有病理诊断(信号失真、长度耦合)和调控设计的基石。
策略梯度与 PPO 比率截断(Policy Gradient / PPO Clipping)
策略梯度通过 $\nabla_\theta E[R]\approx E[\nabla_\theta\log\pi_\theta(y|x)\cdot A]$ 更新策略,其中 $A$ 是优势函数。PPO 在此基础上对重要性比率 $r_t=\pi_\theta(y_t|y_{<t},x)/\pi_{\theta_{old}}(y_t|y_{<t},x)$ 做截断,目标为 $\mathcal{L}_{clip}(\theta)=-E_t[\min(r_t\tilde{a}_t, \text{clip}(r_t,1-\epsilon,1+\epsilon)\tilde{a}_t)]$,约束每次更新的策略移动幅度。本文沿用 PPO 框架,但强调比率截断只约束「步长」,不改变由教师信号 $\Delta\ell_t$ 定义的奖励景观本身。
本文的调控方法是在 PPO clip 框架内对 $\tilde{a}_t$ 做形变(硬截断 / 对数压缩),理解 PPO 的 clip 机制才能区分「比率截断」与「优势调控」两个不同层级的稳定化手段。
pass@k 与 avg@32 评测指标
pass@$k$ 表示对每道题采样 $k$ 次、只要任一回答正确即算通过的概率,反映模型在不同采样预算下的性能上限;当 $k\to\infty$ 时它逼近模型的真实能力天花板。avg@32 是 pass@$k$ 的稳定估计:对每题采 $N=40$ 个候选回答,做 $M=10$ 次独立试验,每次随机抽 $k=32$ 个计算通过率再求平均,公式 $\text{avg@32}=\frac{1}{M}\sum_{i=1}^{M}\frac{1}{k}\sum_{j\in S_i} I_j$。本文用 pass@1024 揭示能力天花板、用 avg@32 反映真实性能。
论文最核心的论点「OPD 是探索催化而非能力扩展」完全依赖 pass@$k$ 在大小 $k$ 下的对比来证明;理解这两个指标的差异才能读懂图3 的双轴分析。
知识蒸馏与能力鸿沟(Knowledge Distillation & Capacity Gap)
传统知识蒸馏(KD)由 Hinton 等提出,假设强教师能通过软化标签把「更优智能」迁移给学生、扩展其能力边界。但 KD 文献中长期存在「能力鸿沟」现象:教师过强时反而降低学生表现(Cho & Hariharan 2019;Mirzadeh 等 2019 的中间教师助理)。本文把这一经典现象首次系统迁移到「在线」蒸馏场景,并给出可计算的信号级解释(Informativeness $I$)。
本文与 KD 经典工作的对照是理解其贡献定位的关键——作者把「强教师教差学生」从纯现象学描述提升为可归因到 $\Delta\ell_t$ 失真的信号级诊断,并证明该失真可用零开销调控修复。
研究动机
在线策略蒸馏(OPD)已成为现代大模型后训练流水线的标准组件:通过让强教师对学生自己生成的轨迹提供 token 级监督,OPD 在多项任务上展现出色效果,被 DeepSeek、GLM-5、Nemotron-Cascade 等大规模后训练广泛采用。然而 OPD 的训练动态至今没有被系统理解,从业者在实践中频繁观察到高度不一致的行为——OPD 在某些场景下显著提升性能(如 Thinking Machines Lab 的报告),但在另一些场景中训练变得不稳定甚至崩塌、探索萎缩,最终表现还不如基于结果的强化学习(如 RLVR)。具体可观察的反常现象包括:训练中响应长度异常爆炸(涨到 16k 上限)或骤缩(只剩几个安全 token)、准确率突然跳水、最强教师(如 Qwen3-4B-GRPO)反而教出在 AIME25 上全程停在 2% 附近的最差学生。这些不稳定性严重制约了 OPD 在规模化训练中的可靠使用,但既无法被「教师规模」解释,也缺乏可操作的诊断与处方。
本文的目标是本文的目标是对 OPD 进行系统性的实证研究,回答三个层层递进的问题。第一,OPD 究竟扮演什么角色——是像传统知识蒸馏那样扩展学生的能力上限,还是像强化学习那样仅在已有能力空间内重塑轨迹分布?第二,OPD 在什么条件下会失败,哪些可计算的机制会导致学生被引向退化轨迹?第三,如何在不引入额外计算开销的前提下改进 OPD?作者通过跨 7 个数学推理基准(MATH500、Minerva、AMC23、AIME 2024–2026、HMMT'25)的严格对照实验,量化 OPD 的作用边界、定位失败根源、并验证提出的轻量级信号调控方法的有效性,最终为 OPD 的工程化使用提供可操作的诊断指标(Informativeness $I$)与处方(硬截断 / 对数压缩)。
与已有工作不同的是,本文的独特切入角度是从「信号保真度」而非「数据规模」或「教师能力」来审视 OPD 失败。先前工作主要从外部修复 OPD 的不稳定:要么引入 off-policy 数据混合与冷启动 SFT 做师生对齐(Luo 等 2026),要么在词表维度上做 top-k token 平滑(DeepSeek-AI 2026 的全词表回放缓冲),这些方法虽有效但带来显著额外开销与工程复杂度。本文则直接对齐到 OPD 作为「探索催化」的本质,提出完全 in-loop 的 token 级信号调控——硬截断与对数压缩——它们只对 per-token 优势 $\Delta\ell_t$ 做零前向开销的形变,无需 off-policy 数据或重 warm-start。这种「先诊断、再零开销治疗」的研究路径让 OPD 的失败机制首次被清晰归因到具体可计算的信号量(如 Informativeness $I$、prefix-advantage 不等式 $\frac{1}{T_{pre}}\sum a_t > \frac{1}{T}\sum a_t$),而非停留在「教师太强」「思考模式不兼容」等模糊归因。
核心方法
方法分三段递进实证。第一段确立 OPD「角色」:固定学生 Qwen3-1.7B-Base,教师取 Qwen3-{1.7B,4B,8B,32B} 变体(含 GRPO 版本),数据 Nemotron-Cascade Math,以空 `` 前缀关闭思考模式确保格式对齐,评测用 pass@$k$ 与 avg@32 双轨。pass@1024 收敛证明 OPD 在小 $k$($\leq 64$)显著加速、大 $k$ 与 base 汇合,不抬升天花板;固定 batch $B$ 下 $n=1$(多 prompt)优于 $n=2,n=8$。第二段诊断「病理」:用 Informativeness $I=E[\Delta\ell|r=1]-E[\Delta\ell|r=0]$ 解释最强教师反常失败,从 $\bar{a}=\frac{1}{T}\sum_t a_t$ 与长度 $T$ 耦合揭示两类长度投机。第三段「调控」:在 PPO-clip 框架内对 $\Delta\ell_t$ 施加硬截断 $\text{clip}(\Delta\ell_t,c_{min},c_{max})$ 或软对数压缩 $\text{sign}(\Delta\ell_t)\log(1+|\Delta\ell_t|)$,零额外前向开销。
核心创新点是把 OPD 重新表述为「探索催化剂(exploration catalyst)」而非「能力扩展器(capability expander)」,并据此把所有训练不稳定归因到「指导信号失真」这一可量化根源。这与现有范式的本质区别在于:传统 KD 视角默认「更强教师→更好学生」,于是追求教师规模(如 Yang 等使用 30B 教师);而本文的实证表明,学生-教师之间的分布失配(distributional mismatch)会让强教师的偏好与学生 rollout 分布脱钩,反而产生反相关信号——Qwen3-4B-GRPO(最强教师)的 Informativeness $I<0$,让学生早期准确率不升反降。基于此,作者提出「信号质量 > 教师规模」的新判据,并用零开销的 token 级调控直接对失真信号做形变(而非外挂数据或重 warm-start),使得一个 4B 教师能反超依赖 30B 教师的 SOTA 方法(GOPD、UniOPD)。
方法步骤详情
步骤1(角色分析):Qwen3-1.7B-Base 作学生,每 prompt 仅 $n=1$ rollout,用 pass@$k$ 扫描 $k\in[1,1024]$,证明 OPD 加速但不抬升 pass@1024 天花板;固定 batch $B$ 下比较 $n\in\{1,2,8\}$,得 $n=1$ 最优。步骤2(病理诊断):枚举教师谱 Qwen3-{1.7B,4B}-GRPO 与 Qwen3-{1.7B,4B}(能力序 4B-GRPO > 1.7B-GRPO > 4B > 1.7B),定义 Informativeness $I=E[\Delta\ell|r=1]-E[\Delta\ell|r=0]$ 把轨迹分入 Passable($I\approx 0$)/Misleading($I<0$)/Recovery 三态;从 $\bar{a}=\frac{1}{T}\sum_t a_t$ 推出 Endless Exploration($\lim_{T\to\infty}\bar{a}=0$,填料稀释负罚)与 Abrupt Degeneration($\frac{1}{T_{pre}}\sum a_t > \frac{1}{T}\sum a_t$,早截断锁正前缀)。步骤3(调控):verl 框架,batch=128、max_seq_len=16384、$\tau=1.0$、top-p=1.0、单 epoch/rollout,对 $\Delta\ell_t$ 做硬截断或对数压缩得 $\tilde{a}_t$,喂入 $\mathcal{L}_{clip}=-E_t[\min(r_t\tilde{a}_t,\text{clip}(r_t,1-\epsilon,1+\epsilon)\tilde{a}_t)]$,零额外前向计算。
技术新颖性
技术新颖性体现在四点。其一,首次以 pass@$k$ 双轴(小 $k$ 加速 vs 大 $k$ 汇合)系统证明 OPD 是探索催化而非能力扩展,并量化「prompt 多样性 > 单题采样深度」的资源分配原则。其二,提出 Informativeness $I=E[\Delta\ell|r=1]-E[\Delta\ell|r=0]$ 作为可计算的「教师信号是否与正确性对齐」指标,把抽象的「教师好坏」转化为可观测的三态分类,精准预测蒸馏轨迹。其三,给出长度投机的形式化推导,把 Endless Exploration 与 Abrupt Degeneration 归约到同一结构缺陷——token 优势 $a_t$ 与长度 $T$ 的乘性耦合。其四,调控方法完全 in-loop 且零前向开销:对数压缩在 $|\Delta\ell_t|\to\infty$ 时亚线性增长、零附近近似线性,既压制极端信号又保留教师细粒度偏好排序,区别于硬截断会把超出阈值的 token 全部映射到边界值(排序信息丢失)。
实验结果
核心发现分三组。其一(角色):pass@$k$ 曲线上(图3),OPD 变体在 $k\leq 64$ 显著优于 base 与 GRPO,但 $k$ 增大后三者汇合到接近的 pass@1024,证明 OPD 不抬升天花板、只把 base 已有能力在前几次尝试内提前释放;固定 batch $B$ 下 $n=1$ 一致优于 $n=2,n=8$(图5),证实「prompt 多样性 > 单题采样深度」。其二(病理):最强教师 Qwen3-4B-GRPO 反而是最差教师,其学生在 AIME25 全程停在约 2%,更弱的 Qwen3-1.7B-GRPO 反而最终胜出;Informativeness $I$ 精准预测倒挂——$I<0$(Misleading)对应早期准确率下滑。其三(调控):表1 中 1.7B-GRPO 教师下 naive OPD 综合 28.1,+Clip 升至 28.6,+Scale 升至 30.4(AIME25 10.6→15.6,HMMT'25 6.3→7.3);表2 中学生升级为 post-train 的 Qwen3-1.7B 后,4B-GRPO 配 +Clip 在 AIME24 达 45.2、AIME25 达 37.5、AIME26 达 36.0,全面反超依赖 30B 教师的 GOPD(37.3/31.5/–)与 UniOPD(35.2/30.7/–),证实「调控后的小教师」超越「未调控的大教师」,信号质量而非教师规模主导 OPD 成败。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 7基准综合 avg(Qwen3-1.7B-Base 学生 / Qwen3-1.7B-GRPO 教师) | avg@32 与 pass@1 综合均值 | OPD+Scale(对数压缩)30.4 | naive OPD 28.1 | +2.3 分(约 +8.2%) |
| AIME 2025(Qwen3-1.7B-GRPO 教师) | avg@32 | OPD+Scale 15.6 | naive OPD 10.6 | +5.0 分(约 +47%) |
| AIME 2024(Qwen3-1.7B 学生 / Qwen3-4B-GRPO 教师) | avg@32 | OPD+Clip(CLIP)45.2 | GOPD(30B 教师)37.3、UniOPD(30B 教师)35.2 | 反超 SOTA 约 +21% / +28% |
| AIME 2025(Qwen3-1.7B 学生 / Qwen3-4B-GRPO 教师) | avg@32 | OPD+Clip 37.5 | GOPD 31.5、UniOPD 30.7 | 反超 SOTA 约 +19% / +22% |
| HMMT'25(Qwen3-1.7B 学生 / Qwen3-4B-GRPO 教师) | avg@32 | OPD+Clip 19.0 | GOPD 16.2 | +2.8 分(约 +17%) |
局限与改进
作者明确承认两点局限。其一,硬截断的阈值区间 $[c_{min},c_{max}]$ 与对数压缩本身仍属启发式超参数,需要依据具体学生-教师能力差进行经验调参;论文虽观察到「能力差大时硬截断优于对数压缩」(因对数压缩保留了失配教师混入的噪声),但缺乏自适应、可微的动态调控框架来自动选择。其二,全部实验聚焦于数学推理(MATH500、Minerva、AIME/AMC/HMMT 系列),因为这类任务答案可验证、推理链稠密,便于构造正确性标签 $r$ 来计算 Informativeness $I$;调控后的 OPD 在开放式文本生成、知识密集型问答等任务上的行为尚未验证。从我的观察补充三点:作者未给出超参 $c_{min},c_{max}$ 的具体取值与搜索协议,影响点级复现;实验仅在 Qwen3-1.7B 这一个学生规模上验证「小教师反超大教师」的结论,是否能外推到 7B/14B 学生未知;Informativeness $I$ 的计算强依赖 verifiable reward $r$,在无标准答案的任务上难以直接迁移。
独立分析的弱点
弱点一:调控阈值的选取仍是黑箱。论文未给出 $c_{min},c_{max}$ 的取值范围与选取准则,不同教师-学生对需要重新调参,工程化成本高;改进方向是引入自适应调控——基于在线估计的 $I$ 或优势分布分位数动态设阈,甚至设计可学习的调控函数 $\tilde{a}_t=g_\phi(\Delta\ell_t)$ 与策略联合优化。弱点二:诊断指标 $I$ 依赖 rollout 正确性标签 $r$,在数学任务之外难以获得,使整套诊断-调控流程难以迁移到代码、对话、agent 任务;改进方向是用模型自评、self-consistency 投票或弱 verifier 近似 $r$。弱点三:仅在 Qwen3-1.7B 单一学生规模验证「4B 调控 > 30B 未调控」结论,规模外推性存疑;改进方向是补做 7B/14B 学生与不同 base 家族(Llama、Mistral)的消融。弱点四:缺乏对「为什么会发生学生-教师失配」的机制性解释(表征几何、注意力模式、logit 分布层面证据),目前停留在现象学层面;改进方向是结合 probing、representation similarity 给出失配机理证据。
未来方向
作者明确提出的方向包括:构建动态自适应的调控框架以摆脱启发式超参;以及把实验从数学推理扩展到开放式文本生成、知识密集型问答等任务以验证普适性。基于本文成果可延伸的方向有五条:其一,将 Informativeness $I$ 作为在线训练监控信号,当 $I<0$ 时自动切换教师或降低其权重,实现自适应教师路由(teacher routing);其二,把 token 级调控与 outcome-based reward 做多目标融合,处理半可验证任务(如代码、工具调用);其三,扩展到代码生成、agent 长轨迹任务,验证长度投机是否同样存在、调控是否同样有效;其四,从「学生-教师失配」延伸到「学生-训练数据失配」,研究训练数据分布与学生当前 rollout 分布的 alignment,可能解释为何 $n=1$ 优于 $n=8$;其五,从理论上推导 OPD 在「探索催化」设定下的样本复杂度与最优阈值 $c_{min},c_{max}$ 的闭式解,把启发式调控提升为有理论保证的方法。
复现评估
复现性中等偏上。论文详细披露了训练框架(verl)、关键超参(batch=128、每 prompt $n=1$ rollout、max_seq_len=16384、$\tau=1.0$、top-p=1.0、单 epoch/rollout batch)、数据集(Nemotron-Cascade Math)、评测协议(avg@32 用 $N=40$ 候选、$M=10$ 次试验、$k=32$ 子采样;pass@1 用于 MATH500/Minerva)以及 7 个基准的具体数字,足以复现核心趋势。但若干关键细节缺失:硬截断的 $[c_{min},c_{max}]$ 取值、对数压缩是否配合 baseline shift、训练总步数与学习率调度、PPO 的 $\epsilon$、GRPO 的 group size(仅一处提 $128\times 8$ rollouts)均未完全列出。代码与 checkpoint 未给出明确开源链接。算力方面,pass@1024 评测每题需 1024 次推理,对 7 基准、多教师组合开销不小,完整复现估计需数卡 H100 数天。总体上结论级别复现可行,点级别复现需补全超参或开源代码。
论文图表
图分三联展示 OPD 的核心现象。左图「Not a Ceiling Breaker」:以 pass@$k$ 为纵轴、训练步数为横轴,OPD 加速早期探索但无法超越模型天花板,曲线最终与 base 汇合。中图「Stronger Teacher ≠ Better Student」:柱状对比显示更强的教师并不一定蒸馏出更好的学生,传达反直觉结论。右图「Length Exploitation」:随着训练步数推进,advantage 上升但响应长度同时爆炸或崩塌,揭示长度投机机制劫持了优化目标。
这张图是论文的「电梯演讲」,一眼传达三个核心论点(不抬天花板、强教师不优、长度投机),是理解全文动机与贡献定位的入口。
图把全文组织成「What does OPD do? / When does it fail? / How to fix it?」三段式:§3 角色为探索催化剂(密集 token 级指导、非能力扩展器、prompt 多样性抬升探索);§4 病理为信号失真(学生-教师失配、Endless Exploration、Abrupt Degeneration);§5 调控为「信号质量 > 教师规模」(硬截断 $\tilde{a}_t=\text{clip}(\Delta\ell_t,c_{min},c_{max})$、软对数 $\tilde{a}_t=\text{sgn}(\Delta\ell_t)\cdot\log(1+|\Delta\ell_t|)$)。
这张图是全文的导航地图,把三段贡献与具体技术手段串成一条因果链(角色→病理→调控),对把握论文整体结构至关重要。