在线策略蒸馏真的在蒸馏吗:从噪声教师到自我改进 Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
OPD的增益并非来自教师蒸馏,而是压制学生低概率token;据此提出零监督OPSA,性能反超OPD
前置知识
在线策略蒸馏(On-Policy Distillation, OPD)
让强教师模型在学生自己采样的轨迹上逐 token 打分的训练范式:教师与学生 log 概率之比作为 token 级优势 $A_i=\log\frac{\pi_t(y_i|x;y_{<i})}{\pi_s(y_i|x;y_{<i})}$,学生据此做策略梯度更新。相比 RLVR 的整句 0/1 奖励,监督信号稠密得多,典型实现是 Thinking Machines 提出的 K1 估计器方案,近一年成为推理后训练的热门路线。
本文的研究对象就是 OPD,全文围绕「教师打分是否可靠、学生到底在学什么」展开,不理解 OPD 的机制就无法理解其动机与结论的颠覆性。
RLVR 与 GRPO
可验证奖励强化学习:对每道题采样一组响应,用可验证器(如数学答案比对)给 0/1 奖励,在组内归一化得到优势(GRPO、DAPO)。缺点是奖励只在响应末尾给出,对长链推理过于稀疏;且当组内回答全对或全错时归一化优势全为零,学习信号直接消失,训练容易停滞或崩溃。
RLVR 是 OPD 的对照基线,论文多处与 GRPO 对比,且 OPD 的卖点正是弥补其信号稀疏,理解两者的监督差异是读懂 Table 1 对比的前提。
反向 KL 与 off-policy 打分问题
OPD 最小化 $\mathrm{KL}(\pi_s\|\pi_t)$,期望在学生分布下计算——即教师必须给「学生才会生成」的前缀逐 token 打分。这些轨迹对教师而言是 off-policy 的,教师在其上的行为从未被验证,打分可能系统性偏离其真实偏好,这是教师监督噪声的根源。
教师监督噪声大且随模型规模增大,正是这种分布错位的直接后果,是本文第一个核心发现(Section 2)的理论背景。
Token 熵与分叉(fork)token
策略在某位置的熵 $H_i=-\sum_v \pi(v)\log\pi(v)$ 衡量其不确定性。高熵位置是推理链的「分叉点」,候选词可能开启不同推理分支,常伴随 wait、but 等反思词;低熵位置模型高度确信,需要高精度。近期工作(如 80/20 高熵 token 研究)表明高熵少数 token 在 RL 中作用关键。
OPSA 用熵决定负优势的幅度:高熵分叉处给最强负信号、低熵处给弱信号,这是它超越固定负优势与 OPD 的关键设计。
Avg@k 与 Pass@k
对每题采样 k 次的两种互补指标:Avg@k 是 k 次采样的平均正确率,衡量单次推理的期望表现;Pass@k 是 k 次中至少答对一次的比例,衡量策略探索能力的上限。若 Avg@k 涨而 Pass@k 跌,说明模型在收敛到局部最优、损失多样性。
论文用 Avg@32 和 Pass@32 双指标证明 OPSA 既提升精度又保持多样性,这是它与 TTRL 等会压塌 Pass@k 的自监督方法的关键区分点。
研究动机
大模型推理能力的后训练以 RLVR(GRPO/DAPO 等)为主流,但可验证奖励只在整条响应结束时给出 0/1 信号,对动辄上千 token 的长链推理过于稀疏;更麻烦的是,当一组采样回答全对或全错时,组内归一化优势全为零,学习信号消失,训练容易不稳定甚至崩溃。在线策略蒸馏(OPD)因此走红:用强教师在学生采样的轨迹上给出逐 token 优势,信号稠密且训练高效。但 OPD 有两个长期被忽视的隐患:一是它要求师生共享词表且能白盒访问教师 logits,教师选择受限;二是更根本的——教师必须给「自己不会生成」的学生轨迹打分,这种 off-policy 场景下教师监督到底有多可靠,此前只有轨迹级的定性讨论(如 Uni-OPD),没有人定量测过噪声率;而 OPD 的性能增益究竟来自「知识迁移」这一立论机制,还是别的什么,也从未被解剖过。
本文的目标是本文的目标分三层递进。第一,定量测量 OPD 训练中教师监督的噪声率——定义为教师对可验证正确的答案 token 给负优势、或对错误答案给正优势的比例——并检验它如何随教师规模(4B/30B-A3B/235B-A22B)变化。第二,通过严格的控制实验定位学生性能提升的真正来源:有效学习集中在哪些 token 上(高 logp 还是低 logp)、什么样的学习信号在起作用(教师提供的优势还是与内容无关的固定值、正值还是负值)。第三,把结论转化为一个完全无外部监督的 token 级 RL 方法——不需要教师模型、不需要可验证奖励、不需要参考答案提示——在 AIME24/25、HMMT25 数学基准上达到并超越 OPD 与 GRPO,同时保持 Pass@32 多样性并泛化到代码与问答任务。
与已有工作不同的是,已有工作大多默认「教师监督值得修而不是值得扔」:TIP、Uni-OPD 等试图用 token 选择或细粒度信用分配降低 OPD 噪声,OPSD 用提示(hint)构造自教师替代外部教师,但它们都保留了「教师在学生轨迹上打分」这一范式本身。本文的独特切入是先解剖、后重建:先证明教师噪声率高得惊人(4B 教师 30.6%,235B 教师达 50.6%)且学生对噪声完全无感,从而釜底抽薪地质疑「蒸馏」这个前提;再把 OPD 的增益重新归因为「压制学生自身的低概率 token」——一个根本不需要教师的操作——并用固定负优势这一最简方案复现 OPD,再用熵调制超越之。这种「证明监督可以不存在」的反直觉视角,与所有在监督框架内做修补的工作形成鲜明对照,也把 NSR、高熵 token 分析等零散观察统一成一个完整的因果链条。
核心方法
直觉上,OPD 像是请一位名师逐字批改学生自己写的草稿:学生的思路对老师来说是 off-policy 的,老师看不懂就给差评,可学生成绩照样提高——说明起作用的不是批改内容,而是「差评」本身。技术路线分四步。第一步,解剖 K1 优势 $A_i=\log\frac{\pi_t(y_i|x;y_{<i})}{\pi_s(y_i|x;y_{<i})}$ 的分布与梯度性质:logit 梯度在 $|A_i|$ 很小或学生概率接近 1 时消失。第二步,过滤实验——只用含噪声优势的轨迹、只用干净轨迹、标准 OPD 三种训练——证明学生对教师噪声无感。第三步,信号替换实验:把全部优势换成固定值 $A=-0.5$ 或 $A=+0.2$,证明负信号是关键、教师打分内容无关紧要。第四步,研究负信号该多强,发现应与位置熵正相关,由此导出 OPSA:只更新每条响应 logp 最低的 20% token,优势按 $A^{\text{dyn}}_i=-\frac{1}{2}-\frac{H_i-H_{\min}}{2(H_{\max}-H_{\min})}$ 随熵从 −0.5 加深到 −1。
核心是三个环环相扣的实证发现。其一,OPD 中 51.7% 的 token 优势幅度 $|A|\le 10^{-4}$、29.2% 精确为零,且这些近零优势恰好集中在学生高 logp token 上:学生在某位置非常确信时,教师在相同前缀下也大概率给该 token 高概率,log 比值趋零、梯度消失。其二,控制实验表明只训练 top 20%–40% 高 logp token 几乎无提升,且把真实优势换成 $[-1,1]$ 均匀随机优势后结果不变——高 logp token 对训练没有任何有效信号。其三,把全部优势换成固定 $A=-0.5$(只施加在最低 20% logp token 上)性能照常上涨并复现 OPD(响应长度同样增长到约 12K);换成 $A=+0.2$ 则 40 步内响应长度崩到零、梯度爆炸、输出退化为乱码。三者合起来得出反直觉结论:OPD 的增益来自「对学生低概率 token 施加负向压制」,与教师是谁、打分是否正确基本无关——知识迁移并非必要,这直接动摇了在线蒸馏的立论基础。
方法步骤详情
OPSA 的训练循环完全不需要外部信号。(1)采样:学生(如 Qwen3-1.7B,关闭思考模式)对 DAPO-17k 的问题——只用题面、无任何标签或答案——以温度 1.0、每题 1 条生成响应,rollout batch 64,最大长度 12000 token。(2)选位置:按学生的 on-policy logp 升序取最低 20%(记为 Slowest20)作为唯一被训练的位置,其余 token 不进入损失。(3)定优势:在被选位置计算 token 熵 $H_i$,用该响应内被选位置的最小/最大熵 $H_{\min},H_{\max}$ 归一化,优势为 $A^{\text{dyn}}_i=-\frac{1}{2}-\frac{H_i-H_{\min}}{2(H_{\max}-H_{\min})}$:最高熵的分叉位置拿最强负信号 −1,最低熵位置拿 −0.5。(4)更新:以策略梯度损失 $L=-\mathbb{E}\sum_{i\in\text{Slowest20}} A^{\text{dyn}}_i\log\pi_\theta(y_i|x;y_{<i})$ 更新参数,学习率 $1\times10^{-6}$,基于 slime 框架在 8 张 H100 上训练约 500 步,按验证集 Avg@4 选 checkpoint。全程没有教师前向、没有奖励模型、没有参考答案。
技术新颖性
与负样本强化(NSR)相比:NSR 需要可验证奖励判定轨迹对错、对错误轨迹整句赋同一负优势;OPSA 无任何监督、只在低 logp 位置赋负优势、且幅度随熵自适应,粒度细一个量级。与 TTRL、EMPO、Intuitor 等无标签方法相比:它们构造轨迹级自奖励(多数投票伪标签、自确信度),严重依赖模型初始能力,容易强化错误模式并压塌 Pass@k;OPSA 不把策略拉向任何自生成奖励,而是纯粹地重新分配概率质量。与「80/20 高熵 token」工作(Wang et al., 2026c)相比:后者在 RLVR 框架内指出高熵少数 token 驱动有效 RL,本文把熵从「该在哪学」的筛选器升级为「负信号该多强」的调制器,并彻底脱离奖励框架。与 OPD 修补类工作(TIP、Uni-OPD、信任域蒸馏、位置偏差分析等)相比:它们仍在改进教师监督的利用方式,本文证明教师监督可以整体移除且效果更好。
实验结果
实证链条分诊断、归因、验证三段。诊断:4B 教师对正确/错误轨迹的噪声比例分别为 20.4% 与 40.8%,总噪声率 30.6%;30B-A3B 教师升至 34.7%;235B-A22B 教师高达 50.6%,97.8% 的正确答案 token 也被打负优势——教师越大越「一边倒地负」且越不区分对错。但学生无感:只用噪声轨迹、只用干净轨迹与标准 OPD 三种训练收敛到相近的 AIME24 Avg@4(约 26)。归因:只训练高 logp token 无效,换成随机优势也无效果;固定 $A=-0.5$ 复现 OPD(响应长度同步涨到约 12K),固定 $A=+0.2$ 则 40 步内策略崩溃;熵调制($\delta=1$)把 Avg@4 推到 50.0%,远超 OPD 的 35.13%。验证:Qwen3-1.7B 的 AIME24 Avg@32 从 13.44 提到 48.85(+263.5%)、Pass@32 从 40 翻倍到 80,AIME25、HMMT25 相对提升 264.4%、307.2%,三基准平均 35.83,超最强基线 GRPO(24.79)11.04 点;Qwen3-4B AIME24 从 23.33 到 62.08,Qwen3.5-9B 从 76.35 到 87.81,域外 MBPP+ 与 GPQA-D 分别相对 +2.1%、+16.0%。消融:只取最低 10% token 会过度锐化、明显变差,20/30/40% 均超 Avg@4=45;遮蔽反思 fork token 后增益消失、约 300 步长度崩溃;对齐 token 预算后 GRPO/OPD 仍只有约 32,证明增益不来自回复变长。效率上每步 46.3 秒,快于 OPD(61.2 秒)与 GRPO(186.2 秒)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 数学推理 AIME24(Qwen3-1.7B) | Avg@32 | 48.85 | 基模型 13.44;GRPO 33.96;OPD 32.08 | +35.41(相对 +263.5%,超最强基线 +14.89) |
| 数学推理 AIME24(Qwen3-1.7B) | Pass@32 | 80.00 | 基模型 40.00;GRPO 70.00 | +40.00(相对 +100.0%) |
| 数学推理 AIME25(Qwen3-1.7B) | Avg@32 | 35.31 | 基模型 9.69;OPSD 22.50 | +25.62(相对 +264.4%) |
| 数学推理 HMMT25(Qwen3-1.7B) | Avg@32 | 23.33 | 基模型 5.73;GRPO 15.10 | +17.60(相对 +307.2%) |
| 数学推理 AIME24(Qwen3-4B) | Avg@32 | 62.08 | 基模型 23.33 | +38.75(相对 +166.1%) |
| 数学推理 AIME24(Qwen3.5-9B) | Avg@32 | 87.81 | 基模型 76.35 | +11.46(相对 +15.0%) |
| 代码生成 MBPP+(Qwen3-1.7B,域外) | Avg@32 | 59.44 | 基模型 58.24 | +1.20(相对 +2.1%) |
| 通用问答 GPQA-Diamond(Qwen3-1.7B,域外) | Avg@32 | 32.40 | 基模型 27.92 | +4.48(相对 +16.0%) |
| 训练效率(Qwen3-1.7B) | 每步训练时间 | 46.3s | OPD 61.2s;GRPO 186.2s | 比 OPD 快约 24%,比 GRPO 快约 4 倍 |
局限与改进
作者在附录中坦承四点:实验只覆盖到 9B 模型,OPSA 对更大规模或 MoE 架构是否有效未知;其机制本质是重新分配策略已有的概率质量,对分布本已过度尖锐的重度后训练模型收益可能有限;思考模式下的 Pass@k 提升不大,说明它可能无法实质性扩展策略的探索边界;OPD(K1 估计器)真正的增益来源仍缺乏理论解释。我的补充观察:噪声的定义只覆盖 \boxed{} 答案 token,推理中间步骤的教师噪声无法量化,诊断结论的适用范围因此受限;「低概率 token 都该压制」隐含任务先验,在代码、创作等低概率 token 可能承载关键信息的任务上未必成立;训练中策略熵持续下降,500 步之后是否崩溃、需要何种早停准则未报告;所有数学评测每题仅 30 题样本,Avg@32 的置信区间较宽,部分小差距结论(如域外 +2.1%)说服力有限;固定优势基线 $-1/2$ 与 20% token 比例虽经消融,本质上仍是经验超参而非原则性推导。
独立分析的弱点
第一,缺少熵下界与停止准则:OPSA 靠持续压制低概率 token 起效,训练熵一路下行,长训可能过度锐化、损害 Pass@k(论文只展示 500 步内的良性动态)。改进方向:加熵正则或按验证集 Pass@k 早停,并对 $A=-1$ 的上限做钳制。第二,「低 logp 等于该压」是任务相关假设:创意写作或代码任务中,低概率 token 可能恰恰是高质量的罕见选择(生僻 API、独特表达),直接迁移可能抹平解法与风格多样性。改进方向:引入任务条件化的 token 筛选,或用轻量可验证器对被压 token 做正向门控。第三,反思 fork 的定义是硬编码英文词表(wait、however、but、hmm 等九个词),多语言与非数学场景需要学习式或语义式 fork 检测。第四,每题只采 1 条响应的 rollout 设置与主流 GRPO 实践(组内多条对比)差异较大,OPSA 与数据课程、样本筛选等技术的叠加效果缺乏研究。第五,与 RLVR 的组合只做了 GRPO 冷启动一个实验,「OPSA 先压噪、RLVR 再提上限」的两阶段配方值得在更大模型与 Agentic 任务上系统验证。
未来方向
作者明确提出的方向有三:把 OPSA 的细粒度负优势与其他 RL 方法结合以扩展探索边界(附录中的 GRPO 冷启动实验——4B 模型接 GRPO 后 40 步再涨约 9 点 Avg@4——是开端);对 K1 估计器下的 OPD 增益来源做理论分析;把方法推广到更大规模与 MoE 架构。基于本文成果还可延伸:其一,构造「负信号无监督、正信号可验证」的混合目标,把熵自适应负优势与过程奖励或结果奖励结合,兼得无监督的普惠性与奖励的上限突破;其二,在代码生成、Agentic 工具调用等长序列任务上验证 fork-token 压制的泛化性;其三,把「高熵分叉处均匀重分配、低熵处锐化」的原则迁移到推理时计算,例如解码时对 fork 位置做受控熵注入以提升 test-time scaling 效率;其四,从分布几何角度刻画「尾部压制即隐式分布锐化」与泛化、记忆的关系,为无监督后训练建立更坚实的理论基础。
复现评估
可复现性相当好。论文封面给出 HuggingFace 与 GitHub 链接,训练细节完整公开:slime 0.2.4 框架、Megatron 0.16.0rc0 训练引擎、SGLang 0.5.14 推理引擎,8×H100 或 H200;学习率 $1\times10^{-6}$,rollout batch 64、每题 1 样本,训练解码温度 1.0、最大长度 12000,评测温度 0.7、top-k 20、top-p 0.8、每题 32 样本、最大 32768 token,约 500 步、每 20 步验证一次。数据用公开的 DAPO-17k 且只用问题,无任何标注成本;方法本身无教师、无奖励模型,实现只需在标准策略梯度上加「低 20% logp 掩码 + 熵归一化负优势」约几十行代码。主要成本在评测(三个数学基准各 30 题 × 32 样本 × 最长 32K 输出)以及复现 GRPO/OPD 基线。对拥有 8 卡 H100 的团队,1.7B 全参训练一两天内可复现;资源有限者可从 1.7B 入手并缩减评测样本数。总体难度:低到中。
论文图表
(a) 展示教师优势方向与可验证奖励矛盾的比例:4B 教师总噪声率 30.6%(正确轨迹拿负优势 20.4%、错误轨迹拿正优势 40.8%),30B-A3B 达 34.7%,235B-A22B 达 50.6%,且最大教师对正确答案 token 也有 97.8% 给负优势。(b) 展示只用噪声轨迹、只用干净轨迹、标准 OPD 三种训练的 AIME24 Avg@4 曲线,三者收敛到相近水平(约 26)。
这张图承载论文第一个核心发现:教师监督噪声大且随规模恶化,但学生对此完全无感——它直接引出「OPD 到底在蒸馏什么」的研究问题,是全文论证的起点。