在失败处蒸馏:用自适应教师引导恢复负样本强化学习组的学习信号 Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance
RSTG在负零方差样本上选择性施加自适应蒸馏,恢复GRPO丢失的梯度信号
前置知识
GRPO(Group Relative Policy Optimization,组相对策略优化)
RLVR 中主流的策略优化算法。对每个 prompt 采样 G 个 rollouts,用组内平均奖励作 baseline,再归一化得到标量优势 $\hat{A}_{i,t}=(r(x,y^{(j)})-\mathrm{mean})/\mathrm{std}$,施加 PPO 式裁剪后的策略梯度 $\sum_t \hat{A}_{i,t}\nabla\log\pi_\theta$。相比 PPO 它省去了 critic,开销小,但优势是组级标量、对所有 token 统一施加,因此奖励天然稀疏。
GRPO 是本文的基础 baseline,看懂它"组内归一化、标量优势"的机制,才能理解为何组内奖励全部相同时优势坍缩为 0、梯度彻底消失,这正是 RSTG 要补救的源头。
On-Policy Distillation(OPD,在策略蒸馏)
让学生自己生成轨迹 $y\sim\pi_\theta(\cdot|x)$,再在这些学生轨迹上最小化与教师的反向 KL 散度 $J_{OPD}=\min E[D_{KL}(\pi_\theta(y|x)\|\pi^*(y|x))]$,提供 token 级密集监督。其梯度可重写为带 token 级优势 $A^{OPD}_t=-(\log\pi_\theta(y_t)-\log\pi^*(y_t))$ 的策略梯度形式,因此能自然嵌入 RL 框架。
OPD 正是 RSTG 要"精准修复"的对象。理解它作为密集 token 监督的本质,以及反向 KL 带来的优势不对称,才能看懂 naive GRPO+OPD 为何失败以及 RSTG 的三层修复逻辑。
RLVR 与零方差样本(Zero-Variance Prompts)
RLVR 指用可验证奖励(数学题答案对错、代码测试通过与否)作为奖励信号的强化学习后训练范式。在 GRPO 中,组内 G 个 rollout 奖励方差为 0 的 prompt 称为零方差样本:全部正确为正零方差(优势为 0),全部错误为负零方差(优势同样为 0),二者都无法产生有效梯度。
负零方差样本是 RSTG 的核心作用对象。本文专门针对这类"学生全军覆没"的梯度黑洞样本,用教师监督注入原本缺失的学习信号。
反向 KL 与优势不对称(Advantage Asymmetry)
反向 KL $D_{KL}(\pi_\theta\|\pi^*)$ 在学生生成的轨迹上度量。由于学生生成的 token 在教师分布下概率通常偏低,token 级优势 $A^{OPD}_t=-(\log\pi_\theta-\log\pi^*)$ 大多为负,这种系统性偏负被称为优势不对称,会持续抑制而非引导学习。
优势不对称是 RSTG 要解决的第三个核心病因。理解它,才能看懂为何要在负零方差样本上额外引入辅助 SFT,用纯正向梯度把优势分布整体向正方向平移。
教师能力差距与置信度加权(Teacher Confidence Weighting)
OPD 有效的前提是教师在给定样本上确实强于学生。当 teacher mean@8=1(8 次全对)而 student mean@8=0(全错)时蒸馏最有价值;反之教师自己也答错时信号不可靠甚至有害。RSTG 因此用教师置信度 $\omega_i\in[0,1]$(mean@8 得分)作为样本级权重 $\beta\cdot\omega_i\cdot A^{OPD}$。
样本级教师置信度加权是 RSTG 的第一层创新。理解这个前提,才能看懂为何只在占 3.63% 数据的 $D_{sw}^{tr}$ 子集上训练反而超过全量训练。
SFT 作为常数优势的 off-policy RL
SFT 最大化教师轨迹的对数似然 $J_{SFT}=\max E_{y\sim\pi^*}\sum_t\log\pi_\theta(y_t|x,y_{<t})$,可统一进 RL 框架:轨迹从教师而非学生采样,且每个 token 的优势隐式为常数 $A^{SFT}_t=1$,即把教师每个 token 都当金标准、获得均匀正向 credit。
RSTG 的辅助 SFT 项正是利用这一性质——在负零方差样本上注入纯正向梯度。理解它才能明白辅助 SFT 为何能缓解优势不对称并提供全局视角。
研究动机
GRPO 是 RLVR 主流方法,把同一 prompt 的 G 个 rollout 奖励做组内归一化得到标量优势,简单高效。但它天然稀疏:组内奖励完全相同时优势为 0、梯度彻底消失。作者把全对样本称正零方差、全错样本称负零方差,二者都无法训练。On-policy distillation(OPD)用教师在学生轨迹上的 token 级 log 概率作为密集监督,看似能补救。但作者在 Qwen3-1.7B→4B、Qwen2.5-3B→14B 等设置下发现(Figure 1),naive GRPO+OPD 甚至不如纯 GRPO,即便对 OPD 系数做 annealing(KDRL)也不理想。深入分析后作者归纳出三大病因:(1) 样本级均匀性——并非所有样本都适合蒸馏,教师在自己也答错的题上信号不可靠;(2) 教师有界性——OPD 快速收敛到教师上限,过早绑定破坏 RL 探索;(3) 优势不对称——学生 token 在教师下概率低,$A^{OPD}_t$ 大多为负,纯惩罚无建设性。此外 OPD 还因条件化在错误学生前缀上而产生不可靠的局部梯度。
本文的目标是本文目标是让 GRPO 与 OPD 真正互补、恢复被丢失的学习信号。具体而言:(1) 找到 OPD 的最适用范围——只在"学生全错但教师全对"的负零方差样本上施加蒸馏,并用教师置信度加权;(2) 用 token 级选择减慢学生向教师的收敛、降低梯度噪声,保护 RL 的探索能力;(3) 用教师预生成的正确轨迹做辅助 SFT,注入正向梯度、缓解优势不对称并提供全局视角。最终在数学和代码两个领域、三个师生对上,要全面超越 naive GRPO+OPD,并同时抑制 OPD 常见的响应长度膨胀问题。
与已有工作不同的是,独特切入角度是"精确地把蒸馏用在最该用的地方"。已有 OPD 工作多在全部样本上无差别施加、或仅做系数 annealing;ReLIFT、RL-ZVP 等"从负样本学习"的工作要么只用 ground-truth 答案做 offline SFT、要么用 token 熵构造对称优势。RSTG 第一次把三个维度统一进 GRPO 框架:仅在负零方差分支激活、用仅占 3.63% 的 $D_{sw}^{tr}$ 子集训练就反超全量,并定量证明每个组件单独都不可或缺——去掉精心设计的 OPD 组件后性能(51.74%)甚至低于纯 GRPO+SFT(ReLIFT 52.52%)。
核心方法
RSTG 整体是一个分支路由框架(Figure 2)。对每个 prompt 采样 G 个 rollout 并用 verifier 打分后判定分支:若组内奖励不全为 0(非负零方差),走标准 GRPO;若全为 0(负零方差,GRPO 优势为 0),走 RSTG 分支。该分支同时包含三项:(a) 教师置信度 $\omega_i$ 加权的 OPD 项 $A^{Hybrid}_{i,t}=\beta\cdot\omega_i\cdot A^{OPD}_{i,t}$;(b) 经 token 选择后的 token 级蒸馏 $\hat{A}^{OPD}_{i,t}$;(c) 教师预生成正确轨迹的 SFT 项。三者共享系数 $\beta$(线性 anneal,$\beta_{init}=5\times10^{-3}$)。直觉是:GRPO 在学生已经能学到东西的地方继续 RL 探索,而把教师监督精确注入 GRPO 无能为力的梯度黑洞样本,既补上密集 token 信号又补上全局正确轨迹。
核心创新是"三层精准注入",与已有方法本质不同。样本级:把 OPD 限制在负零方差 prompt($D_{sw}$),并按教师 mean@8 置信度 $\omega_i$ 加权优势 $A^{Hybrid}=\beta\omega_i A^{OPD}$,作者用 Figure 3 证明只在 3.63% 的 $D_{sw}^{tr}$(学生全错+教师全对)上训练反超全量训练。token 级:用 Soft-OR 融合学生熵 $\hat{h}_t=-\sum_v p_{t,v}\log p_{t,v}$ 与师生差异 $\hat{d}_t=|A^{OPD}_{i,t}|$,选 top-k% 高价值 token 做蒸馏($s_t=\hat{h}_t+\hat{d}_t-\hat{h}_t\hat{d}_t$),减慢收敛、降低噪声。辅助 SFT:在教师轨迹上施加常数正向优势 $A^{SFT}_t=1$,把整个优势分布往正方向平移。这与 ReLIFT(只答案 SFT)、RL-ZVP(只熵对称优势)、KDRL(全量无差别蒸馏)形成鲜明对比。
方法步骤详情
方法步骤:(1) 数据划分——用 57K DeepMath(难度≥6)与 25K Eurus-RL-Code,先用 student mean@8 划出 $D_{sw}$(约9K全错),再用 teacher mean@8 划出 $D_{sw}^{tr}$(约2K全对,3.63%)。(2) 离线预生成 SFT 参考——对 $D_{sw}^{tr}$ 每个 prompt 向教师采样8次,取最短正确轨迹。(3) 训练每步:batch 256、rollout G=8、lr $1\times10^{-6}$、长度 8192;verifier 打分判定分支——负零方差则激活 RSTG,计算 token 级 $A^{OPD}_{i,t}=-(\log\pi_\theta-\log\pi^*)$,乘教师置信度 $\omega_i$ 与 token mask 得 $\hat{A}^{OPD}$,与教师 SFT 轨迹的常数优势 1 合并、乘共享 $\beta$;否则走纯GRPO。(4) $\beta$ 线性 anneal;数学 550 步、代码 400 步,基于 VeRL、8×A100。
技术新颖性
新颖性在于把"教师可信度"显式建模为样本级权重,并首次系统证明 OPD 只对"学生错+教师对"的窄子集有效(Figure 3),从信息论上解释了为何 3.63% 数据胜过全量。token 选择用 Soft-OR $s_t=\hat{h}_t+\hat{d}_t-\hat{h}_t\hat{d}_t$ 同时捕捉学生不确定性与师生分歧,比单纯熵(RL-ZVP)或单纯 KL(TIP)更鲁棒,近似逻辑 OR 又避免双重计数。把 SFT 统一进同一 $\beta$ 系数下作为"正向梯度平移器",理论上对应常数优势 $A^{SFT}_t=1$,与 OPD 的 $\beta$ 一致正则化。消融(Figure 8 / Table 3)显示去掉精心设计的 OPD 组件后性能(51.74%)甚至低于纯 GRPO+SFT(52.52%),证明这些设计不可或缺而非可有可无。
实验结果
Table 1 跨三师生对给出核心结论。数学上 naive GRPO+OPD 常略低于纯 GRPO(-0.2%/-1.57%/+0.36%),而 RSTG 相对 naive GRPO+OPD 提升 +4.02%/+3.52%/+0.89%;Pair1(Qwen3-1.7B→4B)RSTG 平均 55.39 vs GRPO 51.57 vs GRPO+OPD 51.37,AIME24 从 Vanilla 12.08 跃升至 42.98。代码上 RSTG 相对 naive GRPO+OPD 再 +2.56%/+3.05%/+1.97%,Pair1 的 APPS 30.80→61.81、MBPP+ 49.22→72.41。Figure 6 显示 RSTG 优势曲线整体更高、缓解优势不对称;Figure 7 表明 RSTG 几乎不出现 OPD 的长度膨胀。消融(Table 3):GRPO+OPD(neg) 51.37 → +置信度加权 52.69 → +token 选择 53.24 → +SFT 55.39,三步逐项提升。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 数学推理平均(Pair1: Qwen3-1.7B→4B-2507) | AIME24/AIME25/MATH500/OLMPIAD 平均准确率 | RSTG 55.39(AIME24 42.98, AIME25 31.87, MATH500 89.36, OLMPIAD 57.36) | GRPO 51.57,GRPO+OPD 51.37,ReLIFT 52.52,RL-ZVP 49.49 | 比 naive GRPO+OPD +4.02%,比纯 GRPO +3.82%,全面压制所有基线 |
| 代码生成平均(Pair1) | APPS / MBPP+ 平均准确率 | RSTG 67.11(APPS 61.81, MBPP+ 72.41) | GRPO 60.03,GRPO+OPD 64.55,OPD 53.76 | 比 naive GRPO+OPD +2.56%,比纯 GRPO +7.08% |
| AIME 2024(Pair1,竞赛级数学) | 准确率(%) | RSTG 42.98 | Vanilla 12.08,GRPO 34.79,GRPO+OPD 35.21 | 比 GRPO+OPD +7.77%,比 Vanilla +30.90,提升尤为显著 |
| 数学推理平均(Pair2: Qwen3-4B→4B-2507,师生差距小) | 四项数学基准平均 | RSTG 66.89 | GRPO 64.94,GRPO+OPD 63.37,ReLIFT 65.05 | 比 GRPO+OPD +3.52%,但在差距小时增益(+0.89% 相对 GRPO)受限 |
| 组件消融(Pair1,逐步累加) | 数学平均准确率 | GRPO+OPD(neg) 51.37 → +加权 52.69 → +token 选择 53.24 → +SFT 55.39 | GRPO 51.57 | 三个组件各贡献 +1.32/+0.55/+2.15,SFT(正向梯度平移)贡献最大 |
| 优势不对称缓解(Pair2) | 训练全程平均优势值 | RSTG 优势曲线整体更高、向正向平移 | naive GRPO+OPD 优势持续偏低 | Figure 6 显示更多 token 获得正向学习信号 |
局限与改进
作者承认:仅验证数学与代码两类可验证任务,未覆盖 agentic 等长程任务;受算力与 OPD 要求"师生存在能力差距"的限制,实验规模有限(最大 4B 学生 / 14B 教师),更大尺度有待验证。我的补充观察:(1) 整套方法强依赖一个"强且对齐"的教师,若教师在某些负零方差样本上也答错,蒸馏信号无效甚至有害;(2) $D_{sw}^{tr}$ 的 3.63% 依赖事先用教师跑 mean@8 预筛,预生成开销虽作者称可接受(2×A100 约 2 小时)但对超大数据集会放大;(3) token 选择阈值 k% 与 Soft-OR 的超参敏感度未充分报告;(4) $\beta$ 的 anneal schedule 经手工调优,跨任务泛化性存疑;(5) Pair2 师生同为 4B 时数学增益仅 +0.89%,提示"小能力差距"场景收益边际化。
独立分析的弱点
弱点1:强教师依赖。当师生能力差距小(Pair2,同为 4B),RSTG 数学增益仅 +0.89%,远低于 Pair1 的 +4.02%,说明方法在"差距小"时收益边际化;改进方向是用多教师集成或自蒸馏降低对单一强教师的依赖。弱点2:预筛成本。$D_{sw}^{tr}$ 需事先教师 rollout,对扩展到通用对话/agent 任务(无 verifier)不友好;改进方向是用置信度估计或 online teacher filtering 替代离线预筛。弱点3:仅限 verifiable 任务。OPD 依赖 token 级 log-prob 与硬 verifier,在无标准答案的开放任务上优势不对称的缓解逻辑难以直接迁移;改进方向是引入 reward model 替代硬 verifier。弱点4:超参敏感。$\beta_{init}$、k%、Soft-OR 阈值都需要调,缺乏自适应机制;改进方向是把 $\omega_i$ 或 k 做自适应 curriculum。弱点5:评测基准集中,缺少跨语言、跨模态的泛化证据。
未来方向
作者明确未来方向:扩展到 agentic 等更复杂任务、扩大模型规模验证 RSTG 是否仍有效。基于成果可进一步延伸:(1) 把"教师置信度加权"推广到任意 teacher-student 蒸馏场景,例如多智能体协作中的导师选择;(2) token 选择思想可结合 speculative decoding——只在学生不确定的 token 求助教师,减少蒸馏计算;(3) 辅助 SFT 的正向梯度平移思想可推广为"课程化优势塑形",逐步把负向区域拉正;(4) 把 RSTG 分支的路由判断(是否负零方差)与 curriculum learning 结合,动态调整训练难度分布;(5) 探索在 reward model 替代 verifier 后,能否迁移到开放域对话与多轮 agent 任务。
复现评估
基于 VeRL 框架实现,训练数据 DeepMath(57K,难度≥6)和 Eurus-RL-Code(25K)均开源,评测用 AIME24/25、MATH500、OLMPIAD、APPS、MBPP+ 等公开基准。算力需求明确:8×A100,数学 550 步、代码 400 步,Pair1/2/3 数学约 3/4/2.5 天、代码约 4/5/3 天,额外 OPD+SFT 开销约 12 小时;SFT 数据预生成 2×A100 约 2 小时。关键超参齐全(batch 256、G=8、lr $1\times10^{-6}$、$\beta_{init}=5\times10^{-3}$、$\delta=5\times10^{-5}$、$\beta_{min}=1\times10^{-3}$、n=8、温度 1.0)。但论文未明确公开代码仓库,$D_{sw}^{tr}$ 的精确划分脚本、Soft-OR 的归一化范围、top-k% 的具体取值需要查代码;教师轨迹"取最短正确"也可能引入长度偏置。整体中等可复现,但需中等到较大算力。
论文图表
展示在 MATH 上 GRPO、GRPO+OPD、OPD 与 RSTG 的训练动态曲线。关键现象是 naive GRPO+OPD 的性能反而低于纯 GRPO,而 RSTG 显著高于所有基线,直观证明"无脑叠加蒸馏"不仅无效还会拖累 RL。
这张图是整篇论文动机的最直接证据——它一眼说明 naive GRPO+OPD 为何"失败",从而引出作者要解决的三大病因,是理解 motivation 的核心视觉。
对比正零方差与负零方差 prompt 上 OPD advantage 在训练全程的曲线。负零方差的优势始终更偏负(约 0.20-0.48 vs 正零方差更低区间),反映严重的优势不对称,纯惩罚无建设性。
这张图直观量化了"优势不对称"这一第三大病因,为后续引入辅助 SFT 注入正向梯度提供了直接动机。