← 返回 2026-07-21

蒸馏强化学习:将教师监督融入大语言模型后训练 Distilled Reinforcement Learning for LLM Post-training

Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan, Yue Wang 📅 2026-07-19 👍 9 2026-07-25 18:30
GRPO 大语言模型后训练 强化学习 知识蒸馏 策略优化 重要性采样

将教师监督直接融入强化学习目标,通过反向重要性采样实现选择性知识迁移

前置知识

强化学习与GRPO

强化学习(RL)已成为提升大语言模型推理能力的核心方法。其优化目标可写为 $J_{RL}(\theta) = E[\frac{1}{|o|}\sum_t r_{i,t}(\theta) A(q,o)]$,其中策略比率 $r_{i,t}(\theta)=\pi_\theta(o_{i,t}|q,o_{i,<t})/\pi_{\theta_{old}}(o_{i,t}|q,o_{i,<t})$ 衡量新旧策略对同一 token 的概率比,并用裁剪(clipping)限制更新幅度以防策略崩溃。GRPO(Group Relative Policy Optimization)省去独立的 critic,通过同一 prompt 的一组采样响应的相对奖励来估计优势 $A$,从而降低训练开销。

本文 Distilled RL 直接修改 GRPO 的策略优化目标,把教师偏好注入到 RL 梯度中。理解 PPO/GRPO 的比率裁剪机制是读懂本文反向重要性采样和归一化设计的前提。

策略蒸馏(On-Policy Distillation, OPD)

策略蒸馏(OPD)用学生策略自己采样的轨迹 $o\sim\pi_\theta(\cdot|q)$,最小化学生与教师在每个被访问状态上的 token 级 KL 散度:$L_{OPD}(\theta)=E[\frac{1}{|o|}\sum_t D_{KL}(\pi_\theta(\cdot|q,o_{<t})\|\pi_{teacher}(\cdot|q,o_{<t}))]$。与固定教师数据相比,on-policy 采样减少了训练与推理分布的不匹配,同时保留强教师提供的密集 token 级监督。MiniLLM 等采用 reverse KL 形式。

OPD 是本文的核心对比基线,也是它要解决的痛点来源。本文认为 OPD 的无条件 KL 模仿导致过早收敛、跨家族蒸馏失效,因此必须先理解 OPD 的工作方式,才能理解 Distilled RL 为何要改成选择性的重要性加权。

重要性采样(Importance Sampling)

重要性采样通过 $E_{x\sim p}[f(x)] = E_{x\sim q}[\frac{p(x)}{q(x)}f(x)]$ 用一个分布(行为策略)的样本估计另一个分布(目标策略)下的期望,比率 $\rho=p/q$ 起到重加权作用。在 PPO/GRPO 中常用 token 级比率作为序列级重要性采样的实用近似来做 off-policy 校正,从行为策略重加权到当前策略。

本文的关键创新是『反向』重要性采样:不是把行为策略校正到学生,而是把学生采样的轨迹重加权到教师分布,比值 $\rho_{i,t}=\pi_{teacher}/\pi_{\theta_{old}}$。理解重要性采样的方向和裁剪机制,才能理解本文如何用教师偏好重分配学习信号。

信用分配问题(Credit Assignment)

在 RLVR(带可验证奖励的强化学习)中,奖励通常是序列级的二元正确性信号,整条回答只有对错,没有指明哪些 token、哪些推理步骤是关键。RL 一般把同一个序列级优势 $A$ 分配给回答里的每个 token,但往往只有少数 token 决定最终答案对错。这种粗粒度监督造成严重的信用分配难题:模型难以知道该强化还是修正哪些中间步骤。

本文的核心动机之一就是用教师的 token 级偏好来细化 RL 的粗粒度信号,把序列级优势在 token 维度上重新分配。理解信用分配的困难,才能理解细粒度教师监督的价值。

研究动机

现有大模型后训练主要有两种范式,二者各有硬伤。强化学习(如 GRPO)直接优化任务奖励,但奖励通常是序列级的二元正确性信号,整条回答共用一个优势 $A$,造成严重的信用分配难题,且因为信号主要来自任务奖励,只能强化学生已有的行为,难以引入其策略中根本不存在的新知识。策略蒸馏(OPD)提供更密集的 token 级反馈,却通过 KL 散度无条件地让学生模仿教师分布。这带来根本两难:当教师与学生高度相似时,分布提供的互补知识很有限;当二者架构、家族、推理范式差异较大(跨家族蒸馏)时,分布失配使 token 级模仿噪声大、难以优化。作者还观察到 KL 模仿会驱使学生过快向教师分布靠拢,导致过早收敛、压缩了后续奖励驱动提升的空间,混合 OPD+RL 也因 OPD 迅速把学生锁在 KL 局部最优而无法持续提升。

本文的目标是作者的目标是构建一个统一的后训练框架,把教师监督直接融入强化学习梯度,而非作为一个独立的、无条件的 KL 模仿损失。具体而言,希望让教师扮演『选择性的细粒度向导』:只在采样的回答是有益(正优势)时提供 token 级指引,从而既能转移细粒度知识、解决 RL 的信用分配难题,又能避免 OPD 式无条件模仿带来的过早收敛和跨家族失配。作者进一步要求该方法能在受控实验中证明学生确实获得了标准 RL 学不到的新知识,并在 within-family 与 cross-family 蒸馏设置下都持续超越 RL、OPD 及二者简单组合。

与已有工作不同的是,本文的独特切入角度是把『模仿』与『奖励驱动』从两个对立目标变成耦合关系。OPD 把教师当作无条件模仿目标(独立 KL 损失),RL 把教师完全排除(只用任务奖励),而 Distilled RL 让教师偏好直接进入 RL 梯度的 token 级权重——既不是独立损失也不是单纯奖励。关键区别在于『选择性』:通过对正负样本区别处理(负样本重置),以及对权重做序列级几何归一化,确保教师只在合适的时机、以合适的方式介入,而非像 KL 那样在每个被访问状态上一律对齐。

核心方法

Distilled RL 的整体思路是:教师不应作为独立模仿损失,而应耦合进奖励驱动的 RL 目标,仅当采样回答有益时提供 token 级指引。技术路线上,给定学生旧策略 $\pi_{\theta_{old}}$ 采样的响应,教师评估每个学生 token 的似然,得到教师-学生重要性比 $\rho_{i,t}=\pi_{teacher}(o_{i,t}|q,o_{i,<t})/\pi_{\theta_{old}}(o_{i,t}|q,o_{i,<t})$,衡量教师对该 token 相对学生旧策略的偏好,用来在 token 维度上重新分配 RL 学习信号。最终目标 $J_{DistilledRL}(\theta)=E[\frac{1}{G}\sum_i\sum_t\min(r_{i,t}w_{i,t}A_i,\ clip(r_{i,t},1-\epsilon_{low},1+\epsilon_{high})w_{i,t}A_i)]$,其中学生策略比 $r_{i,t}$ 与 GRPO 一致,新增有效权重 $w_{i,t}$ 来自教师比值的归一化。

核心创新是『反向重要性采样 + 选择性重加权』。传统 PPO/GRPO 把行为策略校正到当前学生策略,Distilled RL 反转方向,把学生采样的轨迹重加权到教师分布,从而把『教师偏好的 token』当作更强的奖励信号、『教师不偏好的 token』当作相对抑制。第二个关键区别是对负优势样本重置权重 $w_{i,t}=1$:因为当 $A_i<0$ 时教师偏好越强反而惩罚越大(见 Table 1 分析),这会把学生推离教师,与蒸馏初衷相悖;所以负样本回到原始 RL 惩罚、不施加教师权重,使蒸馏具备选择性。第三个关键是序列级几何归一化,保证整条响应的教师权重几何均值为 1,只做 token 间的相对重分配而不整体放大或抑制响应。

方法步骤详情

方法含三个组件。第 1 步反向重要性采样:对每个学生 token 计算教师-学生比 $\rho_{i,t}=\pi_{teacher}/\pi_{\theta_{old}}$,裁剪到 $\bar{\rho}_{i,t}=clip(\rho_{i,t},1/\epsilon_\rho,\epsilon_\rho)$,阈值 $\epsilon_\rho=3$,作为外层裁剪外的双重稳定保障。第 2 步负样本重置:仅正优势轨迹施加教师权重,$A_i>0$ 时 $w_{i,t}=\bar{\rho}_{i,t}/\exp(\frac{1}{|o_i|}\sum_s\log\bar{\rho}_{i,s})$,$A_i\le0$ 时 $w_{i,t}=1$,避免教师偏好在负轨迹反向作用。第 3 步序列级几何归一化:把裁剪比值除以同响应内所有裁剪比值的几何均值,使 $\prod_t\tilde{\rho}_{i,t}=1$,去除学生 token 在教师下普遍偏低带来的尺度压制,只保留教师对 token 的相对偏好。最终把 $w_{i,t}$ 代入类 GRPO 的 clipped 目标,在 EasyR1、VeRL 框架上实现。

技术新颖性

技术新颖性有四点。其一,首次把重要性采样方向反转——从『行为→当前学生』变为『学生→教师』,让教师偏好直接进入策略梯度而非作为独立 KL 损失,这是与 OPD 本质的区别。其二,提出负样本重置机制,理论上用 Table 1 的 $\rho\times A$ 符号分析证明对负优势样本施加教师权重会反向,实验上消融显示这是性能贡献最大的组件(去掉后 Qwen3-4B 掉 8.81 分、DSQW-1.5B 掉 6.39 分)。其三,序列级几何归一化针对自回归概率乘积性导致 $\prod\rho_{i,t}$ 随长度急剧变小的过抑制问题,使归一化后权重几何均值为 1,保留相对偏好同时移除全局尺度差异。其四,设计了基于熵的温控教师可解释案例研究,直接证明 Distilled RL 能转移教师分布属性这种 RL 奖励之外的信息。

Overview of Distilled RL.
Figure 1: Overview of Distilled RL.

实验结果

在数学推理与知识密集基准上,Distilled RL 在三个学生模型全面领先。Table 2 显示跨家族代表 DSQW-1.5B(教师 Qwen3-8B-GRPO)平均分从基线 31.70 升至 40.00,相比 OPD(35.27)、RL(36.86)、OPD+RL(36.54)分别 +4.73、+3.14、+3.46 分,AIME24 从 OPD 的 20.72 升到 25.31,AMC23 从 57.57 升到 67.26,增益最显著;within-family 的 Qwen3-4B 平均从 46.33 升到 58.96,Qwen3-1.7B 平均 46.37。Table 3 显示 MMLU-Pro、SuperGPQA 泛化上保持最佳或接近最佳,Pass@16 下 DSQW 的 AIME24 达 70.00、CMIMC25 达 27.50,多数竞赛基准最强,说明改进的是整体分布而非仅最高概率回答。Fig.5 显示 Distilled RL 全程奖励更高、熵稳定、Pass@1 持续上升,而 OPD 早期快但很快饱和、OPD+RL 无明显额外增益。Fig.4 证明学生熵能跟随温控教师目标区间,获得奖励外的新知识。

Effect of importance weighting.
Table 1: Effect of importance weighting.
Pass@1 results on mathematical reasoning benchmarks.
Table 2: Pass@1 results on mathematical reasoning benchmarks.
Additional Pass@1 and Pass@16 results.
Table 3: Additional Pass@1 and Pass@16 results.
Ablation results of Distilled RL.
Table 4: Ablation results of Distilled RL.
Detailed configurations in the experiments.
Table 5: Detailed configurations in the experiments.
Entropy trajectory of Distilled RL with a temperature-controlled teacher.
Figure 4: Entropy trajectory of Distilled RL with a temperature-controlled teacher.
Training dynamics of Distilled RL and baseline methods.
Figure 5: Training dynamics of Distilled RL and baseline methods.
查看结构化数据
任务指标本文基线提升
数学推理平均(10 基准,Pass@1) 平均准确率 40.00(DSQW-1.5B)/ 58.96(Qwen3-4B) OPD 35.27 / RL 36.86 / OPD+RL 36.54(DSQW);RL 57.40(Qwen3-4B) DSQW +4.73 vs OPD;Qwen3-4B +1.56 vs RL
AIME24 竞赛数学(Pass@1) 准确率 25.31(DSQW-1.5B) OPD 20.72 / RL 21.04 +4.27 ~ +4.59 分
AIME24(Pass@16,多采样) 准确率 70.00(DSQW-1.5B) RL 60.00 / OPD 55.00 +10 vs RL,+15 vs OPD
知识密集泛化(SuperGPQA) Pass@1 22.20(DSQW)/ 39.60(Qwen3-4B) OPD+RL 22.00 / OPD 38.40 最佳或接近最佳,说明未过拟合数学
消融:去掉负样本重置 平均 Pass@1 下降 Qwen3-4B 掉 8.81、DSQW-1.5B 掉 6.39 完整 Distilled RL 证明负样本重置贡献最大

局限与改进

作者在附录 A 承认根本局限:on-policy 蒸馏中教师只被查询评估学生生成的轨迹,不完整采样教师回答,因此训练无法直接判断教师是否能解某题。Distilled RL 通过负样本重置规避了大部分风险,但隐含假设是:对被学生解对的题,教师也应足够强以提供有用偏好。当学生在动态训练中持续进步、在某些题上局部超过固定教师时,教师重加权可能向本应成功的轨迹注入次优或误导偏好。此外,方法主要在数学推理这类有可验证奖励的任务上验证,对开放式生成、对齐等无明确正确答案的任务,二元奖励与优势估计如何定义尚未讨论。我额外观察到:所有增益相对于 RL 在 Qwen3-1.7B、Qwen3-4B 上仅约 1~2 分,提升在 within-family 上并不巨大;且方法每次前向需额外计算教师对全部学生 token 的 logprob,增加显著推理开销,论文未报告训练时长/显存代价。

独立分析的弱点

第一个弱点是教师能力假设的脆弱性。方法隐含『教师强于学生』,但训练中学生会逼近甚至局部超越固定教师,此时教师偏好可能误导。改进方向是显式估计教师能力,如周期性教师侧 rollout、验证器核查教师正确性、置信度门控,或在教师不确定时自适应衰减蒸馏权重。第二个弱点是效率。每个 token 都要算教师 logprob,教师越大开销越显著,跨家族时教师与学生架构不同还可能需要两次前向。改进方向是用稀疏教师查询、只对关键 token 采样教师分布,或用更轻量的偏好代理。第三个弱点是 within-family 增益有限且依赖二元正确性奖励。在 Qwen3-4B 上对 RL 的提升仅约 1.56 分,说明在同家族场景 KL 失配本就不严重,方法收益边际递减;且仅适用于有可验证奖励的任务。改进方向是把方法扩展到过程级奖励、偏好奖励或对齐任务,并探索对 teacher-student 相似度自适应调节 $\epsilon_\rho$。第四个弱点是阈值 $\epsilon_\rho=3$、负样本的二元切换等均为手工设置,缺乏理论指导,改进方向是自适应或学习这些超参。

未来方向

作者明确提出的方向包括:显式估计教师胜任度(偶尔教师侧 rollout、验证器核查教师正确性、置信度感知门控、或在教师不确定/不一致时自适应衰减蒸馏权重),以缓解学生超越教师后的误导偏好问题。基于本文成果可延伸的方向:把 Distilled RL 从二元正确性奖励扩展到过程奖励(PRM)或偏好奖励,应用到代码、科学推理等多步可验证任务;把选择性蒸馏思想迁移到对齐任务(如 RLHF/DPO)中,让教师/奖励模型在 token 级选择性介入;研究 teacher-student 相似度自适应调度(随训练动态调节权重强度与 $\epsilon_\rho$);探索在线教师选择(多个教师按胜任度动态组合);以及把几何归一化与负样本重置的思路用于其他重要性采样修正方法,如离线 RL 或校正在线蒸馏中的分布失配。

复现评估

复现性较好。作者开源代码(https://github.com/597358816/Distilled-RL),基于公开 EasyR1 和 VeRL 框架,训练用公开 DAPO-17K 数据集,学生模型(DSQW-1.5B、Qwen3-4B、Qwen3-1.7B)与教师(Qwen3-8B-GRPO)均为公开权重,评测基准(AIME24/25/26、CMIMC25、HMMT25、AMC23、GSM8K、MATH500、Minerva、Olympiad、MMLU-Pro、SuperGPQA 子集 500 例)均公开。Table 5 给出完整配置:全局批 128、rollout 组 G=8、最大响应 8192、学习率 1e-6、训练 160 步、裁剪 $\epsilon_{low}=\epsilon_{high}=0.2$、$\epsilon_\rho=3$、KL 系数 1e-2、OPD 用 reverse KL,Pass@1 用 32 样本温度 0.1。主要难点在算力:每组 prompt 需对学生与教师各做前向取 logprob,rollout 组 G=8、全局批 128 资源需求显著,论文未报告 GPU 数量与训练时长,完全复现需中大规模 RL 集群。