在线策略差分蒸馏 On-Policy Delta Distillation
用教师与基础模型的概率差作为蒸馏奖励,大幅提升推理蒸馏效果。
前置知识
On-Policy Distillation (OPD, 在线策略蒸馏)
一种后训练方法,介于知识蒸馏与强化学习之间。它由学生模型 $\pi_\theta$ 自身采样回复 $y \sim \pi_\theta(\cdot|x)$,再由教师模型 $\pi^*$ 对每个采样 token 打分,奖励为对数概率差 $R_t = \log\pi^*(y_t|x,y_{<t}) - \log\pi_\theta(y_t|x,y_{<t})$,并按 RL 式策略梯度更新。与 SFT(用教师生成的序列)不同,OPD 在学生实际到访的状态上施加 token 级密集监督,能缓解曝光偏差(exposure bias)。
OPD 是本文改造的对象。不懂 OPD 的奖励定义与 RL 式梯度形式,就无法理解 delta 信号为何要替代它、以及 centering 与联合条件解决的是什么问题。
Knowledge Distillation (KD, 知识蒸馏)
把高性能教师模型的输出分布迁移到学生模型的训练范式,最早用交叉熵或 KL 散度 $D_{KL}(\pi_\theta \| \pi^*)$ 衡量学生与教师输出分布的距离。在 LLM 时代分为两类:Sequence-KD(蒸馏教师生成的序列,即 SFT 的雏形)与 on-policy 蒸馏(蒸馏学生生成的序列并由教师打分)。
本文属于 KD 家族的 on-policy 分支。理解 KL 散度与 token 级奖励的等价关系(对采样 token 概率求偏导),才能看懂 OPD 损失 $\mathcal{L}_{OPD} = \mathbb{E}[D_{KL}(\pi_\theta \| \pi^*)]$ 与梯度公式之间的转换。
Reasoning tuning / Instruction tuning (推理调优)
LLM 的训练通常分两阶段:先用海量数据做 next-token 预测的预训练,得到基础模型(base);再用 SFT 与 RL 进行指令/推理调优,赋予模型推理、对话等能力。本文的关键洞察正是把'推理调优带来的增量'视作可蒸馏的核心知识。
OPD2 的 delta 信号 $\log\pi^* - \log\pi^*_{base}$ 直接刻画了'推理调优前后教师的差异'。不理解 base 与 reasoning-tuned 模型的分阶段关系,就无法理解为什么要减去 base 而不是直接模仿教师。
Advantage 与 Centering (优势函数与零均值化)
在 RL 中,奖励减去其在策略分布下的期望得到优势(advantage),可消除与动作无关的偏置、稳定训练。本文对 OPD 与 delta 奖励都做 centering:$A_t = R_t - \mathbb{E}_{\tilde{y}\sim\pi_\theta}[R(\tilde{y})]$,由于标准 OPD 的 on-policy 性质会自动消偏,而 delta 信号不含学生项,必须手动 centering。
centering 是 OPD2 三个核心组件之一。理解为何 delta 需要手动零均值化、为何用 top-1024 token 近似全词表期望(省显存),是读懂方法章节 Eq. 6-8 的关键。
ExOPD (外推式在线蒸馏)
本文的主要对比基线之一,也是 SOTA 的 on-policy 蒸馏方法。它同样利用教师与教师基础模型的差异,但用一个因子 $\lambda>1$ 放大该差异,推动学生'超越'教师。ExOPD 本质仍是 student→teacher 分布匹配的外推。
理解 ExOPD 与 OPD2 的本质区别(外推 vs 提取增量)是把握本文新颖性的前提。所有主要实验表格都以 ExOPD 为最强基线,需要知道它的 $\lambda=1.25$ 设置才能解读提升幅度。
研究动机
在在线策略蒸馏(OPD)中,学生模型 $\pi_\theta$ 用自身采样序列 $y \sim \pi_\theta(\cdot|x)$ 训练,由教师模型 $\pi^*$ 对每个采样 token $y_t$ 打分,奖励为对数概率差 $R^{OPD}_t = \log\pi^*(y_t|x,y_{<t}) - \log\pi_\theta(y_t|x,y_{<t})$,并按 RL 式梯度更新。该方法虽在 Qwen3 等模型后训练中表现优异,但奖励设计存在根本盲区:经过推理调优(SFT+RL)的教师不仅获得推理能力,还保留了预训练阶段习得的'自然偏好'与文体倾向。学生模仿教师完整分布时,与推理无关的风格噪声(如泛泛探索词 see/try/verify)也被当作正向信号强化,稀释了真正推理知识的传递。作者通过 token 级分析发现,标准 OPD 信号甚至会为错误推理片段(如把'相加'误判为'相乘')持续给出正奖励——因学生与教师虽都给出强负信号,但学生更强,导致 $R^{OPD}_t$ 反而取正。这暴露出 OPD 信号与'推理正确性'相关性脆弱的根本缺陷。
本文的目标是本文目标是重新设计 OPD 的奖励信号,使其只传递'推理能力'这一真正的后训练知识,而非教师输出分布的全部。具体地,作者引入'差分信号(delta signal)',定义为教师与其基础模型(预训练后、推理调优前)之间的对数概率差 $R^\Delta_t = \log\pi^*(y_t|x,y_{<t}) - \log\pi^*_{base}(y_t|x,y_{<t})$,用以刻画教师从基础模型到推理模型所走的'学习轨迹'。作者希望证明:用这一聚焦推理轨迹的信号替代标准 OPD 奖励后,能在数学、科学、代码三大推理域、跨 1.7B-8B 多个模型规模、且在 Qwen3 的非思考/思考两种模式以及 Gemma4 架构上,一致且显著地超越标准 OPD 与当前 SOTA 的 ExOPD,同时保持较短的后训练周期(仅 100 步)。
与已有工作不同的是,现有 OPD 工作(包括 ExOPD)都把'教师的输出分布'直接当作学生模仿目标,差异只在于如何加权或外推这个分布;ExOPD 用 $\lambda>1$ 放大教师与基础模型的差异以推动学生'超越教师',但本质上仍是外推教师输出。本文的独特切入角度是:放弃模仿教师的完整分布,转而提取'教师因推理调优而改变的那部分'作为主奖励。直觉是——推理知识 $\approx$ 教师 $-$ 基础,因为基础模型已经具备下一段 token 预测能力,真正的新增价值来自推理调优带来的增量。这与知识蒸馏的传统范式形成本质区别:不再是 student→teacher 的分布匹配,而是用 teacher 自身的'学习轨迹'来指导 student。作者通过词云、token 级信号可视化、词级统计三组互补分析验证了该角度的有效性,并据此设计 centering 与联合条件两个工程组件。
核心方法
OPD2 的整体思路是:先用直觉构建新奖励,再用两个技术手段解决其工程问题,最后嵌入 RL 式训练框架。直觉上,作者把蒸馏信号从'student↔teacher'的距离改为'teacher_base→teacher'的学习增量。技术路线分三步:(1) 定义 delta 信号 $R^\Delta_t$ 作主奖励;(2) centering 操作从奖励中减去学生策略分布下的期望奖励,得零均值优势 $A^\Delta_t$(标准 OPD 中该偏置由 on-policy 训练自动消除,delta 需手动处理);(3) 联合条件:仅当 delta 优势 $A^\Delta_t$ 与原始 OPD 优势 $A^{OPD}_t$ 同号($A^\Delta_t A^{OPD}_t>0$)才施加梯度,否则置零,避免学生被过度训练偏离教师。实现基于 TRL 的 GRPOTrainer 改造,每题生成 1 条 completion,对三模型各做一次前向构造 token 级信号,学习率 $5\times10^{-6}$,温度 0.7,训练 100 步。
核心创新是用'delta 信号'替代标准 OPD 奖励作为蒸馏的主学习目标。本质区别在于:标准 OPD 奖励 $R^{OPD}_t = \log\pi^* - \log\pi_\theta$ 编码的是'学生与教师之间的距离',而 delta 信号 $R^\Delta_t = \log\pi^* - \log\pi^*_{base}$ 编码的是'教师推理调优前后的自我增量',完全不依赖学生模型 $\pi_\theta$。这一改变带来两个关键性质:(1) delta 信号天然剥离了教师的预训练风格噪声,只保留推理相关 token 的高信号——词云与统计显示它增强 hence/however/thus 等逻辑连接词,抑制 perhaps/see/try/verify 等模糊探索词;(2) 由于教师与基础模型同源(同一权重出发),推理调优后的教师对错误推理 token 更敏感,使 delta 在'信号方向与推理正确性'的相关性上比 OPD 更鲁棒。这与 ExOPD 仅放大教师-基础差异外推教师输出的做法本质不同:OPD2 不外推、只提取增量。
方法步骤详情
OPD2 完整训练步骤如下。输入:问题 $x$、学生 $\pi_\theta$、教师 $\pi^*$、教师基础模型 $\pi^*_{base}$。第1步,学生采样:由 $\pi_\theta$ 在温度 0.7 下生成一条回复 $y$,最大长度 8192。第2步,三模型前向打分:对每个 token $y_t$ 算三模型对数概率,得原始奖励 $R^{OPD}_t = \log\pi^* - \log\pi_\theta$ 与 delta 奖励 $R^\Delta_t = \log\pi^* - \log\pi^*_{base}$。第3步,centering:在 $\pi_\theta$ 的 top-1024 token 上算期望奖励,得零均值优势 $A^{OPD}_t$ 与 $A^\Delta_t$。第4步,联合条件构造 $A^{D2}_t$:若 $A^\Delta_t A^{OPD}_t>0$ 取 $A^\Delta_t$,否则为 0。第5步,按 $\sum_t A^{D2}_t \nabla\log\pi_\theta$ 用 AdamW 更新,训练 100 步,结果在最终步评测。
技术新颖性
技术新颖性体现在四点。第一,首次提出用'教师-基础模型差分'作为 OPD 主奖励而非辅助项,这与 ExOPD 用 $\lambda$ 外推教师输出在动机与数学上都不同——ExOPD 仍是 student→teacher 分布匹配,OPD2 则把 teacher 推理增量注入 student。第二,centering 操作显式处理 delta 信号偏置:标准 OPD 因 on-policy 训练自动消偏,但 delta 信号不含 $\pi_\theta$,必须手动减期望奖励,作者在 top-1024 token 上近似全词表期望以省显存,工程巧妙。第三,联合条件 $A^\Delta_t A^{OPD}_t>0$ 是简洁'安全阀',使 delta 仅在符号一致时生效,解决 delta 信号不含学生项而可能收敛到 one-hot 极值的稳定性隐患,且当 $\pi_\theta=\pi^*$ 时自动关闭梯度,提供自然收敛点。第四,作者用词云、token 级可视化、词级统计三组互补分析为'delta 为何有效'提供可解释证据,'先分析后设计'的方法论本身值得借鉴。
实验结果
实验跨数学(7基准)/科学(3)/代码(4)三大域,覆盖 Qwen3-1.7B/4B/8B 非思考与思考模式及 Gemma4。非思考数学:OPD2 把 1.7B 从 34.8 提到 54.6(+19.8),超 OPD(51.0)与 ExOPD(51.4)各 3.6/3.2 分;4B 从 45.8 提到 70.3、8B 从 46.9 提到 71.6,4B-OPD2 已超 8B-OPD/ExOPD,增益堪比扩容。思考数学(基线强):OPD2 仍把 1.7B/4B/8B 提到 62.7/74.8/75.9,而 OPD/ExOPD 普遍损害基线(4B 从 73.3 掉到 70.9/72.3);8B HMMT25 从 44.3 提到 52.3。代码与科学同样领先:非思考代码 1.7B 从 10.5 提到 29.4。Gemma4 跨架构:数学从 60.6 提到 67.8(超 ExOPD 2.5)。消融(Table 8)去掉 delta(数学 54.6→50.5)损失最大,证明 delta 是主因;曲线(Fig. 4)显示 OPD2 持续领先不退化。开销比 OPD 多 24-28%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Qwen3 非思考数学(7 基准平均) | pass@1 平均分 | Qwen3-1.7B 54.6, Qwen3-4B 70.3, Qwen3-8B 71.6 | 原始 34.8/45.8/46.9;OPD 51.0/64.0/65.9;ExOPD 51.4/66.4/67.8 | 1.7B 相对原始 +19.8,相对最强基线 ExOPD +3.2;4B-OPD2 已超越 8B-ExOPD,增益堪比模型扩容 |
| Qwen3 思考数学(7 基准平均) | pass@1 平均分 | Qwen3-1.7B 62.7, Qwen3-4B 74.8, Qwen3-8B 75.9 | 原始 59.2/73.3/73.7;OPD 57.1/70.9/72.2;ExOPD 58.4/72.3/73.6 | 在强基线上仍正向提升 +1.5~3.5 分,而 OPD/ExOPD 普遍损害基线;8B HMMT25 从 44.3→52.3 |
| Qwen3 非思考代码(4 基准平均) | pass@1 平均分 | Qwen3-1.7B 29.4, Qwen3-4B 40.1, Qwen3-8B 39.9 | 原始 10.5/22.1/25.1;OPD 21.0/31.4/35.0;ExOPD 24.6/37.2/38.1 | 1.7B 相对原始 +18.9,相对 ExOPD +4.8,代码域增益尤为显著 |
| Gemma4-E4B-it 数学(跨架构泛化) | pass@1 平均分(7 基准) | 67.8 | 原始 60.6;OPD 58.9;ExOPD 65.3 | AIME24 从 51.7→69.2,相对 ExOPD +2.5 平均,证明方法不局限于 Qwen3 家族 |
局限与改进
作者承认的局限:(1) OPD2 需要额外加载 teacher_base 模型做前向,带来 24-28% 的训练时间开销,虽与 ExOPD 相当,但在大规模训练时仍是显存与算力负担;(2) delta 信号不含学生项 $\pi_\theta$,理论上会收敛到 one-hot 极值,虽用联合条件缓解,但在强到弱蒸馏之外的设定下稳定性未经检验。我的补充观察:(3) 所有实验只跑了 100 步、每题仅 1 条 completion,作者自己指出延长训练会退化(Fig. 4),OPD2 的最优训练步数与超参敏感性未被充分刻画;(4) 跨域效果不均衡——Gemma4 代码域上所有方法(含 OPD2)都未超过原始模型(49.5 < 55.2),说明当学生已极强时 delta 蒸馏仍难正向增益,方法的适用边界需进一步厘清;(5) 仅在 Qwen3/Gemma4 两族验证,对参数量更大的教师-基础配对、或非同源 teacher_base 的可行性未探索;(6) 缺乏对 delta 信号在'教师推理调优混合多种能力'时能否干净分离出纯推理信号的更深入理论分析。
独立分析的弱点
弱点一:对 teacher_base 的强依赖。方法要求教师必须存在公开的对应基础模型(如 Qwen3-4B-Base、Gemma4-31B),对许多闭源教师或不发布 base 权重的模型族(如 GPT、Claude)无法直接应用。改进方向:用同一模型的早期检查点或低秩适配器近似 base,或用合成'去推理'数据微调一个伪 base。弱点二:训练预算极短(100 步、<30k 样本),作者虽强调这是 OPD 的典型短训练特性,但也意味着方法对超参(奖励缩放 0.1、centering 的 top-1024 近似)非常敏感,长训练稳定性未知。改进方向:系统刻画 500-2000 步的衰减规律,引入学习率重启或信号退火。弱点三:每题只采 1 条 completion,无法利用多次采样的方差信息,GRPO 式组归一化被禁用,削弱了对噪声信号的鲁棒性。改进方向:结合小样本组采样(如 4 条)与 delta 信号,兼顾信号质量与方差缩减。弱点四:Gemma4 代码域负迁移现象未解,说明 delta 可能损害某些已强能力。改进方向:引入按域/按 token 的自适应权重或能力门控。
未来方向
作者提出的延伸:(1) 优化 delta 奖励计算(Eq. 5)的实现以进一步降低 24-28% 的额外开销;(2) 探索 OPD2 与 top-k OPD(处理未采样 token)的结合,本文刻意未覆盖该变体。基于成果可延伸的方向:(3) 将 delta 信号推广到多阶段后训练——除了 base→reasoning,还可定义 stage-1 RL→stage-2 RL 的 delta,提取更精细的'阶段增量'知识;(4) 把 delta 思想用于偏好优化(DPO/RLHF)的奖励设计,用'奖励模型 - base'的差分去除奖励模型的风格偏置;(5) 研究多教师 delta 融合,即从多个教师-基础对中聚合稳定一致的推理信号;(6) 把 centering + 联合条件的安全阀机制迁移到其他 token 级 RL 任务(如工具调用、代码执行反馈),验证其作为通用'去发散正则'的有效性;(7) 理论上分析 delta 信号在 KL 散度框架下对应的目标函数与收敛性,为'增量蒸馏'建立形式化基础。
复现评估
复现性总体良好。代码承诺开源(github.com/naver-ai/opd2),基于 TRL 的 GRPOTrainer 改造,给出清晰训练参数(AdamW、lr $5\times10^{-6}$、cosine 衰减、warmup 0.1、梯度裁剪 1.0、奖励缩放 0.1、温度 0.7、max length 8192、100 步)。模型均开源(Qwen3 全系列、Gemma4)。数据(OpenMathReasoning/OpenScienceReasoning-2/OpenCodeReasoning)均公开,作者只用问题、丢弃自带推理轨迹,采样 1:1:1 共 100k。算力门槛较高:Qwen3-1.7B 需 1 个 H100 8-GPU 节点跑约 5.5 小时,更大模型需 4 节点(24+8 GPU)9-10 小时,full 蒸馏需 teacher+teacher_base+student+vLLM 共 4 模型同显存,对中小团队有压力。难度中等:核心算法(centering+联合条件)实现不复杂,但工程上需处理三模型前向显存与 vLLM 两种 rollout 切换。
论文图表
对比 OPD 与 OPD2 的信号来源。(a) OPD 中学生直接从教师获得反馈,奖励编码 student↔teacher 距离;(b) OPD2 引入教师基础模型(teacher base,推理调优前),先用 teacher 与 teacher base 做差得到 delta 信号 $\Delta$,再把它作为反馈注入学生。delta 捕获的是教师为获得推理能力所走的学习轨迹,而非其完整输出分布。
这是理解整篇论文动机的'一图胜千言':它直观说明了 OPD2 为何要引入第三个模型(teacher base),以及 delta 信号 $\log\pi^*-\log\pi^*_{base}$ 与标准 OPD 信号在语义上的根本区别。没有这张图,后续公式都缺乏直觉支撑。