β-OPSD:用策略优化推导目标、用自蒸馏训练的推理模型改进方法 β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation
把在线自蒸馏视为β=1的KL正则化策略优化特例,借logit插值与回报到当前信贷分配改进推理
前置知识
在线自蒸馏(On-Policy Self-Distillation, OPSD)
在线自蒸馏是一种改进推理语言模型的方法:学生模型在自己的当前策略下采样生成轨迹(on-policy),而教师则利用训练时才有的特权信息(如参考答案、验证过的推理轨迹或外部反馈)在每个 token 上给出密集的监督信号。学生通过最小化与教师 token 分布之间的反向 KL 散度来学习。与离线蒸馏相比,它能让教师针对学生实际生成的中间状态作出回应,从而缓解 exposure bias。
本文正是要重新审视 OPSD:作者证明标准 OPSD 不过是一个更大家族在 $\beta=1$ 处的特例,理解 OPSD 的标准做法及其痛点,是把握本文为何能把一个被当成“唯一目标”的教师匹配问题,转化为一个可调的、连续的策略优化问题的关键前提。
KL 正则化策略优化与 DPO 的最优策略闭式解
RLHF 与 KL 正则化强化学习的标准目标是 $\max_\theta \mathbb{E}_{y\sim\pi_\theta}[R(y)] - \beta D_{KL}(\pi_\theta\|\pi_{ref})$,其中 $\beta$ 控制学习策略被锚定到参考策略的强度。DPO 等工作指出,这类目标的最优策略可写成闭式形式,揭示奖励、参考策略与最优分布之间的直接联系。在本文中,奖励被特别选为教师与参考之间的对数比 $R(y;x,c)=\log\frac{p_T(y|x,c)}{\pi_{ref}(y|x)}$。
本文的全部理论贡献都建立在“KL 正则化目标有闭式最优策略”这一视角之上。只有理解这套机制,才能看懂作者如何把 $\beta$ 从隐式固定的 1 变成可控的超参,并推导出最优策略是参考策略与特权教师的几何插值这一关键结论。
特权教师(Privileged Teacher)
特权教师指在自蒸馏设定中与学生同架构、但额外条件于特权信息 $c$(例如数学题的参考答案、已验证的推理轨迹或外部反馈器)的模型分支。训练时教师能看到 $c$,而学生生成时只能看到问题 $x$。教师因此在学生生成的任意前缀上都能给出 token 级预测,从而提供密集监督。特权教师正是 OPSD 中被匹配的“唯一目标”。
本文的核心改造就是把“直接匹配特权教师”这一固定目标,替换为参考策略与特权教师之间的几何插值目标。理解教师为何是特权、它与参考学生的区别,是理解 $\beta$ 如何在“靠近参考”与“走向教师”之间权衡的基础。
回报到当前的信贷分配(Return-to-Go Credit Assignment)
借鉴 REINFORCE 等策略梯度方法,回报到当前把某个时刻 $t$ 的更新权重设为从该时刻起未来回报的折扣累加 $G_{t,\gamma}=\sum_{s=t}^{T}\gamma^{s-t}\rho_s$,而不是只用当前 token 的瞬时信号。在蒸馏语境下,$\rho_s$ 是 token 级的学生与目标对数比。这样早期的 token 会为它所引发的未来分布不匹配负责,从而把序列级目标的梯度正确地分摊到各个 token 上。
这是本文两个关键改动之一。作者论证标准 token 局部 KL 更新是“近视”的——它忽略了早期 token 改变后续前缀、进而影响未来目标不匹配的事实。只有掌握回报到当前,才能理解本文如何在不引入重型 RL 机制的前提下获得无偏的序列级梯度估计。
Logit 插值与几何插值的局部实现
序列级最优策略 $\pi_\beta^\star\propto \pi_{ref}^{1-1/\beta} p_T^{1/\beta}$ 是参考与教师的几何插值,但其归一化常数 $Z_\beta(x,c)$ 要遍历所有完整序列而不可计算。作者用每个解码前缀上的局部近似绕开它:由于概率相乘(几何)等价于 logit 相加(线性,差一个归一化),所以可在每个前缀把参考 logits 与教师 logits 按权重混合后再 softmax,即 $\tilde{p}_{\beta_k}=\text{softmax}[(1-1/\beta_k)z_{ref}+(1/\beta_k)z_T]$。
这是把“昂贵的 RL 推导”变回“廉价的蒸馏训练”的关键工程落点。理解 logit 插值如何以一次逐元素加权求和加一次 softmax 实现几何插值,是看懂算法高效性、以及为何能把不可计算的序列级常数完全规避的核心。
研究动机
在线自蒸馏(OPSD)是改进推理语言模型的一条有前景路线——学生用自己的策略采样轨迹,教师借助训练时才有的特权信息(参考解、已验证推理轨迹、外部反馈)在每个 token 上给监督。但它在实践中非常脆弱:让它可靠工作往往需要大量工程调参。作者指出其结构性根源在于:绝大多数 OPSD 方法从“直接模仿教师”出发,把教师 token 分布当作唯一优化目标,对学生应该多激进地离开当前/初始策略毫无显式控制;同时 token 局部的 KL 更新是“近视”的,只看当前 token 的瞬时不匹配,忽略了早期 token 会改变后续前缀、从而影响未来所有目标不匹配这一事实。这种“固定目标 + 近视更新”的组合,正是 OPSD 容易崩、收益不稳的内在原因。
本文的目标是本文的目标是为 OPSD 提供一个有原则、可控的推广,直接解决其脆弱性。具体而言:第一,揭示标准 OPSD 在一个更广的 KL 正则化策略优化族中对应的位置,把原本隐式固定为 1 的 $\beta$ 变成可调的正则化参数;第二,给出该族最优策略的闭式解,说明每个 $\beta$ 对应参考策略与特权教师之间的某个插值目标,从而可以用一条从参考到教师的平滑课程替代“一步跳到教师”;第三,把这条由策略优化推导出的目标,重新转化为高效的 token 级蒸馏,同时用回报到当前的信贷分配让更新忠实于序列级目标;最终在数学推理基准上稳定地、显著地超越 vanilla OPSD、SFT 与 GRPO。
与已有工作不同的是,本文的独特切入角度是把“选择稳定教师目标”与“沿轨迹做信贷分配”这两个过去被分开处理的问题,统一进同一个策略优化框架。已有工作要么停留在直接教师匹配,要么把插值、课程、引导采样当作经验技巧;而本文从 KL 正则化 RL 出发做严格推导,先证明 OPSD 恰是该族在 $\beta=1$ 的特例,再给出最优策略的几何插值闭式解,并把这个闭式解“翻译”成廉价可算的 token 级 logit 插值目标与回报到当前估计。于是插值不再是启发式技巧,而是某个参考正则化蒸馏目标的最优策略;这为平滑目标路径与未来感知的信贷分配提供了理论依据,是本文区别于已有 OPSD 文献的根本所在。
核心方法
整体思路是“用策略优化推导目标,用自蒸馏做训练”。设学生策略为 $\pi_\theta$、特权教师为 $p_T(y|x,c)$、参考策略为 $\pi_{ref}$(如初始学生或当前学生的 stop-gradient 拷贝)。作者从标准 KL 正则化 RL 目标 $\max_\theta \mathbb{E}_{y\sim\pi_\theta}[R] - \beta D_{KL}(\pi_\theta\|\pi_{ref})$ 出发,把奖励取为教师-参考对数比 $R(y;x,c)=\log\frac{p_T(y|x,c)}{\pi_{ref}(y|x)}$,得到族目标 $J_\beta(\theta)$。当 $\beta=1$ 时参考项在奖励与 KL 中相消,恰好退化为最小化到教师的反向 KL,即标准 OPSD。作者随后推导出该族的最优策略是参考与教师的几何插值,用 token 级 logit 混合近似这个不可计算的序列级常数,再对 $1/\beta$(教师权重)做线性调度,最后以回报到当前把序列级目标分摊到各 token。
核心创新有两点,都源于策略优化视角。其一,把教师从“唯一目标”降级为参考-教师路径上的一个端点:最优策略闭式解 $\pi_\beta^\star=\frac{1}{Z_\beta}\pi_{ref}^{1-1/\beta}p_T^{1/\beta}$ 表明 $\beta\geq 1$ 时教师权重 $1/\beta\in[0,1]$,每个 $\beta$ 选定路径上一个目标;$\beta=1$ 取教师端点,$\beta\to\infty$ 趋近参考。训练中调度 $w_k=1/\beta_k$ 形成平滑课程,避免一步硬投到教师。其二,把 token 局部 KL 梯度换成回报到当前 $G^\beta_{t,\gamma}=\sum_{s=t}^{T}\gamma^{s-t}\rho^\beta_s$,让早期 token 为其引发的未来分布不匹配负责,$\gamma=1$ 时给出序列级目标的精确无偏估计。与已有方法的本质区别:插值目标与回报到当前都不是经验技巧,而是同一 KL 正则化目标的最优策略与无偏梯度的直接产物。
方法步骤详情
完整算法(Algorithm 1)在 $K=200$ 步内迭代。① 取小批量 $(x,c)$,用当前学生 $\pi_\theta$ 在线采样 $y=(y_1,\dots,y_T)$(仅条件于 $x$)。② 按进度 $s_k=k/(K-1)$ 算教师权重 $w_k=w_{start}+(w_{end}-w_{start})s_k$,令 $\beta_k=1/w_k$(默认 $w_{start}{=}0.5,w_{end}{=}0.8,K{=}200,\gamma{=}0.99$)。③ 对学生做 stop-gradient 拷贝 $\bar\theta=\text{sg}(\theta)$,在每个前缀 $h_t=(x,y_{<t})$ 构造局部目标 $\tilde{p}_{\beta_k}=\text{softmax}[(1-w_k)z_{\bar\theta}(\cdot|h_t)+w_k z_T(\cdot|h_t,c)]$。④ 算 token 不匹配 $\rho^\beta_t(y)=\log\pi_\theta(y_t|x,y_{<t})-\log\tilde{p}_{\beta_k}(y_t|x,y_{<t},c)$。⑤ 算折扣回报到当前 $G^\beta_{t,\gamma}(y)=\sum_{s=t}^{T}\gamma^{s-t}\rho^\beta_s(y)$。⑥ 最小化 $\mathcal{L}=\frac{1}{T}\sum_t\text{sg}(G^\beta_{t,\gamma}(y))\log\pi_\theta(y_t|x,y_{<t})$,仅学生概率出梯度,插值 logits 与回报权重都 detach。实验用 NVIDIA RTX A6000 或 H200、配 LoRA。
技术新颖性
技术新颖性体现在理论与实现的多重统一。理论层面,首次把标准序列级 OPSD 严格刻画为某个 KL 正则化 RL 目标在 $\beta=1$ 的特例(Proposition 2.1,$\beta=1$ 时参考项相消、恰剩到教师的反向 KL),并给出该族最优策略的闭式几何插值解(Proposition 2.2),把 $\beta$ 从隐式固定值提升为可调正则化系数。实现层面,用局部 logit 插值绕开不可计算的序列级归一化常数 $Z_\beta(x,c)$,把昂贵的 RL 推导“翻译”成一次逐元素加权求和加 softmax 的廉价蒸馏目标,保留了 OPSD 的计算结构。算法层面,回报到当前信贷分配(Proposition,$\gamma=1$ 给序列级 KL 的精确无偏梯度)把过去“近视”的 token 局部更新修正为未来感知。与已有 OPSD 工作相比,插值不再是启发式技巧而是最优策略的落地,这与 DPO 用闭式解重写偏好优化有异曲同工之妙。
实验结果
主实验在 Qwen3-1.7B/4B/8B 的 100 步检查点评估 avg@12(AIME 2024/2025、HMMT 2025)。最显著的是 Qwen3-1.7B:相对 vanilla OPSD,$\beta$-OPSD 在 AIME 2024 从 44.17 升到 53.33(+9.16)、AIME 2025 35.56→40.83(+5.27)、HMMT 2025 13.33→16.11(+2.78),平均 +5.74。规模放大后增益收窄但仍领先:4B 平均 57.87(+1.76)、8B 平均 60.18(+1.66);个别单项(4B AIME 2024 为 73.89 vs 75.00)略低,整体平均最优。$\beta$-OPSD 一致超过 SFT(1.7B 上 SFT 平均仅 26.30)并强于 GRPO。消融隔离两大贡献:固定回报到当前时插值目标比直接教师高 6.03/5.30/1.67(Table 2);固定插值目标时回报到当前比 token 局部梯度高 1.12/5.55/3.61(Table 3)。另:动态学生+固定教师端点全面最优(Figure 2),0.5→0.8 调度最佳(Table 4)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 数学推理(AIME 2024 / AIME 2025 / HMMT 2025,Qwen3-1.7B) | avg@12(%,100 步检查点) | 53.33 / 40.83 / 16.11,平均 36.76 | vanilla OPSD 44.17 / 35.56 / 13.33,平均 31.02 | 平均 +5.74 个百分点;AIME 2024 单项 +9.16 |
| 数学推理(Qwen3-4B,三基准平均) | avg@12(%) | 73.89 / 69.17 / 30.56,平均 57.87 | vanilla OPSD 平均 56.11 | 平均 +1.76 个百分点 |
| 数学推理(Qwen3-8B,三基准平均) | avg@12(%) | 78.33 / 70.28 / 31.94,平均 60.18 | vanilla OPSD 平均 58.52 | 平均 +1.66 个百分点 |
| 蒸馏目标消融(Qwen3-1.7B,固定回报到当前) | avg@12(%) | β-OPSD 插值目标 53.33 / 40.83 / 16.11 | 直接教师目标 47.30 / 35.53 / 14.44 | AIME 2024/2025/HMMT 分别 +6.03 / +5.30 / +1.67 |
| 信贷分配消融(Qwen3-1.7B,固定插值目标 w=0.5) | avg@12(%) | 回报到当前 50.56 / 38.33 / 16.67 | token 局部梯度 49.44 / 32.78 / 13.06 | 分别 +1.12 / +5.55 / +3.61 |
局限与改进
作者明确指出若干局限:调度仅研究了线性方案,是否存在最优调度、以及它如何依赖模型规模、训练预算与任务分布仍是开放问题;非线性、分段或性能自适应调度可能更优但未被探索;方法只在数学推理基准上验证,迁移到代码、科学问答等其它推理任务尚未检验;回报到当前估计的方差控制依赖折扣 $\gamma$,长生成下的方差仍待降低。此外从读者视角还可观察:其一,大模型(4B/8B)上的增益明显收窄(平均仅 +1.76/+1.66),且个别单项反而低于 vanilla OPSD,提示当学生-教师分布差距变小时插值收益递减;其二,所有结果均以 LoRA、100 步检查点报出,未给出完整微调、更长训练或最终检查点下的曲线,最佳性能点与稳定性边界不清楚;其三,教师需在每个学生前缀上条件于特权信息做前向,双路前向与在线采样带来显著开销,论文未充分报告训练成本/吞吐。
独立分析的弱点
第一,超参敏感性与规模饱和:增益高度集中在小模型(1.7B 上 +5.74),大模型几乎抹平,且单项波动,说明当前线性调度与固定端点不足以稳定吃下大模型的潜力——可改进方向是自适应/基于性能反馈的调度、或按层、按 token 动态调度 $\beta$。第二,回报到当前的方差与折扣依赖:长生成下 $\gamma<1$ 的折扣虽稳但引入偏差,$\gamma=1$ 无偏但方差大——可引入基线/优势函数(如 GAE 风格)或更低方差的序列级估计器。第三,特权教师的可用性与成本:方法依赖一个条件于参考解/验证反馈的特权教师分支,并要求其在学生生成前缀上可靠,这在无标准答案的开放任务上难以满足——可结合过程奖励模型或自洽投票构造“软特权”。第四,评估范围窄:仅数学竞赛推理、仅 avg@12 单一指标、仅 100 步检查点——应补充 pass@1、鲁棒性、跨域迁移与完整训练曲线。第五,理论中的序列级常数 $Z_\beta(x,c)$ 被局部近似绕开,但局部近似的误差与收敛性缺少严格分析,可补理论保证。
未来方向
作者提出的方向包括:探索自适应或理论最优的插值调度;设计更低方差的回报到当前估计器;把方法推广到数学推理之外的领域。基于成果可进一步延伸:其一,把插值视角与过程奖励/可验证奖励结合,把“特权教师”替换为验证器,扩展到代码、科学问答等可验证任务;其二,研究 $\beta$ 的“课程最优性”——是否可用元学习或-bandit 自动搜调度端点与形状;其三,把几何插值与 DPO/GRPO 统一,看能否推出一个涵盖偏好优化、结果奖励 RL 与蒸馏的统一 $\beta$-族;其四,从信息几何角度分析局部 logit 插值对序列级最优的逼近误差,给出可信的训练步长与调度界;其五,把回报到当前与 n-best 重排序、MCTS 式搜索结合,让信贷分配与解码时搜索互补。
复现评估
复现评估中等偏上。论文提供了完整算法(Algorithm 1)、关键公式与默认超参($w_{start}=0.5,w_{end}=0.8,K=200,\gamma=0.99$,线性调度),并在附录给出记号表、证明与训练/生成/评估细节,骨干模型为开源 Qwen3-1.7B/4B/8B,数据用 OpenThoughts 数学子集,基准 AIME 2024/2025、HMMT 2025 公开可得,硬件为 NVIDIA RTX A6000 或 H200 配 LoRA。这些都是正面的复现信号。但论文未提供代码或检查点仓库链接,也未报告训练时长、吞吐与显存占用;特权教师分支的构建(如何条件化于参考解、用何种前向)描述较粗,自行实现需补足工程细节。整体而言,有充足信息供有经验者复现核心结论,但完全对齐仍需一定工程量,且算力门槛对中小团队偏高。
论文图表