← 返回 2026-08-03

面向在策略蒸馏的稳定优势融合 SAF-OPD: Stable Advantage Fusion for On-Policy Distillation

Yifan Ding, Xincheng Wei, Yoshua Y. Li, Ziheng Li, Yuquan Lu, Siyu Zhang, Dongsheng Ma, Rongxiang Weng, Xunliang Cai, Yun Chen 📅 2026-07-31 👍 34 2026-08-08 18:30
GRPO RLVR 强化学习 熵坍塌 知识蒸馏 策略优化

提出SAF四阶段流水线融合GRPO与OPD优势,避免熵坍塌并稳定提升性能。

前置知识

可验证奖励强化学习 RLVR 与 GRPO

RLVR指用规则型验证器(如数学答案校验、代码单元测试)对模型生成的完整响应打分的强化学习范式。GRPO(Group Relative Policy Optimization)是其代表算法:对一个提示采样一组G个响应,用验证器给每个响应一个标量奖励,再相对该组的均值和标准差做组内归一化,得到响应级优势 $A_i^{GRPO}$,然后把这个标量恒等地广播给该响应中的每个token。它的优点是奖励有界、被验证过,缺点是粒度粗糙——所有token承担相同责任。

本文的融合方法以GRPO作为RLVR的具体实例,所有对比实验的基线都围绕它构建,不懂GRPO就无法理解SAF要修正的那个'有界、组归一化'的标量优势。

在策略蒸馏 OPD 与 token 级优势

OPD(On-Policy Distillation)区别于在固定教师目标上做的离线蒸馏,它对学生策略自己生成的轨迹用教师模型 $\pi_T$ 重新打分。在下一token近似下,每个token的OPD优势定义为对数概率差 $A_{i,t}^{OPD} = \log \pi_T(y_{i,t}\mid s_{i,t}) - \log \pi_ heta(y_{i,t}\mid s_{i,t})$,当教师比学生更倾向该token时为正。它是token级、稠密、且每步在线重估的,但幅值不被组归一化约束,因此可能呈现重尾。

SAF的全部四阶段操作都只施加在 $A_{i,t}^{OPD}$ 上,本文的核心矛盾就是'有界标量优势'与'无界token级优势'之间的不对称,理解OPD优势的来源和性质是读懂方法的前提。

熵坍塌 entropy collapse

熵坍塌指训练过程中策略熵过早、过快地降到很低并长期保持低位的现象。策略熵反映模型输出的随机性/探索能力,熵坍塌意味着模型早早失去探索,往往伴随准确率过早见顶、响应变短、训练停滞。在RLVR文献中被广泛报告为阻碍最终性能的失败模式。本文发现对GRPO与OPD做定系数融合会诱发熵坍塌,这是提出SAF的直接动因。

避免熵坍塌是SAF设计的核心目标之一,也是评估其有效性的关键诊断指标(Figure 4a),理解这一概念才能把握本文要解决的核心问题。

反向KL散度与学生-教师对齐

反向KL散度 $D_{KL}(\pi_ heta \| \pi_T)$ 衡量学生策略相对教师分布的偏离。在OPD中,持续的全强度蒸馏会把它压低,使学生不断逼近教师。但教师本身并非完美,过度对齐会让学生拟合教师自身的错误并丧失自主探索空间。SAF正是用采样token估计的反向KL随训练下降的程度,来判定何时该结束预热并开始退火教师引导。

KL触发的预热早停(Stage 3)直接依赖在线反向KL的相对下降量 $(KL_0 - KL_s)/KL_0 \geq \delta$,理解KL散度才能理解SAF如何自适应地决定教师引导的强度与时长。

研究动机

RLVR(以GRPO为例)与OPD天然互补:前者奖励稀疏但被规则验证过、且组归一化后有界,后者奖励稠密、token级、但相对教师而定义。因此近期工作(如MiMo-V2-Flash、KDRL)尝试把两者以固定系数简单相加 $A_i^{GRPO} + A_{i,t}^{OPD}$。然而本文作者在Qwen3-4B数学推理上做初步研究发现,这种定系数融合会让策略熵从约0.35迅速掉到0.30并长期低迷,把学生-教师KL压到所有方案中最低,最终AIME-24/25准确率却最早见顶(约0.57/0.51),低于更受控的方案。诊断后发现这是两种并存且方向不同的失配:一是幅度失配——token级 $|A_{i,t}^{OPD}|$ 分布高度集中在零附近,但少量token幅值可比GRPO大一到两个数量级,文中实测180个最大OPD token全部超过同序列GRPO幅值,OPD极值达20.36而同序列GRPO最大仅2.47,导致少数token在名义1:1权重下数值性主导整个序列的梯度;二是时间失配——全程全强度OPD会持续把学生拉向教师,挤占GRPO探索、过早封顶性能。

本文的目标是本文的具体目标是:构建一个融合优势 $A_{i,t}^{total}$,使其同时满足两点硬性约束——(i) 限制任意单个token的 $A_{i,t}^{OPD}$ 绝对影响,防止它在数值上压过序列级 $A_i^{GRPO}$;(ii) 让OPD的整体强度能随训练自适应变化,而不是全程固定。在此基础上要求方案轻量、不引入额外模型或辅助损失、可作为现有GRPO+OPD训练循环的即插即用替换件。最终要在数学推理与代码生成、跨Qwen3-8B/4B/1.7B三种规模上,稳定超越定系数GRPO+OPD融合,并避免熵坍塌、保留探索能力、抬升性能上限。文中把目标量化为:在六个'模型×领域'设置中聚合分都优于定系数融合。

与已有工作不同的是,已有工作大多只触及问题的一面。第一类(G-OPD等)把OPD重新解释为KL约束RL,但没有与RLVR信号结合。第二类(KDRL、MiMo-V2-Flash)确实融合了OPD与RLVR,却停留在定系数相加,对失配视而不见——而这正是诱因。第三类(RLSD、SDAR等)虽然超越了定系数,但只用响应级的粗粒度统计去门控或调度整个OPD项,没有任何机制去约束单个token的OPD幅值相对 $A_i^{GRPO}$ 的大小,重尾token在粗门控后仍可主导更新。SAF的独特切入点是:识别出失配发生在两个不同轴(token级幅度 vs 训练时调度),因此为每个失配配一个'粒度匹配'的专门机制——token级控制器处理幅度、训练阶段控制器处理时间——而不是再去调一个全局系数。

核心方法

整体思路是'对症下药':既然定系数融合的失败来自幅度和时间两个独立轴上的失配,那就给每个轴一个专用控制器,且全部只作用于OPD分支,让GRPO优势保持原样。直觉上,先在'空间维度'上对 $A_{i,t}^{OPD}$ 做幅度控制(去掉低显著token、压住极端尖峰),再在'时间维度'上控制教师引导的强度曲线(先线性预热、再线性退火),最后把变换后的OPD项加回未动的GRPO项。技术路线由此形成四阶段可独立开关的流水线:Stage 1 序列内top-k%稀疏化、Stage 2 有界tanh压缩、Stage 3 KL触发的预热、Stage 4 剩余步上的线性退火。关闭全部四阶段即退化为定系数融合 $A_i^{GRPO}+A_{i,t}^{OPD}$,这保证了向后兼容。整套机制不增加模型、不加辅助损失、不需额外前向,只多算每序列一个分位数和在线KL估计,开销可忽略。默认超参为 $k=20$、$c=0.1$、$S_{warmup}=100$、$\delta=0.2$、$c_{min}=0$。

核心创新是把'失配'分解为幅度与时间两个正交维度,并为每个维度配一个粒度匹配的机制,从而彻底放弃'调一个全局系数'的思路。这与已有方法有本质区别:定系数法假设两个优势在每个token、每个训练步都'同量级可比',而SAF显式否定了该假设。粗粒度门控法(RLSD/SDAR)虽调度了OPD整体强度,却无法约束单个token幅值,重尾仍能穿透门控;SAF的Stage 1-2正是按token粒度逐个限制影响。G-OPD把OPD理论化为稠密KL约束RL,为两者求和提供了合理性,但同样未触及幅值控制。此外,SAF的退火窗口起点 $s_w$ 不是预先固定的步数,而是由在线KL相对下降量 $(KL_0-KL_s)/KL_0\geq\delta$ 触发决定,使强度曲线能自适应不同模型与任务,这是区别于固定调度表的关键。

方法步骤详情

SAF对OPD优势依次施加四阶段,GRPO优势原样保留。Stage 1稀疏化:对序列 $i$ 求 $\{|A_{i,t}^{OPD}|\}$ 的 $(1-k\%)$ 分位数 $\tau_k^{(i)}$,仅留幅值超阈值的token、其余置零,$k=100$ 关闭。Stage 2压缩:做有界变换 $c\tanh(\cdot)$,把尖峰压入 $(-c,c)$,近原点近似线性。Stage 3预热:乘随步线性上升因子 $scale(s)=\min(s/S_w,1)$,并在 $(KL_0-KL_s)/KL_0\geq\delta$ 时提前结束预热并冻结 $scale$,KL用学生响应采样token估计。Stage 4退火:对剩余预算 $R=S-s_w$ 线性递减 $opd\_coef(s)=c_{min}+(1-c_{min})(1-t_a/R)$,从1降到 $c_{min}$。最终融合 $A_{i,t}^{total}=A_i^{GRPO}+opd\_coef(s)\cdot scale(s)\cdot A_{i,t}^{OPD,\tanh}$,用于策略梯度更新 $\pi_\theta$。

技术新颖性

技术新颖性体现在三点。其一,首次把'定系数融合的不稳定'形式化为幅度失配与时间失配两个正交、且单一系数无法同时解决的形式,并用经验证据(Figure 3的重尾分布、180个极值token全部超GRPO幅值)支撑这一分解。其二,幅度控制采用'每序列分位数稀疏化+有界tanh压缩'的组合,前者随每序列自身分布自适应、后者保证数值有界,二者均按token粒度生效,粒度上严格匹配问题——这是粗粒度门控方法做不到的。其三,时间控制用在线反向KL相对下降量触发预热早停,再在'观察到的'预热终点之后才开始退火,退火窗口因此随模型/任务自适应,而非套用固定步数表。整体上SAF零额外模型、零辅助损失、零额外前向,只新增每序列一个分位数与一个在线KL统计量,工程上可作为GRPO+OPD循环的drop-in替换,可落地性强。

Overview of SAF. SAF modifies only the OPD branch through four stages before it is added to the unchanged GRPO advantage for the policy-gradient update.
Figure 2: Overview of SAF. SAF modifies only the OPD branch through four stages before it is added to the unchanged GRPO advantage for the policy-gradient update.
Empirical distribution of the absolute token-level OPD advantages, |A^OPD_{i,t}|, collected during the first 10 training steps of Qwen3-4B on mathematical reasoning tasks.
Figure 3: Empirical distribution of the absolute token-level OPD advantages, |A^OPD_{i,t}|, collected during the first 10 training steps of Qwen3-4B on mathematical reasoning tasks.

实验结果

主实验(Table 1)在七基准(数学AIME-24/25、HMMT25-Feb/Nov;代码HumanEval+/MBPP+/LiveCodeBench)跨Qwen3-8B/4B/1.7B,SAF在全部六个'模型×领域'聚合分上都超定系数GRPO+OPD:数学提升0.97%/1.51%/1.85%,代码1.67%/2.70%/0.51%;六设置平均SAF达49.46%,领先定系数融合、GRPO-only、OPD-only 1.54%/2.71%/1.60%。消融(Table 2,4B数学300步)显示仅加幅度控制≈定系数(44.35% vs 44.38%)、加预热不退火不足(44.07%)、开退火升至45.23%、完整SAF(δ=0.2)达45.89%、δ=0.3反降到44.51%,证明过度追教师有害。动态(Figure 4)显示定系数融合熵从0.35掉到0.30且KL最低,SAF熵维持0.35-0.38、critic约0.84(定系数0.77)、AIME-24/25约0.59/0.53优于定系数0.57/0.51。注意定系数KL最低却准确率最低、最早见顶,说明过度模仿适得其反。

Results on mathematical reasoning and code generation. All entries are accuracies (%). Within each model scale and column, the best result is bold and the second best is underlined.
Table 1: Results on mathematical reasoning and code generation. All entries are accuracies (%). Within each model scale and column, the best result is bold and the second best is underlined.
Representative SAF ablations on Qwen3-4B mathematical reasoning after 300 training steps.
Table 2: Representative SAF ablations on Qwen3-4B mathematical reasoning after 300 training steps.
Training dynamics of Qwen3-4B on mathematical reasoning tasks over 300 optimization steps: (a) actor entropy, (b) student-teacher KL divergence, (c) mean critic score, (d) mean response length, (e) AIME-24 accuracy, (f) AIME-25 accuracy.
Figure 4: Training dynamics of Qwen3-4B on mathematical reasoning tasks over 300 optimization steps: (a) actor entropy, (b) student-teacher KL divergence, (c) mean critic score, (d) mean response length, (e) AIME-24 accuracy, (f) AIME-25 accuracy.
查看结构化数据
任务指标本文基线提升
数学推理聚合(8B) AIME-24/25+HMMT25-Feb/Nov均值 46.93%(SAF) 45.96%(GRPO+OPD fixed) +0.97%
数学推理聚合(4B) 四基准均值 45.89%(SAF) 44.38%(GRPO+OPD fixed) +1.51%
数学推理聚合(1.7B) 四基准均值 26.49%(SAF) 24.64%(GRPO+OPD fixed) +1.85%
代码生成聚合(8B) HumanEval+/MBPP+/LiveCodeBench均值 63.41%(SAF) 61.74%(GRPO+OPD fixed) +1.67%
代码生成聚合(4B) 三基准均值 62.66%(SAF) 59.96%(GRPO+OPD fixed) +2.70%
代码生成聚合(1.7B) 三基准均值 51.39%(SAF) 50.88%(GRPO+OPD fixed) +0.51%
六模型×领域设置平均 聚合分均值 49.46%(SAF) 47.92%(GRPO+OPD fixed) +1.54%

局限与改进

作者明确把工作定位为初步研究,声明只在1.7B-8B范围、单一教师(Qwen3-30B-A3B-Instruct-2507)、特定超参下验证,未声称对未测教师、超参和更大规模的鲁棒性。SAF依赖在线反向KL估计来触发预热早停,但采样token估计本身有方差,论文在附录C给出估计方法却未系统分析估计噪声对触发判据稳定性的影响。代码生成上1.7B时OPD-only(51.77%)反而高于SAF(51.39%),说明在该设置下SAF的复杂控制器相对简单纯蒸馏并非占优,作者也承认'广但不均匀'。从我的观察看,提升幅度多为0.5-2.7个百分点、属温和提升,且只在聚合分上稳定占优,单基准上仍有落后(如8B MBPP+落后GRPO-only/OPD-only至多0.53%);幅度控制单独使用几乎无效(44.35% vs 44.38%)这一点也让'四阶段缺一不可'的叙事略打折扣,实际起决定作用的是退火。此外论文未报告训练成本/时间的具体数字,对算力可及性描述不足。

独立分析的弱点

第一,提升幅度温和且偏聚合:绝对增益多为0.51-2.70个百分点,单基准并不一致占优,说明SAF主要带来稳定性而非革命性突破;改进方向是探索更强的幅度控制(如自适应分位数或基于不确定度的token重加权)以放大增益。第二,幅度控制单独几乎无效(消融44.35%≈44.38%),真正起作用的是退火调度,意味着Stage 1-2在当前设置可能被Stage 3-4掩盖;改进方向是在更重尾的教师/更长的训练上验证幅度控制的独立价值,或将其与token级重要性采样结合。第三,KL触发的早停依赖在线KL估计的方差,作者未给出估计噪声对触发稳定性的分析;改进方向是引入减方差估计(如分层/重要性加权KL)或加平滑滤波,使触发判据更稳。第四,代码1.7B上OPD-only已占优,SAF的控制器在该处甚至略微拖累;改进方向是设计按规模/领域自适应的控制器开关,对极小模型退回到更简单的纯蒸馏。第五,仅在单一教师和有限规模上验证;改进方向是跨多教师(含更强/更弱教师)和更大规模(如70B+)验证外推性。

未来方向

作者自身方向:把SAF推广到未测试的教师、超参与1.7B-8B之外规模,验证鲁棒性;并强调融合稀疏验证奖励与稠密代理信号'不应退化为单一混合系数'这一更一般原则,暗示可迁移到其他RLVR+OPD之外的融合场景。基于成果可延伸:其一,SAF的四阶段开关化设计天然适合作为自动超参/控制器搜索的搜索空间,可用元学习或bandit在线选择每阶段开关与超参,实现按训练进程动态切换的'自适应SAF'。其二,KL触发的早停思想可推广为更丰富的在线'信任度'信号——除反向KL外,引入critic score、响应长度、验证准确率的联合指标来调度教师强度。其三,幅度控制的per-sequence分位数思想可与token级不确定性估计、process reward模型结合,做更精细的逐token信用分配。其四,作者把OPD视为稠密KL约束RL这一理论联系(G-OPD)可作为进一步理论分析SAF收敛性与稳定性的起点。

复现评估

复现评估中等偏上。论文给出关键超参默认值($k=20$、$c=0.1$、$S_{warmup}=100$、$\delta=0.2$、$c_{min}=0$)、训练数据(数学57K DeepMath难度≥6、代码25K Eurus-RL-Code)、模型初始化(学生Qwen3-8B/4B/1.7B、教师Qwen3-30B-A3B-Instruct-2507)、评估基准(AIME24/25、HMMT25 Feb/Nov、HumanEval+、MBPP+、LiveCodeBench v6)及验证工具(Math-Verify、基准自带单测),并明示实现基于开源框架verl。四阶段均有闭式公式,附录C给KL估计方法、附录D给代表性token级数值,工程上drop-in可插入现有GRPO+OPD循环。不足在于:未声明代码是否开源;训练步数预算、batch/group大小、采样设置、显卡数与总时长等算力细节未在正文给出(称在附录A),复现者需自行补全;完整复现七个基准(尤其8B学生+30B教师前向打分)需较大算力。总体方法层清晰可复现,完整实验成本较高。