← 返回 2026-08-18

学其所缺,不恋所精:面向多奖励策略优化的饱和度感知优势重加权 Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization

Yixuan Wang, Yifei Chen, Haichao Zhang, Haozheng Luo, Xander Wu, Jie Ni, Yun Fu, Nuno Vasconcelos, Yijiang Li 📅 2026-08-17 👍 148 2026-08-23 18:30
GRPO LLM推理 RLVR 多奖励策略优化 强化学习

按目标剩余提升空间动态重加权组相对优势,把RL优化力度转向未饱和目标

前置知识

GRPO(组相对策略优化)

RLVR 后训练的事实标准算法:对每个查询用旧策略采样一组 rollout(本文 G=8),用组内奖励的均值和标准差把每条 rollout 的奖励标准化为相对优势,从而省去 PPO 的学习型价值网络。本文完全保留 GRPO 的裁剪代理目标,只重写优势的计算方式。

SA-MRPO 是 GRPO 优势构造上的即插即用改进,γ=0 时严格退化为 GDPO、单目标时退化为 GRPO;不理解组相对优势就无法定位本文究竟改了什么。

奖励标量化与组内标准化

多目标 RL 的常规做法:先用固定权重把各奖励加权求和成标量 $r_{sum}$,再在组内做 $(r-\text{mean})/\text{std}$ 得到优势。标量化会造成奖励分辨率损失——等权下 $(1,0)$ 与 $(0,1)$ 得到相同标量分、相同优势。

这是论文指出的第一个问题;主要基线 GDPO 正是靠逐目标独立归一化解决它,SA-MRPO 在此之上进一步处理饱和度问题。

目标饱和度(saturation ratio)

衡量某目标已实现奖励占可达奖励区间的比例 $s^{(k)}=(\bar r^{(k)}-r_{min}^{(k)})/(r_{max}^{(k)}-r_{min}^{(k)})\in[0,1]$,由当前 batch 的平均奖励相对该奖励的上下界算出;$s$ 越接近 1 表示越接近奖励上限、剩余提升空间越小。

全文核心量:SA-MRPO 用 $(1-s^{(k)})^\gamma$ 对有效权重打折,越饱和的目标对聚合优势的贡献越小,这是方法的全部机制所在。

PPO/GRPO 裁剪代理目标

策略更新最大化 $\min(\rho A,\ \text{clip}(\rho,1-\epsilon,1+\epsilon)A)$,其中 $\rho$ 是新旧策略对该 token 的概率比,裁剪限制单步更新幅度、防止训练崩溃,GRPO 沿用此目标并可选 KL 惩罚项。

理解『只换优势、不改更新规则』这一方法定位,以及优势符号被反转为何等价于改变更新方向而不只是缩放步长。

RLVR(可验证奖励强化学习)

用程序可验证的信号(答案抽取比对、格式正则匹配、测试用例通过比例等)替代学习型奖励模型来训练 LLM 推理能力,奖励通常为 0/1 二值或具有明确已知的上下界。

饱和度定义依赖奖励上下界已知,这正是 RLVR 有界奖励的特性;论文数学与代码实验的所有奖励函数都由此构造。

研究动机

在 RLVR 后训练中,模型通常要同时优化多个目标:答案正确性、长度合规、格式、代码可执行性等。标准做法是把多奖励按固定权重加总成标量,再在每组 rollout 内做标准化,这带来两个具体问题。其一,标量化损失奖励分辨率:等权下奖励配置 $(1,0)$ 与 $(0,1)$ 得到相同标量、相同优势,模型无法区分『全对但格式错』与『全错但格式对』。其二,固定权重无视目标饱和度:格式与长度这类辅助目标在训练早期就迅速逼近上限(饱和),而正确率仍有巨大提升空间,但梯度预算仍按原比例持续投入已解决的目标。论文 Figure 1 给出实例:$G=4$ 的一组 rollout 中,第 2、3 条标量总分相同被 GRPO 赋零优势;GDPO 虽能区分二者,却因已饱和的格式目标仍占主导,给正确率为 0 的第 3 条更大的正优势。GDPO 只解决了第一个问题,饱和度失衡问题在奖励解耦之后依然存在。

本文的目标是本文目标是设计一种即插即用的多奖励优势构造:在保留每个目标独立组内归一化的同时,依据各目标当前饱和程度自适应调整其贡献,把优化力度从已接近上限的目标重新分配给剩余提升空间大的目标,同时完全不改动 GRPO 底层策略更新。具体希望做到三点:(1)用一个饱和指数 $\gamma$ 控制重加权强度,$\gamma=0$ 时严格退化为 GDPO,单目标设置退化为 GRPO,与已有方法兼容;(2)证明该重加权不只是缩放优势幅度,还可以反转聚合优势的符号、真正改变更新方向;(3)在数学推理(两/三目标)、自适应推理(显式饱和长度目标)和代码生成三类任务、多个模型规模上实证『提升难目标、保住易目标』的预期行为。

与已有工作不同的是,独特切入在于把『优化力度的分配』直接绑定到剩余可达奖励区间这一可观测标量。已有工作 GDPO 逐维归一化只解决分辨率损失;DVAO 依据奖励方差、GD2PO 依据优势一致性调整多奖励权重,但它们依据的都是奖励统计量或优化结构,而非每个目标还剩多少可实现的奖励范围;动态奖励加权、SAW 与 Focal Reward 虽承认目标进度不同,但 SAW 用奖励波动性度量信息量、Focal Reward 针对 rubric 型奖励估饱和。SA-MRPO 则针对有界可验证奖励,直接用 batch 级平均奖励在 $[r_{min}^{(k)},r_{max}^{(k)}]$ 中的位置定义饱和度 $s^{(k)}$,以 $(1-s)^{\gamma}$ 打折权重,并附带给出一阶冲突条件分析重加权何时会牺牲已饱和目标,坦承自身是自适应分配规则而非受约束的多目标保持方法。

核心方法

直觉:训练应该『学还没学会的,而不是继续打磨已经满分的』。技术上,SA-MRPO 保持 GRPO 框架不变,只重写优势。对每个目标 $k$ 先做组内标准化得到 $A^{(k)}_{i,j}=(r^{(k)}_{i,j}-\mu^{(i)}_k)/\sigma^{(i)}_k$;再用当前 batch 的平均奖励 $\bar r^{(k)}$ 相对可达区间 $[r_{min}^{(k)},r_{max}^{(k)}]$ 计算饱和度 $s^{(k)}\in[0,1]$;有效权重取 $\tilde w_k=w_k(1-s^{(k)})^\gamma$,目标越接近其奖励上限,权重打折越狠。聚合优势 $\tilde A_{i,j}=\sum_k \tilde w_k A^{(k)}_{i,j}$ 再做 batch 级标准化(式 1,减均值除标准差),代入标准 GRPO 裁剪代理目标。由于 $s^{(k)}$ 随训练演化会导致 $\tilde A$ 尺度漂移,这层 batch 归一化保证了优势尺度稳定。整个方法只改优势计算,用 verl+vLLM 实现仅需十几行代码。

核心创新是把多目标优化的『力度分配』显式建模为饱和度的函数。与 GDPO、DVAO、GD2PO 的本质区别:后者的相对权重由奖励统计量或优势一致性决定,SA-MRPO 的权重由每个目标的剩余奖励 headroom 决定——两目标有效权重比 $\tilde w_a/\tilde w_b=(w_a/w_b)\cdot[(1-s^{(a)})/(1-s^{(b)})]^\gamma$,当 $s^{(a)}>s^{(b)}$ 时该比值随 $\gamma$ 严格递减,任何 $\gamma>0$ 都使饱和目标的相对权重低于人为设定的值。另一个要点:重加权可以反转聚合优势的符号,即改变更新方向而非只缩放步长——Figure 1 中正确率为 0 的第 3 条 rollout 在 GDPO 下拿到正优势,在 SA-MRPO 下被翻为更负的优势。方法严格泛化 GDPO($\gamma=0$)与单目标 GRPO,同时保留原 GRPO 策略更新,与具体 RL 基础设施解耦。

方法步骤详情

按 Algorithm 1 执行一次策略更新:输入 $B$ 个查询、权重 $\{w_k\}$、奖励上下界与饱和指数 $\gamma$。(1)每个查询 $q_i$ 用旧策略采样 $G$ 条 rollout(实验 $G=8$);(2)计算各目标奖励 $r^{(k)}_{i,j}$,如正确性 0/1、长度合规、格式匹配、测试通过比例;(3)逐目标算 batch 平均奖励 $\bar r^{(k)}$,得饱和度 $s^{(k)}=(\bar r^{(k)}-r_{min}^{(k)})/(r_{max}^{(k)}-r_{min}^{(k)})$;(4)计算每目标的组内标准化优势 $A^{(k)}_{i,j}$;(5)按 $\tilde w_k=w_k(1-s^{(k)})^\gamma$ 加权求和得 $\tilde A_{i,j}$;(6)对整个 batch 的 $\tilde A$ 减均值、除标准差(式 1)得 $\bar A^{SA}_{i,j}$,稳定随训练漂移的优势尺度;(7)将其代入 GRPO 裁剪代理目标做梯度上升,KL 惩罚照常可选,输出更新后的参数 $\theta$。

技术新颖性

技术新颖性有四点。第一,饱和度定义直接、可观测:对有界可验证奖励,$s^{(k)}$ 由奖励函数声明的上下界精确计算,无需估计奖励上限或引入学习模块,这区别于 SAW 的方差代理和 Focal Reward 的 rubric 估计。第二,理论性质清晰:证明了两目标有效权重比随 $\gamma$ 单调变化;给出一阶冲突条件(式 2)——当其他目标的梯度内积项 $\sum_{k\ne a}\tilde w_k g_a^\top g_k<-\tilde w_a\|g_a\|^2$ 时目标 $a$ 会被牺牲,并区分『名义 headroom』与受策略类容量限制的『可优化 headroom』。第三,符号反转能力:区别于只调步长的方法,重加权能改变更新方向。第四,兼容性与可控性:单标量 $\gamma$ 即可在 GDPO 与更强分配之间连续插值,$\gamma=0/0.25/0.5/0.75/1.0$ 的消融证实分配随 $\gamma$ 系统性演化。

Comparison of GRPO, GDPO, and SA-MRPO on one group of G = 4 rollouts with a saturated format objective and an unsaturated correctness objective.
Figure 1: Comparison of GRPO, GDPO, and SA-MRPO on one group of G = 4 rollouts with a saturated format objective and an unsaturated correctness objective.

实验结果

四组实验。(1)数学推理:Qwen2.5-7B/3B-Instruct 于 DeepScaleR-Preview(约 4 万题)训练,15 组比较胜 12 组:7B 三目标 AIME24 11.5%→16.5%(+5.0pp)、MATH500 64.2%→67.7%、Minerva/Olympiad 小幅领先(AMC23 43.5% 略逊 44.6%);3B 两目标 AIME24 8.5% vs 5.0%;EXCEED 基本持平。(2)自适应推理:R1-Distill-Qwen-7B 配分级长度奖励(Bmin=1024),五基准全胜,平均 26.6% vs 22.8%(+3.8pp),AMC23 +9.2pp,平均长度 459 vs 333 token(均<1024)。(3)代码生成:Qwen2.5-7B 联合优化通过率与可执行性,Codeforces 12.9% vs 10.6%(+2.3pp)、CodeContests/APPS +1.4/+0.6pp,TACO -0.4pp,Bug 率相当。(4)γ 消融:所有正 γ 均优于 γ=0,γ=0.5 最佳(AIME24 9.0%),γ 增大时超长率上升(0.6%→1.1%)。

Comparison of GDPO and SA-MRPO on mathematical reasoning under two and three reward objectives.
Table 1: Comparison of GDPO and SA-MRPO on mathematical reasoning under two and three reward objectives.
Adaptive reasoning with an explicitly saturated length objective.
Table 2: Adaptive reasoning with an explicitly saturated length objective.
Effect of the saturation exponent γ on Qwen2.5-3B-Instruct under the two objective setting Rcorrect + Rlength.
Table 4: Effect of the saturation exponent γ on Qwen2.5-3B-Instruct under the two objective setting Rcorrect + Rlength.
Training reward trajectories under different values of the saturation exponent γ.
Figure 2: Training reward trajectories under different values of the saturation exponent γ.
查看结构化数据
任务指标本文基线提升
数学推理(Qwen2.5-7B-Instruct,三目标:正确率+长度+格式) AIME24 pass@1 准确率 16.5%(SA-MRPO) 11.5%(GDPO) +5.0 个百分点
数学推理(Qwen2.5-7B-Instruct,三目标) MATH500 准确率 67.7% 64.2% +3.5 个百分点
数学推理(Qwen2.5-3B-Instruct,两目标:正确率+长度) AIME24 准确率 8.5% 5.0% +3.5 个百分点
自适应推理(DeepSeek-R1-Distill-Qwen-7B,正确率+分级长度效率) 五基准平均准确率 26.6% 22.8% +3.8 个百分点(5 项全胜)
自适应推理 AMC23 准确率 37.5% 28.3% +9.2 个百分点
代码生成(Qwen2.5-7B-Instruct,通过率+可执行性) Codeforces 测试通过率 12.9% 10.6% +2.3 个百分点
代码生成 APPS / CodeContests / TACO 通过率 53.8% / 20.6% / 35.6% 53.2% / 19.2% / 36.0% +0.6 / +1.4 / -0.4 个百分点
γ 消融(Qwen2.5-3B,两目标,1 epoch) AIME24 准确率(最优 γ) 9.0%(γ=0.5) 5.0%(γ=0,等价 GDPO) +4.0 个百分点

局限与改进

作者承认两点:其一,方法不保证保持已优化目标——在一阶冲突条件(式 2)下,饱和目标的自我改进项被 $\tilde w_a=w_a(1-s^{(a)})^\gamma$ 削弱,若未饱和目标的梯度与之强冲突,其性能可能回退,故 SA-MRPO 是自适应分配规则而非受约束的多目标方法;其二,饱和度只度量名义奖励 headroom,不等于可优化 headroom,策略类容量不足时剩余奖励区间可能无法兑现。我补充观察:3B 两目标下 Olympiad 从 20.6% 降到 19.3%、代码任务 TACO 通过率降 0.4pp,说明再分配并非全赢;自适应推理平均长度从 333 涨至 459 token,虽低于 Bmin=1024,但长度效率目标实质让步;饱和度要求奖励上下界已知,对无界或学习型奖励模型不适用;$\gamma$ 是全局标量,所有目标共用同一折扣强度;实验只与 GDPO 对比,未跑 DVAO/GD2PO 基线,也未报告多种子方差。

独立分析的弱点

独立分析四点弱点。(1)边界依赖:$s^{(k)}$ 要求奖励上下界先验已知,若上界未知或随时间漂移(学习型 judge、开放式偏好奖励),饱和度会系统性失真;改进方向是在线估计可达上界(如奖励的滑动高分位数)替代声明式边界。(2)batch 级饱和估计噪声:batch=256 时 0/1 奖励的均值估计尚可,但小 batch 或极稀疏奖励(如 base 模型在 AIME24 上仅 0.6% 通过率)时 $s^{(k)}$ 抖动很大,权重会在训练早期剧烈震荡;可用训练全程的指数滑动平均平滑饱和度。(3)γ 全局统一:不同目标的合理折扣强度不同,且最优 γ(本文为 0.5)随任务与模型规模变化,逐任务调参成本高;可做成每目标独立的 γ 或随训练进度退火。(4)冲突无保护:已饱和目标缺乏显式约束,Olympiad(20.6%→19.3%)与 TACO(-0.4pp)的回退即为例证;可结合 PCGrad 类梯度手术,先投影消除冲突再按饱和权重聚合。

未来方向

作者层面:把方法扩展到奖励上界需要估计的场景;与基于方差(DVAO)、一致性(GD2PO)的多奖励机制正交组合;把饱和分配与受约束优化结合以显式保护已饱和目标。延伸方向:(1)自适应 γ——按目标或按训练阶段动态调整折扣强度,早期保探索、后期强聚焦;(2)把一阶冲突条件(式 2)变成在线监控指标,当 $\sum_{k\ne a}\tilde w_k g_a^\top g_k$ 逼近阈值时预警目标回退并自动回调 γ;(3)把饱和度推广到安全、偏好等主观对齐目标,定义软饱和度或用评委分数区间替代硬上下界;(4)容量感知饱和:用探针或低秩子空间估计『可优化 headroom』,修正名义区间与可实现改进的错配;(5)理论补全:在标准假设下证明 SA-MRPO 相对 GDPO 的改进下界,或刻画 γ 与梯度冲突范数之间的相变关系。

复现评估

复现条件较好。方法本身只是 GRPO 优势计算上的小改动(Algorithm 1 约 10 行核心逻辑),实现构建在开源 verl + vLLM 栈上;训练数据 DeepScaleR-Preview(约 4 万竞赛级数学题)与 Eurus-2-RL 均公开;基座 Qwen2.5-3B/7B-Instruct、DeepSeek-R1-Distill-Qwen-7B 皆为公开权重;评测集 AIME24/AMC23/MATH500/Minerva/OlympiadBench/APPS/CodeContests/Codeforces/TACO 全部公开,评测协议明确(temperature 0.6、top-p 0.95、每题 16 采样取平均 pass@1)。超参完整:G=8、全局 batch 256、3 epoch、最大响应 4096 token(代码任务 2048)。论文未提及代码发布;7B 级 RL 训练需多卡环境(8×A100 量级、按天计),γ=0 即 GDPO 基线可直接复用现有实现。总体复现难度中低,关键在于准确实现饱和度统计与 batch 归一化的位置。