← 返回 2026-08-03

CriPO:基于策略自蒸馏增强评分准则强化学习的方法 Enhancing Rubric-based RL via Self-Distillation

Mingxuan Xia, Yuhang Yang, Chao Ye, Shuai Zhu, Shenzhi Yang, Guangcheng Zhu, Yuhang Zhang, Cheng Peng, Haobo Wang, Siqing Wang 📅 2026-07-21 👍 25 2026-08-08 18:30
RLVR/GRPO 大语言模型后训练 强化学习 策略自蒸馏 评分式奖励

CriPO用策略内自蒸馏注入缺失行为、翻转被压制的优势,约2×更少步数超越GRPO

前置知识

GRPO(Group Relative Policy Optimization)

GRPO 是 RLVR 的代表算法。给定提示 $x$,策略 $\pi_\theta$ 采样一组(group)rollout $\{y_i\}_{i=1}^G$,用一个奖励函数为每条 rollout 打分得到标量奖励 $R_i$,再在组内做归一化得到组相对优势 $A_i=(R_i-\mu_R)/(\sigma_R+\epsilon)$,最后用 PPO 风格的截断目标 $\min(\rho_{i,t}A_i,\mathrm{clip}(\rho_{i,t},1-\epsilon_{\mathrm{clip}},1+\epsilon_{\mathrm{clip}})A_i)$ 更新策略。它不额外维护价值网络,靠组内相对比较提供梯度方向。

本文以 GRPO 为优化主干,所有失效模式分析(未探索/被压制评分项)都是相对于 GRPO 的标量奖励广播与组内采样机制定义的,理解 GRPO 才能理解 CriPO 在修正什么。

评分式强化学习(Rubric-based RL)

Rubric-based RL 把开放式任务(医疗问诊、长文写作)的输出质量分解为一组可解释的评分准则 $C=\{(c_j,\omega_j)\}$,每条准则带一个权重 $\omega_j$。用 LLM-as-a-Judge 为每条 rollout 在每条准则上打分 $r_{ij}$,再加权聚合成标量奖励 $R_i=\sum_j\omega_j r_{ij}/\sum_j\omega_j$ 供 GRPO 优化。它把不可验证的开放式任务接入了 RLVR 框架。

Rubric-based RL 是论文的整个问题域,作者要修复的正是这种“多准则聚合为标量”的奖励设计所固有的失效模式;不熟悉 rubric 奖励就无法理解未探索准则与被压制准则为何产生。

策略内自蒸馏(On-Policy Self-Distillation, OPSD)

OPSD 用“同一个策略在不同条件下的两个分布”做教师-学生。学生分布仅看原始上下文 $\pi_\theta(\cdot|x,y_{<t})$,自教师分布额外看到特权信息 $\xi$,即 $\pi_\theta(\cdot|x,\xi,y_{<t})$。对模型自己采样的 on-policy rollout 逐 token 比较这两个分布(如反向 KL $D_{KL}(\pi_\theta(\cdot|x,y_{<t})\|\mathrm{sg}(\pi_\theta(\cdot|x,\xi,y_{<t})))$,对教师做 stop-gradient)。因为是同模型、同分布 rollout,所以没有训练-推理的分布鸿沟。

CriPO 的两大模块(行为注入、优势翻转)都建立在 OPSD 之上——把评分准则当作特权信息 $\xi$,用自教师定位/注入行为。理解 OPSD 是理解 CriPO 为何“无训练-推理失配”的关键。

前向 KL 与反向 KL 散度

前向 KL $D_{KL}(p_T\|p_S)$ 把教师 $p_T$ 当第一项、学生 $p_S$ 当第二项,它具有“覆盖(mass-covering)”性质,学生被推向覆盖教师所有高概率模式、鼓励探索;反向 KL $D_{KL}(p_S\|p_T)$ 则是“聚焦(mass-seeking)”,学生倾向集中在教师最强的单一模式、容易模式坍缩。在自蒸馏中,教师分布做 stop-gradient。

行为注入模块刻意选择前向 KL(而非 OPSD 默认的反向 KL),正是因为未探索准则需要鼓励探索、覆盖缺失的模式;区分两者才能理解作者的设计取舍。

曝光偏差/训练-推理失配(Exposure Bias)

当训练时 rollout 在“特权信息”前缀引导下生成、而推理时模型只能从自己的前缀自回归生成时,两者分布不一致,称为曝光偏差。在长序列自回归解码中,早期的细小偏差会逐 token 累积放大。这正是 HeRL/RuscaRL 这类“用 rubric 引导生成 rollout”方法的通病。

CriPO 的核心卖点之一就是用 on-policy 自蒸馏规避这种训练-推理失配;理解曝光偏差才能理解为何 CriPO 比那些“引导式探索”方法更干净。

研究动机

Rubric-based RL 把开放式任务(医疗问诊、长文写作)的输出质量分解成可解释评分准则,用 LLM 裁判打分后聚合成标量奖励喂给 GRPO。但作者指出它有两类被忽视的失效。其一是未探索准则(Unexplored Criteria, $C_u$):GRPO 只在采样到的一组 rollout 上优化,若整组无人满足某条准则,它得不到任何梯度。其二是被压制准则(Suppressed Criteria, $C_s$):标量奖励被均匀广播到整条响应,某条 rollout 虽满足若干准则但整体优势为负或为零(Eq.4 的负优势与零优势压制),于是有用的准则相关 token 反被惩罚。作者在 RaR-Medicine 上训练 Qwen3-4B 统计:超 83% 样本含未探索准则(平均 2.5 条/样本),超 57% 含被压制准则(平均 1.8 条/样本),且贯穿训练持续存在。现有改进如 RuscaRL、HeRL 用 rubric 作外部引导生成 rollout 缓解探索不足,却引入训练-推理失配(曝光偏差),长响应中误差累积,且完全无视被压制准则。

本文的目标是本文要在不引入任何训练-推理分布失配的前提下,用纯 on-policy 的方式同时解决未探索准则与被压制准则这两类失效,并保留 GRPO 作为稳定、奖励对齐的优化主干(因为初步实验表明直接把 OPSD 当主算法会让奖励崩溃)。具体目标有三:对未探索准则,把缺失的准则相关行为注入策略而无需生成离策略引导 rollout;对被压制准则,恢复并保留那些本该被标量聚合惩罚掉的有用 token;在 Qwen3-1.7B/4B 上的医疗与科学基准上,取得比 GRPO 和 rubric 引导类基线(HeRL)更强、且收敛更快(步数更少)的结果。

与已有工作不同的是,作者的独特切入是把 rubric 准则当作 OPSD 的“特权信息” $\xi$:用同一个策略在自己采样出的 on-policy rollout 上构建特权条件的自教师,提供 token 级监督,从而既获得准则级信号又没有 HeRL/RuscaRL 那种引导式 rollout 的分布鸿沟。与 Chen、Lan、Xu 等只笼统说“标量聚合会遮蔽准则贡献”却未系统刻画失效、也只处理被压制准则的工作不同,CriPO 给出了被压制准则的精确定义(Eq.4,区分负优势压制与零优势压制)与统计画像,并用两个截然不同的自教师分别针对两类失效:准则注入教师治未探索、反事实教师治被压制。关键洞见是这些缺失/有用行为本就存在于模型自身分布中,OPSD 只是去“定位”它们,再决定是蒸馏还是改写优势。

核心方法

CriPO 保留 GRPO 作为优化主干,外加一个面向两类失效的 OPSD 修正层。流程是:对每个提示采样 $G$ 条 rollout,用 Qwen3-32B 裁判在准则集 $C=\{(c_j,\omega_j)\}$ 上打分,按 Eq.1 聚合为标量奖励 $R_i$,算组相对优势 $A_i=(R_i-\mu_R)/(\sigma_R+\epsilon)$,再识别未探索集 $C_u$(Eq.3)与被压制集 $C_s$(Eq.4)。随后两条独立支路各司其职:行为注入用准则注入自教师在最高优势 rollout 上算前向 KL 的 OPSD 损失;优势翻转用反事实自教师定位负优势 rollout 中的准则相关 token,把这些 token 的优势翻为正值后送回 GRPO。最终目标 $\mathcal{L}_{\mathrm{CriPO}}=\mathcal{L}_{\mathrm{GRPO}}+\beta\mathcal{L}_{\mathrm{OPSD}}$(Eq.11)。全程 on-policy,教师就是同一模型在不同条件下的两个分布,不存在外部引导 rollout。

核心创新是把 OPSD 从“全局蒸馏目标”降格为“针对两类具体失效的诊断-定位工具”,并为每类失效设计专属自教师。对未探索准则,构建“准则注入教师”——给它提示要求以最小改动把缺失准则加进最高优势 rollout,并在贡献度最高的一小撮 token 上算前向 KL;刻意选前向 KL 是因为它鼓励模式覆盖/探索,正好对应“完全缺失的行为”。对被压制准则,构建“反事实教师”——给它提示要求把已经满足的准则“删掉或弱化”,于是学生与教师在分布上差异最大的那些 token,恰恰是承载该准则内容的位置(定位见 Eq.8 的 $\Delta_{i,t}>0$ 且 $p^T(y_{i,t})<\alpha\max_v p^T(v)$);把这些 token 的优势从负值翻为 $\tau_{\mathrm{flip}}=0.1$ 的正值(Eq.9),在 GRPO 损失内部就地反转梯度方向。这与 HeRL(离策略引导 rollout→失配,且无视压制)和原始 OPSD(不稳定、噪声大)本质不同。

方法步骤详情

按算法 1,每步:(1) 从提示 $x$ 采 $G$ 条 rollout,用 Qwen3-32B 裁判在准则集 $C$ 上打分 $r_{ij}$,聚合成标量奖励 $R_i$ 并算组优势 $A_i$,识别未探索集 $C_u$(Eq.3)与被压制集 $C_s$(Eq.4),初始化 token 级优势 $\tilde A_{i,t}=A_i$、$L_{\text{OPSD}}=0$。(2) 行为注入:若 $C_u$ 非空,取最高优势 rollout $y^*$,构建准则注入教师(同模型额外看 $C_u$),算逐 token 前向 KL,用 TopCum 仅保留累计贡献达 $\gamma=0.95$ 的 token(实测 34.6% token 即贡献 95% KL)求 $L_{\text{OPSD}}$。(3) 优势翻转:若 $C_s$ 非空,对每条负优势 rollout 构建反事实教师(同模型额外看其满足的 $C_i^s$),选出 $\Delta_{i,t}>0$ 且教师更偏好别的 token 的位置($\alpha=0.1$)作为 $T_i^s$,把其优势翻为 $\tau=0.1$。(4) 用修正后 $\tilde A_{i,t}$ 算 GRPO 损失,总目标 $L_{\text{CriPO}}=L_{\text{GRPO}}+\beta L_{\text{OPSD}}$ 更新 $\theta$,两教师前向均 stop-gradient。

技术新颖性

技术新颖性有五点。其一,首次系统定义并量化了“被压制准则” $C_s$(Eq.4,区分负优势压制与零优势压制),并用 57%/1.8 的统计证明它普遍且持续,而非罕见边角。其二,双教师设计:准则注入教师“补”未探索、反事实教师“删”已满足准则来反推 token 归因——这种对比式定位是新的。其三,贡献度引导的 token 过滤(TopCum,$\gamma=0.95$),并实证仅 34.6% token 承载 95% 的 KL,避免致不稳的稠密 OPSD。其四,对行为注入只取最高优势 rollout,让教师只做最小编辑,信号更干净。其五,GRPO+局部 OPSD 的混合结构既保住 GRPO 稳定性,又只用 OPSD 做定向修正——解释了为何原始 OPSD 单独训练会崩(Figure 2 的熵坍缩/教师泄漏)。相对 HeRL/RuscaRL 它纯 on-policy 无失配,相对通用 OPSD 它是局部且准则专用的。

CriPO 框架总览
Figure 3: CriPO 框架总览
按前向 KL 排序的 token 累计贡献
Figure 4: 按前向 KL 排序的 token 累计贡献
被压制准则的 token 选择案例
Figure 8: 被压制准则的 token 选择案例

实验结果

主结果见表 1(GPT-4o-mini 裁判,训练 200 步)。Qwen3-1.7B 上 CriPO 平均分由 GRPO 的 59.2 提到 62.4(+3.2,优于 HeRL 60.4),单基准最大增益在 HealthBench(60.2→65.6,+5.4)与 ResearchQA(56.5→64.7,+8.2);Qwen3-4B 平均 68.2→69.6(+1.4),HealthBench 63.9→70.9(+7.0)。OPSD 单独作主算法灾难性失败(1.7B -18.9、4B -20.1),坐实须保留 GRPO 主干。效率上 CriPO 约第 175 步即达 GRPO 最佳性能,约省 2.0× 步数,wall-clock 上虽单步更贵却在 GRPO 跑完前反超。消融(表 2):去 token 过滤使 CriPO-U 平均 66.4→65.5,去最佳 rollout 选择降到 65.6;把 CriPO-S 定位换随机使平均 68.9→64.9(大幅退化),证明收益来自准确定位而非盲目加优势。Figure 7 显示 CriPO 同时压低 UC/SC,且 CriPO-U 专攻 UC、CriPO-S 专攻 SC,与设计相符。

医疗与科学基准主结果(%)
Table 1: 医疗与科学基准主结果(%)
CriPO 关键设计消融
Table 2: CriPO 关键设计消融
CriPO 的计算效率
Figure 5: CriPO 的计算效率
CriPO 训练动态(奖励/熵/响应长度)
Figure 6: CriPO 训练动态(奖励/熵/响应长度)
各方法的未探索/被压制准则统计
Figure 7: 各方法的未探索/被压制准则统计
查看结构化数据
任务指标本文基线提升
RaR-Medicine(医疗问诊,域内) GPT-4o-mini 评分 % CriPO 在 Qwen3-4B 上 62.1 GRPO 60.2 +1.9
HealthBench(医疗,跨域) GPT-4o-mini 评分 % Qwen3-4B CriPO 70.9 / Qwen3-1.7B CriPO 65.6 Qwen3-4B GRPO 69.8 / Qwen3-1.7B GRPO 60.2 +1.1 / +5.4
LLMEval-Med(医疗,跨域) GPT-4o-mini 评分 % Qwen3-4B CriPO 69.9 Qwen3-4B GRPO 67.8 +2.1
RaR-Science(科学问答,域内) GPT-4o-mini 评分 % Qwen3-4B CriPO 75.0(与 CriPO-U 并列) GRPO 74.4 +0.6
ResearchQA(科学,跨域) GPT-4o-mini 评分 % Qwen3-4B CriPO 70.1 GRPO 68.7 +1.4
五基准平均(Qwen3-1.7B) GPT-4o-mini 平均 % CriPO 62.4 GRPO 59.2 / HeRL 60.4 +3.2 / +2.0

局限与改进

作者承认的局限:CriPO 相比基模虽压低了被压制准则的发生率,但其绝对计数反而上升(归因于探索增强后遇到更多“被压”案例),属移动靶。我的额外观察:(1) 评测面窄,仅医疗与科学问答、两个 Qwen3 尺寸(1.7B/4B),未触及创意写作、代码评审、多轮对话等更广开放式任务,泛化性未证;(2) 高度依赖强裁判(训练用 Qwen3-32B rubric、评测用 GPT-4o-mini),裁判噪声与成本未被分析,裁判偏弱或偏倚会直接污染准则注入教师与反事实教师;(3) Qwen3-4B 的平均增益偏小(+1.4),暗示大尺度收益递减,且单干预变体 CriPO-S 在 HealthBench 上(72.7)甚至高于完整 CriPO(70.9),提示两条支路存在相互干扰;(4) 行为注入仅用前向 KL,Figure 2 的不稳分析比较了 JSD/RKL/FKL 但最终目标只取 FKL,其余组合未探;(5) 正文未给 $\beta$(OPSD 权重)、$\alpha$、$\tau_{\mathrm{flip}}$ 的敏感性分析。

独立分析的弱点

独立分析弱点与改进方向:(1) 单步算力开销明显——完整 wall-clock 比纯 GRPO 长约 40%(如 1.7B RaR-Medicine 7h42m→11h02m)。改进:缓存自教师前向、或仅当失效密度 $|C_u|/|C_s|$ 超阈值才触发 OPSD 的自适应门控。(2) token 定位依赖单条反事实提示,属启发式且裁判敏感,教师一旦改错位置就会误标。改进:对多版反事实改写做集成投票,或训练一个轻量准则归因头替代提示式教师。(3) 被压制准则计数随训练上升,说明 CriPO 在追移动靶。改进:引入显式的压制正则或课程调度。(4) $\tau_{\mathrm{flip}}=0.1$、$\gamma=0.95$、$\alpha=0.1$ 全程固定。改进:让翻转幅度按准则权重 $\omega_j$ 或压制程度缩放,$\gamma$ 按训练进度退火。(5) 失效定义(Eq.4)默认准则分二值 $r_{ij}\in\{0,1\}$,而真实 rubric 常为连续分,定义未必平滑迁移。改进:推广到分级软分数下的软优势修正。

未来方向

作者展望:希望启发社区联合研究 rubric-based RL 中的“探索不足”与“奖励歧义”。可延伸方向:(1) 把准则注入/反事实双教师思路迁移到 rubric 之外的 OPSD+RLVR 混合,如工具调用、多轮智能体等带验证反馈的开放式任务;(2) 被压制准则形式化(Eq.4)很通用,可移植到可验证 RL 中带部分分的场景(数学证明步骤、代码测试用例),从失败轨迹里救回个别正确的子步骤;(3) 研究 $\beta$ 的自适应调度与按权重的优势翻转;(4) 与“更好的 rubric 构造/奖励聚合”这条互补路线(Chen、Lan、Xu)叠加;(5) 把尺度推到 4B 以上及多轮对话域;(6) 系统分析裁判强弱如何影响 CriPO 退化曲线。

复现评估

复现难度中等偏上。论文未明确发布代码(OPSD 实现跟随公开的 SDPO 仓库 github.com/lasgroup/SDPO)。超参交代较全:$\gamma=0.95$、$\alpha=0.1$、$\tau_{\mathrm{flip}}=0.1$,GRPO 基于 verl 代码库,报告 200 训练步,基模 Qwen3-1.7B/4B,训练裁判 Qwen3-32B,评测裁判 GPT-4o-mini。数据集 RaR-Medicine/RaR-Science(Gunjal 等 2025)及 HealthBench、LLMEval-Med、ResearchQA 均公开;两个自教师的提示模板在 §3.1、§3.2 逐字给出。主要障碍:每步需用 Qwen3-32B 对 $G$ 条 rollout × $M$ 条准则大量打分,外加两路自教师前向,显存与 API 成本高;TopCum(Eq.6)与优势翻转(Eq.8-9)需对 GRPO trainer 做定制修改,verl 分布式训练栈本身不简单;算力预算论文未给但隐含多卡。对有 GPU 预算的 RL 熟练团队,忠实复现可行。