← 返回 2026-07-20

超越熵:基于对比策略优化的正确性感知优势塑形 Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization

Weiwen Xu, Jia Liu, Hou Pong Chan, Long Li, Deng Cai, Min Chen, Hao Zhang 📅 2026-07-16 👍 12 2026-07-25 18:30
GRPO RLVR 优势塑形 大模型推理 对比学习 强化学习 知识蒸馏

用参考答案引导的对比概率差作为token级正确性信号来塑形RLVR优势

前置知识

RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习)

在数学、编程等存在客观正确答案的领域,用一个可验证的二值奖励 $R(x,y)\in\{-1,1\}$ 训练大模型推理能力的方法范式。代表方法是 GRPO,它对每个问题采样多个回答,在同一组内对奖励做归一化来估计优势,省去了独立的 critic 模型。奖励只有对错之分,是轨迹级别(trajectory-level)的稀疏信号。

本文的所有改进都建立在 RLVR/GRPO 的框架之上,理解它的二值稀疏奖励和组内归一化优势,才能明白 token 级别正确性信号为何能补足它的不足。

优势塑形(Advantage Shaping)

策略梯度中,优势 $A_{i,t}$ 衡量某个动作相对平均水平的好坏。优势塑形指在原始轨迹级优势基础上,叠加额外的 token 级信号(如熵、对比分歧)来精细调整每个 token 的更新方向和强度,公式形如 $\tilde{A}_{i,t}=A_{i,t}+\alpha\cdot\delta_{i,t}$。它决定了哪些 token 被强化、哪些被抑制。

CPO 的核心贡献就是一种新的优势塑形方式,用对比分歧 $\delta_{i,t}$ 替代熵。不懂优势塑形就无法理解 CPO 在优化目标里到底改了什么。

熵正则化与熵干预(Entropy-Intervened RL)

训练中策略熵 $H(\pi)$ 反映输出分布的不确定性。熵干预方法把熵引入 RLVR:有的只优化高熵 token(Entropy-Tokens),有的把熵项直接加到优势上(Entropy-Adv),有的用负熵当奖励(EM-RL-token)。它们旨在鼓励探索、防止熵坍缩到零,但熵无法区分‘有用的探索’和‘有害的困惑’。

CPO 正是要证明熵作为正确性信号存在根本缺陷,本文把它作为主要对比基线(5 种熵方法)。理解熵方法的逻辑与矛盾,才能理解 CPO 的动机。

On-Policy Distillation(OPD,在线策略蒸馏)

学生模型在自己生成的输出上,通过最小化与教师分布的反向 KL 散度 $\mathrm{KL}(\pi_{\theta}\|\pi_{teacher})$ 来学习。教师可以是更强的外部模型,也可以是受参考答案/批评引导的自身。本文证明 OPD 的 reverse KL 是 CPO 对比分歧的一个特例(当 $\pi_{post}$ 取教师分布时)。

本文的一个理论亮点是统一了 RLVR 和 OPD:把多种教师形式(外部教师、参考引导、critic 引导)都理解为‘更知情分布 $\pi_{post}$’的不同实例。这是理解 CPO 理论框架的关键。

研究动机

当前 RLVR(以 GRPO 为代表)存在两个根本局限:第一,它的二值正确性奖励 $R\in\{-1,1\}$ 忽略了推理轨迹中各 token 的不同贡献,无法做细粒度信用分配;第二,当一组采样回答奖励全相同时(零优势组,zero-advantage group),梯度为零,浪费大量训练数据。为此,近期工作引入熵作为优势塑形信号(如 Entropy-Tokens 只优化前 20% 高熵 token、Entropy-Adv、EM-RL-token、RL-ZVP、IB-reg),试图鼓励探索。但熵本质上只度量不确定性,对推理质量一无所知——模型在‘积极探索多种解法’和‘被错误路径搞糊涂’时都会出现高熵。这导致现有方法设计选择自相矛盾:RL-ZVP 奖励正确回答中的高熵 token,而 IB-reg 却偏好低熵 token。熵无法把有价值的探索和有害的错误区分开。

本文的目标是本文的目标是寻找一个比熵更可靠、与正确性对齐(correctness-aligned)的 token 级信号,用它来做 RLVR 的优势塑形。具体而言,作者希望构造一个能直接反映 token 级别正确性的量,既能区分‘该 token 是否倾向于通向正确答案’,又能与轨迹级奖励自然互补;并希望它能在统一框架下同时解决 token 级信用分配和零优势组浪费数据这两大问题,最终在复杂推理任务(如 AIME)和域外泛化上都取得显著提升,且不依赖更强的外部教师模型。

与已有工作不同的是,本文的独特切入角度是一个类比直觉:学生对照参考答案批改作业时,错误步骤会立刻显现;类似地,当 LLM 被给予参考答案作为条件时,其 token 生成概率会发生特异性移动——与参考一致的 token 概率上升,与之矛盾的 token 概率下降。作者捕捉这种‘对比概率变化’作为正确性信号,而非用与质量无关的熵。这一思路把‘正确性源于自我审视与参考引导审视的对比’形式化为 token 级对比分歧,并进一步从贝叶斯视角证明它是理想正确性后验对数比的估计,从而把 RLVR 和在线策略蒸馏统一到同一个正确性驱动的目标下——这是已有熵方法完全没有的理论视角。

核心方法

CPO 的思路是‘先直觉、再理论、后落地’。直觉上,给模型参考答案后重新生成,token 概率的变化就暴露了哪个 token 走偏。技术上,作者定义理想正确性后验 $\tilde\pi_{post}(y_t|x,y_{<t},C)=\pi(y_t|x,y_{<t})\,g(x,y_{<t},y_t)/Z$,其中 $g$ 是该 token 通向正确解的概率、$Z$ 是前缀处平均正确性。由贝叶斯公式其对数比 $\log(\tilde\pi_{post}/\pi)=\log g-\log Z$ 单调递增于 $g$,故正确 token 对应正对数比、错误 token 对应负对数比。实践中用参考引导提示得到的 $\pi_{post}(\cdot|x,y^\star,y_{<t})$ 近似该理想分布,对比分歧 $\delta_{i,t}=\log[\pi_{post}(y_{i,t}|x,y_i^\star,y_{i,<t})/\pi(y_{i,t}|x,y_{i,<t})]$ 即为该对数比的估计。CPO 把它与轨迹级优势结合做塑形,并保留 GRPO 的 PPO 裁剪目标,实验在 MATH 的 7.5k 题上训练。

核心创新点在于提出‘对比分歧(contrastive disagreement)’作为 token 级正确性信号,与已有熵方法的本质区别是:熵度量的是‘这个位置有多不确定’,而对比分歧度量的是‘给定参考答案后,这个 token 的概率被推高还是压低’,后者直接编码了正确性。作者进一步证明它不仅可靠(负分歧对应 Accuracy@16 从 57% 降到约 48%),而且为在线策略蒸馏(OPD)提供了理论基础——OPD 的 reverse KL 是当 $\pi_{post}$ 取外部教师时的特例,于是 RLVR 和 OPD 被统一为‘选择更知情分布 $\pi_{post}$’的同一框架。同时,CPO 通过对零优势组也注入 $\alpha\cdot\delta$ 的梯度,直接化解了 GRPO 浪费零优势数据的问题。

方法步骤详情

CPO 完整步骤:(1)策略模型以先验概率 $\pi_{\theta_{old}}(y_t|x,y_{0$ 时 $\tilde{A}_{i,t}=A_{i,t}+\max(\alpha^+\delta_{i,t},-A_{i,t}/2)$,$A_{i,t}<0$ 对称,零优势时直接用 $\alpha\delta$,保证塑形方向不与轨迹级优势冲突;(6)代入标准 GRPO 目标,用 $\tilde{A}_{i,t}$ 替换原优势做 PPO 裁剪更新。

技术新颖性

技术新颖性体现在四点:第一,首次把‘参考引导 vs 原始生成’的概率对比定义为可证明正确的 token 级正确性信号,并给出贝叶斯理论保证(对数比单调于 $g$);第二,裁剪机制 $\max(\alpha^+\delta,-\frac{1}{2}A)$ 巧妙约束分歧幅度,防止其压倒或反转轨迹级优势方向,消融显示去掉裁剪在 AIME2024/2025 上明显退化;第三,把零优势组从‘无梯度’变成‘有信息梯度’,激活了原本浪费的大规模语料;第四,统一理论把外部教师、参考引导自教师、critic 引导等多种 OPD 变体都归为 $\pi_{post}$ 的不同实例,使 RLVR 与 OPD 共享同一正确性驱动目标。这种‘自对比、免强教师’的设计也更具实用价值。

The illustration of CPO. Prior and reference-guided posterior likelihoods are contrasted to shape token-level advantages.
Figure 3: The illustration of CPO. Prior and reference-guided posterior likelihoods are contrasted to shape token-level advantages.

实验结果

核心发现分几方面。主实验:Qwen2.5-Math-7B 上 CPO 平均 70.2,比 GRPO 的 62.5 高 7.7 个点,也优于 DAPO(63.8)、IB-reg(63.9);Qwen3-Base-4B 上平均 77.0,比 GRPO(68.5) 高 8.5 个点。最具挑战的 AIME2025 上,7B 模型从 30.0 提升到 43.3,4B 模型从 40.0 提升到 53.3,验证细粒度监督对长链推理尤其有效。域外泛化上其它基线普遍退化(如 GRPO 在 4B 的 GPQA 从原模型 76.8 掉到 56.7),而 CPO 在 GPQA(78.3)、MMLU-PRO(82.6) 反超原模型。理论验证(Figure 2)显示负分歧使 Accuracy@16 从 57% 降到约 48%,正分歧维持基线,证实对比分歧与正确性强相关。训练动态(Figure 5)显示 GRPO 把熵压向 0、探索受限,CPO 维持高熵平台、回答更长,Pass@K 在 K=1~16 全线提升。消融(Table 3)证明 token 级塑形优于轨迹级平均、裁剪不可或缺、单轮参考提示最优。

Qwen2.5-Math-7B experiments with PASS@16 on math and out-domain tasks.
Table 1: Qwen2.5-Math-7B experiments with PASS@16 on math and out-domain tasks.
Qwen3-Base-4B experiments with PASS@16 on math and out-domain tasks.
Table 2: Qwen3-Base-4B experiments with PASS@16 on math and out-domain tasks.
Ablation study of CPO.
Table 3: Ablation study of CPO.
Comparison of different posterior designs (πpost) under a unified CPO framework.
Figure 4: Comparison of different posterior designs (πpost) under a unified CPO framework.
Training dynamics of Qwen2.5-Math-7B under CPO and GRPO.
Figure 5: Training dynamics of Qwen2.5-Math-7B under CPO and GRPO.
Word clouds of 100 tokens with top absolute disagreement (CPO) and entropy.
Figure 7: Word clouds of 100 tokens with top absolute disagreement (CPO) and entropy.
查看结构化数据
任务指标本文基线提升
Qwen2.5-Math-7B 七任务平均 (Pass@16) 平均准确率 70.2 GRPO 62.5 +7.7 个百分点,且优于 DAPO(63.8)、IB-reg(63.9)
Qwen3-Base-4B 七任务平均 (Pass@16) 平均准确率 77.0 GRPO 68.5 +8.5 个百分点
AIME2025 (Qwen2.5-Math-7B) Pass@16 43.3 GRPO 30.0 +13.3 个百分点,长链推理增益最大
AIME2025 (Qwen3-Base-4B) Pass@16 53.3 GRPO 40.0 +13.3 个百分点
域外 GPQA (Qwen3-Base-4B) Pass@16 78.3 GRPO 56.7 / 原模型 76.8 保住甚至超过原模型,泛化不退化
零优势问题专用实验 (Appendix F.2) 平均准确率 CPO RL-ZVP +3.2%,证明对比分歧优于熵

局限与改进

作者承认的局限包括:受算力约束,多数主结果基于单次运行(仅 CPO/GRPO/DAPO 报告了 3 次独立运行的均值±标准差),统计稳健性证据仍有限;后验分布 $\pi_{post}$ 依赖参考答案,意味着方法天然适用于有标准答案的可验证任务(数学、编程),对开放式、无参考答案的生成任务适用性存疑。我自己的观察:第一,参考引导提示需要额外的前向传播(每条样本多一次完整前向),训练开销相比 GRPO 增加,论文未给出明确的训练时间和显存对比;第二,对比分歧依赖模型自身能‘理解’参考答案并产生合理概率移动,若模型能力太弱(参考答案也看不懂),信号质量可能退化,存在 backbone 能力下限;第三,所有实验均在 Qwen 系列 4B/7B 上完成,缺乏更大模型(如 32B/72B 学生)的验证,扩展性尚未充分检验。

独立分析的弱点

独立分析的弱点与改进方向有三:第一,计算开销——参考引导分支需要对每条采样回答额外做一次前向,在大规模 RL(大 batch、多采样)下翻倍前向成本明显,改进方向是用缓存、低秩近似或稀疏只对高分歧 token 计算来降低开销;第二,提示工程敏感——消融显示不同参考引导提示(单轮 vs 2-turn gold-shot vs 1-shot)结果差异较大(如 2-turn 1-shot 在 GPQA 仅 60.0 而默认 68.8),说明性能依赖人工提示设计,改进方向是自动搜索或学习提示、或直接用 logit 级别的参考注入(teacher forcing 概率)替代文本提示;第三,任务范围受限——强依赖参考答案使其难以迁移到对话、创意写作等无标准答案的 RL 场景,改进方向是探索用 critic 模型、工具调用结果或人类偏好作为 $\pi_{post}$ 的条件,作者已在理论上为这类扩展留了接口(critic-guided、contextual signals)。

未来方向

作者明确提出的方向:把 CPO 推广到编程等其它可验证领域,并进一步研究不同 $\pi_{post}$ 实例(外部教师、参考引导、critic 引导)的组合。基于本文成果可延伸的方向包括:第一,scaling up——在更大模型和更长上下文上验证对比分歧是否依然可靠,尤其测试 CPO 在 32B/72B 学生模型上的收益曲线;第二,将对比分歧信号用于推理时的早停/自我纠错(在生成中检测强负分歧并即时重写),把训练时信号延伸到推理阶段;第三,与过程奖励模型(PRM)、树搜索结合,用对比分歧替代昂贵的步级人工标注来获得步骤级监督;第四,理论侧可深化对比分歧与信息瓶颈、互信息估计的关联,给出更紧的方差/样本复杂度界。

复现评估

复现评估:论文未提及是否开源代码或权重,附录 D 提供了完整的先验与参考引导提示模板,附录 E 给出了全部超参数(基于 GRPO 实现,$\epsilon$ 裁剪、组大小 G、学习率等),数据集为公开的 MATH(7.5k 题)及标准 benchmark(MATH500、AIME2024/2025、AMC23、GPQA、MMLU-Pro、KnowLogic),评测用温度 0.6、top-p 0.95、Pass@16,这些都有利于复现。主要难度在算力:训练 7B 模型做 RL 需要多卡且每个 token 多一次前向,对个人或小团队门槛较高;此外对比分歧的具体实现细节(如两个前向如何共享 KV cache)未充分说明,可能导致复现性能波动。整体属于‘理论清晰、配置详细、但算力门槛高’的中等偏难复现级别。