← 返回 2026-07-30

CoRT:面向令牌级评分引导策略优化的反事实回放信用分配方法 CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

Bo-Wen Zhang, Junwei He, Wen Wang, Song-Lin Lv, Wentao Ma, Rongyi Lin, Shuhan Zhong, Lan-Zhe Guo 📅 2026-07-28 👍 82 2026-08-04 18:30
GRPO 信用分配 反事实推理 大语言模型后训练 强化学习 指令跟随

用反事实回放为GRPO分配令牌级信用,无需训练评分器即可提升指令跟随RL效果

前置知识

GRPO(Group Relative Policy Optimization,组相对策略优化)

DeepSeek 提出的 RL 算法,去掉了 PPO 中的价值网络(value model)。它对同一个 prompt 采样一组(group)回复,用组内奖励的均值 $\mu$ 和标准差 $\sigma$ 对每个奖励做归一化得到优势 $A_i = (r_i - \mu)/(\sigma + \epsilon)$,再用 PPO 式的 clipped surrogate 更新策略。优势是简单、可扩展,但所有生成的 token 共享同一个回复级优势。

CoRT 的全部改动都建立在 GRPO 的优势计算之上——它不改变 $A_i$ 的定义,只是把这个回复级优势重新分配到不同 token 上,所以必须先理解 GRPO 把哪些量当作可改动的接口。

令牌级信用分配(Token-level Credit Assignment)

在 RL 中,奖励往往只在轨迹末端给出(稀疏奖励),而更新是在 token 粒度上做的。信用分配要回答:一个最终得分里,每个 token 贡献了多少?过程奖励模型(PRM)给中间步骤打分、Agent RL 用隐式步奖励、本文方法则把回复级优势按 token 重要性加权——都是让稀疏信号变稠密的不同路线。

本文的核心问题就是「GRPO 的信用分配太粗」:一整条回复无论哪个 token 满足或违反了评分标准,都吃同一个 $A_i$。理解信用分配的粒度差异,才能理解 CoRT 想填的空。

评分标准奖励(Rubric-based Reward)

区别于单一偏好标签,rubric 把回复质量分解成可检查的显式标准,例如「正确性、格式、长度、安全」或「恰好三个 Markdown 项目符号、以 P.S. 开头的附言」。约束满足率 CSR 把奖励定义为满足标准占比 $r_{CSR} = \frac{1}{M}\sum_j z_j$,全有或全无 AON 则只在全部满足时给 1。这种结构化监督是本文的工作场景。

CoRT 的切入点正是「rubric 在标准层是结构化的,但进到 GRPO 后被压成标量、再均匀广播到所有 token」这一信息损失。理解 rubric 的结构,才能理解被浪费的监督信号。

反事实干预与上下文归因(Counterfactual Intervention / Context Attribution)

因果推断里的思想:固定其他一切,只改变一个原因变量,看结果变化多少,以此衡量该变量的因果作用。在 LLM 上体现为 ContextCite、上下文消融等方法——删掉/替换输入的某一段,看输出概率如何变化。本文把它从「事后解释」搬到了「训练时塑造梯度」。

CoRT 的核心操作就是反事实回放:固定生成的回复、把 rubric 标准从 prompt 里删掉再重算每个 token 的对数概率,对比两次概率得到 $\Delta_{i,t}$。不懂反事实干预,就抓不住本文最关键的那个信号从哪来。

PPO 的 clipped surrogate 目标

策略比率 $\rho_{i,t}(\theta) = \pi_\theta(y_{i,t}|x^+,y_{i,<t})/\pi_{\theta_{old}}(y_{i,t}|x^+,y_{i,<t})$,损失 $\mathcal{L} = -\mathbb{E}[\min(\rho A, \text{clip}(\rho, 1-\epsilon, 1+\epsilon)A)]$。clip 范围限制每步更新幅度,防止策略崩溃。CoRT 直接复用这个目标形式,只把里面的优势从均匀的 $A_i$ 换成加权的 $\tilde{A}_{i,t}$。

CoRT 不改 clip、不改采样、不改奖励接口,只在 surrogate 内部替换优势项,所以理解 PPO/GRPO 的损失结构是看懂「最小改动」这一设计哲学的前提。

研究动机

在基于评分标准(rubric)的强化学习里,本来存在一个结构化的监督来源:rubric 把回复质量拆成可检查的显式标准,例如「恰好三个 Markdown 项目符号、以 P.S. 开头的附言、整段用双引号包裹」这类格式约束,以及正确性、安全性等语义约束。然而在 GRPO 式训练流水线中,这些结构化判断被压扁成两步:先由验证器给标量奖励 $r_i$,再聚合成单一组相对优势 $A_i=(r_i-\mu)/(\sigma+\epsilon)$,最后把这个 $A_i$ 均匀广播到该回复每个生成 token。结果:满足「三个项目符号」的关键 token(数字 three、星号 *)和无关填充词拿到完全一样的梯度强度。这条流水线在标准层结构化、token 层均匀,把 rubric 本可提供的「哪段 token 对应哪条标准」归因信息丢光,造成监督浪费。这在开放域指令跟随场景尤其明显——这类任务没有唯一可验证答案,反而堆叠大量表面格式与行为约束,均匀分配让真正承载约束的 token 和噪声 token 一视同仁。

本文的目标是本文的目标是让评分标准层的结构化监督真正传递到 token 层策略更新,同时不引入额外的训练阶段或额外组件。具体地,作者希望在不改变验证器、不改奖励接口、不改组相对归一化的前提下,把同一个回复级 GRPO 优势 $A_i$ 在 token 间重新分配,让那些对 rubric 标准依赖更强的 token 拿到更大份额的正/负更新。量化目标是:在指令跟随基准(IFEval、IFBench、MultiDimIF、AdvancedIF)上、跨多种奖励粒度(CSR、AON)和多个模型规模(4B/7B/14B),稳定地超过同等设置下的纯 GRPO,并力争追平或超过需要额外训练判别器的 RTT 方法——且这一切要靠「只多一次前向打分」实现。

与已有工作不同的是,已有工作要么停留在改进响应级反馈的归一化与采样(DAPO、GSPO、GDPO),要么走「训练一个 token 级相关性判别器」的路子(RTT,需要专门的数据生成流水线产出 token 级标签)。作者抓住一个被忽视的点:策略模型自己就「知道」哪些 token 依赖 rubric,不需要外挂一个判别器。只要固定住采样到的回复、把 rubric 标准从 prompt 里删掉再做一次反事实回放,看哪些 token 的对数概率掉得多,就能免费得到一个策略内部的 token 敏感性信号。这个信号既不是重标注的轨迹,也不是新数据,而是把上下文归因(ContextCite 那类事后解释方法)直接搬进训练 loop 当梯度塑造器——这是本文独到的切入角度。

核心方法

打个比方:判一条菜谱好坏,与其只给整道菜一个总分,不如问「如果把菜谱里的调味要求撕掉,厨师原本写的每个步骤还有几个站得住脚?」那些因要求存在才被写出的步骤,对数概率会大幅下降;通用填充词几乎不动。CoRT 就是把这道反事实问句自动化:对每个采样回复,先在带 rubric 的完整 prompt $x^+=(x,c)$ 下算每个 token 对数概率 $\ell^+_{i,t}$(本就来自正常 rollout),再在去掉标准的 $x^-=x$ 下对同一串 token 做反事实回放打分得 $\ell^-_{i,t}$,做差得对比量 $\Delta_{i,t}=\ell^+_{i,t}-\ell^-_{i,t}$ 作为「该 token 多依赖 rubric」的代理。技术路线:把对比量经 sigmoid 压到有界区间,乘 SmoothStep 调度系数做渐进激活,再在响应内归一化使均值 token 权重为 1,最后乘到原始 GRPO 优势上得 token 级优势 $\tilde A_{i,t}=\text{sg}(w_{i,t})A_i$,喂进标准 clipped surrogate。

核心创新是用策略内部的反事实对数概率对比,去替代「训练一个 token 级相关性判别器」这条更重的路线。最本质的区别在于:RTT 这类工作把 token 重要性当成需要额外监督、额外学习的东西,因此要搭一套数据生成流水线;而 CoRT 把 token 重要性当成「策略模型在被追问时自己就暴露」的东西——你只需要一次反事实回放去探测它。这件事能成立,是因为生成的 token 序列被固定了,于是 $\Delta_{i,t}$ 隔离出的就是「在去掉标准这个上下文变量时,策略对同一轨迹的似然变化」,而非重新生成的轨迹。这意味着信号来源是免费的、无需外部标注的,而且天然与当前策略同分布。这种从「学一个 token scorer」到「直接读策略自己的敏感性」的范式转变,是全文最该记住的点。

方法步骤详情

按 Algorithm 1,单 prompt group 流程为:(1)从标量奖励 $\{r_i\}$ 算组相对优势 $A_i$;(2)从正常 rollout 拿完整 prompt 下逐 token 对数概率 $\ell^+_{i,t}$;(3)用冻结策略 $\bar\theta$ 对同一串 token 在 $x^-$ 下回放打分得 $\ell^-_{i,t}$——不重新生成、不调验证器、不做拒绝采样,只多一次前向打分;(4)做对比 $\Delta_{i,t}=\ell^+_{i,t}-\ell^-_{i,t}$;(5)映射到有界评分 $s_{i,t}=\text{sigmoid}(\tau(\Delta_{i,t}-b))\!-\!\tfrac12$,再乘 SmoothStep 调度 $\lambda_k=3u_k^2\!-\!2u_k^3$($u_k$ 为归一化训练进度)与强度 $\eta$,得临时权重 $\tilde w_{i,t}=1+\eta\lambda_k s_{i,t}$;(6)响应内归一化 $w_{i,t}=\tilde w_{i,t}/\bar w_i$ 保证 $\tfrac1{T_i}\sum_t w_{i,t}=1$;(7)用 $\tilde A_{i,t}=\text{sg}(w_{i,t})A_i$(sg 截梯度)替换 clipped surrogate 里的优势。归一化保证 $\tfrac1{T_i}\sum_t w_{i,t}A_i=A_i$,即只重分配、不改响应级更新方向与量级。

技术新颖性

技术新颖性体现在三方面。第一,信号来源新颖:把上下文归因(ContextCite、Sarti et al.)和反事实数据增强(Hindsight Experience Replay、counterfactual data augmentation)的思想从「事后解释 / 数据增强」改造成「训练时分配梯度」,让反事实对比第一次直接服务于策略更新。第二,设计约束新颖:通过响应内归一化把权重约束在「重分配而不重定标」上——平均 token 系数恒为 1,保证 CoRT 不会偷偷变成响应级奖励放大器,这一点在消融里被验证是稳定性的关键。第三,工程代价最小:相对 GRPO 只多一次反事实打分前向 pass,不需要 token 级标签、不需要拒绝采样、不需要额外训练阶段。相比 RTT 必须先训一个 Token-Level Relevance Discriminator,CoRT 证明了「显式学习 token 相关性并非 token 级信用分配的必要条件」。

Overview of CoRT pipeline
Figure 2: Overview of CoRT pipeline

实验结果

Table 1 是核心证据,按模型族×奖励粒度组织(具体数字见 benchmarks 数组)。Qwen3-4B + CSR 下 CoRT 相对匹配的 GRPO 全面提升,且多数列追平或超过需训判别器的 RTT(如 MultiDimIF 80.48 vs RTT 76.33)。Qwen2.5-7B + CSR 增益更猛,MultiDimIF 达 +11.85,说明在小基模型上尤其有效,作者报告平均增益约 4.4 个百分点、绝大多数对比胜出。但并非全胜:Qwen2.5-7B + AON 下 IFBench 反而 −2.31,提示稀疏 AON 奖励对个别指标不稳。Table 2 把规模推到 Qwen3-14B:CSR 全部指标提升,AON 下 IFBench/MultiDimIF 改善但 IFEval 略落后。Table 3 验证可移植性:DAPO 加 CoRT 全部 5 个指标提升,GSPO 上 5 项里 4 项提升,说明反事实 token 信用与底层策略目标改动正交互补。Table 5 通用能力检查(Math500/GPQA-Diamond/MMLU-Pro)显示 CoRT 基本保留原模型能力(4B 平均 +0.27、7B −0.62)。训练诊断(Figure 3)显示完整配方下平均 token 权重始终贴近 1.0、长度裁剪近零、梯度与熵稳定;去掉响应归一化或斜坡都会出现权重漂移与后段尖峰,证明这两套控制分别解决「量级漂移」与「突变」两类失败模式。

Main validation results on instruction following benchmarks
Table 1: Main validation results on instruction following benchmarks
Qwen3-14B results
Table 2: Qwen3-14B results
CoRT with DAPO and GSPO (CSR)
Table 3: CoRT with DAPO and GSPO (CSR)
General capability checks under mean@5 evaluation
Table 5: General capability checks under mean@5 evaluation
Replay contrasts from the balanced-diet HIR case
Table 6: Replay contrasts from the balanced-diet HIR case
Criterion-wise removal controls on the pandemic case
Table 9: Criterion-wise removal controls on the pandemic case
查看结构化数据
任务指标本文基线提升
IFEval (Qwen3-4B, CSR) Prompt 准确率 Prompt-level accuracy (%) 86.06 GRPO 84.29 +1.77
IFBench (Qwen3-4B, CSR) Instruction 准确率 Instruction-level accuracy (%) 36.24 GRPO 33.43 +2.81
MultiDimIF (Qwen3-4B, CSR) Multi-dimensional accuracy (%) 80.48 GRPO 74.38;RTT 76.33 +6.10 vs GRPO,且超过需训判别器的 RTT
MultiDimIF (Qwen2.5-7B, CSR) Multi-dimensional accuracy (%) 78.52 GRPO 66.67 +11.85(全文最大单项增益)
IFBench (Qwen2.5-7B, CSR) Prompt 准确率 Prompt-level accuracy (%) 34.63 GRPO 28.23 +6.40
AdvancedIF (Qwen2.5-7B, CSR) Overall Judge-based overall (%) 34.18 GRPO 30.91 +3.27
Qwen3-14B (CSR) IFBench Instruction Instruction-level accuracy (%) 43.11 GRPO 42.53 +0.58(14B 规模扩展)
DAPO + CoRT (Qwen3-4B, CSR) IFEval Instruction Instruction-level accuracy (%) 90.20 DAPO 88.90 +1.30(兼容性验证)

局限与改进

作者在结论里明确列出三类失效场景:当 rubric 标准对 token 似然影响很小时、当标准与原 prompt 内容冗余时、当响应级奖励本身噪声大时,反事实信号都会变弱。这些都在方法原理上可解释——$\Delta_{i,t}$ 测的是「标准能多大程度上移 token 概率」,影响小自然没信号。从结果看,Qwen2.5-7B + AON 下 IFBench 不升反降(−2.31),Qwen3-14B + AON 下 IFEval 也落后 GRPO,说明稀疏 AON 奖励是脆弱点。我自己额外观察到的局限:(1) 方法只在指令跟随基准上验证,没有触及数学推理、代码、长链推理这类「标准本身不是显式格式约束」的场景,泛化性存疑;(2) 反事实回放需要多一次前向 pass,在小 batch、大上下文场景下是实打实的算力开销;(3) 整个方法依赖能把 rubric 标准干净地从 prompt 里剥离构造 $x^-$,对于「正确性、有用性」这类语义标准、或与任务描述深度纠缠的标准,剥离后语义会变怪,$\Delta$ 的可解释性下降(Table 8/9 的对照也只针对可见的格式标记)。

独立分析的弱点

第一,对「可见格式约束」依赖性强。从 Table 6、7 的案例看,高对比 token 几乎全是引号、星号、P.S.、数字 three 这类肉眼可见的格式标记,而对「正确性、有用性」这类没有局部痕迹的标准,反事实信号会很弱(Table 9 里「English language / 至少五句」几乎没有局部集中效果)。改进方向:引入标准特异性分配——对每条标准单独回放再融合,或对全局/语义标准做语义级而非 token 级的信用分配。第二,仅一次反事实 pass 的成本在大上下文场景不可忽视,可以探索缓存 $\ell^-$ 或用稀疏/低秩近似降低回放开销。第三,方法对响应级奖励质量敏感:AON 这种稀疏奖励下个别指标退化,可结合奖励塑形或自蒸馏来稳住底层 $A_i$。第四,当前仅验证到 14B 且只在指令跟随场景,建议在数学/代码/Agent 任务上做扩展实验,证明反事实对比不只是「格式约束专用」。第五,评估用 best-within-500-step 选点,Table 4 的固定 step-500 结果显示部分指标比 best 点低,需谨慎看待「报告增益」与「实际部署增益」之间的差距。

未来方向

作者明确点出三个方向:更细粒度的干预(不止删标准,还可替换/扰动标准)、标准特异性的信用分配(区分不同标准分别贡献到哪些 token)、以及跨轮次/动作/工具调用的长视野信用分配(把 CoRT 思想从单轮生成搬到多轮 Agent 与工具使用场景)。基于成果可延伸的方向我认为还有:把反事实对比与过程奖励模型 PRM 结合,让 $\Delta_{i,t}$ 同时承载「标准依赖」与「推理步骤正确性」两类信号;探索与 DPO/RLVR 自蒸馏路线的融合,看反事实回放能否给 self-distillation 提供更稳的 token 调制;以及理论上去刻画 $\Delta_{i,t}$ 作为 token 重要性代理的偏差与方差边界,目前它只是「proxy」而非校准量。

复现评估

复现友好度较高。数据用公开的 HIR-16k(Zhang et al. 2025,arXiv:2512.23457),每条样本天然提供「无指令列表的 prompt + 指令列表」,正好构造 $x^+$ 与 $x^-$。模型是开源的 Qwen3-4B/14B-Instruct 与 Qwen2.5-7B-Instruct。关键超参写得清楚:actor 学习率 $10^{-6}$、warmup 0.03、prompt batch 64、每 prompt 采样 8 条、rollout 温度 1.0/top-p 0.99/top-k 100、clip 0.2 与 0.27、响应上限 4096。CoRT 自身超参也明确:零中心 replay-margin、$\tau=1$、$\eta=0.5$、100 步 SmoothStep 斜坡、响应均值归一化,token 乘子有界在 $(0.75,1.25)$。算力上相对 GRPO 只多一次反事实前向打分,4B–14B 规模在中型 GPU 集群可跑。唯一未提代码是否开源,需自行实现 Algorithm 1——好在改动局部、约束清晰,工程量不大。