并非所有 token 都值得同等信用:面向长链式推理的反事实敏感度信用再分配 Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning
将特权偏移重解为反事实敏感度,重分配 GRPO token 信用以提升长链推理。
前置知识
GRPO(组相对策略优化)
GRPO 是 DeepSeek 提出的免 critic 强化学习算法。对每个问题采样 $G$ 条回答,用验证器给每条打分得到奖励 $R_i$,再按组内均值 $\mu_R$ 和标准差 $\sigma_R$ 归一化得到序列级优势 $A_i=(R_i-\mu_R)/(\sigma_R+\varepsilon_A)$。它把这个相同的优势值均匀广播到该回答中的每一个 token 上,从而省去了训练价值模型,是当前长链推理 RLVR 的主流范式。
本文就是在 GRPO 的基础上做改动,理解 GRPO 如何把序列级奖励变成 token 级信号,是读懂 CSCR 为何要'再分配信用'的前提。
OPSD(在线自蒸馏)
在线自蒸馏让策略自身充当'特权教师':在输入中注入验证过的答案、参考解或结果反馈等特权信息 $c$,得到条件分布 $q_i^c(v)=\mathrm{sg}[\pi_\theta(v\mid x,c,y_{<i})]$,再通过前向 KL 散度 $D_{KL}(q_i^c \| p_i)$ 把这个全词表分布蒸馏回无条件策略 $p_i$。它相比离线蒸馏减少了训练-推理分布失配,被广泛用来提供 token 级的稠密监督。
本文要质疑和诊断的正是 OPSD 的核心假设——'特权条件下产生的全词表概率变化是可靠的答案对齐监督信号',这是全文立论的靶子。
前向 KL 散度与特权偏移
前向 KL $D_{KL}(q\|p)=\sum_v q(v)\log(q(v)/p(v))$ 的下降方向在 logit 空间等于概率差向量 $\Delta_i^c=q_i^c-p_i$,也就是'特权分布减去普通分布'。这意味着特权偏移本身就是前向 KL 优化在 token 级的直接信号:在特权分布更高的 token 上提概率、更低的 token 上降概率。
论文正是用这个性质把'概率偏移'和'优化信号'严格对应起来,从而能用量化的方式检验特权偏移到底带不带答案对齐的方向信息。
反事实敏感度与 CPC
论文把对同一条轨迹在两种对立特权条件(声称答对 $c^{pos}$ vs 声称答错 $c^{neg}$)下重新打分得到的偏移幅度,解读为该 token 对'特权条件'有多敏感。CPC(反事实扰动一致性)$=1-D/M$ 衡量两种条件下优化信号在同一坐标、同一方向上的重叠比例,越接近 1 说明特权偏移越无法区分答对答错。
CPC 是诊断的核心度量,论文用它证明特权偏移约 58% 的信号在两种对立条件下方向一致,从而论证其不可靠;反事实敏感度则是 CSCR 信用再分配的直接依据。
长链式推理(Long-CoT)
指大模型在给出最终答案前生成上千 token 的逐步推理过程,常见于数学竞赛、代码等可验证任务。这种长序列让'信用分配'问题格外突出:决定成败的关键推理步、探索性分支和几乎确定的前缀续写,会在长达数千 token 的回答中混合在一起。
长链推理是本文的实验场景,正是因为序列很长,token 级信用的均匀广播才造成明显的'不该得信用'问题,CSCR 的收益也最显著。
研究动机
现行的免 critic 方法 GRPO 把序列级的验证奖励均匀广播到整条回答的每个 token 上:无论这一步是关键的推理转折还是几乎确定的前缀续写,都拿到相同的优势值 $A_i$。在动辄数千 token 的长链推理里,这种'一刀切'会造成结果级评估与 token 级优化之间的根本错配。为了补这个洞,研究者转向在线自蒸馏(OPSD)和它的各种变体(SDPO、SRPO、RLSD、RLCSD),寄望于'特权条件下的全词表概率变化'能提供答案对齐的稠密 token 级监督。但这一整套范式都建立在一个未经检验的前提之上:把策略自身注入特权信息(如参考解、已验证答案)后产生的概率偏移,真的编码了'哪些 token 该奖、哪些该罚'的方向信息。如果这个前提不成立,所有依赖特权偏移方向的方法都会在长链训练中失稳甚至反噬,而多个自蒸馏基线在主实验中确实低于 base 模型,正是这一隐患的实证体现。
本文的目标是本文要回答两个层层递进的问题。第一步是诊断:特权偏移到底带不携带答案对齐的方向信息?作者用一种'反事实重打分'实验来做最严苛的检验——固定同一条采样轨迹和所有前缀,分别在'声称答对'和'声称答错'两种极端对立的特权条件下重新打分,看 token 的偏移方向是否随验证器结论翻转。第二步是建设:在不引入额外标注、不训练辅助奖励模型、尽量保持 GRPO 简洁性的前提下,设计一种 token 级信用再分配方法,让它能在长链数学推理基准上稳定地、跨模型规模地超过 GRPO 及一众自蒸馏基线,并保持训练稳定、不出现长度爆炸或奖励坍塌。作者把这两步分别落在 400 条轨迹的诊断统计和五基准 Mean@32 主实验上,要求结论可量化、可复现。
与已有工作不同的是,最关键的切入角度是'把偏移的方向和幅度拆开来看',并且用一个明确的零重叠参照系来衡量。已有工作(OPSD、RLSD、RLCSD)几乎都默认特权偏移的'方向'就是有用的监督,于是要么照搬方向、要么用对比来调整方向。本文却用反事实重打分证明:即便在语义最对立的两端,方向也高度重叠(同号偏移占 91.4%–95.8%,全词表层面 $\mathrm{CPC}\approx 0.58$),而 GRPO 给同一轨迹相反符号的优势本应产生完全反向($\mathrm{CPC}=0$)的信号。更妙的是,作者发现偏移的'幅度'才是稳定且有用的信息——它衡量的是 token 对特权条件的敏感度,且敏感 token 恰恰是 But、So、Therefore 这类可替换的表面词,而非承载问题专属推理的数字与运算符。于是'该信任的不是方向、而是幅度的反面'这一反直觉的洞察,成了 CSCR 的立论基础。
核心方法
直觉上,CSCR 的思路很朴素:在一条长推理里,真正承载问题专属推理的是数字、变量、运算符这些'不可替换'的 token,而 But、So、Therefore、Wait 这些话语标记高度可替换、换个说法也行。后者对'别人怎么评价这条答案'反应剧烈(一夸就涨、一批就跌),但它的涨跌并不代表它对答对答错有因果贡献。所以正确的做法不是去信任这些敏感 token 的偏移方向,而是恰恰相反——把它们'降权',把省下来的信用还到那些真正做事的 token 上。技术路线也很轻:CSCR 仍是 GRPO,序列级优势 $A_i$(由验证器决定的方向)原封不动,只是把每个 token 的优势乘上一个经轨迹内归一化的权重 $\tilde{w}_{i,t}$,让敏感 token 的权重小、不敏感 token 的权重大,且整条回答的总信用预算不变,默认 $\lambda=0.05,\alpha=10,\gamma=0.2$。
核心创新是对'特权似然偏移'的重新解读:把它从'答案对齐的学习价值'翻转为'对特权条件的反事实敏感度'。作者先用反事实重打分证明偏移的方向不可靠(对立条件下高度同号、$\mathrm{CPC}\approx 0.58$ 远高于 GRPO 反号优势的理论值 0),再把它的幅度定义为敏感度分数 $s_{i,t}=\max(|z_{i,t}^{pos}|,|z_{i,t}^{neg}|)$。关键的设计选择是'只调幅度、不动方向、做归一化':CSCR 完全保留验证器决定的优势方向 $A_i$,只用敏感度衰减高敏 token 的权重,再在轨迹内归一化以守住总信用预算。这与 OPSD/RLSD/RLCSD 形成本质区别——后者都试图利用偏移的'方向'作为监督,而 CSCR 把方向视为噪声、只借用幅度的反面(敏感即降权)。另一个精妙之处是这套降权是 stop-gradient 的,敏感度只是个静态的再分配系数,不引入新的优化目标。
方法步骤详情
完整 CSCR 流程分五步,输入为问题 $x$ 和在线轨迹 $y_i$。第一步,用 Table 1 两段对立特权提示 $c^{pos}/c^{neg}$ 在固定前缀下对每个 token 重打分,得偏移 $z_{i,t}^{pos}$ 与 $z_{i,t}^{neg}$。第二步,取幅度较大者为反事实敏感度 $s_{i,t}=\mathrm{sg}[\max(|z_{i,t}^{pos}|,|z_{i,t}^{neg}|)]$。第三步映射权重:$s_{i,t}<\lambda(=0.05)$ 时为 1,否则 $w_{i,t}=1-\gamma(1-\exp(-\alpha(s_{i,t}-\lambda)))$,下限为 $1-\gamma$(默认 $\alpha=10,\gamma=0.2$)。第四步在轨迹内归一化 $\tilde{w}_{i,t}=w_{i,t}/(\frac{1}{T_i}\sum_j w_{i,j})$,得 token 级优势 $\tilde{A}_{i,t}=\tilde{w}_{i,t}A_i$。第五步把 $\tilde{A}_{i,t}$ 代回标准 GRPO clipped 目标,唯一额外开销是两次前向重打分。
技术新颖性
CSCR 的新颖性在于'反着用'敏感度,并与已有自蒸馏方法在三个层面划清界限。其一,诊断维度:以往工作默认特权偏移带方向信息,本文是第一个用'固定前缀+对立特权条件重打分'的受控反事实实验,并用 CPC 这个零重叠参照系(GRPO 反号优势必给出 $\mathrm{CPC}=0$,附录 A 有证明)量化证明方向不可靠。其二,方法维度:OPSD 照搬方向、SDPO 把反馈变成稠密 token 监督、RLSD 用偏移调幅度但仍依赖方向、RLCSD 用对比调方向,CSCR 则彻底放弃方向、只用幅度的反面(敏感即降权)做再分配。其三,工程维度:它是对 GRPO 的极小改动,不引入新损失、不训练奖励模型、不需要过程标注,却同时打败了五类自蒸馏基线,挑战了'特权分布变化可直接当监督'这一流行假设。
实验结果
诊断稳健:在 DAPO-17K 共 400 条在线轨迹上,同时显著的 token 里 91.4%–95.8% 同号,全词表 CPC 均值/中位均为 0.583,即约 58% 优化信号在两种对立特权条件下方向一致,而 GRPO 反号优势理论参照为 $\mathrm{CPC}=0$(附录 A 证明)。大偏移集中在 But/So/Therefore/Wait 等可替换词,近零偏移集中在数字与运算符(Table 3)。主实验(Table 4,Mean@32)CSCR 在 1.7B/4B 两规模、五个竞赛级基准全部十个组合上都最优:1.7B 相对 GRPO 在 AMC23/AIME24/AIME25/AIME26/SMT25 分别 +4.7/+4.6/+8.1/+7.0/+5.9,相对各基准最强对手平均 +3.9(1.7B)、+1.7(4B)分,多个自蒸馏基线甚至低于 base。训练曲线(Figure 3)显示 CSCR 早期即拉开、长度从约 10000 缓涨到 11500 后稳定、无坍塌。消融中 SD-GRPO(信任偏移符号)约 30 步内崩溃(奖励 0.8→0、长度顶满 20480),中度降权 $\gamma=0.2$ 最稳,强升权/强降权都失稳。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| AIME25(Qwen3-1.7B) | Mean@32 | 43.6 | 36.7(GRPO) | +6.9 分,相对提升约 18.8% |
| AIME26(Qwen3-1.7B) | Mean@32 | 42.2 | 37.4(GRPO) | +4.8 分 |
| AMC23(Qwen3-1.7B) | Mean@32 | 88.8 | 84.1(GRPO) | +4.7 分 |
| AIME25(Qwen3-4B) | Mean@32 | 68.3 | 65.0(GRPO) | +3.3 分 |
| SMT-2025(Qwen3-4B) | Mean@32 | 59.0 | 57.4(GRPO) | +1.6 分 |
局限与改进
作者承认的局限主要在方法论假设上:CSCR 的两段对立提示是任务无关的(Table 1),但反事实重打分毕竟仍是启发式的条件构造,论文只验证了它(含附录 C 的三种替代构造:答案级、温和结果级、参考解级)在数学推理上的有效性,未推广到代码、科学问答等其他可验证域。作者也未声称找到了'理论上最优'的敏感度—权重映射,$\alpha,\gamma,\lambda$ 是凭经验网格得到的默认值。我自己的观察补充几点:其一,全部实验只覆盖 1.7B/4B 两个偏小规模、且只训 300 步,CSCR 在 7B/70B 乃至更长训练里是否仍稳定领先、是否仍无奖励坍塌,论文没有证据;其二,CSCR 每步要对每条轨迹多跑两次前向(正/负特权重打分),实际训练吞吐和显存的代价论文未给出量化对比;其三,'敏感 token 即降权'暗含一个假设——高敏 token 对最终答案总是贡献低,但少数情况下某个话语标记可能恰好触发关键回溯,一律降权存在误伤风险。
独立分析的弱点
弱点一:超参敏感性。$\gamma=0.2$ 是甜点,$\gamma\geq 0.5$ 就坍塌(Figure 5),意味着留给调参的安全裕度很窄,换数据集或换模型时默认值未必成立——改进方向是把衰减强度做成随训练进度或敏感度分布自适应,而非固定 $\gamma$。弱点二:诊断偏小规模。所有结论建立在 Qwen3-1.7B 和 4B、400 条轨迹上,'高敏 token 多为可替换词'这一现象在 70B 或代码模型上是否同样成立、CPC 的 0.583 是否会随规模下降,都没验证——改进方向是补做规模扫描和跨域(代码/工具调用)诊断。弱点三:额外前向开销未量化。两次特权重打分会让每步算力明显增加,长 20480 token 轨迹下尤其贵——改进方向是用缓存、低秩近似或离线敏感度估计来摊薄开销。弱点四:把敏感度与'学习价值'完全对立可能过激,少数话语标记确有功能性价值,可考虑只对'可替换性高'的子集降权而非一刀切,或引入一个保留下限的学习价值估计来纠偏。
未来方向
作者明确提出的延伸包括:把反事实敏感度诊断推广到更多可验证域(代码、科学问答)、更多模型规模,以检验结论的普适性;并探索更优的敏感度—权重映射函数和自适应超参。基于本文成果可延伸的方向我认为至少有三条:第一,CSCR 的'降权高敏 token'思想可与过程级奖励或价值模型结合——用敏感度先做粗筛、再用 PRM 在低敏的推理 token 上给精细信用,可能比纯结果监督更准。第二,反事实重打分本身可作为通用的诊断工具,用来审计其他任何'蒸馏/微调'信号是否真带答案对齐方向,而不只是修 GRPO,例如可用来检验 SFT 数据里教师分布的方向可靠性。第三,可研究把敏感度估计与推理时解码干预(如对高敏 token 降温、约束重复 n-gram)结合,从训练侧延伸到推理侧,直接缓解 SD-GRPO 暴露的 'The...The...' 式重复退化。
复现评估
复现门槛中等偏上。有利因素:算法描述完整、关键超参明确($\lambda=0.05,\alpha=10,\gamma=0.2$,lr $2\times10^{-6}$,300 步,每步 256 条轨迹),诊断实验只用 400 条轨迹和 100 道公开 DAPO-17K 题,五个评测基准(AMC23/AIME24/AIME25/AIME26/SMT-2025)均公开可得,两段反事实提示(Table 1)逐字给出,连附录都给了三种替代提示和 Top-50 token 列表。不利因素:论文(arXiv 预印本)未提及是否开源代码与权重;实验用 veRL 框架在 8 张 H800 上做全参微调,长 20480 训练 + 30720 评测 token 的采样让单机多卡成本不低,且额外两次特权重打分会进一步拉高开销;评测用 Mean@32 需要大量采样,复现全表算力需求较大。总体看,方法本身容易在一个已有的 GRPO 训练管线里加上百行代码实现,但完整复现五个基准的数字需要相当的算力。
论文图表
在 400 条在线轨迹上统计特权偏移:(a) 显示在两种特权条件下都不显著的 token 占 82.4%–84.7%,同时显著的仅 8.2%–10.4%;(b) 显示同时显著的 token 中同号偏移占 91.4%–95.8%,反号极少。
这张图是全文诊断的起点,用一张图同时说明'特权偏移只影响少数 token'和'方向不随验证器结论翻转'两个反直觉结论,直接动摇 OPSD 的立论基础。
在 γ∈{0.2,0.5,1.0} 下对比升权与降权:中度降权 γ=0.2 最稳、验证集收益最高;强升权让熵从 0.2 升到 0.6/0.8,强降权则使长度塌缩到约 6000/2000。
这张消融图给出 CSCR 的关键超参依据:敏感 token 应被适度降权而非强调或几乎忽略,是理解方法稳健性边界的核心。