← 返回 2026-08-05

知道何时停止:用于减少过度思考的段落级信用分配 Know When to Stop: Segment-Level Credit Assignment for Reducing Overthinking

Chia-Hsuan Lee, Sihui Dai, Mingyang Zhou, Isha Slavin, Hsuan Su, Shi-Xiong Zhang, Sambit Sahu, William Campbell 📅 2026-08-04 👍 7 2026-08-10 18:30
GRPO 信用分配 强化学习 推理语言模型 答案漂移 过度思考

DASH通过检测答案漂移为推理段落分配信用,在减少过度思考的同时提升准确率。

前置知识

GRPO(群体相对策略优化)

Group Relative Policy Optimization 是一种强化学习算法:对每个提示 $x$,模型生成 $n$ 个 rollout $\{y_1,\dots,y_n\}$,每个 rollout 得到奖励 $r_i$,然后用组内归一化计算优势 $A_i=(r_i-\text{mean}(r_j))/\text{std}(r_j)$,并将该标量优势广播到 rollout 的所有 token 位置,再配合 PPO 式的 clip 损失进行策略更新。

DASH 是在 GRPO 之上构建的,理解 GRPO 如何把单个标量优势均匀分配给整条轨迹,才能明白 DASH 为什么要把它细化为段落级优势,以及为什么 GRPO 会丢弃轨迹内部的结构信息。

过度思考(Overthinking)

推理模型(如 DeepSeek-R1)在生成思维链时常常出现 hedging(犹豫)、approach abandonment(策略放弃)、self-contradiction(自我矛盾)、recomputation(重复计算)等行为,这些行为消耗大量 token 却不改善甚至损害最终答案。论文强调过度思考并非单纯的长度问题:即使控制响应长度,错误轨迹仍比正确轨迹表现出更高的非生产性自我反思。

整篇论文的核心动机就是减少过度思考,理解这六类语言信号(S1–S6)以及‘长度不等于效率’这一关键观察,才能理解 DASH 为何不从截断生成长度入手,而是从信用的精细分配入手。

答案漂移(Answer Drift)

设推理轨迹 $y$ 中提取出有序的中间答案候选序列 $(\hat{a}_1,\dots,\hat{a}_K)$,若最后一个 $\hat{a}_K \neq a^*$(真值)但存在某个 $\hat{a}_i = a^*$($i<K$),则称轨迹发生了答案漂移——模型曾到达正确答案,却在后续反思中偏离了它。

答案漂移是 DASH 全部机制的核心检测对象:它把‘既包含有效推理前缀又包含有害反思后缀’的轨迹识别出来,从而提供免费的监督信号,这是论文区别于传统长度惩罚或粗粒度奖励的关键。

研究动机

DeepSeek-R1 这类推理语言模型通过长思维链取得强表现,但常常‘过度思考’:生成 hedging(‘wait, no’)、approach abandonment(‘this approach is wrong’)、self-contradiction、recomputation 等行为,消耗大量 token 却把模型引向错误答案。以往工作主要把过度思考等同于‘太长’,于是用长度惩罚或提前停止来鼓励简短。但论文用 Nemotron-4B 在 AIME 2024 上的 960 条轨迹分析证明这不够:准确率随响应长度单调下降(图2a),而即使在同一长度桶内,错误轨迹的数值重复计算密度和自我矛盾密度都明显高于正确轨迹(图2b、2c)。这说明过度思考本质上是‘往错误方向反思’,而不是单纯的长度。更关键的是,标准 GRPO 把整条错误轨迹的所有 token 统一赋负优势,$A_i$ 广播到每个位置,等于把‘找到正确答案的有效前缀’和‘偏离正确答案的有害后缀’一视同仁地惩罚,把宝贵信息扔掉了。而要识别每一步反思是否有用,通常需要过程奖励模型、LLM-as-judge 或人工标注,成本极高。

本文的目标是本文的目标是训练模型‘保留有用的自我反思、抑制有害的自我反思’,在不简单截断生成长度的前提下,同时提升推理效率与准确率。具体而言,作者希望找到一种廉价的代理信号来判断每段反思究竟是帮助纠错还是把模型拖向错误,并据此把 GRPO 的单一标量优势升级为对轨迹内部结构敏感的精细化信用分配,让模型学会‘知道何时停止’。最终目标是让推理轨迹更长但更高效——出现矛盾后能果断解决(contradiction-then-resolution),而不是盲目切换策略(abandonment)陷入螺旋。

与已有工作不同的是,本文的独特切入角度是:推理模型会在思维链中‘承诺中间答案’,例如写出‘the answer is X’或 $\boxed{X}$ 然后继续推理。把这些中间答案候选与真值逐一比较,就能判断其后的反思究竟改善还是恶化了答案,完全不需要外部监督、过程奖励模型或学习型组件。这一观察把以往被当作‘浪费的负样本’(drift 轨迹)转化成信息丰富的训练样本:一条漂移轨迹同时教会模型去强化‘找到正确答案的那段推理’、抑制‘随后偏离正确答案的那段过度反思’。这正是 GRPO 当作平坦负例而丢弃的信号,也是 DASH 区别于所有长度导向方法(如 DR-GRPO、Brevity Bonus)的根本所在。

核心方法

DASH(Drift-Aware advantage SHaping,漂移感知优势塑形)的整体思路是:先用正则匹配从推理轨迹中提取中间答案候选 $(\hat{a}_1,\dots,\hat{a}_K)$(含 $\boxed{\dots}$、‘the answer is X’ 及自然语言承诺),与真值 $a^*$ 比较以判定是否发生答案漂移;随后把每条 rollout 切分为以相邻答案检查点为界的若干段,按每段是通向正确还是错误答案来分配段级优势。直觉上,当模型先到正确答案再反思到错误答案时,这段反思就是有害的、应当被压制的。由于 DASH 只在每 token 优势层面操作,它能直接与 GRPO 家族优化器(如 DR-GRPO)组合而无需算法改动,与 DR-GRPO 配对时仅改两个超参:关闭显式长度惩罚并把 $\alpha_+$ 从 1.0 降到 0.5。

核心创新点在于用‘答案漂移检测’驱动的段落级信用分配,本质区别于已有方法。标准 GRPO 把单一标量优势 $A_i$ 广播到轨迹所有 token;长度导向方法(DR-GRPO 通过 token-mean 隐式给短轨迹更强梯度,Brevity Bonus 对正确短轨迹加奖)只看整体长度而不看轨迹内部结构。DASH 则定义:若 $\hat{a}_K\neq a^*$ 但存在 $\hat{a}_i=a^*$,该段反思是‘有害的过度思考’,应当被升级惩罚;通向正确检查点的段获得正优势,通向错误的段获得随长度递增的负优势,重复确认则几何衰减以避免反向强化过度思考。这种设计从一条漂移轨迹中同时抽取‘强化正确推理’与‘抑制有害反思’的双重训练信号,把 GRPO 视为平坦负例的轨迹变废为宝。所有监督都来自模型自身的中间答案承诺,无需外部奖励模型、学习组件或逐模型调参。

方法步骤详情

DASH 步骤:(1) 用 $\boxed{\dots}$、‘the answer is X’ 及自然语言模式匹配出有序中间答案候选 $(\hat{a}_1,\dots,\hat{a}_K)$ 及 token 位置 $p_1<\dots<p_K$。(2) 漂移判定:若 $\hat{a}_K\neq a^*$ 且某 $\hat{a}_i=a^*$ 则判为漂移,区分漂移、纯错误、正确三类。(3) 段落构建:$S_0$ 为首检查点前的中立段,$S_j^+$ 通向正确检查点(正段),$S_j^-$ 通向错误(负段)。(4) 漂移轨迹奖励塑形 $r_{\text{drift}}=r_{\text{inc}}+\delta(1-L_{\text{post}}/L_{\text{tot}})$,高于纯错误、低于正确。(5) 逐 token 优势:正段 $a_t=+|A_i|\alpha_+ d_j$,负段 $a_t=-|A_i|\alpha_- w(t)$,中立段条件化给 $\alpha_n$。(6) 重复确认衰减 $d_j=\max(\gamma^{k_j},\gamma_{\min})$,$k_j$ 为紧邻正段数。(7) 负段长度惩罚 $w(t)=1+\alpha\Delta_t$,封顶 $w_{\max}$,越往后越重。(8) $S_0$ 条件化:正确给标准优势、漂移给弱正信号、纯错误不施加梯度。超参取 $\alpha_+=\alpha_-=1.0$、$\alpha=3.0$、$w_{\max}=3.0$、$\alpha_n=0.1$、组规模 $n=16$;配 DR-GRPO 时关闭长度惩罚并把 $\alpha_+$ 降至 0.5。

技术新颖性

技术新颖性体现在四点。第一,‘免费监督’:首次系统性地把模型自身的中间答案承诺作为可验证训练信号,无需过程奖励模型(PRM)、LLM-as-judge 或人工标注,成本低一个量级。第二,‘段落级信用’与 GRPO 的标量广播形成本质对比,把单条漂移轨迹拆成‘强化正确前缀 + 抑制有害后缀’的双重梯度,从负样本中榨取双倍信号。第三,‘组合性’:DASH 只在每 token 优势层面操作,与任意 GRPO 家族优化器无缝组合,与 DR-GRPO 配对时仅改两个超参,无需算法改动。第四,‘可迁移性’:跨 Nemotron-4B、Phi-4-reasoning-plus-14B、OLMO-3-think-SFT-7B 三个不同家族的模型以完全相同配置提升,无逐模型调参。此外六类语言信号 S1–S6 用纯正则/n-gram 实现,无需学习组件,为评估‘真正的行为改善’而非‘表面变短’提供了可复现的诊断工具。

Overview of DASH. We decompose reasoning traces into segments bounded by intermediate answer checkpoints.
Figure 1: Overview of DASH. We decompose reasoning traces into segments bounded by intermediate answer checkpoints.

实验结果

在四个竞赛级数学基准上 DASH 成果显著。整体最高:DR-GRPO+DASH 平均 59.45%,优于 DR-GRPO 58.13%、GRPO 56.95%、base 55.65%。在过度思考最严重的硬基准上最强:OlympiadBench、MinervaMath、AIME24 均最优,分别 67.6 vs 66.7、57.4 vs 53.3(+4.1)、65.3 vs 62.2(+3.1)。揭示 GRPO 盲点:标准 GRPO 在 AIME24 比 base +1.3 但 AIME25 反而 −0.7,因统一负优势误伤漂移轨迹里的有效前缀;DASH 避免此退化,AIME25 比 base +4.7(但 DR-GRPO+DASH 47.5 < DR-GRPO 50.3,−2.8 为唯一短板)。自纠错更强:矛盾-后-解决模式是 GRPO 的两倍(0.92 vs 0.47/trace),盲目放弃减少 3 倍以上。降过度思考:相对 DR-GRPO,hedging −14%、abandonment −41%、length outlier −17%,响应长度几乎不变(+0.03%);唯一升高的 contradiction(+13%)被证明是生产性自我监控。跨模型泛化:GRPO+DASH 比 vanilla GRPO 在 Nemotron +0.5、OLMO-3-think +1.5、Phi-4 +4.1。消融:奖励塑形最关键(去 $\delta$ 降 2.9 至 54.6),长度惩罚次之(−2.2)。

Main results. Subscripts show improvement over the corresponding base method. Best per column in bold.
Table 1: Main results. Subscripts show improvement over the corresponding base method. Best per column in bold.
Ablation study on DASH components. Average is computed over OlympiadBench, Minerva-Math, AIME24, and AIME25.
Table 2: Ablation study on DASH components. Average is computed over OlympiadBench, Minerva-Math, AIME24, and AIME25.
Self-correction rate on AIME 2024 and AIME 2025 against benchmark accuracy.
Figure 3: Self-correction rate on AIME 2024 and AIME 2025 against benchmark accuracy.
DASH generalizes across model families.
Figure 4: DASH generalizes across model families.
Overthinking signal profile (averaged across AIME24, AIME25, OlympiadBench, and MinervaMath).
Figure 5: Overthinking signal profile (averaged across AIME24, AIME25, OlympiadBench, and MinervaMath).
查看结构化数据
任务指标本文基线提升
OlympiadBench(pass@1) 准确率 67.6(DR-GRPO+DASH) DR-GRPO 66.7 +0.9
MinervaMath(pass@1) 准确率 57.4(DR-GRPO+DASH) DR-GRPO 53.3 +4.1
AIME 2024(avg@32) 准确率 65.3(DR-GRPO+DASH) DR-GRPO 62.2 +3.1
AIME 2025(avg@32) 准确率 47.5(DR-GRPO+DASH) DR-GRPO 50.3 −2.8(短板)
四基准平均 准确率 59.45(DR-GRPO+DASH) GRPO 56.95 / DR-GRPO 58.13 / base 55.65 比 DR-GRPO +1.32、比 GRPO +2.50
跨模型平均准确率 准确率 GRPO+DASH 57.48 vanilla GRPO 56.95(Nemotron-4B) +0.5(OLMO +1.5,Phi-4 +4.1)

局限与改进

作者承认四点局限。其一,主体实验仅在 4B 模型(Nemotron-4B)上完成,虽分析显示漂移模式具有尺度不变性,但更大尺度的训练动力学可能不同。其二,方法依赖可提取的中间答案来检测漂移,因此只适用于有可验证检查点的领域(数学、带测试用例的代码);开放式推理任务缺乏明确答案标记,需另寻漂移指标。其三,在简单基准上略有下降,如 Nemotron 在 MATH-500 上比 base 低 1.7pp,存在‘硬题受益、易题受损’的真实权衡。其四,评估仅限数学推理,向逻辑、科学、常识等其他推理域的泛化有待验证。从我的观察看还有两点:DASH 在 AIME25 上对 DR-GRPO 反而 −2.8,说明段级信用并非普适增益;答案提取高度依赖 $\boxed{\dots}$、‘the answer is X’ 等模式匹配,模型若不按这些格式书写中间结论,漂移检测会失效;伦理层面 DASH 作为 RL 微调方法继承基座模型的安全属性与失效模式,未引入额外缓解。

独立分析的弱点

独立分析有三个弱点及改进方向。第一,AIME25 上的退化:DR-GRPO+DASH 47.5 < DR-GRPO 50.3,且 GRPO+DASH 47.2 也仅略高于 GRPO 45.4,说明在答案漂移最严重的基准上段级信用反而可能误伤某些有效反思;改进方向是引入难度自适应,根据问题难度或模型不确定性动态调节漂移惩罚强度(作者自己也提及此设想)。第二,对答案提取模式的脆弱依赖:漂移检测完全靠正则匹配 $\boxed{\dots}$ 与‘the answer is X’ 等模式,若模型把中间结论写成自然语言(‘由此可知结果约为 N’)或干脆不显式承诺,则提取失败、信号中断;改进方向是引入轻量序列标注/解析器或更鲁棒的自然语言答案抽取,甚至用模型自身的内省来定位承诺点。第三,域受限与尺度证据不足:仅在数学上验证、仅在 4B 上做主体实验,跨域(代码、逻辑、开放推理)与大尺度(14B+)的迁移尚未证实;改进方向是先在带测试用例的代码基准上扩展漂移定义(把‘通过/失败’作为检查点),再在 14B–70B 尺度上验证尺度不变性假设。

未来方向

作者明确提出的方向有:探索难度自适应方法,按问题难度或模型不确定性调节漂移惩罚强度;验证更大模型尺度下训练动力学的差异;为开放式推理任务设计无需明确答案标记的替代漂移指标。基于本文成果可延伸的研究包括:把‘中间答案承诺作为免费监督’的范式推广到代码(用单元测试通过/失败作为可验证检查点)与多步工具调用(用工具返回作为检查点);把六类语言信号 S1–S6 与段级信用联合,形成‘诊断—干预’闭环,自动判定何时该施加长度惩罚;研究 DASH 与测试时计算(test-time scaling)的交互——既然模型已学会‘知道何时停止’,是否可同时减少推理与训练成本;以及把‘contradiction 作为生产性自我监控’这一发现系统化,设计显式鼓励矛盾-解决模式的奖励。此外,把漂移检测与思维链压缩、思维树搜索结合,也是一个有价值的方向。

复现评估

复现性总体较好但未完全开源。数据侧:训练数据来自公开的 OpenR1-Math-220K(源自 NuminaMath 1.5,含 DeepSeek-R1 验证轨迹),评测用公开基准 OlympiadBench、MinervaMath、AIME 2024/2025,均可获取。模型侧:基座模型均为开权重——Llama-3.1-Nemotron-Nano-4B-v1.1、Phi-4-reasoning-plus、OLMO-3-think-SFT-7B。方法侧:六类语言信号是纯正则/n-gram,公式(奖励塑形、段构建、$d_j$、$w(t)$)与超参($\alpha_+=\alpha_-=1.0$、$\alpha=3.0$、$w_{\max}=3.0$、$\alpha_n=0.1$、$n=16$、$\beta=0.2$)在正文与附录 F 中给出,理论上可复现。算力门槛高:每次训练用 4 节点 × 8 H100 GPU,普通研究者难以独立复现完整实验。代码与训练 checkpoint 论文未明确提及是否开源,是复现性的主要不确定因素。