← 返回 2026-09-10

重思完整推理轨迹在后训练中的必要性 Revisiting Complete Reasoning Traces for Post-Training

Jaehui Hwang, Sangdoo Yun, Byeongho Heo, Dongyoon Han 📅 2026-09-07 👍 17 2026-09-12 18:30
SFT 大语言模型 强化学习 推理训练 数据质量 知识蒸馏

推理轨迹中段约20%是冗余的:SFT只保留首尾,效果反超完整轨迹训练

前置知识

SFT(监督微调)

用(问题 $x_i$,答案 $y_i$,推理轨迹 $r_i$)三元组对预训练模型做负对数似然训练,损失为 $\mathcal{L}_{\text{SFT}}(\theta) = -\sum_{i=1}^{N} \log p_\theta(y_i, r_i \mid x_i)$,是让小模型习得推理能力最常用的后训练手段。

本文所有主实验都在 SFT 设定下进行,E-SFT 本质上就是修改 SFT 训练信号的数据配方,理解该目标是读懂全文的前提。

推理轨迹与 LRM

大推理模型(LRM,如 DeepSeek-R1 671B)在 ... 标记间生成的从问题到答案的显式思维链,常被当作教师监督信号蒸馏给小模型。这类轨迹通常长达数千至上万 token,含重复检查、回溯等冗余。

本文的研究对象就是这些机器生成轨迹的哪些部分值得学习,全部论证围绕轨迹的结构展开。

GRPO

组相对策略优化,DeepSeek 提出的强化学习后训练算法:对每个 prompt 采样一组 rollout,用组内奖励归一化结果作为优势估计来更新策略,无需价值网络。

论文 §4.4 把「屏蔽中段梯度」的思想移植到 GRPO 并获得显著提升,是方法普适性验证的关键实验。

On-Policy Distillation(OPD)

在线策略蒸馏:学生模型自己生成轨迹,用教师模型对同一轨迹逐 token 的概率分布作为监督信号,最小化两个分布的差异(而非模仿固定语料),兼顾教师的知识与学生的采样分布。

论文在 OPD 上对比了 token 级与步级屏蔽(+0.7 vs +2.2),由此得出「推理步是去冗余的自然单元」这一重要结论。

困惑度(Perplexity / PPL)

语言模型对一段文本的平均负对数似然的指数化度量,衡量模型对该文本的「意外程度」:$\text{PPL} = \exp\left(-\frac{1}{T}\sum_t \log p(x_t \mid x_{<t})\right)$。文本越符合模型预期,困惑度越低。

论文用「答案 token 的困惑度变化」因果检验某段轨迹是否关键:删/换某段后答案 PPL 上升说明该段重要,说明可以删。

Lost in the Middle

Liu et al. 2024 发现的现象:LLM 处理长上下文时,对位于中间位置的信息注意力不足、检索性能下降,即使该信息很重要;首尾位置的信息利用最好。

论文发现 LRM 轨迹的注意力模式与此现象同构(中段被弱注意),并讨论了二者共享的机制成因,是理解「为何中段可删」的背景知识。

研究动机

主流的推理后训练范式是用 DeepSeek-R1 这类 671B 参数的大推理模型(LRM)预先收集推理轨迹,再对 3B–32B 的小模型做 SFT,代表工作包括 s1K、Sky-T1、Bespoke-Stratos 和 OpenThoughts:训练目标 $\mathcal{L}_{\text{SFT}}(\theta) = -\sum_{i=1}^{N} \log p_\theta(y_i, r_i \mid x_i)$ 默认把完整轨迹 $r_i$ 全部当作监督信号。问题在于这些轨迹动辄上万 token,中间充斥重复检查、回溯与不必要的展开(例如反复出现的「Wait, but maybe...」);已有研究指出 LLM 在写出显式推理前往往已经知道答案,部分问题甚至不需要显式推理也能解出。那么完整轨迹中到底哪些片段真正承载监督信号、哪些只是噪音,此前缺乏系统性回答;而训练时因 16k/32k 上下文上限做的截断只是机械地丢弃尾部,与信息价值完全无关。

本文的目标是本文想回答两个递进的问题。第一,完整推理轨迹的各个区段对 SFT 是否同等重要?作者希望通过两类互补分析定位关键区段:一是对生成答案时注意力在轨迹相对位置上的分布做分层解读,二是因果式的片段消融与替换实验——截掉或改写不同区段后重新生成答案,用答案相似度与困惑度衡量每段的重要性。第二,在确认「中段冗余、首尾关键」后,能否据此设计一个不依赖任何打分器、外部 LLM 或额外算力的极简 SFT 配方,在把训练序列缩短约 20% 的同时不损失甚至提升推理性能?并进一步检验该结论能否推广到 GRPO 强化学习与 on-policy distillation 等非 SFT 目标,从而修正「推理数据越完整越好」这一领域默认实践。

与已有工作不同的是,已有工作的切入大多围绕「长度」:Ghosal 等与 Hassid 等发现过长或最长的思维链反而因 overthinking 伤害准确率,催生了 short-m@k 等推理期策略;ThinkPrune 用带 token 预算的 RL 迭代剪短思维;Yuan 等对 token 打分后压缩 CoT;Lin 等在预训练中只对高效用 token 计损失。这些方法要么把长度本身当关键变量,要么依赖 token 级打分器或控制策略。本文的独特之处在于换成「结构位置」视角:把轨迹看作问题定义—探索推理—答案固化的三段功能结构,用分层注意力分析加答案困惑度因果实验证明冗余集中在中间的转接性步骤,从而把去冗余简化为「保头保尾、删中段」这一分段级配方——无需模型参与、无需打分、训练前一次性离线完成,与所有压缩式方法形成本质区别。

核心方法

直觉上,这就像高水平的学习者不再需要导师把每一步都讲透:模型经预训练已具备足够先验知识,只要知道轨迹的起点(问题如何定义)和终点(结论是什么),就能自行推断出中间缺失的环节,甚至补得比原文更合理。技术路线分三步。第一步是观察性分析:把模型生成答案时的 1D 注意力按轨迹相对位置平均,发现注意力峰值集中在轨迹首尾、中间步骤被系统性忽略,且分层模式呈现「早层(L2–6)看候选答案、中层(L25–35)兼顾问题定义与推理步骤、晚层(L60–64)回到开头做格式化」的演进。第二步是因果性分析:分别截断或替换开头、中间、结尾后重新生成答案——删中段后的答案与完整轨迹版本最相似(ROUGE-L/Jaccard/BLEU 均最高),用预训练模型自生成内容替换中段甚至让答案困惑度从 1.54 降到 1.52,而动首尾则困惑度升到 1.56/1.58。第三步据此提出 E-SFT:训练时只保留轨迹的前后两端。

核心创新是把推理轨迹的教学价值从「均匀信号」重新理解为「结构化信号」:开头承载问题定义与规划(两个数据集的早期区段中规划类步骤占 33% 与 49%),结尾承载结论固化(结论类占 30% 与 28%),中段则以演绎和回溯为主(演绎 54% 与 39%、回溯 14% 与 13%),多半是被推翻、改写后才走通的探索废路径。与已有方法的本质区别有三:其一,与按固定 token 上限截断相反,E-SFT 删的是中段、保的是首尾,取舍方向恰好与朴素截断相反;其二,与所有打分式过滤(LLM 压缩、困惑度、相似度)不同,它不需要任何模型参与,仅以 \n\n 为界按步数切分即可离线完成,零额外算力;其三,被删的中段并非信息损失,而是把学习信号转化为「让模型利用先验知识自行内插补全」的隐式正则,这解释了为何删掉内容反而涨点。

方法步骤详情

步骤一,切分:以 \n\n 为分隔把每条轨迹切成推理步。作者验证了该边界的合理性——在两个数据集各采样 200 个位置,跨 \n\n 发生语义转折的比例为 33.5% 和 28.0%,步内仅 2.5% 和 1.0%,是可靠的语义断点代理。步骤二,删中段:保留前 $n$ 步和后 $n$ 步、删除中间 $\text{total}-2n$ 步,s1K-1.1(平均 234 步)取 $n=100$,OpenThoughts3(平均 461 步)取 $n=200$,均约删 20% token;Figure B 显示性能对该比例不敏感,但过度截断会掉点。步骤三,训练:仅对保留 token 计算负对数似然 $\mathcal{L} = -\sum \log p_\theta(y_i, r_i^{\text{trim}} \mid x_i)$,流程复用 s1 与 Llama-Factory 仓库。步骤四,推广:GRPO 中把中段 20% token 保留在上下文并参与奖励计算、但不产生每 token 梯度;OPD 中对中段 20% 做步级或 token 级的蒸馏损失屏蔽。

技术新颖性

新颖性体现在三个层面。实证层面:首次用「分层注意力分析 + 答案困惑度因果替换」的双重证据系统证明 LRM 轨迹的中间步骤对最终答案贡献极小——用预训练模型自生成内容替换中段后,答案困惑度不升反降(1.54→1.52),直接反驳了「完整 CoT 都是必要监督」的默认假设。方法层面:极简到近乎反直觉——不训练打分器、不调用外部 LLM、不做相似度计算,只做确定性的首尾保留;对照实验显示五种替代方案要么更差(Claude 压缩平均掉 13.43 点、Gemini 掉 23.96 点),要么需数小时 H100 算力(困惑度过滤单节点超 2 小时)仍不敌 E-SFT 的 75.19。粒度层面:OPD 实验中步级 mask(+2.2)显著优于 token 级 mask(+0.7),说明「推理步」而非「token」才是冗余的自然载体,为推理数据工程提供了新的操作单元。

Averaged 1D attention weights across reasoning trajectories during answer generation.
Figure 2: Averaged 1D attention weights across reasoning trajectories during answer generation.

实验结果

试点实验(Table 1)率先显示:s1K-1.1 上 Qwen2.5-32B 保头保尾版平均 75.19,高于完整轨迹的 73.51;Qwen3-8B 为 64.48 对 63.91。机制分析(Figure 2、3,Table 2)证实注意力峰值在首尾、删中段后答案相似度最高、替换中段使答案困惑度降至 1.52(替换首尾升至 1.56/1.58)。主结果(Table 3/B):Qwen2.5-32B&s1K-1.1 平均 73.51→75.19(AIME24 64.44→68.89);Qwen3-8B&OT3-100K 65.78→67.50;Qwen3-4B 58.97→60.04(AIME24 36.67→40.00)。通用能力不受损(Table 4:MMLU 72.90 对 SFT 的 72.53)。过滤对比(Table 5/6)中 E-SFT 的 75.19 优于最佳对照 PPL-high 的 74.43,LLM 压缩仅 60.08。跨目标迁移(Table 7/8):GRPO 上 Qwen3-1.7B-Base 25.8→34.5(MATH500 39.3→60.7),OPD 步级 mask 61.2→63.4,优于 token 级的 +0.7。LLM-as-judge 以 22% 对 19% 偏好 E-SFT 轨迹;推理期截断中段 25–75% 性能几乎不变(Table D),端到端省 4.5% 时间。

Average performance for segment variants across AIME24, GPQA-D, and MATH. Both (Prefix+Suffix) retained trajectories achieve the best overall performance.
Table 1: Average performance for segment variants across AIME24, GPQA-D, and MATH. Both (Prefix+Suffix) retained trajectories achieve the best overall performance.
Answer perplexities under segment-wise replacement of reasoning trajectories.
Table 2: Answer perplexities under segment-wise replacement of reasoning trajectories.
Performance of segment-level SFT on three benchmarks.
Table 3: Performance of segment-level SFT on three benchmarks.
E-SFT on language-centric and code generation benchmarks using Qwen3-4B-Base and OpenThoughts3-100K.
Table 4: E-SFT on language-centric and code generation benchmarks using Qwen3-4B-Base and OpenThoughts3-100K.
Comparison with resource-free filtering strategies on s1K-1.1.
Table 5: Comparison with resource-free filtering strategies on s1K-1.1.
Comparison with resource-intensive filtering strategies on s1K-1.1 (Qwen2.5-32B).
Table 6: Comparison with resource-intensive filtering strategies on s1K-1.1 (Qwen2.5-32B).
Applying E-SFT to GRPO on DAPO-17k.
Table 7: Applying E-SFT to GRPO on DAPO-17k.
Applying E-SFT to OPD on OpenThoughts3, with Qwen3-1.7B as the student and Qwen3-8B as the teacher.
Table 8: Applying E-SFT to OPD on OpenThoughts3, with Qwen3-1.7B as the student and Qwen3-8B as the teacher.
Changes in generated reasoning traces by E-SFT.
Figure 4: Changes in generated reasoning traces by E-SFT.
Token length changes compared to “Baseline length” from a standard SFT model.
Figure 5: Token length changes compared to “Baseline length” from a standard SFT model.
Lowered perplexity using E-SFT vs. baseline during training.
Figure 6: Lowered perplexity using E-SFT vs. baseline during training.
查看结构化数据
任务指标本文基线提升
AIME24(Qwen2.5-32B-Instruct + s1K-1.1) 准确率 % 68.89(E-SFT) 64.44(标准 SFT,完整轨迹) +4.45
AIME24(Qwen3-4B-Base + OpenThoughts3-100K) 准确率 % 40.00(E-SFT) 36.67(标准 SFT) +3.33
三基准平均(Qwen3-8B-Base + OpenThoughts3-100K) AIME24/GPQA-D/MATH 平均 67.50(E-SFT) 65.78(标准 SFT) +1.72
GRPO 后训练(Qwen3-1.7B-Base + DAPO-17k) 三基准平均 34.5(屏蔽中段 20% 梯度) 25.8(GRPO 基线) +8.7
OPD 在线蒸馏(学生 Qwen3-1.7B ← 教师 Qwen3-8B) 三基准平均 63.4(步级 mask) 61.2(OPD 基线) +2.2(token 级仅 +0.7)
对比资源密集型过滤(s1K-1.1,Qwen2.5-32B) 三基准平均 75.19(零额外算力) 74.43(PPL-high,最佳对照,需 H100 节点 >2 小时打分) +0.76 且计算成本近乎为零

局限与改进

作者承认的局限:收益强依赖基座能力——s1K-1.1 上只有基座平均性能超过约 60–65 才有增益,Llama-3.2-3B-Instruct 完全无增益(33.50→33.50),说明弱模型缺乏可靠补全被删内容的能力;删除比例虽稳健但仍是超参数,过度截断会掉点,且缺少原则性的截断规则,只能依赖「约删 20%」的启发式。我补充的观察:其一,\n\n 只是代理边界,约七成的 \n\n 并非语义转折,教师模型输出格式一旦变化(如无空行分隔)配方可能失效;其二,AIME24 仅 30 题、每题采样 3 次取平均,+4.45 的提升处于高方差区间,论文未报告显著性检验;其三,功能构成分析(Table A)仅标注每数据集 30 条轨迹、每区段 12 步,样本量偏小;其四,20% 的删除比例可能与教师轨迹的冗余率耦合,面对更长更啰嗦的教师模型是否仍最优未知;其五,GRPO/OPD 实验只训 100 步且限于 1.7B 模型,向更大规模外推未经检验。

独立分析的弱点

弱点一:保头保尾隐含「两端皆有用」的假设,但结尾也常含答案前的冗余重申,且固定 $n$ 步对长短轨迹一刀切——改进方向是按注意力或熵信号为每条轨迹自适应选择保留窗口。弱点二:只删中间连续一段,而真实冗余可能分散多处(反复验证多出现在中后段)——可先检测「Wait / Alternatively / Hmm」等回溯语言标记再做非连续多段删除。弱点三:何时有效缺乏可操作判据:论文只给出「基座要够强」的散点观察(阈值约 60–65),没有可事先度量的指标,实践中难以判断该不该用——可设计廉价的 pre-flight 检验,例如在少量样本上比较删段前后的训练损失或答案困惑度变化。弱点四:评测集中在数学与科学 QA,代码仅有 LiveCodeBench 且提升可忽略(38.40→38.47),agentic、多轮工具调用等长轨迹场景完全未验证。弱点五:与 RL 的结合只做了 mask 消融,「先 E-SFT 预热再 GRPO」的两阶段流水线是否能叠加收益尚未探索。

未来方向

作者提出的方向:把中段截断扩展为推理期加速手段(Section D 已显示 33% 截断可减少约 46% 的二次预填充计算、端到端省 4.5% 时间),进一步可让模型学会预测哪些中段可跳过,实现难度感知的自适应推理;以及把段级去冗余思想延伸到 mid-training/预训练的 token 效率研究,与高效用 token 训练(Rho-1 风格)衔接。基于本文成果可延伸的方向:其一,训练一个轻量「步骤价值头」在线估计每步是否应纳入损失,统一 SFT/GRPO/OPD 三种目标下的屏蔽策略并自动决定删除比例;其二,既然 100K 子集加删中段已足够,推理数据配方(选哪些题)与信号配方(每条轨迹学哪些部分)应当联合优化,OpenThoughts3-1.2M 全量的必要性值得重估;其三,E-SFT 使过长输出变短、过短输出变长的行为可被用作隐式长度控制器,与 overthinking 研究结合;其四,在多模态与工具调用轨迹上检验首尾监督假设;其五,把中段冗余建模为噪声标签,给出「删中段等价于正则化」的理论分析。

复现评估

复现条件非常友好。所有组件开源:模型(Qwen2.5/Qwen3/Llama 系列)、数据集(s1K-1.1、OpenThoughts3-1.2M、DAPO-17k)、框架(s1、OpenThoughts、Llama-Factory、lm-evaluation-harness),作者承诺代码公开。E-SFT 本身只是确定性数据预处理(按 \n\n 切步、保留首尾各 $n$ 步),几行脚本即可实现,边际算力为零。关键超参齐全:$n=100/200$、s1K 训 5 epochs、OT3 训 1 epoch、GRPO 用 $\eta=10^{-6}$、batch 32、8 rollouts、KL 系数 0.001;OPD 用 $\beta=0$、生成损失权重 0.1。算力参考:Qwen2.5-32B 在 OT3-100K 上 1 epoch 约 20 小时 × 16 张 H100,单机 8×H100 跑两倍时间即可复现主表。主要不确定性在评测噪声:AIME24 仅 30 题、每题采样 3 次,1–2 点增益需多种子确认;LLM-as-judge 依赖 GPT-OSS-120B。总体难度:中低。