无思维链数据下的训练策略再审视:下一块推理强化学习真的优于SFT吗 Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data
混合SFT以不到1/60的算力在RLVR后全面超越下一块推理RL
前置知识
no-CoT 数据
指不含显式思维链(chain-of-thought)标注、但仍蕴含知识与解题模式的语料,例如教材例题解答、定理推导过程、AoPS 上的标准题解。它们直接给出结论或压缩过的推导步骤,没有展开式的思考痕迹,但推导链条本身是完整的。与 long-CoT 数据(由强模型 rejection sampling 生成、带显式 标记的完整思考轨迹)相对。
本文研究的核心问题就是如何利用这类无思维链数据:是直接 SFT,还是先用下一块推理 RL 重建推理痕迹。理解 no-CoT 与 long-CoT 数据在格式和内容上的差异,是读懂全部实验设计的前提。
RLVR(可验证奖励强化学习)
Reinforcement Learning with Verifiable Rewards,用规则化的可验证奖励(如数学答案精确匹配、代码单元测试通过)替代人类偏好模型做强化学习,通常以 GRPO 等策略梯度算法实现:对每个 prompt 采样一组回答,按组内相对优劣计算优势并更新策略,无需训练价值模型。
本文所有训练策略最后都接同一个 RLVR 阶段,论文主张用 post-RLVR 精度上限而非中间 checkpoint 分数来评价 no-CoT 数据利用策略,RLVR 是贯穿全文的统一评测终点。
下一块推理 RL(Next-Chunk Reasoning)
把『预测下文』改造成可被 RL 优化的推理任务:模型先生成隐式推理,再据此预测下一块内容,奖励取决于预测是否命中原文。按粒度分两类:NTR(next-token reasoning,如 RPT/RLP/RMT)奖励下一 token 的前缀匹配;NSR(next-sentence reasoning,如 RLPT/PretrainZero)用生成式裁判模型判断预测句子与原文的语义一致性。
这是被论文重新审视的对象。要理解论文结论——NCR 的收益并非来自其推理重建机制——必须先理解 NTR/NSR 的目标设计与奖励方式,以及它们与普通 SFT 的本质区别。
熵过滤器(entropy filter)
NTR 类方法(如 RPT)假设『高熵 token = 难预测 = 需要推理』,因此先用一个模型在 no-CoT 语料上计算逐 token 的下一 token 熵,只保留熵最高的前 20% 作为 RL 的预测目标,试图把训练信号集中在真正需要推理的位置。
论文的 Observation 1 直接证伪了这一假设:在 2048 个高熵 token 上,不带推理的直推准确率约 0.48,说明近半数目标无需推理即可命中,高熵只反映语料的局部不确定性而非推理难度。这是理解 NCR 失效机制的关键。
avg@n 与 pass@n
两种抽样评测指标:avg@n 对每题采样 n 次取平均正确率,反映期望单次表现;pass@n 只要 n 次中有一次正确即算正确,反映能力上限。论文在 AIME/HMMT/IMO-Answer 上用 avg@32,GPQA-Diamond 用 avg@4,HLE 与 MMLU-Pro 用 pass@1。
主表用 avg@n、附录用 pass@n 是重要细节:post-RLVR 后 pass@n 会饱和(各法都到 93.33),avg@n 才能区分初始化策略的优劣,读懂这两个指标才能正确解读表格。
研究动机
推理后训练高度依赖长思维链(long-CoT)示范,而这些示范通常要靠强推理教师模型 rejection sampling 出的正确轨迹得到,成本高、难以规模化。相比之下,大量现成语料——如 AoPS 上的完整题解、教材推导、研究论文——虽然富含推理所需的知识与解题模式,却没有显式思维链标注。本文爬取的语料规模对比很直观:long-CoT 数据只有 152K 条(约 1.95B tokens),而 no-CoT 题解有 421K 条(约 0.53B tokens)。直接对 no-CoT 数据做 SFT 有已知风险:它缺少 … 标记和统一答案格式,会破坏模型已有的长 CoT 推理格式。于是 RPT、RLP、RMT、RLPT、PretrainZero 等工作提出下一块推理 RL(NCR)来利用这类数据,并报告了优于 SFT 的结果。但这些工作的 SFT 基线只在 no-CoT 数据上单独训练,得到的格式崩坏 checkpoint 本就不是后续 RLVR 阶段的合理参照,『RL 优于 SFT』的结论因此存疑。
本文的目标是论文的目标是在受控条件下回答一个直白的问题:在相同的 no-CoT 数据、相同的基座模型和相同的 RLVR 预算下,下一块推理 RL 是否真的比 SFT 更能利用无思维链数据?为此作者构造了五方公平对比:从同一个 Qwen3-30B-A3B-Base 出发,比较 NTR(RPT 式)、NSR(RLPT 式)、Sequential SFT(先 no-CoT 后 long-CoT 两阶段)、Mixed SFT(单阶段混合训练,论文补上的缺失基线)以及 Reasoning SFT(只用 long-CoT 的对照),全部接完全相同的 GRPO + DAPO-Math-17K RLVR 阶段,并把 post-RLVR 精度(九个基准上的最终上限)作为首要指标,而非中间 checkpoint 的 pre-RLVR 分数。论文还进一步给出机制解释:为什么 NCR 打不过 Mixed SFT,以及为什么 Mixed SFT 的 pre-RLVR 分数最低、最终上限却最高。
与已有工作不同的是,独特切入角度有三层。第一,指出此前 NCR 文献的比较对象是错的:Table 1 显示五个代表性工作没有一个与 Mixed SFT 比过,RLPT 和 PretrainZero 甚至没有与 no-CoT SFT 比过;有的从 reasoning 模型出发(RPT/RMT/RLPT),有的从 base 模型出发(RLP/PretrainZero),先验后训练带来的混淆从未被清除。第二,提出把评价时机从 pre-RLVR 挪到 post-RLVR:已有工作都在中间 checkpoint 上比高低,而论文发现 pre-RLVR 分数与最终上限系统性背离——Mixed SFT pre-RLVR 平均仅 27.5,比其他方法低约 20 分,post-RLVR 却以 61.1 居首。第三,不只停在性能对比,而是做了机制层面的六个观察(熵过滤器失效、痕迹退化为局部补全、保熵无用、增益叠加无效、pre-RLVR 下跌是格式伪影、Sequential SFT 跨阶段遗忘),把『哪种训练策略更好』上升为『为什么』。
核心方法
整体思路先用直觉说:与其花 60 多倍算力让模型在 RL 里『学着预测下一块文本』,不如在 SFT 阶段把 no-CoT 知识直接喂进去、同时保住 long-CoT 格式,剩下的能力提升交给后面的 RLVR 去放大。技术路线上,论文从同一基座 Qwen3-30B-A3B-Base 构造五条流水线:(1) Reasoning SFT 只用 152K 条 long-CoT 轨迹;(2) Sequential SFT 先在 421K 条 no-CoT 题解上、再在 long-CoT 上各做一阶段 SFT;(3) Mixed SFT 把两类数据合并在单个 SFT 阶段训练;(4) NTR 按 RPT 的做法,只取语料中熵最高的前 20% token,让模型生成推理后预测下一 token,按字节级前缀匹配给奖励;(5) NSR 按 RLPT 的做法做句子级预测,用 gpt-oss-120b 作生成式裁判。所有数据都爬自 AoPS,long-CoT 由 DeepSeek-V3.2 生成并只保留答案正确的轨迹。五条流水线最后进入同一个 RLVR 阶段:GRPO 算法、DAPO-Math-17K 训练集、规则精确匹配奖励。
核心创新不是新算法,而是补上缺失基线和错误评价时点这两个方法论漏洞。已有 NCR 工作声称『RL 比 SFT 更会利用 no-CoT 数据』,但它们的 SFT 基线只喂 no-CoT 数据,会把模型的长 CoT 格式打乱,用这种格式崩坏的 checkpoint 去接 RLVR 本来就不公平。Mixed SFT 的关键洞察是:no-CoT 数据的价值在于知识和推导模式,long-CoT 数据的价值在于输出格式,两者可以在单阶段内同时注入——代价是暂时打乱输出结构,但这只是格式伪影,RLVR 的可验证奖励能很快修复。与此相对,Sequential SFT 的第二阶段 long-CoT 训练会覆盖第一阶段学到的 no-CoT 知识(保留探针上 59.19 对 68.63),而 NTR 的 RL 目标把大量算力花在局部可预测的 token 上。本质区别在于:NCR 试图『重建推理过程』,Mixed SFT 直接『吸收知识、保留格式』,把推理优化完全留给 RLVR。
方法步骤详情
完整流程如下。第一步,数据构建:爬取 AoPS 题目与题解,用 DeepSeek-V3.2(最大生成长度 64K tokens)对部分题目生成推理轨迹,只保留最终答案正确的样本,得 152K 条 long-CoT(约 1.95B tokens);原始题解作为 no-CoT 数据共 421K 条(约 0.53B tokens);全部训练数据与评测集去重防污染。第二步,策略训练:SFT 用标准逐 token 负对数似然损失 $\mathcal{L}_{\text{SFT}}(\theta) = -\mathbb{E}_{(x,y)\sim\mathcal{D}_{\text{SFT}}}\left[\frac{1}{|y|}\sum_{t=1}^{|y|}\log\pi_\theta(y_t\mid x, y_{<t})\right]$,单 epoch、最大序列长 131072;NTR 先用 Qwen3-30B-A3B 算全语料逐 token 熵、取 top-20%,对每个前缀采 64 个 rollout,奖励为字节级前缀匹配 $r_i=\mathbf{1}[\bar{y}_i=\bar{x}_{\geq t}[1:l]]$;NSR 按句子切分语料,用 gpt-oss-120b(reasoning_effort=high)判断预测句与原句的语义一致性给 0/1 奖励;两者都用 GRPO 优化。第三步,统一 RLVR:GRPO、精确匹配奖励、学习率 1e-6、关闭 KL 惩罚、全局 batch 256、每题 16 个 rollout、最大回复 32K tokens、64 张 H200。第四步,评测:AIME/HMMT/IMO-Answer 报 avg@32,GPQA-Diamond 报 avg@4,HLE 与 MMLU-Pro 报 pass@1;解码统一 temperature 0.8、top-p 0.999、最大 64K tokens。
技术新颖性
技术新颖性体现在四个方面。其一,受控实验设计:五个策略从同一 base 模型出发、用同一批数据、接同一个 RLVR,把『范式差异』从『初始化差异』和『数据差异』中剥离出来,这是此前 NCR 文献没有做过的。其二,Mixed SFT 的角色重新定位:DeepSeek-R1 的二阶段 SFT、Qwen3 的 Thinking Mode Fusion、LS-Mixture 都把长/短 CoT 混合当作 RL 之后的恢复步骤或独立配方,本文首次系统研究『用 long-CoT + 原始 no-CoT 文本做混合 SFT 来初始化后续 RLVR』这一用法。其三,机制分析工具链:2048 个高熵 token 的推理/直推双准确率探针、熵控制版 NTR(组成功率 $\rho=n_+/n$ 的随机丢弃概率 $p_{\text{keep}}(\rho)$,加上批熵 $\bar{H}<0.5$ 时对正优势乘 0.75 的降权)、100 题 avg@8 保留探针,这些诊断实验把『NCR 为何无效』拆成可验证的因果链。其四,明确揭示『pre-RLVR 分数不能预测 post-RLVR 上限』这一反直觉规律,对整个领域的评测方法论都有警示意义。
实验结果
核心发现可按实验逐条看。(1) 主表(Table 2):post-RLVR 后 Mixed SFT 在六个域内基准上平均 67.4 分,比次优的 NTR(64.2)高 3.1 分、比 NSR(63.6)高 3.7 分;具体为 AIME24/25/26 = 87.50/85.73/70.42,HMMT25/26 = 55.00/51.52,IMO-Answer 54.00,全面高于 Reasoning SFT+RLVR(如 AIME24 仅 81.98)和 Sequential SFT+RLVR(AIME24 仅 74.90)。(2) OOD 泛化:HLE 9.24、GPQA-Diamond 60.98、MMLU-Pro 75.84 均为五法最高,说明优势不是数学特化过拟合。(3) 算力:Figure 2 显示 SFT 仅 65.6 GPU 时(1×),NSR 4283.7 时(65×)、NTR 4608.1 时(70×)。(4) 评测时机:Figure 3 显示 Mixed SFT pre-RLVR 平均 27.5(比其他方法低约 20 分)却以 post-RLVR 61.1 登顶,提升 33.7 分是其他方法(提升 3.3–10.3)的三倍以上。(5) 熵过滤器检验:2048 个高熵 token 上推理准确率从 0.29 升至 0.55 而熵几乎不变,直推准确率稳定在约 0.48,证明近半数『难 token』无需推理。(6) 熵控制 NTR:保住熵约 0.52 和长度约 640 token 后,post-RLVR 反而全线略降(如 AIME25 83.71 对 84.38)。(7) 叠加检验:Mixed SFT 后再插 NTR/NSR 阶段,AIME24 从 87.50 变为 86.35/87.21,无增益。(8) 遗忘探针:100 道 no-CoT 训练题上 avg@8,Mixed SFT+RLVR 68.63 对 Sequential SFT+RLVR 59.19。(9) pass@n 饱和:post-RLVR 后各法在 AIME24/25 上 pass@n 都到 93.33,Mixed SFT 仍在 8/9 个基准并列或居首,avg@n 的差异才反映真实差距。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 域内数学推理(AIME24/25/26 + HMMT25/26 + IMO-Answer 六基准平均) | post-RLVR avg@32 平均分 | Mixed SFT + RLVR:67.4 | 最强 NCR 变体 NTR(Reasoning SFT + NTR + RLVR):64.2 | +3.1 分,且训练算力仅为 NTR 的约 1/70 |
| AIME 2024(域内) | post-RLVR avg@32 | 87.50 | Reasoning SFT + RLVR 81.98;NTR + RLVR 87.50 | 对 Reasoning SFT + RLVR +5.52 分;与 NTR 持平但算力低约 70 倍 |
| HLE(域外) | pass@1 | 9.24 | NTR + RLVR 7.68;Reasoning SFT + RLVR 7.22 | +1.56(对 NTR) |
| GPQA-Diamond(域外) | avg@4 | 60.98 | NTR + RLVR 57.70;Reasoning SFT + RLVR 56.94 | +3.28(对 NTR) |
| MMLU-Pro(域外) | pass@1 | 75.84 | Reasoning SFT + NSR + RLVR 74.89;Reasoning SFT + RLVR 73.95 | +0.95(对次优 NSR) |
| no-CoT 知识保留探针(100 道训练见过的题) | avg@8 | Mixed SFT + RLVR:68.63 | Sequential SFT + RLVR:59.19 | +9.44,证明混合训练避免了跨阶段遗忘 |
| 训练算力(同量 no-CoT 数据,160 步) | GPU 小时 | SFT:65.6(1×) | NSR:4283.7(65×);NTR:4608.1(70×) | 节省超过 60 倍训练算力 |
局限与改进
作者承认的局限有两点:一是 Mixed SFT 只试了一个固定的 no-CoT/long-CoT 混合比例,没有探索比例扫描、某一数据源稀缺时的表现,以及『吸收知识 vs 保住格式』的权衡;二是训练语料和几乎全部评测集中在数学(OOD 也只有 GPQA 涉及理化生),结论能否迁移到代码、多语言等 no-CoT 结构不同的领域仍是开放问题。我的补充观察:其一,NCR 只实例化了 RPT 和 RLPT 两个代表,未覆盖 RMT(mid-training 场景)、RLP(预训练阶段)和 PretrainZero,结论对训练阶段更早的 NCR 变体未必同样成立;其二,只用了 Qwen3-30B-A3B 这一个 MoE 基座,规模与架构上的泛化性未知;其三,no-CoT 与 long-CoT 数据同源于 AoPS,分布高度一致,混合训练的红利在异源数据上是否保持需要检验;其四,NSR 依赖 gpt-oss-120b 做生成式裁判,裁判成本与噪声未单独讨论;其五,Mixed SFT 的 pre-RLVR 大跌意味着任何基于中间 checkpoint 的早停或模型选择流程都会错杀它,而论文只给出了保留探针这一初步的廉价识别方案。
独立分析的弱点
独立分析的弱点:第一,混合比例未扫描——不同比例可能显著改变格式冲突强度与知识吸收量,改进方向是做比例扫描并给出自适应配比(如按数据源 token 数或梯度冲突动态调整),甚至设计共享优化器的软两段式方案。第二,熵过滤器被证伪,但论文没有给出替代的目标选择标准——可以用语义难度(如 PMI、压缩率、跨模型分歧度)替代 token 熵来挑真正需要推理的位置,这可能让重建式 RL 真正产生增益。第三,Mixed SFT 训练中的格式不稳定虽是瞬态的,但会拖慢 RLVR 收敛——可以给 no-CoT 数据包一层轻量格式模板(统一 边界与 \boxed{} 答案格式)来缓解冲突。第四,RLVR 只在数学上做,OOD 增益可能主要来自 SFT 阶段——补充多领域 RLVR(代码、科学 QA)实验才能确认上限差异的来源。第五,所有 SFT 只跑单 epoch、RLVR 只训练约 200 步,更长训练是否会改变『NCR 无增益』的结论未被排除。每个弱点都对应一个可执行的后续实验。
未来方向
作者提出的方向:系统扫描 no-CoT/long-CoT 混合比例,包括单一数据源稀缺的情形;把结论推广到代码生成、GPQA 之外的科学推理、多语言等结构不同的 no-CoT 领域。基于成果可延伸的方向:其一,重新设计下一块推理 RL 的目标选择——既然 token 熵不等于推理难度,可以探索基于信息论或模型间一致性的难度度量,或在 Mixed SFT 之上只对真正难的位置做重建 RL(论文已证明整体叠加 NTR/NSR 无增益,『选择性叠加』是最后的可能空间);其二,把 Mixed SFT 与 mid-training 结合,在预训练中后期就混入 no-CoT 知识;其三,建立『管线感知』的评测协议,用廉价探针(如 100 题保留探针)替代昂贵的全流程对比来预测 post-RLVR 上限;其四,研究 RLVR 放大潜在知识的条件与边界——什么类型的 no-CoT 知识能被可验证奖励放大、什么不能;其五,在更大规模、dense 架构或多轮 RLVR 预算下复验结论的稳健性。
复现评估
复现条件总体友好但需要相当算力。开源情况:基座 Qwen3-30B-A3B-Base、裁判模型 gpt-oss-120b、RL 训练集 DAPO-Math-17K 均公开;AoPS 数据可自行爬取;long-CoT 需通过 DeepSeek-V3.2(最大 64K 生成长度)做 rejection sampling 生成;论文正文未明确承诺放出代码与数据,需自行实现。超参数给出得很完整:SFT 单 epoch、序列长 131072;RL 学习率 1e-6、KL 关闭;NTR 全局 batch 4096、每前缀 64 个 rollout、回复长 2K;NSR 与 RLVR batch 256、16 个 rollout、回复长 32K;解码 temperature 0.8、top-p 0.999。算力门槛:RL 阶段各需 64 张 H200,SFT 约 65.6 GPU 时,若复现 NTR/NSR 对比则各需约 4300–4600 GPU 时,long-CoT 生成还需大量 DeepSeek-V3.2 API 调用。主要工程难点在 128K 长序列 SFT 和多节点 GRPO 训练框架。综合评估:对有百卡级集群的团队,复现主结论(Mixed SFT 对比)难度中等;复现全部五条流水线与机制分析难度中高。
论文图表
并排展示 Mixed SFT 在 RLVR 前的两种典型失败输出:一种是完全跳过 <think> 块、直接列步骤给答案的 no-think 回答;另一种是同一回复里出现多个互相断裂的 <think> 段。两者的数学内容大体正确,但推理过程被打乱。
让读者直观看到『格式伪影』具体长什么样,理解为什么 pre-RLVR 分数会暴跌而知识并未丢失。
展示一个具体案例:语料上下文以『4.』结尾,模型只需用极短的局部补全推理出下一个词是 Compute 并输出 \boxed{Compute} 即可拿满奖励——即便在名义上最难的 top-20% 高熵目标上,多数情况也能靠几个前缀 token 的局部模式完成。
定性证据:NTR 的重建奖励可以被模板化局部补全满足,无需长程推理,解释了为什么这种训练练不出推理结构。
展示 NSR 的一次完整训练轨迹:给定一道代数题解的前缀(进行到第 10 步 $3(z-x)^2=32$),模型在 <think> 中推理『下一步应是两边除以 3』,最终输出下一句 Divide both sides by 3: $(z-x)^2=\frac{32}{3}$,由生成式裁判判断与原句一致。
直观呈现句子级重建任务的形式,看出它本质上是『续写下一句』,印证 Observation 2 中 NSR 退化为局部续写的判断。
展示一条 long-CoT 训练样本:数论题(求使 $p^2 \mid n^6+1$ 有解的最小素数 $p$ 及对应最小 $m$),附 DeepSeek-V3.2 生成的冗长 <think> 探索轨迹和带 Hensel 引理提升、以 \boxed{7} 收尾的规范解答。
让读者理解 long-CoT 数据的格式约定(显式 <think> 标记、规范答案格式),这是 Mixed SFT 中与 no-CoT 数据发生格式冲突的另一方。
展示一条 no-CoT 训练样本:整数分组余数证明题,解答是 13 步压缩推导(利用 $\mathbb{Z}/(2n\mathbb{Z})$ 加法表是拉丁方),直接给出结论并以 $\blacksquare$ 结束,全程没有思维链痕迹。
no-CoT 数据的形态是理解全文问题的起点:这类数据有完整推导但无推理过程展示,正是『知识丰富但痕迹缺失』的典型。