← 返回 2026-07-20

从预训练到后训练:以国际象棋为测试床研究推理能力的形成 Understanding Reasoning from Pretraining to Post-Training

Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov 📅 2026-07-17 👍 28 2026-07-25 18:30
GRPO 国际象棋 强化学习 推理 缩放律 预训练

用国际象棋测试床建立预训练-RL联合缩放律并揭示RL机制

前置知识

Group Relative Policy Optimization (GRPO)

GRPO 是一种策略梯度强化学习算法,常用于 LLM 推理后训练。它不需要单独训练价值网络,而是对同一问题采样一组(group)轨迹,用组内相对优势(某条轨迹的奖励减去组内均值)作为优势估计来更新策略,从而降低方差。本文从 SFT 策略出发,用 GRPO 在带可验证奖励的国际象棋谜题上优化模型。

本文的 RL 阶段完全依赖 GRPO,理解它能明白论文中 1000-5000 步 RL 训练与二值奖励如何驱动策略改进,也是把'后训练'与预训练区分开的核心机制。

缩放律与 Chinchilla 律

缩放律(scaling law)用幂律/对数线性函数描述模型损失随参数量 $N$、数据量 $T$、算力 $C$ 的变化。Hoffmann et al. (2022) 提出的 Chinchilla 律进一步给出固定算力下参数与 token 的最优分配,并给出损失预测 $L(N,T)=0.414+95.4N^{-0.404}+1.62\times10^5 T^{-0.677}$(本文拟合)。本文把这种预训练损失预测与后 RL 性能挂钩。

论文的核心贡献就是在 Chinchilla 预训练律之上叠加 RL 维度,形成联合缩放律。不懂 Chinchilla 律就看不懂作者如何把预训练损失代入后 RL 性能预测、如何外推算力前沿。

pass@k 指标

pass@$k$ 指对同一问题采样 $k$ 次,只要其中至少一次答案正确即算通过的概率。$k=1$ 衡量模型'一击命中'的能力,$k$ 较大时衡量模型候选解的覆盖广度。本文在 1,480 道战术谜题上报告 pass@1 与 pass@16,发现 RL 大幅提升 pass@1 但对 pass@16 改善有限。

pass@1 与 pass@16 对预训练/RL 的不同敏感性是本文关键结论之一,也是机制分析(RL 放大已偏好走法 vs. 从尾部挖掘新走法)所要解释的现象。

IsoFLOP 曲线

IsoFLOP 曲线是在若干固定算力(FLOPs)水平下,画出不同模型规模对应的验证损失,从而在每个算力水平找到损失最低的最优参数-token 组合。本文对 10 个模型规模扫掠 11 个预训练算力预算($6.5\times10^{16}$ 到 $6.5\times10^{19}$ FLOPs),确认最优分配在验证损失、pass@1、pass@16 上一致。

IsoFLOP 扫掠是构建预训练基线检查点的手段,也是后续固定预算前沿分析与联合律拟合的数据来源,理解它才能看懂 Figure 2、Figure 4 的前沿如何得到。

合成思维链推理轨迹

不同于以往棋类模型外挂 MCTS/beam search,本文让预训练模型作为提案策略采样 $K$ 条续走,按公共前缀合并成一棵以谜题状态 $s_0$ 为根的树,再深度优先序列化为 $r=\langle T\rangle \tilde\tau_1\langle sep\rangle\cdots\tilde\tau_m\langle/T\rangle$ 的 token 序列作为'思维链'。训练时让模型在该轨迹后给出最佳解,从而把推理'写进上下文'。

这条 SFT 配方(带推理轨迹)被证明能同时提升所有 pass@$k$,是后续所有 RL 实验统一采用的初始化,决定了实验对比的公平性。

研究动机

强化学习(RL)已成为提升大型语言模型(LLM)复杂推理能力的核心手段,但 RL 后训练通常被孤立研究,与它所依赖的预训练阶段割裂。这导致两个基本问题长期悬而未决:(1)预训练选择(模型规模、数据量)如何决定 RL 计算的回报;(2)RL 究竟对模型做了什么。在标准 LLM 场景下研究这些问题困难重重:预训练语料庞大且不可控,难以将某种行为归因于预训练还是 RL;在两个阶段同时做系统性算力扫掠在 frontier 规模下成本高到不可承受。此外学术界对 RL 作用存在尖锐分歧:Yue et al. (2025) 认为 RL 主要是在'锐化'基座已有的推理模式;Yuan et al. (2025) 持相反观点,认为 RL 能把预训练技能组合成全新能力;Sun et al. (2025) 则报告两种现象并存。这些分歧直接影响算力分配决策——若 RL 主要锐化,应多投预训练;若 RL 能真正'发现',则应多投 RL。

本文的目标是本文的总体目标是定量刻画预训练与 RL 后训练之间的交互界面,回答两个核心研究问题。RQ1(算力分配):在不同总算力预算下,预训练与 RL 之间的不同分配会诱导出怎样的最终性能前沿(frontier)?RQ2(预测 RL 缩放):预训练属性(模型规模 $N$、预训练 token 数 $T$、预训练损失 $L_{pt}$)能否预测某一算力区间内的 RL 缩放行为?此外,作者希望从机制层面回答 RL 到底如何重塑它所继承的策略——是放大已有偏好、还是从尾部'挖掘'出近乎缺失的正确走法、抑或强化错误模式——并考察所发现的规律能否从国际象棋迁移到自然语言的数学领域,最终给出一份可指导实践算力分配的量化账本。

与已有工作不同的是,本文的独特切入角度是用'国际象棋'作为可控测试床(testbed)来隔离研究预训练与 RL 的交互。国际象棋拥有紧凑、显式的动作空间(词表 $|V|=81$),每步走法都能通过棋局结果或强引擎精确验证,从而在推理轨迹每一步提供地面真值(ground truth)。人类对局数据充足且可精细控制——可按棋手 Elo、对局长度下采样而无需复杂的数据配比决策。任务专用的小模型已能达到不错的水平,使横跨预训练与 RL 的算力扫掠既经济又有信息量。作者刻意复刻标准 LLM 训练管线:在 token 化的人类对局上自回归预训练、在合成推理轨迹上 SFT、在带可验证奖励的谜题环境上做 GRPO 强化学习。这样既保留 LLM 训练范式,又消除自然语言研究中语料不可控、评估只看最终答案、动作空间巨大且模糊等障碍。

核心方法

方法的整体思路是先直觉地理解'算力如何在预训练与 RL 间分配',再用受控实验建立量化规律。作者构建一套镜像标准 LLM 训练的三阶段管线。第一阶段预训练:从 Lichess 2022 年 Blitz/Rapid 人类对局收集 54B token 语料,训练 10 个 Qwen3 稠密模型(参数量 $\{5M,\dots,1B\}$),每局棋编码为交替走子 token 序列。第二阶段 SFT:用预训练模型作提案策略采样续走,按公共前缀合并成以谜题状态 $s_0$ 为根的搜索树,深度优先序列化为合成思维链,训练模型在该轨迹后给出最佳解。第三阶段 RL:从 SFT 策略出发用 GRPO 在 156K 道质量过滤的 Lichess 谜题上优化,奖励为二值 $R(\zeta,s_0)=\mathbf{1}[a_1=a^*_1,\dots,a_H=a^*_H]$,只有每步都正确才给 1。作者扫掠 36 组预训练-RL 组合,并在 1,480 道战术谜题基准上评估,谜题分 5 个难度档 B1-B5。

核心创新是一条'联合预训练-RL 缩放律',把预训练损失、模型规模与 RL 算力统一进一个可外推的函数。与已有工作的本质区别在于:Khatri et al. (2025) 只对固定模型拟合 sigmoid 形式的 RL 缩放曲线,把预训练初始化当作给定;前人既未把下游性能与预训练损失定量挂钩,也未建模预训练数据规模如何改变 RL 提升速率。本文发现:在非饱和 RL 区间内,对 sigmoid 律做一阶泰勒展开可得到一个对 RL 算力对数线性的局部律 $R_{N,T}(C)=R^{ref}_{N,T}+B_{N,T}(\log_{10}C-\log_{10}C_{ref})$,其中参考奖励 $R^{ref}_{N,T}$ 由预训练损失高度预测、斜率 $B_{N,T}$ 近似线性依赖预训练 token 数。进一步把该局部律与 Chinchilla 预训练损失律结合,就能不实际训练就评估任意配方 $(N,T,C_{RL})$ 的最终性能,从而描绘算力最优前沿。另一关键创新是用机制分析把'RL 做了什么'分解为对走法分布的逐态重塑,而非笼统的'锐化'。

方法步骤详情

方法分六步。第一步(预训练扫掠):在 10 个规模上扫掠 11 个预训练算力预算($6.5\times10^{16}$ 到 $6.5\times10^{19}$ FLOPs,约 200M-52B token),得 IsoFLOP 曲线,确认固定算力下有最优参数-token 分配且在验证损失、pass@1、pass@16 上一致。第二步(SFT 配方):对比'仅训目标走子'与'训合成推理轨迹再给答案',前者只升 pass@1、后者提升所有 pass@$k$,故统一用带推理轨迹的 SFT。第三步(固定预算前沿):对 $\{20M,50M,200M,680M\}$ 各选 8-11 个检查点 SFT 后做 1000-5000 步 RL(50M 模型 2000 步约 160 H200 小时),统计每预算最优分配。第四、五步(拟合并外推联合律):对每条 RL 轨迹用最小二乘拟合 $(R^{ref}_{N,T},B_{N,T})$ 并回归 $f(L_{pt}),g(N,T)$,再在 13 规模、260 预算、每预算 400 种分配上网格搜索、代入 Chinchilla 律。第六步(机制分析):每谜题状态定义归纳策略 $\pi_\theta$,采样 128 条轨迹边缘化,把策略变化归为地面真值放大/尾部挖掘/错误模式放大($k=3,\epsilon_{tail}=0.05$)。

技术新颖性

技术新颖性体现在几个层面。其一,首次把'预训练损失预测后 RL 性能'与'预训练 token 数预测 RL 提升斜率'合并成单一可外推联合律 $R(C_{RL},N,T)=f(L_{pt}(N,T))+g(N,T)(\log_{10}C_{RL}-\log_{10}C_{ref})$,并给出拟合:$f(L)=0.0314+\exp(4.87-12.85L)$,$g(N,T)=-0.216+0.0172\log_{10}T+0.0098\log_{10}N$,Chinchilla 损失律 $L(N,T)=0.414+95.4N^{-0.404}+1.62\times10^5 T^{-0.677}$。其二,与把 RL 缩放当独立问题的前人不同,本文联合建模两阶段,能直接回答算力分配。其三,机制分析用'逐态走法分布重塑'的细粒度分类驳斥'RL 即均匀温度锐化'的图景——全局幂律拟合 $R^2$ 有限、逐态斜率方差很大。其四,合成推理轨迹用模型自采样而非外部搜索,保持分布一致。其五,把棋类规律在 1B 数学模型上做了迁移验证,提升结论普适性。

Overview
Figure 1: Overview

实验结果

核心发现分四块。(1)联合缩放律:预训练损失强预测固定 RL 算力下的后 RL pass@1,关系随参考算力增大愈发单调——$\log_{10}C_{ref}$ 从 16 增到 20 时 Spearman $|\rho|$ 从 0.93 升到 0.99;斜率 $B_{N,T}$ 与 $\log_{10}T$ 正相关(Pearson $r=+0.84$),联合模型 $R^2=0.87$。(2)算力最优前沿:RL 显著提升 pass@1,但 pass@16 改善有限、大模型甚至略降;最优 RL 占比随总算力增长而上升,20M 模型前沿点从 5% 升至 32%,50M 约 20%、680M 约 28%。(3)机制分析:易题(B1-B2)以地面真值放大为主,难题(B4-B5)同时出现尾部挖掘与错误模式放大,这解释了 RL 提升 pass@1 却不持续提升 pass@$k$。(4)数学迁移:1B OLMo-2 在 10B-200B token 的 14 个检查点上,后 RL 性能同样由预训练损失预测(高算力下 $|\rho|=0.99$),斜率与 $\log_{10}T$ 近似线性正相关($r=+0.95$)。

Formal definitions of policy-update categories
Table 13: Formal definitions of policy-update categories
Empirical frontier of puzzle benchmark performance across pretraining-RL sweeps
Figure 2: Empirical frontier of puzzle benchmark performance across pretraining-RL sweeps
Pretraining properties predict local RL scaling behavior
Figure 3: Pretraining properties predict local RL scaling behavior
Extrapolated compute-optimal frontier across model sizes using the fitted law
Figure 4: Extrapolated compute-optimal frontier across model sizes using the fitted law
RL reshapes the move policy in qualitatively different ways across puzzle difficulty
Figure 5: RL reshapes the move policy in qualitatively different ways across puzzle difficulty
The predictive pattern extends to the math domain
Figure 6: The predictive pattern extends to the math domain
查看结构化数据
任务指标本文基线提升
谜题基准(B1-B4) pass@1 RL 一致显著提升 pass@1,并随 RL 训练持续上升 SFT/pre-RL 基线(空心环) 例如 20M 模型前沿点 RL 算力占比从 5% 增至 32% 时性能持续爬升
谜题基准(B1-B4) pass@16 RL 改善有限,大模型上甚至略降 SFT 基线 / 追加预训练 此区间追加预训练往往比 RL 更有效
后 RL 性能预测(RQ2) Spearman |ρ|(损失 vs 后 RL pass@1) 0.93 → 0.99(随 $\log_{10}C_{ref}$ 从 16→20) 高 RL 算力下预训练损失近乎完美预测后 RL 性能
RL 提升斜率预测(RQ2) Pearson r / 联合模型 $R^2$ r=+0.84($B_{N,T}$ vs $\log_{10}T$),联合 $R^2=0.87$ 更多预训练 token 预示更快 RL 提升
算力最优 RL 占比(RQ1) RL 算力占比 $C^*_{RL}/C_{total}$ 50M≈20%,680M≈28%,20M 沿前沿 5%→32% 最优 RL 份额随总算力增长而上升
数学领域迁移(1B OLMo-2) 后 RL 性能预测 Spearman |ρ| 高算力下 |ρ|=0.99,斜率 Pearson r=+0.95 棋类规律定性迁移到自然语言数学

局限与改进

作者承认若干局限。其一,缩放律是在非饱和 RL 区间用一阶泰勒近似得到的局部经验趋势,一旦模型在易题基准上接近饱和(sigmoid 奖励曲线进入平台),斜率估计会被系统性压缩,不能当作跨所有训练区间的全局关系。其二,国际象棋词表仅 81、动作空间紧凑且奖励精确可验证,与自然语言推理的巨大动作空间和稀疏奖励差异显著,迁移结论来自单一 1B 数学模型的'定性案例研究'(作者原文 a qualitative case study),缺乏大规模定量验证。其三,机制分析的三分类(地面真值放大/尾部挖掘/错误模式放大)依赖 $k=3,\epsilon_{tail}=0.05$ 等超参,稳健性未充分展示。其四,pass@16 在大模型上几乎不受益于 RL,作者归因于机制混合但未提出有效缓解。我自己的观察:实验主要覆盖到 1B 规模、最大学术级算力(50M 模型 2000 步约 160 H200 小时),能否外推到 frontier 规模存疑;B5 谜题模型极少能解,该档数据稀疏;FLOPs 作为主算力单位忽略了预训练与 RL 在墙钟时间上的系统性差异,可能影响真实成本决策。

独立分析的弱点

独立分析的弱点及改进方向。其一,'局部律'的适用边界不清晰:从弱初始化过早启动 RL 时回报极有限(RL 仍是初始化受限的),但联合律对'过早启动'区间的预测能力未被严格检验。改进方向是显式建模 RL 的'启动阈值'(初始化需达到多强才有正回报),并研究预训练-RL 交错(interleaving)策略何时优于固定两阶段配方。其二,错误模式放大(wrong-mode amplification)是阻碍 pass@k 提升的关键,但本文只诊断未治疗。改进方向是设计能扩大正确解支撑、抑制错误模式的 RL 目标或正则项,例如覆盖度(coverage)导向奖励或熵正则化。其三,深度搜索能力不足:RL 主要展宽广度,长于 5 步的续走难恢复。改进方向是用结构化搜索特征指导合成 SFT 数据,鼓励更系统、更深的搜索。其四,迁移证据薄弱——仅 1 个数学模型、定性结论。改进方向是在更多领域(代码、科学推理)和更大规模重复实验,检验 $f(L)$ 函数形式是否稳定。其五,评估粒度偏粗:pass@$k$ 只反映最终答案,缺少对中间推理步骤质量的连续度量,可引入逐步骤正确率。

未来方向

作者明确指出几个方向:一是用该缩放框架研究'何时从预训练切换到 RL',更一般地如何在 $(N,T,C_{RL})$ 上分配算力;二是要突破 pass@1 的天花板,需要能减少错误模式放大、扩展正确解支撑的方法,而非仅锐化当前策略;三是研究交错式策略(interleaving),在额外预训练数据比额外 RL 更有价值时切换,因为固定两阶段配方可能次优。基于本文成果还可延伸:把逐态机制分类推广为 RL 训练的在线诊断信号,实时检测错误模式放大并触发干预;把'预训练损失预测后 RL 性能'的思想用于早停与配方搜索,省去昂贵的完整 RL 跑;将国际象棋测试床扩展为研究合成数据设计、自博弈(self-play)、超越(transcendence)与弱到强泛化(weak-to-strong generalization)的通用平台;探索用 coverage 理论(Huang et al. 2025; Chen et al. 2025)把预训练下一 token 目标与后训练 pass@k 之间的桥梁做形式化,解释 pass@16 为何对 RL 不敏感。

复现评估

复现评估良好但门槛较高。开源方面,作者提供模型与数据集(huggingface.co/pavelslab-nyu/pre2post-chess)及代码(github.com/pavelslab-nyu/pre2post-chess)。数据可获取:预训练语料来自公开 Lichess database,谜题来自 Lichess 公开谜题集,数学领域用 Nemotron-CC-Math-v1、Dolma3、NuminaMath-CoT、GSM8K、MATH、DeepScaler 等公开数据。方法细节充分:附录 C 给数据集、推理轨迹构造、模型架构与训练超参,附录 D 给 FLOPs 估算,附录 G 给统计分析与拟合参数。算力门槛是主要障碍:完整复现 36 组预训练-RL 扫掠需相当规模 GPU(50M 模型 2000 步 RL 约 160 H200 小时),个人或小团队难完整复现,但可借助发布的拟合律做'纸面'配方评估。难度中高:需熟悉 LLM 训练管线、GRPO、缩放律拟合与 FLOPs 估算。