超越人类监督扩展大型推理模型:通往超级智能之路 Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence
提出L0–L4递退监督阶梯,沿奖励与经验双轴梳理LRM超越人类监督的方法、风险与评测。
前置知识
RLVR(可验证奖励强化学习)
奖励由规则自动判定的强化学习范式:数学答案与标准答案比对、代码在测试套件上编译执行、定理提交 Lean 内核检查,无需人工逐条评估。DeepSeek-R1 与 OpenAI o1 在数学和代码上的突破即基于此,它使大规模 rollout 的评估摆脱人工带宽限制。
全文的出发点:奖励轴讨论的正是当确定性验证缺失时,如何寻找能替代答案比对与执行检查的奖励来源。
GRPO(组相对策略优化)
对每个问题采样 $G$ 条 rollout,用组内统计构造相对优势 $\hat{A}_i=\frac{r_i-\mathrm{mean}(\{r_j\})}{\mathrm{std}(\{r_j\})}$,以组均值作为隐式基线,省去 PPO 中与策略同规模的价值网络,再配合裁剪目标与 KL 正则更新策略,是当前 LRM 训练最常用的无评论家算法。
论文用『GRPO 优势恒为零』解释课程坍缩——任务全对或全错时学习停滞;这也是自博弈 proposer 采用可学习性信号 $\bar{p}(1-\bar{p})$ 的直接动因。
LLM-as-a-Judge 与奖励模型
用另一个语言模型充当裁判 $\pi_v$,或训练奖励模型 $R_\phi$,把人类偏好与标准编码为可复用的评估器,对任意输出打分或排序,从而无需对每个新实例重新进行人工判断,是 RLHF 后期与开放式任务评估的基础设施。
对应阶梯 L1 的核心对象;论文进一步分析其位置、长度、自我偏好等偏差,以及被策略优化利用(奖励黑客)的风险。
MDP 与 POMDP
马尔可夫决策过程用 $(S,A,P,R,\gamma)$ 描述序列决策;部分可观测版本 POMDP 增加观察空间,策略只能基于交互历史 $h_t$ 行动。GUI 操作、工具调用与多轮对话天然是 POMDP;单轮推理即 $T=1$、$\gamma=1$ 的特例。
论文用这套记号把单轮推理与多轮智能体交互统一进同一个目标函数(式 1),是读懂第 2 章设定与全文公式的基础。
自博弈与课程学习
让模型同时扮演出题者与解题者:proposer 生成任务、solver 尝试求解,proposer 奖励采用可学习性信号 $\bar{p}(1-\bar{p})$($\bar{p}$ 为经验解率),在任务全对或全错时为零,从而把课程维持在解题者能力边界附近;环境设计中的遗憾目标 $\mathrm{Regret}=U(\pi_A,\boldsymbol{q})-U(\pi_P,\boldsymbol{q})$ 与之同构。
经验轴 L3/L4 的核心机制,R-Zero、AZR、SPIRAL、GenEnv 等方法均由它驱动,也是课程坍缩与共同演化风险分析的对象。
奖励黑客(reward hacking)
策略利用奖励函数与真实意图之间的缝隙获取高奖励而不产生目标行为:迎合 judge 偏好的文风与长度、通过不完备的单元测试、输出 judge 爱见的套话开头等。受控研究表明验证器的假阳性比假阴性危害更大,因为可被利用的假阳性模式会在优化下形成次优平台甚至崩溃。
论文把 reward hacking、反馈漂移、课程坍缩、环境错误列为自主奖励与经验生成的四大风险,贯穿第 3 至第 6 章的主线讨论。
研究动机
RLVR 让大型推理模型(LRM)在数学和代码上进步显著,因为答案可比对、程序可执行,奖励可以完全自动化,DeepSeek-R1 与 OpenAI o1 即为代表。但这一范式依赖确定性验证器,而实践中大量重要任务并不具备:创意写作、开放式问答、多轮智能体交互往往存在多个同样有效的结果,质量取决于上下文、偏好与长期后果;学习到的奖励模型和 LLM 裁判虽把反馈扩展到这些场景,但分数只是目标函数的代理。更严峻的是,随推理链变长、交互步数增多,人工逐条评估的成本急剧上升(Casper et al., 2023),当任务难度接近或超过领域专家时,评估者自己都需要模型辅助才能可靠找错(Saunders et al., 2022)。同时训练经验本身被人类设计封顶:固定任务分布 $\Pi_H$ 与环境 $E_H$ 决定了模型能遇见什么问题,重复采样和增加测试时算力都无法拓宽这一分布。因此核心挑战不是用便宜的分数替代昂贵的标签,而是在人类判断与人类设计无法覆盖全部学习经验流时,如何维持有意义的持续改进。
本文的目标是本文的目标是为『大型推理模型如何在人类监督逐渐退出学习回路的情况下继续改进』提供结构化框架与路线图。具体包括三件事:其一,把『超越人类监督的扩展』形式化为两个相连的轴——奖励轴(评估行为的证据从逐实例人工判断演进到可复用验证器,再到无需人类反馈的奖励)与经验轴(学习从人工策划的任务与环境演进到自生成课程、自构造环境与自主共同演化);其二,用 L0–L4 五级阶梯刻画学习过程中哪些环节仍处于人类持续控制之下,把数百个现有方法映射到阶梯上,并逐一检视每个层级引入的新失败模式(奖励黑客、反馈漂移、课程坍缩、环境错误);其三,提出一套评测框架,把证据划分为策略能力、反馈保真度、经验质量三个互补对象,并为每个层级给出最低评测证据要求(Table 6 的记分卡),使『向自我维持学习系统迈进』的声明变得可审计。
与已有工作不同的是,已有的自我改进综述要么采取模型中心视角,要么采取环境中心视角,往往只覆盖学习回路的一段。本文的独特切入点是把奖励 $R$、任务分布 $\Pi$ 与环境动力学 $(S,P)$ 放进同一个学习回路统一追踪:生成的任务若结果无法评估就支撑不了学习,而可扩展的奖励若总让模型重复遇见熟悉情境也无价值,因此奖励与经验必须共同演化。其次,本文明确区分『操作责任』与『历史来源』:一个方法处于哪一级,取决于学习回路中哪个组件减少了对人类持续输入的依赖,而不取决于模型、数据、工具或环境最初是否由人创造——这与按数据来源分类的常见做法有本质区别。第三,本文指出在线/离线优化只是反馈的消费方式,与评估标准的来源正交,澄清了文献中把『无需人工标注的离线偏好优化』误当作超越人类监督的混淆。最后,它把评测从单一能力分数扩展为与监督来源匹配的三对象审计,填补了『内部奖励上升但外部能力存疑』这一评测空白。
核心方法
直觉上,可以把学习回路拆成『谁来打分』和『谁来出题』两个问题,人类在这两处的参与度各自递减,由此自然形成 L0-L4 五级阶梯。技术上,论文先用统一的 MDP/POMDP 记号(Table 1)把单轮推理与多轮智能体交互纳入同一目标(式 1):$\max_\theta \mathbb{E}[\sum_{t=0}^{T-1}\gamma^t R(\boldsymbol{s}_t,\boldsymbol{a}_t)]$,$T=1$ 即常见 RLVR,$T>1$ 时部分可观测与长程信用分配成为核心难题。奖励通过 PPO 的裁剪目标或 GRPO 的组相对优势 $\hat{A}_i=\frac{r_i-\mathrm{mean}}{\mathrm{std}}$(式 4-6)驱动策略更新;模型内部信号则需区分序列 surprisal 与 token 熵 $H_t$(式 8-9),二者都不能当作正确性概率。随后论文沿奖励轴(第 3 章:L1 可复用评估器 → L2 模型衍生/参照锚定/环境接地信号)与经验轴(第 4 章:固定经验 → 任务生成 → 环境构造 → 集成生成 → 共同演化)系统分类现有方法,配以失败模式分析,最后给出三对象评测框架与各层级最低证据要求(Table 6)。
核心创新是『递退监督阶梯』(Figure 1):L0 每个实例由人提供答案、偏好或判断;L1 人类标准被编码进可复用的奖励模型、rubric 或 LLM 裁判;L2 奖励来自模型置信度、样本间一致性、可用参照或环境后果,而任务与环境仍外部提供;L3 任务、课程与环境在训练中生成、发现或重组,人只设定目标、约束与初始条件;L4 反馈、经验与策略改进在持久回路中共同适应,人类只在意图、安全约束与独立审计层面介入。与已有分类的本质区别有三:第一,分类对象是『学习过程中哪些部分仍需人类持续供给』这一操作性问题,而非模型能力、可靠性或训练数据的历史来源;第二,奖励证据被划分为模型衍生、参照锚定、环境接地三类,并指出错误来源随层级系统变化——共识会强化模型自己的多数错误,参照会过拟合不完整目标,环境会奖励测试盲区;第三,两轴在成熟回路中收敛:更强策略暴露新弱点,弱点引导新任务与环境生成,可靠评估再把轨迹转化为策略更新。这种共同演化既是超越人类监督带宽的可能路径,也是策略-生成器-评估器相互适应、在外部标准下停滞甚至退化的耦合失效之源。
方法步骤详情
论证分五步。第一步建立形式化基础(第 2 章):MDP/POMDP 设定、轨迹目标(式 1)、PPO/GRPO 目标(式 4-7)、不确定性度量(式 8-9)。第二步定义五级阶梯并说明边界:标准 RLHF 同时跨越 L0(人给偏好)与 L1(学到的奖励模型即复用评估器);一个方法可在奖励上自动化而在任务上仍靠人工。第三步梳理奖励轴(第 3 章)。L1 侧:Math-Shepherd 用蒙特卡洛补全估计步级奖励 $R(\boldsymbol{z}_{\le t})=\frac{1}{N}\sum_j \mathbb{I}\{\boldsymbol{y}_j=\boldsymbol{y}^*\}$,PRIME 从结果标签隐式推导过程奖励,另有生成式验证器与 rubric 评估器。L2 侧分三支:模型衍生(EM-RL 负熵奖励、Intuitor 自确信 $R_i=\frac{1}{|\boldsymbol{o}_i|}\sum_t \mathrm{KL}(\mathcal{U}\|\pi_\theta)$、TTRL 多数投票伪标签、CoVo 轨迹一致性);参照锚定(JEPO/VeriFree/RLPR/NOVER 等,统一为『推理项+答案项』梯度分解,Table 2);环境接地(代码执行、游戏胜负、Lean 形式化验证)。第四步梳理经验轴(第 4 章):固定 $(\Pi_H,E_H)$ 是出发点;任务生成在固定环境中进行(STaR、R-Zero、AZR、LSP),proposer 奖励用可学习性 $\bar{p}(1-\bar{p})$(式 18);环境构造围绕固定任务展开(PAIRED 遗憾目标、Eureka、Agent World Model、ScaleEnv、Genie);L3 要求任务与环境流水线集成(EvoEnv,ZeroGUI 为边界);L4 共同演化代表有 CURE、SPIRAL、GenEnv、Darwin Gödel Machine。第五步给出评测框架(第 5 章):能力用冻结基准、反馈用来源匹配的审计、经验用解率分布与环境有效性,Table 6 规定各级最低证据。
技术新颖性
技术新颖性体现在框架层面而非新算法。第一,递退监督阶梯是首个把『奖励来源』与『经验来源』统一进一张 L0-L4 地图的分类学:Figure 2-4 把二百多个方法按『回路中哪个组件仍依赖人类』定位——TTRL 属于 L2(多数投票替代人工评估)而非 L3(任务仍外部提供),SPIRAL 的奖励证据在奖励轴、自博弈课程在经验轴。第二,Table 2 的策略梯度分解把 JEPO、LaTRO、VeriFree、RLPR、DRO、NOVER、P2S、DARL、DuPO 等十余种参照锚定方法统一写成 $R_r\nabla_\theta\log\pi_\theta(\boldsymbol{z}|\boldsymbol{q})+R_a\nabla_\theta\log\pi_\theta(\boldsymbol{y}|\boldsymbol{q},\boldsymbol{z})$,揭示它们只是给推理项与答案项赋不同权重的同族变体。第三,Table 3 用 R/E/Π 三个圆点标注经验轴方法的组件自主性,并把 PAIRED 的遗憾目标与任务生成的可学习性信号识别为同构机制(都在策略能力边界附近采样)。第四,三对象评测框架与 Table 6 记分卡把『声明处于哪一级』与『必须提供哪些证据』绑定,在评测方法论上是新的。
实验结果
作为综述,本文的核心产出是框架与系统性发现而非新实验,主要发现有六。其一,奖励可扩展性与证据独立性存在根本权衡:熵最小化、自确信、多数共识可零边际成本打分,但长期优化导致分布锐化、多数错误被强化、置信度与正确性解耦——TTRL 类共识训练呈『先升后崩』曲线,代理奖励与真实准确率分离后出现模板化答案;执行、游戏、形式化验证接地更强,但不完备测试仍可被利用,受控分析表明验证器假阳性比假阴性更具破坏性。其二,参照锚定方法可被统一理解:VeriFree 的 Rao-Blackwellized 估计器方差不高于『采样答案+二元验证器』,但似然奖励的收益可能部分来自更短的推理轨迹。其三,RLVR 的提升更接近采样效率改善而非能力扩展:在线优化下精确支撑集无法超出初始非零概率输出,长程训练可在部分难题扩界(ProRL)但在其他任务平台化;迁移实验显示 RL 比 SFT 更能保留非数学能力,结论依赖基模型与任务的匹配度。其四,经验轴上无约束 proposer 会漂向过易或不可解任务,使 GRPO 优势 $\hat{A}_i$ 恒为零、学习停滞;可学习性信号 $\bar{p}(1-\bar{p})$ 与遗憾目标是主流对策,但早期解率估计噪声大且不保证语义多样性。其五,最关键的实证担忧:闭环自演化实验中内部奖励持续上升,但冻结外部测试上的能力停滞在 oracle 监督水平之下,且模型生成答案的能力强于验证答案的能力。其六,评测生态严重失衡:公共排行榜几乎只测能力,很少审计训练 judge 与独立评估者的一致性、课程多样性与环境保真度。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 共识伪标签自训练(TTRL 类)的长期稳定性 | 代理奖励 vs 真实任务准确率 | 综述归纳:多数投票自训练初期提升后崩溃,伪标签被策略利用,出现模板答案与奖励-准确率分离(引 Shafayat et al., 2025;TTRL-Guard、SCOPE、SCRL 为缓解方案) | 带外部验证器的标准 RLVR | 定性结论:无独立锚点的共识奖励不可长期持续,需要保留在优化回路之外的检查点干预 |
| 闭环自演化学习(L4 方向) | 内部奖励曲线 vs 冻结外部测试能力 | 现有闭环实验先超越初始策略、随后进入平台期,外部能力停留在 oracle 监督训练之下(引 Qi et al., 2026b) | oracle / 人工监督训练 | 尚未超越人类监督上限,证明独立外部锚点对检测漂移不可或缺 |
| 参照条件似然奖励 vs 二元验证器(VeriFree) | 策略梯度估计方差 | 在唯一答案串与精确匹配假设下,Rao-Blackwellized 估计器方差不高于『采样答案+二元验证器』方案(引 Zhou et al., 2025b) | 采样答案 + 二元验证器的结果奖励估计 | 理论保证:方差无增且免除独立验证器,同时解释推理项如何被参照似然间接塑形 |
| RLVR 对策略输出支撑集的影响 | 输出支撑集覆盖率 / 大 k 的 Pass@k | 标准在线优化下精确支撑不能超出初始非零概率输出;有限采样收缩经验支撑;长程训练在部分难题扩界但其他任务平台化(引 Yue et al., 2025;Wu & Choi, 2025;ProRL) | 基模型的采样分布 | 采样效率提升,但可解问题集合可能收窄——能力扩展与奖励改进不是同一回事 |
| 验证器噪声容忍度 | 假阳性/假阴性比例与最终策略性能的关系 | 受控分析:系统性假阴性延迟学习,可被利用的假阳性模式造成次优平台或崩溃;错误标注同样降低性能(引 Plesner et al., 2026;Egashira et al., 2026;Zhu & Kang, 2026) | 干净监督下的 RLVR | 定性:奖励审计应优先压缩验证器假阳性,而非盲目追求自动打分的覆盖率 |
局限与改进
作者明确承认的限制:阶梯是分析性框架而非互斥的方法分类,方法常处于过渡态,奖励自动化与任务自动化并不同步发生;框架追踪的是学习期间监督的操作来源,而非预训练模型、参照、语料、工具或环境中嵌入的历史人类知识量;跨方法直接比较受模型、算力、数据、解码、验证器与评测协议差异的制约;对安全、多语言、多模态交互与长上下文的覆盖是选择性的;关于超级智能的讨论停留在概念层面,框架不意味着当前系统已具备超级智能,也不意味着沿阶梯移动必然带来超级智能行为。我自己的观察:其一,框架是描述性的,无法预测一个给定方法何时、以何种速度崩溃,缺乏可操作的理论保证;其二,Table 6 的记分卡目前只是建议,社区没有强制执行机制,而最需要这类审计的 L3/L4 方法恰恰最难审计;其三,五级阶梯顶端的 L4 目前没有完全体实例,文献中的代表系统都还依赖固定的运行时、游戏规则或评估目标,说明最高层更像是研究议程而非对现状的刻画;其四,综述未能给出统一算力下的定量横向比较,许多结论只能停留在定性归纳层面。
独立分析的弱点
独立分析的弱点:(1) 分类边界主观性强——例如 ZeroGUI 被标为边界情形,但同类 GUI 方法可能因评估者是否外置而被归入不同层级,缺乏可计算的判定规则,改进方向是给出可操作判据(如强制列出每个组件的输入来源清单)。(2) 框架对『多久审计一次、审计多少样本才够』没有定量指导,稀疏外部锚点的采样理论(类似漂移检测与最优监控)完全缺失,改进方向是把锚点调度形式化为最优停止或在线漂移检测问题。(3) 对失败模式的对策大多是枚举式的(共识过滤、多数确认、集成、冻结评估器),缺少在这些防御机制本身被策略适应后的二级分析——即『审计者也可能被共同适应』的递归问题,改进方向是研究审计协议自身的对抗鲁棒性。(4) 多模态、长上下文与安全评估同低监督学习的联系只是指出薄弱,没有给出跨模态的反馈保真度迁移评测协议。(5) 计算经济学视角缺席:综述承认低标注成本会转嫁为更高的推理与交互成本(共识要多次采样、自生成经验要额外的 proposer 与环境构造开销),但没有给出任何方法族的成本模型,改进方向是建立『每个可学习样本的端到端计算成本』标准报告格式,使 token 效用可跨方法比较。
未来方向
作者提出的方向:为内在与共识奖励建立独立锚点(稀疏可执行检查、跨家族冻结评估器、语料接地一致性测试、周期性专家抽审),并让锚点保持在优化回路之外以监测内部奖励与外部能力的分歧;研究验证器在优化压力下的鲁棒性认证——静态 RewardBench 通过不等于能抵抗被优化的输出,需要对抗评估、与更严格检查器的差分测试、不对称目标与集成防御;把结构化证据(rubric、claim 级验证、检索、校准 judge)扩展到科学推理、长文事实性、多模态与偏好敏感生成;对课程做可学习性与覆盖面的纵向测量,保留未解任务档案供未来策略使用;用分阶段可执行检查与对公共基准(SWE-bench、OSWorld、WebArena)的差分测试验证生成环境的保真度;为闭环系统设计停止准则与角色条件基线,应对非平稳性;把经验生成视为资源分配问题——样本集中于学习边界、低信息 rollout 提前拒绝、短过程反馈与重放缓冲复用昂贵交互;把稀疏锚定与生成课程延伸到预训练与持续 mid-training;在安全上对策略、反馈、经验三个对象同步审计,保持人类否决通道独立。基于本文成果可延伸的:形式化『生成-验证不对称』的理论边界;把 Table 6 记分卡工程化为训练时持续集成式的自动审计工具;研究阶梯层级之间的最优转移策略——何时值得从 L2 升到 L3、升级的边际收益与风险如何量化。
复现评估
这是综述/立场论文,没有需要复现的实验与代码,复现对象是它的分析框架与评测协议。有利条件:论文维护一个持续更新的 GitHub 仓库跟踪最新进展;符号系统完整(Table 1),公式推导自包含;所有评测建议都映射到公开可得的套件(RewardBench、ProcessBench、PRMBench、JudgeBench、WebArena、OSWorld 等)与公共工具链(lm-evaluation-harness、LightEval、ZeroEval 等),复现『三对象审计』本身主要是工程性工作,单卡即可完成大部分反馈保真度检查。困难在于:第一,若想复核综述对某类现象的归纳(如共识训练先升后崩、闭环平台期低于 oracle 监督),需要重新运行相应原始方法,算力需求从单卡到大规模 RL 集群不等,论文未给统一预算;第二,Table 6 要求 compute-matched 基线与完整解码配置披露(温度、top-$p$、最大 token、种子、judge 提示、环境版本),这超出多数已发表报告提供的信息,意味着按此标准严格复核文献结论往往不可行;第三,闭环与自生成环境的审计需要冻结外部测试、组件冻结消融与多样性轨迹记录,实验设计与记录负担显著高于常规评测。总体而言:理解与引用框架零门槛,复现其评测主张需中等偏上的工程投入,复现其归纳的实证结论则受各原始工作可复现性的制约。
论文图表
经验轴方法对照表:每行一个方法(STaR、Self-Instruct、Evol-Instruct、SeRL、R-Zero、SQLM、LSP、SPICE、AZR、MemAgent、ZeroGUI、SEAgent、Voyager、Eureka、Genie、PAIRED、AWM、ScaleEnv、CuES、EvoEnv、CURE、SPIRAL、POET、OMNI-EPIC、GenEnv、Agent-World 等),三列圆点分别标注 Reward $R$、Environment $(S,P)$、Task distribution $\Pi$ 的来源——实心=学习回路内供给或自适应,半实心=外部脚手架下部分自适应,空心=保持外部固定——并附机制与领域两列;三大块对应 L2→L3→L4 的过渡。
它把『一个方法在经验轴上到底自主到什么程度』变成逐组件可查验的标注,是区分 L2/L3/L4 边界情形(如 ZeroGUI、CuES 被明确标为 boundary)的直接依据。