← 返回 2026-09-10

基于世界模型的自动研究智能体规模化训练 Scaling Automatic Research Agents via World Models

Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Xing Fan, Chenlei Guo, Jingrui He, Zhenyu Liao 📅 2026-08-29 👍 444 2026-09-12 18:30
LLM后训练 世界模型 具身智能 强化学习 自动研究智能体

用世界模型替代昂贵的沙箱执行训练研究智能体,在线去偏去噪,训练加速3-4倍且性能更优。

前置知识

GRPO(组相对策略优化)

当前智能体 RL 规模化训练最常用的目标函数。对每个任务并行采样一组 $n$ 条轨迹,把真实执行给出的分数在组内归一化得到优势 $A_i = r(\tau_i) - \frac{1}{n}\sum_j r(\tau_j)$,再按策略梯度 $\hat{g} = \frac{1}{n}\sum_i A_i \nabla_\theta \log \pi_\theta(\tau_i)$ 更新参数。它不训练价值网络,靠组内相对比较充当基线,因此每个分数都要真实执行才能得到。

本文的全部理论和实验都构建在 GRPO 的组结构之上:奖励替换、anchor 采样、梯度融合都以组为单位进行,不懂 GRPO 就无法理解 WMRL 的流水线。

世界模型(World Model / Model-based RL)

环境的学习模拟器:输入状态与动作,输出对环境结果的预测,agent 与模拟器而非真实环境交互,从而绕开昂贵的真实采样。经典 model-based RL(如 Dyna、MuZero)用它生成想象轨迹。本文的实例很特别:一个与 agent 同 backbone 的通用 LLM,仅靠 prompt 对 agent 的代码做静态分析,预测沙箱执行结果并给出分数,训练期间完全冻结。

WMRL 的核心就是用世界模型替换真实执行来消除扩展瓶颈,同时它的不完美(偏差与噪声)正是两个校正机制要处理的对象。

梯度支配与策略梯度收敛分析

分析 RL 收敛的标准框架:假设目标 $J$ 是 $L$-光滑的,且满足梯度支配条件 $\|\nabla J(\theta)\|^2 \ge 2\mu (J^\star - J(\theta))$,则梯度上升的次优差距 $J^\star - \mathbb{E}[J(\theta_T)]$ 以 $(1-\gamma\mu/4)^T$ 几何衰减。若梯度估计带有系统性偏差,会在界中加入一个不随训练步数 $T$ 消失的误差地板。

论文的 Theorem 3 与 Theorem 4 完全在此框架下推导:理解 $O(B^2)$ 偏差地板为何致命、以及两个机制如何把它变成收缩项,是读懂理论贡献的前提。

等回归(Isotonic Regression)

拟合单调函数的非参数方法:在数据点上寻找使平方误差最小的非降阶梯函数,可通过 PAVA 算法把任意散点投影到单调锥上。它比参数化校准(如 Platt scaling)更灵活,不需要假设误差的具体函数形式,常用于概率校准。本文用它在线拟合世界模型分数到真实分数的单调重校准映射 $\hat{f}$。

Online Debiasing 机制的全部实现就是等回归:在 anchor 分数对 $(\hat{r}_j, r_j)$ 上拟合 $\hat{f} = \arg\min_f \sum_j (f(\hat{r}_j) - r_j)^2$ 并把所有预测分数重cast为 $\hat{f}(\hat{r})$。

奖励代理的偏差-噪声分解

用学习到的信号替代真实奖励时,误差可分解为 $\hat{r}(\tau) = r(\tau) + b(\tau) + \xi(\tau)$:偏差 $b$ 是条件期望的系统偏移(平均后仍残留,$|b| \le B$),噪声 $\xi$ 是零均值随机波动(标准差至多 $\sigma$)。RLHF 文献早已证明过度信任不完美奖励模型会让真实性能退化,有偏梯度会让 SGD 收敛卡在误差地板上。

这一分解是全文的骨架:两类误差在收敛界中分别对应 $O(B^2)$ 与 $O(\sigma^2)$ 两个误差项,两个校正机制各自负责消灭其中一项。

研究动机

AutoResearch 智能体是能独立开展实证研究的 LLM:给定研究问题,它提出想法、写出实验代码、分析执行结果并迭代。这类智能体已被证明能在 Kaggle 风格的机器学习竞赛中超越人类专家,而 RL 后训练是进一步提升其能力的关键路径——但 RL 需要海量在线轨迹,本文指出了一个被忽视的结构性矛盾:一条 AutoResearch 轨迹由 agent 生成和环境执行两部分组成,二者的扩展方式完全不同。生成侧由 vLLM、SGLang 等现代推理后端服务,batching 技术让并发轨迹共享计算,额外轨迹的边际成本趋近于零;执行侧则完全无法摊销——每个候选方案必须在隔离沙箱(加载完整 ML 环境、独占约 40GB GPU)中真实训练模型并打分,本文设置中单次执行预算高达 1200 秒,每增加一条轨迹都要付出全额成本,总成本随轨迹数严格线性增长。结果是环境执行率先撞上算力上限、主导训练开销:本文实验里 4B 模型的全真执行 GRPO 需要 883 A100 GPU 小时,9B 需要 1174 小时,而轨迹量还远未达到理想规模。

本文的目标是本文的目标可以用引言里的两个研究问题概括。其一,能否用一个快速、可批处理扩展的信号替换昂贵的环境执行(瓶颈本身)?其二,天下没有免费的午餐,这个信号引入了什么代价,如何精确地偿付?落到可衡量的指标上:把 AutoResearch 智能体 RL 训练的总计算量削减 3-4 倍,同时在留出基准(held-out 竞赛)上匹配甚至超过全真执行 GRPO 的最终性能;并且方法不能是 AutoResearch 专属的 trick,要能推广到一切『执行贵、生成便宜』的后训练场景(本文用具身 VLA 策略训练验证)。此外作者希望整个框架有严格的理论支撑——不只是经验上 work,而是能证明校正后的训练在收敛意义上严格优于不加校正的世界模型训练。

与已有工作不同的是,已有工作的改进集中在奖励的消费端:GRPO 等组相对目标优化奖励怎么用,大规模 RL 系统(如 veRL)优化训练基建,合成任务扩充训练语料——但奖励的来源始终是昂贵的真实执行,瓶颈原封不动。本文的独特切入是把 model-based RL 的世界模型思想引入 AutoResearch 训练,改变的是奖励从哪里来。更关键的是它对『代理信号必然有错』这件事的态度:以往对不完美奖励模型(RLHF 中的 reward hacking、LLM judge)的补救多是离线重校准,或者约束策略不许过度利用代理;本文反其道而行——在训练循环内部保留一小股真值流(约 10% 的组仍做真实执行,称为 anchor),用它在线估计并校正代理的偏差与方差,并把这两个校正直接量化进收敛界,证明校正后的界逐项严格优于未校正的界。把『模拟器会犯错』从经验担忧提升为可分析、可消除的数学对象,是本文区别于所有相关工作的地方。

核心方法

直觉上,WMRL 给昂贵的真实实验雇了一个陪练模拟器。这个模拟器(世界模型)读入任务上下文和 agent 写的解题代码,用几次前向传播预测出沙箱会返回的执行结果和分数 $\hat{r}(\tau)$,全程可以像文本生成一样 batch 化,执行瓶颈就此消失。但模拟器会犯错,且错误分两种:系统性地高估或低估(偏差 $b$),和随机的打分抖动(噪声 $\xi$),即 $\hat{r}(\tau) = r(\tau) + b(\tau) + \xi(\tau)$。WMRL 的应对是保留一条细的真值流:每步约 10% 的组(anchor 组)既被世界模型打分也被真实执行打分,产生的分数对完成两件事——一是 Online Debiasing,用等回归在分数对上拟合单调映射 $\hat{f}$,把预测分数重校准回真实尺度,消除 $O(B^2)$ 的偏差误差;二是 Inverse-Variance Denoising,把稀疏但无噪的 anchor 梯度流 $g_E$ 与海量但有噪的世界模型梯度流 $g_{WM}$ 按逆方差加权融合,融合方差 $V_{WM}/(1+V_{WM}/V_E)$ 严格低于任一单独流。理论上,纯世界模型奖励的收敛界含永久误差地板 $O(B^2)$ 和方差项 $O(\sigma^2)$;两种机制分别把前者变为随训练步数收缩的 $\tilde{O}(1/T)$ 项、把后者压到调和平均,使 WMRL 渐近收敛到与全真执行相同的解。

全文最重要的一个点:代理信号的错误不是需要容忍的成本,而是可以被在线测量、分解并逐项消除的对象。与已有工作的本质区别有三层。第一,与传统 model-based RL 相比,那里 learned 模拟器通常被直接信任,本文显式建模 $\hat{r} = r + b + \xi$ 并在收敛证明中追踪每一项的去向。第二,与奖励模型校准文献相比,以往 remedy 是离线重校准(训练前固定校准曲线)或约束策略不要 exploit 代理,本文把少量真值放回训练循环内、在线校正、且证明随 anchor 对累积偏差项按 $\sqrt{\log T / T}$ 收缩——永久地板变成会消失的项,这在以往工作中没有。第三,实现上两个校正机制无自由超参:去偏映射由等回归自动拟合(每 64 个新分数对重拟合一次以跟踪分布漂移),融合权重由可测量的残差自动导出 $\rho = 1 + \hat{\eta}^2/\hat{\eta}^2_{cal}$,误差尺度靠 warmup 期的一次测量归一。此外世界模型与 agent 共享同一 backbone 且只靠 prompt(不微调、不更新),排除『蒸馏更强外部模型』的解释,保证增益来自机制本身而非知识泄露。

方法步骤详情

完整流水线如下。第一步,每步采样 $m=8$ 个组、每组 $n=8$ 条轨迹:agent 策略 $\pi_\theta$ 接收任务上下文(Kaggle 竞赛描述、数据 inventory、提交格式契约),迭代至多 4 轮生成解决方案代码,每轮上限 4096 token。第二步,奖励打分:随机选约 10% 的组为 anchor 组,其 solution 送入真实沙箱执行(Python 3.11 虚拟环境、单张约 40GB GPU、1200 秒预算)得到真实分数 $r$,世界模型同时对其打分得到 $\hat{r}$,分数对 $(\hat{r}_j, r_j)$ 存入池 $P$;其余组只被世界模型打分。世界模型是对 agent 同款 LLM 的 prompt 调用:对每条轨迹并行执行 8 个单方面静态检查(import 与命名、API 版本兼容、文件与列引用、形状与 dtype、计算预算、运行时错误、提交有效性、方案质量),每个检查输出严格 JSON 裁决,聚合为标量分数 $\hat{r}$。第三步,Online Debiasing:$P$ 累积满 200 对后首次用等回归拟合单调映射 $\hat{f}$,此后每新增 64 对重拟合一次,所有世界模型分数经 $\hat{f}(\hat{r})$ 重校准后再算组内优势 $\hat{A}_i$。第四步,Inverse-Variance Denoising:分别对 anchor 集 $G_E$ 与世界模型集 $G_{WM}$ 求组梯度估计之和得 $g_E, g_{WM}$,按 $\hat{g} = (\rho\, g_E + g_{WM})/(\rho|G_E| + |G_{WM}|)$ 融合,其中 $\rho = 1 + \hat{\eta}^2/\hat{\eta}^2_{cal}$($\hat{\eta}^2$ 是滑动窗口内 anchor 上校准后残差均方,warmup 值 $\hat{\eta}^2_{cal}$ 实测约 0.96),为稳定把 $\rho$ 截断在 $[1, 4]$。第五步,用融合梯度以学习率 $10^{-6}$(KL 系数 0.04、熵系数 0.002)更新 agent,世界模型全程冻结。该设计自带安全降级:若任务结果本质上不可从代码预测($\hat{\eta}^2$ 持续偏大),anchor 权重自动升高,训练退化为标准 GRPO 而不是从坏信号中学习。

技术新颖性

技术新颖性可从与三条相关线的对比中看清。与经典 model-based RL(Dyna、MuZero 到世界模型基础模型):那些系统的模拟器是专门训练出来的动力学模型,误差没有以奖励级偏差-噪声分解的形式进入收敛分析;本文的模拟器是零训练的 LLM prompting(8 路静态分析检查),且误差被精确映射——利用 GRPO 梯度对奖励的线性性,Lemma 10 把分数级误差转为梯度级扰动:偏差产生范数至多 $2MB$ 的确定性扰动 $g_b$,噪声使方差膨胀为 $V_{WM} = (1 + c\sigma^2)V_E$($c = 4M^2/(nV_E)$),两个量恰好是收敛分析引擎 Lemma 9 消费的全部输入。与 learned reward / LLM judge 文献:那些工作承认 proxy 会被过度优化,补救是约束策略或离线重校准;WMRL 的在线 anchor 校正把偏差项从常数地板 $32M^2B^2/\mu$ 变为 $\tilde{O}(M^2c_f^2\log(2KT/\delta)/T)$(Theorem 4),这是一个可证伪、可比较的理论改进,而非启发式修补。与 off-policy 校正比:learned correction ratios 修正的是更细粒度的分布失配对象,与本文处理的奖励统计量正交。此外 Lemma 12 证明逆方差融合对权重估计误差只有二阶敏感(相对误差 $\varepsilon_\rho$ 只造成 $\varepsilon_\rho^2/4$ 量级的方差膨胀,实测低于 3%),这让无超参的 plug-in 权重在实践中安全。

WMRL corrects the world model rewards in two steps. Each row is one of the m groups in a batch.
Figure 2: WMRL corrects the world model rewards in two steps. Each row is one of the m groups in a batch.

实验结果

核心发现有三组。第一,AutoResearch 主实验(Table 1,MLE-Dojo 按类别划分为 45 个训练竞赛和 14 个留出竞赛,外加完全不相交的 DSBench 60 任务,指标为真实竞赛排行榜百分位,avg@8):WMRL-4B 用 286 GPU 小时达到 MLE-Dojo 平均 16.4、DSBench 平均 28.8,而全真执行 GRPO-4B 花 883 GPU 小时只得到 15.2 和 25.7——计算削减 3.1 倍的同时反超 1.2 和 3.1 分;WMRL-9B 用 349 GPU 小时达到 21.6 和 32.8,超过花 1174 小时的 GRPO-9B(18.8 和 31.2)2.8 和 1.6 分,加速比 3.4 倍。跨规模对比更有说服力:4B 后训练智能体(16.4)大幅超过 48B 的 Kimi-A3B(8.1),9B(21.6)超过 120B 的 Nemotron-A12B(20.5),说明后训练数据效率可以碾压参数规模。纯世界模型基线(不加校正)全面落后于 WMRL(4B:12.9 vs 16.4;9B:16.1 vs 21.6),证明校正机制是必要的。第二,VLA 迁移实验(Table 2,LIBERO-Long 机械臂操作成功率):SFT 基线 37.4%,稀疏成功信号的 GRPO 只加 0.9 分到 38.3%,纯世界模型(Robometer 密集进度预测)只加 1.8 分到 39.2%,WMRL 融合两者达到 41.2%(+2.9 相对 GRPO),且增益集中在分布外初始状态上(OOD 平均 41.2 vs 37.8,All@8 提升 5.9 分)——两种信号单独都不够用,融合才有效,与理论预期一致。第三,消融实验(Table 3):两种信号直接混合不加校正反而每一列都低于全真执行 GRPO;单独加 IVD 提升 0.9-1.7 分,单独加 OD 提升 2.2-2.8 分,同时开启提升 2.9-4.8 分(4B MLE 16.4、DS 28.8;9B MLE 21.6、DS 32.8),二者互补而非冗余。OD 增益大于 IVD 也精确呼应 Theorem 3:偏差以全尺寸进入收敛界,而噪声被步长 $\gamma$ 阻尼。

Main results (leaderboard percentile in %, higher is better).
Table 1: Main results (leaderboard percentile in %, higher is better).
VLA post-training results on LIBERO-Long (success rate in %, higher is better).
Table 2: VLA post-training results on LIBERO-Long (success rate in %, higher is better).
Ablation on the two corrections (leaderboard percentile in %, Avg over categories). OD is Online Debiasing, IVD is Inverse-Variance Denoising.
Table 3: Ablation on the two corrections (leaderboard percentile in %, Avg over categories). OD is Online Debiasing, IVD is Inverse-Variance Denoising.
查看结构化数据
任务指标本文基线提升
MLE-Dojo (test) 自动研究(Qwen3.5-4B) 竞赛排行榜百分位 avg@8(类别平均) WMRL 16.4(286 GPU 小时) GRPO 真实执行 15.2(883 GPU 小时) +1.2 分,训练计算减少 3.1 倍
MLE-Dojo (test) 自动研究(Qwen3.5-9B) 竞赛排行榜百分位 avg@8(类别平均) WMRL 21.6(349 GPU 小时) GRPO 真实执行 18.8(1174 GPU 小时) +2.8 分,训练计算减少 3.4 倍
DSBench 数据科学(4B / 9B) 排行榜百分位 avg@8 28.8 / 32.8 GRPO 25.7 / 31.2 +3.1 / +1.6 分
小模型 vs 大型开源智能体 MLE-Dojo (test) 平均百分位 4B-WMRL 16.4;9B-WMRL 21.6 Kimi-48B-A3B 8.1;Nemotron-120B-A12B 20.5 4B 超 48B 达 8.3 分;9B 超 120B 达 1.1 分
LIBERO-Long 具身 VLA 后训练 成功率 Overall % MiniVLA-1B + WMRL 41.2 GRPO 38.3;SFT 37.4 +2.9 相对 GRPO,+3.8 相对 SFT
两种校正机制消融(4B MLE-Dojo) 平均百分位 OD+IVD 16.4 无校正混合 13.5;仅 IVD 14.9;仅 OD 15.7 双开较无校正 +2.9 分

局限与改进

作者承认的局限主要藏在假设里:Online Debiasing 依赖 Assumption 6,即偏差是真实分数的单调扭曲 $b(\tau) = \phi(r(\tau)) - r(\tau)$;Lemma 11 进一步要求扭曲不把相邻分数层级坍缩到一起($\Delta_\phi > 0$)且每个层级都能获得 anchor 对的覆盖。若世界模型的错误是非单调的——比如系统性地把某类好方案判坏、把另一类差方案判好——等回归校准在原理上就无能为力。我自己的观察:其一,世界模型与 agent 同 backbone、纯静态分析,对复杂深度学习方案(多阶段训练、自定义操作)的预测上限存疑,论文只报告了校准后残差 $\hat{\eta}^2_{cal} \approx 0.96$ 这个相对量,从未给出世界模型自身预测精度的绝对水平;其二,所有 AutoResearch 任务都是能装进沙箱的小型 Kaggle 竞赛(每个类别选数据集最小的 20 个),执行耗时数小时以上的大型实验任务未验证,而那正是执行瓶颈最尖锐的场景;其三,9B 模型在 DSBench 回归子任务上反而下降 1.2 分(39.2 vs 40.4),提示某些任务类型上噪声校正仍不充分;其四,anchor 比例约 10% 是经验值,论文未扫描该超参的敏感性;其五,作者弃用 MLE-Bench 官方测试集、手动重划任务池的理由虽然充分(两个竞赛永久关闭、奖牌指标退化、预训练数据污染),但结果与社区惯用 leaderboard 数字不可直接比较。

独立分析的弱点

第一个弱点是世界模型的失败模式偏乐观:prompt 中明确写了『DEFAULT TO PASS』——不确定时倾向判通过,这在减少假阴性(错杀好代码)的同时会系统性放过某些真错误,agent 可能学会钻模拟器的空子(写代码欺骗静态检查而非真实提高性能)。改进方向:把 anchor 的 10% 预算从随机分配改为主动分配——世界模型给出置信度,把真执行花在最不确定的组上,用同样的真值预算换更大的校正覆盖。第二个弱点是校正滞后:$\hat{f}$ 每 64 个新分数对才重拟合,而 agent 策略在快速漂移,世界模型误差的形态也随之变化,训练前期可能存在一段校准追不上漂移的窗口。改进方向:引入漂移检测(如对残差做 CUSUM 监控)触发即时重拟合,或用指数加权在线等回归。第三个弱点是理论假设偏理想:$L$-光滑加梯度支配对神经网络微调只是启发式,噪声独立同分布的假设在组内共享任务时也未必成立;结论对实践的约束力主要在定性层面。改进方向:在更弱的假设(如重尾噪声、相关偏差)下推导稳健版本,或补充非渐近的实验验证。第四个弱点是任务形态单一:排行榜百分位只有有限离散层级,恰好契合单调校准假设,换成连续或主观评价的任务(如开放式研究)时 Lemma 11 的条件可能失效。改进方向:对连续分数改用带形状约束的样条校准并理论化其收敛。

未来方向

作者指出的方向是:WMRL 的适用条件只是『奖励执行昂贵、但可以从 agent 产物预测、且有一小股真值流可锚定』,满足者皆可迁移——VLA 后训练已验证,自然的延伸包括科学实验自动化(湿实验验证贵、结果可从方案预测)、软件工程 agent 的测试执行等执行主导的场景。基于本文成果还可延伸:其一,把世界模型从纯 prompt 升级为在 anchor 分数对上轻量微调的专用模拟器,形成『真值流喂模拟器、模拟器喂 RL』的自举循环;其二,让世界模型输出校准的不确定度而非点估计,用于构造课程或拒绝采样,进一步压低 anchor 比例;其三,与测试时扩展结合——当 agent 交互轮数和轨迹量继续增长时,执行瓶颈只会更尖锐,WMRL 的相对收益会更大,值得在 10 倍轨迹量级上验证加速比是否保持;其四,理论上的自然延伸是放宽单调性假设到分段单调或 Lipschitz 扭曲,并把 anchor 分配从固定比例变为最优控制的在线分配问题;其五,长程科研工作流(文献调研、假设提出、实验、写作)中每个环节的成本结构不同,可以设计层次化的世界模型,只在最贵的环节引入真值锚定。

复现评估

复现条件总体友好。数据全部可得:MLE-Dojo 是公开基准,论文附录 C 给出了确定性的 45 训练/14 测试划分规则与完整任务列表(按每类数据集最小的 20 个竞赛、取最小 15 个训练、次小 5 个留出),DSBench 的 60 任务筛选规则(数据过大、缺 sample submission、格式超限的剔除)也写明,LIBERO-Long 公开。模型全部开源:Qwen3.5-4B/9B 开源权重,世界模型即同款权重加 prompt(附录 E 给出 agent 与世界模型的完整结构化 prompt,含真实运行实例),MiniVLA-1B 与 Robometer 均为公开模型。算力门槛:9B 训练 349 A100 GPU 小时(约合 15 张 A100 跑一天),4B 仅 286 小时,大学实验室可负担。工程细节披露充分:沙箱环境(Python 3.11、122 个包及精确版本表)、训练超参(lr $10^{-6}$、KL 0.04、熵 0.002、温度 1.0、8 组×8 轨迹、anchor 权重截断 $[1,4]$、校准从 200 对开始每 64 对重拟合)全部列出。主要难度在于 RL 基建:GRPO 训练循环、并行沙箱执行、世界模型 8 路检查流水线的工程整合需要相当的 infra 经验,但没有原理性障碍;论文未明确提及代码开源仓库(有项目页),完整复现可能需要自行搭建训练框架。综合评估:中等难度,2-3 名工程师一两个月可复现 4B 规模的主结果。