AutoWorldModel-Bench:面向自动化世界模型研究的状态中心基准 AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research
让AI编码智能体在6小时固定算力内自主改进世界模型,64次会话63次成功提升
前置知识
世界模型
学习环境动力学 $P(s_{t+1} \mid s_t, a_t)$ 的预测模型:给定当前状态和动作,预测下一状态。强的世界模型可以在潜空间或状态空间中'想象'长时程轨迹,供规划、控制和仿真使用。代表工作包括 Dreamer 的 RSSM、IRIS 等基于像素或潜变量的模型。
本文的整个基准就是围绕'改进世界模型'这一任务构建的,读者必须理解世界模型预测的对象(状态转移)以及为什么长时程开环 rollout 比单步预测更能反映模型质量。
ECS(实体-组件-系统)架构
游戏引擎中常用的架构模式:实体(Entity)是唯一标识的对象(玩家、子弹、墙);组件(Component)是挂在实体上的类型化数据容器(位置、速度、碰撞体);系统(System)是处理特定组件组合的函数。这种分解让场景可以模块化、可组合地序列化。
本文核心的状态表示直接借用 ECS:每一帧游戏状态被序列化为'帧信封'JSON,包含动作、全局状态和实体槽位列表。理解 ECS 才能理解为什么八款差异巨大的游戏能统一成同构张量。
Teacher forcing 与开环 rollout
Teacher forcing($h=1$)指模型每步都接收真值历史状态 $s_t$,只预测 $\hat{s}_{t+1}$,误差不累积;开环 rollout($h>1$)指只给初始状态 $s_0$ 和动作序列,模型把自己的输出 $\hat{s}_t$ 喂回作为下一步输入自回归预测到底,预测误差会逐步复利式放大。
本文最重要的实验发现是智能体的增益几乎全部集中在长程开环 rollout($h=10,20$)而非单步拟合,这一 horizon 不对称的结论完全建立在对这两种评测模式的区分上。
四种基础世界模型架构
Dreamer/RSSM:GRU 循环状态空间模型,离散类别隐变量(32×32)、free-bits KL 正则、symlog 损失;AR-Transformer:块因果注意力的自回归 Transformer;D3PM:离散去噪扩散 + Transformer 编码器,把位置量化为词表 token;MaskGIT:掩码生成目标 + 迭代并行解码。连续模型预测位置增量,离散模型预测绝对 bin 索引。
智能体必须从这四种截然不同的架构家族之一出发做改进,结果表(Table 2)按(游戏,架构)分格报告,不认识这些架构就看不懂增益的分布规律。
AI 研究智能体与 MLE 基准
指能读代码库、提出假设、写训练管线、跑实验并根据结果迭代的 LLM 驱动系统。现有评测如 MLE-bench 类专注于目标明确的机器学习工程任务,改进方向和指标事先指定;更开放的科研发现设定则难以可控、可复现地评估。
本文的自我定位就是填补'开放式研究'评测的空白:改进方向不预先指定,智能体要自己在大且欠定的设计空间里生成并检验假设,这是理解论文动机的关键。
奖励黑客与防作弊设计
智能体为最大化评测分数而钻评分器空子而非真正解决任务的行为。常见防御手段包括:把评分脚本设为只读、固定评测配置、用独立的后验评估器在 agent 看不到的 held-out 数据上打分、设计能淘汰退化解的复合指标。
因为智能体可以自由修改 train.py,本文的 harness 必须防止它去优化评分器而不是动力学模型;论文第 5.5 节的 reward-hacking 审计是结果可信度的关键保障。
研究动机
世界建模是一个'尚未定论'的领域:架构、训练目标、状态表示之间以复杂方式相互作用,没有任何单一配方在所有环境下占优,这导致系统性地探索设计空间可能带来巨大回报。与此同时,当前对 AI 研究智能体的评测严重失衡:大多数基准集中在数据集、指标、改进方向都事先规定好的良构问题上(工程到规格型任务),而最开放的科研发现设定又难以可控、可复现地评估。稀缺的恰恰是两者的结合——把智能体放在真正的研究前沿:设计空间巨大、决策间交互规律不明、实验必须在有限预算下顺序展开、成功依赖提出并检验新假设而非重组已知配方。此外,主流世界模型大多从像素或潜变量学习,感知误差与动力学误差纠缠在一起,无法单独评估'动力学建模'本身的质量,也让每次实验迭代慢到难以支撑智能体的闭环研究。
本文的目标是本文要构建一个闭环基准 AutoWorldModel-Bench:让前沿编码智能体(Codex-5.4 与 Claude Opus 4.6)在严格固定的算力预算内(单卡 H100、6 小时会话、单次训练 10 分钟墙钟上限)自主改进一个给定的基础世界模型,以 held-out 测试集上的预测性能作为唯一成功标准。具体目标包括四个:(1) 在八款游戏环境上建立统一的结构化状态表示,剥离感知、支持分钟级每次运行的迭代;(2) 定义六小时算力受限的闭环评测协议;(3) 系统评估两个前沿智能体在 64 个(游戏,基础模型)会话上的表现;(4) 用零样本判官分类每次实验改动,分析增益究竟来自非平凡的研究型修改还是超参数调节。
与已有工作不同的是,本文的独特切入角度有两个层面。其一是状态中心:与 WorldTest/AutumnBench、WorldModelBench 等像素或视频导向的世界模型评测不同,它直接把游戏引擎内部的真值实体状态(ECS 快照)暴露给模型,用共享张量格式统一八款游戏,从而把'动力学建模'从感知中隔离出来,并把单次实验迭代压缩到分钟级——这是让智能体能做闭环研究的前提。其二是智能体侧闭环:被测对象不是某个预训练好的模型,而是编码智能体在固定算力预算内现场产出、现场改进的模型,这使它区别于所有'评测既有模型'的基准,成为首个衡量'开放式研究能力'而非'按规格工程能力'的世界模型研究基准。
核心方法
整体思路是先造一个'干净的研究底座',再把智能体放进闭环。底座方面:八款经典街机游戏(贪吃蛇、青蛙过河、Pong、打砖块、小行星、平台跳跃、Kong、赛车)各自通过游戏适配器把引擎状态转成统一的 ECS 帧信封 JSON,再张量化为同构格式——实体注册表 $R \in \mathbb{R}^{N \times 34}$(碰撞形状、半径、碰撞层等,episode 内不变)、实体状态 $S_t \in \mathbb{R}^{N \times 23}$(归一化位置、存活标志、速度、14 维游戏字段、4 维位置历史增量)、动作 $a_t \in \mathbb{R}^7$(并集字段,逐游戏掩码激活 1–3 维)、游戏状态 $g_t \in \mathbb{R}^{17}$、终止标志 $t_t$。数据集共 152,000 个 episode、超过 1.58 亿帧,由启发式、随机、RL(PPO/DQN)三种策略采集。评测采用三种互补模式:teacher-forced($h=1$)、开环 rollout($h \in \{10,20\}$)、以及隔离单一游戏机制的场景测试。每个 horizon 上计算 $\text{composite}_h = 0.9 \cdot (1 - \text{Position L1}_h) + 0.1 \cdot \text{Alive F1}_h$,最终分数 $\text{final} = 0.1 c_1 + 0.2 c_{10} + 0.7 c_{20}$,权重刻意偏向长程 rollout。智能体在基于 Harbor 的 Docker 容器中工作:任务目录含 instruction.md、单文件基础模型 train.py、config.json、只读的 run.py 与 score.py、预缓存张量数据,实验记录追加到 experiments/ 的 summary.tsv 供后续决策参考。
核心创新有三点。第一,'真值结构化状态'的表示选择:不像 IRIS 等工作在离散图像 token 上操作,也不像对象中心方法必须从视觉推断物体身份,本文直接读取游戏引擎内部的实体状态,使感知与动力学解耦、误差归因清晰、迭代达到分钟级——这把世界模型研究变成智能体可负担的闭环实验。第二,闭环智能体评测协议:与 MLE-bench 类'目标明确'的工程任务不同,本文不指定改进方向,智能体面对的是欠定的开放设计空间,评分完全由事后独立评估器在 agent 从未见过的 test 与 scenario 划分上给出。第三,系统性的防奖励黑客设计:run.py、score.py、评测器只读挂载,评分器硬编码评测 horizon 为 $\{1,10,20\}$ 使配置编辑无法缩小评分范围,会话内分数不能结转,复合分中的 Alive-F1 项专门击败'预测一切存活'的退化解。
方法步骤详情
第一步,数据采集:每款游戏用启发式智能体、随机智能体和 RL 智能体(PPO/DQN 加逐游戏奖励塑形)各采集 19,000 个 episode,八款游戏合计 152k episode、1.58 亿帧;人工审查后为六个启发式打不到后期状态的游戏补充了 RL 智能体。第二步,张量化:按每游戏 manifest 把帧信封转为固定槽位预算 $N$ 的张量(可变实体为预测目标,不可变实体作条件上下文),轨迹切成 $W=8$ 的窗口缓存,划分为训练/验证/test/scenario 四个划分,agent 只读前两者。第三步,会话启动:每个(游戏,基础模型,智能体)组合打包成 Docker 容器,智能体阅读统一模板的 instruction.md,从单文件 train.py 出发。第四步,迭代循环:分析 summary.tsv 与历史日志 → 设计改动(架构/损失/超参)→ 经 run.py 训练(每次上限 10 分钟)→ score.py 在验证集三个 horizon 上评分 → 循环。第五步,会话收尾:独立验证器用 score.py 选出验证最优 checkpoint,再在 held-out test 与 scenario 划分上各评一次,得到最终排名依据。
技术新颖性
技术新颖性体现在四个方面。其一,表示层面的新颖性:文献中对象中心方法需推断物体身份与对应关系,感知误差会传导进动力学;本文利用'视频游戏本来就在内部维护结构化实体状态'这一事实,首次在真值 ECS 状态上系统评测世界模型学习,形成干净的'无噪声底座'。其二,评测目标的新颖性:WorldTest/AutumnBench 评测无奖励探索,WorldModelBench 评判视频生成模型,都是'评预训练模型';本文评的是'智能体现场研究产出的模型',并加入来自真值初始状态、隔离碰撞/得分/终止等机制的场景测试套件,检验规则一致性而非仅轨迹统计。其三,协议设计的新颖性:horizon 加权分数 $0.1c_1+0.2c_{10}+0.7c_{20}$ 刻意放大长程误差累积的信号,场景分数把长程项放在整条 episode 末尾 $h_{end}$,奖励全程保真。其四,分析方法的新颖性:用 Gemini Pro 3.1 做零样本判官,把全部 1,335 个实验的代码 diff 分类为九类改动,并验证去掉智能体自述意图后平凡/非平凡二分仍有 94.6% 的复现一致性。
实验结果
核心发现可以分五条来看。第一,智能体几乎总能改进基础模型:64 个会话中 63 个在 held-out test 划分上超过基线,平均 test 分数提升 $+0.196$(中位数 $+0.115$),其中 33 个为大幅提升($\Delta \ge +0.10$)、10 个中等、20 个微小;唯一例外是 Claude Opus 4.6 在 Breakout/D3PM 上回退 0.001,而 Codex-5.4 在所有任务上都改进了基线。增益幅度与基线强弱挂钩:Asteroids 基线平均仅 0.213、提升后达 0.618($+0.405$),而 Pong 基线已达 0.792、只提升到 0.895($+0.103$)。第二,两个智能体在此样本量下无法区分:Codex-5.4 以 19–13 领先,平均最高 test 分 0.772 对 0.736,配对 Wilcoxon 检验 $p=0.15$ 不显著;但 Codex-5.4 中位只用 25.9M token(Claude 为 37.2M),累计 $\Delta$test 更高($+6.71$ 对 $+5.85$),单位分数提升的 token 效率约高 1.65 倍。第三,获胜改动以非平凡研究型修改为主:58/64(91%)会话的最佳实验属于架构/损失/rollout/推理/数据增强类而非纯超参数调节;全池 1,335 个实验中非平凡子集(1,220 个)平均 $\Delta$ 为 $+0.146$、85% 超基线,平凡子集(115 个)仅 $+0.126$、73%。第四,增益集中在长程 rollout:$h=1$ 平均仅 $+0.056$(47/64 会话改善),$h=10$ 达 $+0.205$(62/64),$h=20$ 达 $+0.215$(63/64)——智能体改进的是'用自己预测滚动的状态保真度'而非单步拟合。第五,三项稳健性检查全部通过:智能体在场景套件上击败随机搜索 27/32、TPE 25/32,关闭的 headroom 中位数为随机搜索的约两倍(46% 对 21%);96 个种子重复会话中 94 个改进基线,中位改进 $+0.14$ 约为种子波动(0.049)的 2.9 倍;奖励黑客审计未发现评分器篡改,自报与独立分数差中位仅 0.008。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| held-out test 划分上的世界模型改进(64 会话) | test 分数提升 $\Delta$test($0.1c_1+0.2c_{10}+0.7c_{20}$) | 63/64 会话改进基线,平均 $+0.196$,中位 $+0.115$,33 项 $\ge +0.10$ | 四个基础世界模型原版(Dreamer/AR-Transformer/D3PM/MaskGIT) | 平均 $+0.196$;最大单格如 Snake/AR-Trans/Codex 达 $+0.74$,Asteroids 游戏平均 $+0.405$ |
| 场景规则测试套件(held-out scenario) | scenario 分数(长程项取 $h_{end}$) | 56/64 会话超过基线,平均提升 $+0.170$(中位 $+0.149$) | 基础模型在同一场景套件上的得分 | 平均 $+0.170$,与 test 提升方向在 55/64 会话一致(任务级相关 $r=0.89$) |
| 对计算量匹配的搜索基线(逐格比较) | held-out 场景/test 分数胜场与 headroom 关闭比例 | 最佳智能体击败随机搜索 27/32、TPE 25/32(场景套件),关闭约 2 倍 headroom(中位 46% 对 21%) | 同等 6 小时预算 + 10 分钟单次上限的随机搜索与 Optuna/TPE 贝叶斯优化 | 证明仅调暴露的超参数旋钮无法达到智能体改 train.py 的收益 |
| 智能体间对比(32 个共享任务) | 最高 test 分数与 token 效率 | Codex-5.4 平均 0.772、19–13 领先;中位 25.9M token;累计 $\Delta$test $+6.71$ | Claude Opus 4.6:平均 0.736;中位 37.2M token;累计 $+5.85$ | 统计不显著(Wilcoxon $p=0.15$),但 Codex-5.4 单位分数 token 效率约 1.65 倍 |
局限与改进
作者明确承认四点局限。其一,对比的是完整的编码智能体系统而非纯模型:context 管理、重启行为、工具使用、实验调度都混在 6 小时预算里,token 效率差异(1.65×)很大程度上反映 harness 差异(重启循环 vs 单连续会话),只能作系统级结论。其二,主分数强调 $h_{10},h_{20}$ 的动作条件 rollout 保真,总分提升不应读作各 horizon 均匀提升;场景套件仍评分状态保真度,而非为每条规则手写的符号谓词。其三,真值结构化状态剥离了感知但限制了外推:结论未必迁移到像素设定,张量格式只覆盖八款游戏需要的字段,且这是无传感器噪声、无缺失值的刻意干净底座,与真实科研数据的脏程度不同。其四,多数会话只跑一次,种子敏感性可观:Snake/Codex/Dreamer 三个种子的最高分波动为 0.64/0.92/0.65,在已接近饱和的 Racer 格子上增益与种子波动同量级。我自己的观察补充两点:八款经典街机游戏的动力学相对简单、实体数最多 52,能否代表现代复杂环境存疑;且九类改动分类依赖 Gemini Pro 3.1 零样本判官与智能体自述意图,论文自己也把细粒度类别降级为描述性结论。
独立分析的弱点
第一,单次会话的统计功效不足:每个(游戏,架构)格子对每个智能体只跑一次,仅一半网格有三次种子重复,导致 Codex 与 Claude 的 19–13 对比无法达到显著($p=0.15$),论文自己也承认缺少 TOST 等价检验——改进方向是预注册等价边际并扩大重复网格到全部 64 格。第二,评测只覆盖状态保真度,不含任何下游使用:世界模型的最终价值在于支撑规划与控制,一个 rollout 误差小但不含可控隐变量的模型未必是好规划基底,可补充'用改进后模型做 MPC/RL 的下游回报'作为第二指标。第三,Best-of-k 偏差未解决:Claude 平均每会话 23.5 次实验、Codex 18.2 次,取最高分时尝试次数多者天然占优,论文只把它作为与 19–13 结果一致的另一种解释,可用固定 $k$ 的配对重采样或按 token 预算归一来消除。第四,场景测试虽隔离机制但仍用位置/存活复合分打分,一条'吃食物得分'规则可以被轨迹统计部分掩盖,改为符号化规则判据(如'碰撞后位置必须反转')会更锐利。第五,游戏域窄且动力学简单:网格、连续物理、多智能体虽都有覆盖,但缺少部分可观测、随机性动力学和长时程记忆需求强的环境,智能体在这些设定下的研究能力可能完全不同。每个弱点都对应明确的后续实验设计,属于'可以修'的问题。
未来方向
作者指出的方向:给干净底座加入噪声注入与字段掩码变体,逐步逼近真实科研数据中的传感器噪声与缺失值;把张量表示扩展到视觉属性与更多物理变量以覆盖更广的游戏类型;用共享编排层或互换 harness 来分离模型质量与 harness 效应,把系统级对比升级为模型级结论;执行预指定边际的 TOST 等价检验。基于本文成果可自然延伸的方向:其一,把同一闭环协议搬到像素级世界模型,检验状态中心发现的'长程误差累积改进'配方(运动学先验、环形包裹增量表示等)是否迁移;其二,将评测对象从'改模型'扩展到'改环境假设',例如让智能体面对含噪声、含未观测混淆的真值状态,衡量其提出并验证因果假设的能力;其三,用该基准的 1,335 个已分类实验构建'研究策略轨迹'数据集,训练或微调专门的实验策略模型;其四,把场景套件符号化,直接评测模型的规则一致性与反事实推理;其五,随前沿模型迭代做纵向研究,观察'开放式研究能力'随模型代际的增长曲线,这正是此类基准相对静态工程基准的最大价值。
复现评估
复现条件总体友好但依赖较重的资源。论文承诺开源基准、全部基础模型代码和逐实验产物(experiments/ 目录含每次运行的配置、日志、checkpoint 与 summary.tsv 索引),项目页面为 electronicarts.github.io/AutoWorldModelBench/。数据侧:152k episode、1.58 亿帧的轨迹与预缓存窗口张量($W=8$)会随之发布,训练/验证划分只读、test/scenario 划分单独存放——复现者需要注意不要让被测 agent 接触 held-out 划分。算力侧:单次会话需一张 H100 跑 6 小时(单次训练上限 10 分钟),完整复现论文主表需 64 个会话、种子研究再加 96 个,总计约 160 卡时 × 6 = 上千 GPU 小时,但只复现几个格子的消融则每格仅需 6 小时单卡。智能体侧需要 Codex-5.4 与 Claude Opus 4.6 的 API 访问(中位每会话 25.9M–37.2M token),改用其他智能体时 harness 基于 Harbor 容器运行时,接口明确。主要复现风险:平台非确定性会让基线重跑产生不同的步数与长程行为(论文 G.9 节专门记录了 8 卡共享主机上的这一问题),以及 LLM 判官分类结果随模型版本漂移。综合评估:代码与数据开源后,中等投入即可复现单格结果,完整复现主表需要机构级算力。
论文图表