← 返回 2026-07-30

AI 智能体开展开放式 AI 研究的能力评估:两项案例研究的早期证据 Can AI agents conduct open-ended AI research? Early evidence from two case studies

Peter Kirgis, Sayash Kapoor, Andrew Schwartz, Stephan Rabanser, David Africa, Konstantinos Voudouris, Viet Nguyen, Toby Pilditch, Magda Dubois, Harry Coppock, Cozmin Ududec, Nitya Nadgir, Matilda Orona, Tilman Bayer, Derrick Chan-Sew, Yue Ling, Abhishek Shetty, Helen Toner, Gillian Hadfield, Seth Lazar, Steve Newman, Shoshannah Tekofsky, Rishi Bommasani, Arvind Narayanan 📅 2026-07-29 👍 18 2026-08-04 18:30
AI智能体 AI研究自动化 前沿模型 同行评审 影子评估 评估方法

提出影子评估法,测试前沿智能体能否独立完成开放式 AI 研究并写出顶会论文

前置知识

AI 研发自动化(AI R&D Automation)

指 AI 智能体自主完成 AI 研究的整套生命周期——选题、设计实验、跑训练、写论文——从而加速甚至闭环'递归自我改进'。这是许多'爆炸性 AI 进展'预测的核心前提,也是 Anthropic《When AI Builds Itself》、OpenAI 宣传 GPT-5.6 Sol 参与小模型后训练等声明的依据。

这正是本文要检验的中心问题:当前前沿模型到底能不能做开放式 AI 研究,而不只是窄指标工程。

可验证任务 vs 开放式任务(Verifiable vs Open-ended)

可验证任务有一个可由自动验证器打分的单一指标,如 RE-Bench、MLE-Bench、PostTrainBench、NanoGPT Speedrun 要求智能体优化训练损失或 Kaggle 排名;智能体可以靠'爬山'(hill-climb)逐步逼近。开放式任务则要求判断'该问什么问题、什么证据能定论、何时该推倒重来',无法压缩成单一数字。

本文的关键区分正是:智能体能爬山完成可验证工程,却在开放式研究判断上系统性失败。

智能体脚手架(Agent Scaffold)

包裹大语言模型、负责编排工具调用、记忆、子智能体、上下文管理与预算监控的外层程序。本文用模型商无关的 OpenClaw 跑 Claude Opus 4.8,并用 OpenAI 原生 Codex 跑 GPT-5.6 Sol 做鲁棒性对照。'脚手架过载'(scaffold overhang)指能力被坏工具/缺指令而非模型本身卡住的风险。

评估结论是否可信,很大程度取决于失败是模型能力不足还是脚手架瓶颈——作者用双脚手架对照正是为此。

影子评估(Shadow Evaluation)

本文提出的新评估范式:取一篇尚未公开的高质量论文的核心研究问题,交给资源充足的前沿智能体独立攻关(看不到原文与结论),再由该论文原作者像审会议投稿一样给产出打分。智能体在'影子'里重走原作者的路。它兼具开放式、未污染、专家评审、可重复四点。

这是论文最核心的方法论贡献,理解它才能理解全部结果与局限的来由。

生成器-验证器差距(Generator-Verifier Gap)

指智能体可能'生成'研究却无法可靠'判断'研究好坏。若存在可靠的验证器,就能用强化学习快速驱动研究能力进步。本文发现 AI 审稿能稳定拒掉差稿,但因两篇都是拒稿,无法证实它真的具备判别好坏的能力——可能只是无差别拒稿。

这一差距是解释智能体为何'能自审却不改进'的关键,也指向未来的核心研究机会。

研究动机

关于 AI 智能体能否自主开展 AI 研究,现有评估方法存在两类明显盲区。第一类是'可验证任务'基准,如 RE-Bench、MLE-Bench、PostTrainBench、NanoGPT Speedrun 等,要求智能体优化一个固定窄指标并由自动验证器打分;这类评估客观、可重复、可规模化,却把成功压缩成单一数字,排除了'该问什么问题、什么证据能定论、何时该推倒重来'这类无法爬山得到的开放式研究能力。第二类是把 AI 生成的论文投递盲审会议,如 Sakana 的 AI Scientist-v2 在 ICLR 2025 workshop、Intology 的 Zochi 在 ACL 2025。但会议评审本就过载且随机:NeurIPS 在 2014 与 2021 用两个委员会重审同样论文,发现约一半分数变异来自主观、约四分之一的接收/拒稿决定不一致、约一半被接收的论文若重审会被拒。此外生成一篇论文成本极低,开发者可海量投稿只报接收、隐瞒拒稿,使'接收'几乎无法说明系统能稳定产出好研究。

本文的目标是本文的目标是补上第三条评估路径——既能考察开放式、长周期的研究任务,又能拿到真正懂该问题的专家深度评审。具体地,作者希望设计一种可重复的方法,用顶会级(NeurIPS 2026)真实研究问题作为考题,给前沿智能体几乎不受约束的推理算力与外部资源(6 天挂钟时间、$3{,}000 API 额度、GPU、完整虚拟机与开放网络),让它独立产出一篇'值得在顶会发表'的论文,再由原论文作者按会议审稿标准打分(1='Strong Reject' 到 6='Strong Accept')。借此判断:当前前沿模型在工程能力之外,能否完成研究生命周期中真正关键的判断、创造与回溯环节。

与已有工作不同的是,本文的独特切入在于'未公开论文'这一杠杆:研究问题取自已投稿但尚未上网的 NeurIPS 论文,因此智能体既无法从训练数据里背答案、也无法在网上检索到结论,保证了任务未被污染;同时原论文作者为回答同一问题已投入数月,是世上最懂'这条研究路线做到什么程度算成功'的人,比随机分配的盲审专家更能精确定位智能体是否真正取得进展。这一设计还直接检验了'递归自我改进'预测背后的核心机制——研究者把整个项目委托给智能体、再判断返回结果是否推进了工作。它与仅看窄指标或仅看会议接收的既有做法形成互补。

核心方法

方法的直觉是让智能体'影随'原论文作者:拿到同一道研究问题,在看不到原论文与结论的前提下独立攻关,最后由原作者像审会议投稿一样评判其产出。技术路线上,作者与两篇未公开 NeurIPS 2026 投稿的作者合作——一篇是关于 LLM 人格(persona)能否在'权重空间'中被分解、测量与控制的 Personas 论文;另一篇是为表格基础模型(tabular PFN)设计部署时分布偏移检测器的 TabPFN 论文。原作者负责三件事:不暗示方向地写出研究问题、协助设定足以实质性回答问题的资源预算、最后以顶会审稿人身份给分。整个流程对两道问题完全通用,脚手架的任何修改都必须对一般 ML 研究适用,作者记录了运行中的每一次人工介入。

核心创新是评估方法本身——'影子评估',它把开放式任务与深度专家评审嫁接到一起,并用'未公开论文'同时解决污染与专家稀缺两个难题。与可验证基准(窄指标、可爬山、可规模化但排除判断力)和盲审评估(开放式但随机、过载、可被海量投稿注水)相比,影子评估兼具四点:任务开放式且贴近顶会真实难度、问题未被污染、评审者是世上最懂该问题的原作者、且可随新论文与新模型重复。资源设定同样关键:6 天挂钟时间、$3{,}000 API、GPU 额度、完整 AWS 虚拟机与开放网络,外加自我审查子智能体与三类外部 AI 审稿工具(Stanford Agentic Reviewer、CMU Paper Reviewer、refine.ink),力求测出性能上界而非被资源卡住。

方法步骤详情

流程分为六步。①选题:与两篇未公开论文作者合作,产出不含提示的研究问题与背景说明(附录 A)。②搭环境:在 OpenClaw(模型商无关的通用脚手架)上跑 Claude Opus 4.8 的'超高推理'档,给一台 Linux 虚拟机、可实时自查 token/算力/剩余时间的接口、可派发子智能体并维护研究日志,再加一个只能看到成稿 PDF 加 NeurIPS 模板的盲审子智能体,以及三类外部 AI 审稿工具。③执行:智能体自主完成文献综述、调试 GPU 环境、跑数百次实验、抓取外部审稿、编译 LaTeX 终稿;期间仅三次人工介入(修 OpenClaw 与 Anthropic thinking 块签名冲突的崩溃、给 24 小时延期、要求重写晦涩文本)。④评审:原作者按 NeurIPS 四维度(质量/清晰度/重要性/原创性,各 1–4)与总分(1–6)打分并给置信度。⑤日志分析:团队逐条分析完整轨迹,归纳失败模式。⑥鲁棒性:用 GPT-5.6 Sol Ultra 加 Codex 原生脚手架在 TabPFN 上重跑。整轮还事先对 12 位合作者做了预期调查以记录先验。

技术新颖性

新颖性在于评估范式而非某个算法。相比 RE-Bench/MLE-Bench 这类用自动验证器打单一指标的基准,影子评估测的是无法被指标压缩的开放式研究判断力;相比 AI Scientist-v2/Zochi 这类把生成论文投盲审的做法,它用'未公开问题加原作者评审'同时消除了训练污染、评审随机性与'只报接收隐瞒拒稿'的注水空间,并把评分颗粒度细化到专家对'是否真推进了这道题'的判断。它还把脚手架做成通用型(OpenClaw/Codex),避免为单题过拟合,并通过发布全部专家评审、调查、智能体仓库与日志来对冲开放世界评估固有的研究者裁量权。

Comparison between the agents' planned and realized wall-clock budgets for milestones
Figure 2: Comparison between the agents' planned and realized wall-clock budgets for milestones
How OpenClaw coordinates the core agent, subagents, tool calls, and long-running GPU jobs
Figure 5: How OpenClaw coordinates the core agent, subagents, tool calls, and long-running GPU jobs

实验结果

核心结论是:两个智能体都完成了研究所需的全部工程,却没能产出顶会级研究,被原作者明确拒稿。打分上(Table 1),Personas 论文质量 2/4、清晰度 1/4、重要性 2/4、原创性 3/4、总分 2/6(Reject)、置信度 4/5;TabPFN 论文质量 1/4、清晰度 2/4、重要性 2/4、原创性 2/4、总分 1/6(Strong Reject)、置信度 5/5。资源利用是显著异常:Personas 仅花 $1{,}130/$3{,}000 API、$392/$500 GPU;TabPFN 花 $1{,}235/$3{,}000 API、$69/$100 GPU,两轮都不到预算一半(Figure 1)。承诺过快同样触目惊心:Personas 计划 42 小时探索却在 5 小时就定方法;TabPFN 头 14 小时内把六条假设全部证伪,之后 110 小时再未改换思路(Figure 2)。自我审稿在十余轮里从未给过接收(Figure 3)。两篇都超 9 页上限写到第 10 页,Personas 正文 0 张图(原作有 15 张),参考文献 16 vs 52(Personas)、36 vs 69(TabPFN)。日志分析归纳出五大失败模式:对发表门槛判断差、对设计缺陷缺乏创造性回应、无法有效回溯死路、资源意识差、指令漂移。值得肯定的是未发现实质性 reward hacking,智能体反而主动把可营销主张撤回为负结果;Personas 还产出一项反直觉发现(仅在错位'风格'上微调并未引发广泛的错位泛化,与 emergent misalignment 预期相反)。用 GPT-5.6 Sol Ultra 加 Codex 在 TabPFN 上重跑,复现了几乎所有失败模式(虽在两天内烧光 $3{,}000、剩约 100 小时)。TabPFN 智能体最像样的结果——一个超越 D3M/Detectron 的检测器——在合成偏移上 AUROC 约 0.76,到真实偏移上却掉到约 0.60。

Summary of the original paper authors' reviews of the agents' submitted work
Table 1: Summary of the original paper authors' reviews of the agents' submitted work
Strengths and limitations of our shadow evaluations for measuring progress towards AI R&D automation
Table 3: Strengths and limitations of our shadow evaluations for measuring progress towards AI R&D automation
Detailed comparison of the human experts' and agents' final reviews of the agents' work
Table 4: Detailed comparison of the human experts' and agents' final reviews of the agents' work
Annotated summaries of the agents' time, API, and GPU compute expenditures
Figure 1: Annotated summaries of the agents' time, API, and GPU compute expenditures
Summary of the paper reviews from subagents, external AI reviews, and expert human reviews
Figure 3: Summary of the paper reviews from subagents, external AI reviews, and expert human reviews
查看结构化数据
任务指标本文基线提升
独立产出顶会级 Personas 论文 原作者 NeurIPS 总评(1–6) 2/6(Reject),置信度 4/5 ≥4/6(Borderline Accept 及以上) 未达标,距接收门槛差 2 档,被明确拒稿
独立产出顶会级 TabPFN 论文 原作者 NeurIPS 总评(1–6) 1/6(Strong Reject),置信度 5/5 ≥4/6(Borderline Accept 及以上) 未达标,距接收门槛差 3 档,被强烈拒稿
API 预算利用率 实际花费 / 可用额度 Personas 约 38%、TabPFN 约 41% 接近 100%(在未达标时应继续投入) 大量闲置(<50%),暴露资源意识缺失
自我审稿识别稿件质量 十余轮迭代中的接收次数 0 次接收(始终 Weak Reject 及以下) 应在达标稿件上给出接收 一致拒稿,无法证实判别好坏的能力
跨脚手架/模型鲁棒性 失败模式复现情况 GPT-5.6 Sol Ultra + Codex 复现几乎全部五大失败模式 结论稳健,排除了单一脚手架/模型artifact的解释

局限与改进

作者坦承若干局限。样本极小:核心结果来自五次运行(两次无推理 pilot、两次超高推理主跑、一次 Codex 鲁棒性),远小于动辄数十题的基准评估,尽管失败模式跨运行一致。评审非盲:原作者既已用特定方法答过该题,又知道稿件出自 AI,可能偏向自家思路或对 AI 更苛刻;Personas 评审者甚至直言'this paper basically misses the point of our paper'。还存在研究者裁量权(选题、脚手架、日志解读都带先验)与评估意识(明确告知智能体在按 NeurIPS 标准被评)。此外 6 天虽长于多数既有评估,却远短于原作者投入的数月与其训练所用 GPU 时数;且无法测到 Anthropic 最强模型(Fable 5 在前沿 AI R&D 上被刻意限制)。我的观察是:'无弃权选项'的设计可能系统性诱导智能体写负结果论文,而非像人类那样尽早换路。

独立分析的弱点

第一,n=2 过小且选题可能偏向'需要创造力的实证研究',难以外推到增量式或偏工程的研究;改进方向是建立预注册的、跨子领域的问题库并公开抽样规则。第二,非盲评审引入偏差风险(原作者偏好自家方法、对 AI 更严),可做'去 AI 化'的轻量盲法(统一格式、剥离可识别痕迹)或引入第三方领域专家二次评审。第三,6 天挂钟对'慢科学'不公——某些研究需要更长的训练运行或迭代周期;可按问题类型分级设定预算并报告预算敏感度。第四,'必须交论文、不可弃权'的设计把失败包装成负结果论文;应增加显式弃权/重启选项并奖励及时止损。第五,脚手架投入不对称——OpenClaw 经多轮迭代而 Codex 仅做鲁棒性复现;未来应在每个脚手架上做等量工程后再比较,以免低估 GPT-5.6 的真实上界。

未来方向

作者计划在更大问题集上用 GPT-5.6 Sol、Opus 5、Fable 5/Mythos 5 继续跑,并进一步优化脚手架以厘清结果对模型与脚手架的敏感度,同时欢迎对抗性合作。基于成果可延伸的方向包括:构建预注册的未公开论文问题池形成标准化基准;校准 AI 审稿器(论文发现其一致拒稿却无法证实判别力,需正样本标定 generator-verifier gap);消融'弃权选项/奖励函数'对负结果倾向的影响;把影子评估从 ML 扩展到其他学科的开放式研究;研究'判断力/创造力/认知锁定'等构念的可操作定义,以减少作者团队承认的诠释分歧。

复现评估

透明度较高:作者在 cruxevals.com 发布了专家评审、预期调查、智能体仓库与运行日志;但其中一篇论文尚未公开,故其详细日志与智能体成稿暂不披露,复现该题需等待原文公开。算力门槛中等偏上:单次运行约 6 天挂钟加最多 $3{,}000 API 加数百 GPU 时(Personas 约 $392、TabPFN 约 $69 GPU)加一台 AWS 虚拟机与开放网络。脚手架为通用型(OpenClaw、Codex),降低了为单题过拟合的风险,但 OpenClaw 与 Anthropic thinking 块签名冲突的崩溃需手动 patch(TabPFN 触发 14 次、Personas 5 次)。总体而言,方法学流程可复现,但完整重跑需可观的 API/GPU 预算与对脚手架细节的调试。