AI 智能体开展开放式 AI 研究的能力评估:两项案例研究的早期证据 Can AI agents conduct open-ended AI research? Early evidence from two case studies
提出影子评估法,测试前沿智能体能否独立完成开放式 AI 研究并写出顶会论文
前置知识
AI 研发自动化(AI R&D Automation)
指 AI 智能体自主完成 AI 研究的整套生命周期——选题、设计实验、跑训练、写论文——从而加速甚至闭环'递归自我改进'。这是许多'爆炸性 AI 进展'预测的核心前提,也是 Anthropic《When AI Builds Itself》、OpenAI 宣传 GPT-5.6 Sol 参与小模型后训练等声明的依据。
这正是本文要检验的中心问题:当前前沿模型到底能不能做开放式 AI 研究,而不只是窄指标工程。
可验证任务 vs 开放式任务(Verifiable vs Open-ended)
可验证任务有一个可由自动验证器打分的单一指标,如 RE-Bench、MLE-Bench、PostTrainBench、NanoGPT Speedrun 要求智能体优化训练损失或 Kaggle 排名;智能体可以靠'爬山'(hill-climb)逐步逼近。开放式任务则要求判断'该问什么问题、什么证据能定论、何时该推倒重来',无法压缩成单一数字。
本文的关键区分正是:智能体能爬山完成可验证工程,却在开放式研究判断上系统性失败。
智能体脚手架(Agent Scaffold)
包裹大语言模型、负责编排工具调用、记忆、子智能体、上下文管理与预算监控的外层程序。本文用模型商无关的 OpenClaw 跑 Claude Opus 4.8,并用 OpenAI 原生 Codex 跑 GPT-5.6 Sol 做鲁棒性对照。'脚手架过载'(scaffold overhang)指能力被坏工具/缺指令而非模型本身卡住的风险。
评估结论是否可信,很大程度取决于失败是模型能力不足还是脚手架瓶颈——作者用双脚手架对照正是为此。
影子评估(Shadow Evaluation)
本文提出的新评估范式:取一篇尚未公开的高质量论文的核心研究问题,交给资源充足的前沿智能体独立攻关(看不到原文与结论),再由该论文原作者像审会议投稿一样给产出打分。智能体在'影子'里重走原作者的路。它兼具开放式、未污染、专家评审、可重复四点。
这是论文最核心的方法论贡献,理解它才能理解全部结果与局限的来由。
生成器-验证器差距(Generator-Verifier Gap)
指智能体可能'生成'研究却无法可靠'判断'研究好坏。若存在可靠的验证器,就能用强化学习快速驱动研究能力进步。本文发现 AI 审稿能稳定拒掉差稿,但因两篇都是拒稿,无法证实它真的具备判别好坏的能力——可能只是无差别拒稿。
这一差距是解释智能体为何'能自审却不改进'的关键,也指向未来的核心研究机会。
研究动机
关于 AI 智能体能否自主开展 AI 研究,现有评估方法存在两类明显盲区。第一类是'可验证任务'基准,如 RE-Bench、MLE-Bench、PostTrainBench、NanoGPT Speedrun 等,要求智能体优化一个固定窄指标并由自动验证器打分;这类评估客观、可重复、可规模化,却把成功压缩成单一数字,排除了'该问什么问题、什么证据能定论、何时该推倒重来'这类无法爬山得到的开放式研究能力。第二类是把 AI 生成的论文投递盲审会议,如 Sakana 的 AI Scientist-v2 在 ICLR 2025 workshop、Intology 的 Zochi 在 ACL 2025。但会议评审本就过载且随机:NeurIPS 在 2014 与 2021 用两个委员会重审同样论文,发现约一半分数变异来自主观、约四分之一的接收/拒稿决定不一致、约一半被接收的论文若重审会被拒。此外生成一篇论文成本极低,开发者可海量投稿只报接收、隐瞒拒稿,使'接收'几乎无法说明系统能稳定产出好研究。
本文的目标是本文的目标是补上第三条评估路径——既能考察开放式、长周期的研究任务,又能拿到真正懂该问题的专家深度评审。具体地,作者希望设计一种可重复的方法,用顶会级(NeurIPS 2026)真实研究问题作为考题,给前沿智能体几乎不受约束的推理算力与外部资源(6 天挂钟时间、$3{,}000 API 额度、GPU、完整虚拟机与开放网络),让它独立产出一篇'值得在顶会发表'的论文,再由原论文作者按会议审稿标准打分(1='Strong Reject' 到 6='Strong Accept')。借此判断:当前前沿模型在工程能力之外,能否完成研究生命周期中真正关键的判断、创造与回溯环节。
与已有工作不同的是,本文的独特切入在于'未公开论文'这一杠杆:研究问题取自已投稿但尚未上网的 NeurIPS 论文,因此智能体既无法从训练数据里背答案、也无法在网上检索到结论,保证了任务未被污染;同时原论文作者为回答同一问题已投入数月,是世上最懂'这条研究路线做到什么程度算成功'的人,比随机分配的盲审专家更能精确定位智能体是否真正取得进展。这一设计还直接检验了'递归自我改进'预测背后的核心机制——研究者把整个项目委托给智能体、再判断返回结果是否推进了工作。它与仅看窄指标或仅看会议接收的既有做法形成互补。
核心方法
方法的直觉是让智能体'影随'原论文作者:拿到同一道研究问题,在看不到原论文与结论的前提下独立攻关,最后由原作者像审会议投稿一样评判其产出。技术路线上,作者与两篇未公开 NeurIPS 2026 投稿的作者合作——一篇是关于 LLM 人格(persona)能否在'权重空间'中被分解、测量与控制的 Personas 论文;另一篇是为表格基础模型(tabular PFN)设计部署时分布偏移检测器的 TabPFN 论文。原作者负责三件事:不暗示方向地写出研究问题、协助设定足以实质性回答问题的资源预算、最后以顶会审稿人身份给分。整个流程对两道问题完全通用,脚手架的任何修改都必须对一般 ML 研究适用,作者记录了运行中的每一次人工介入。
核心创新是评估方法本身——'影子评估',它把开放式任务与深度专家评审嫁接到一起,并用'未公开论文'同时解决污染与专家稀缺两个难题。与可验证基准(窄指标、可爬山、可规模化但排除判断力)和盲审评估(开放式但随机、过载、可被海量投稿注水)相比,影子评估兼具四点:任务开放式且贴近顶会真实难度、问题未被污染、评审者是世上最懂该问题的原作者、且可随新论文与新模型重复。资源设定同样关键:6 天挂钟时间、$3{,}000 API、GPU 额度、完整 AWS 虚拟机与开放网络,外加自我审查子智能体与三类外部 AI 审稿工具(Stanford Agentic Reviewer、CMU Paper Reviewer、refine.ink),力求测出性能上界而非被资源卡住。
方法步骤详情
流程分为六步。①选题:与两篇未公开论文作者合作,产出不含提示的研究问题与背景说明(附录 A)。②搭环境:在 OpenClaw(模型商无关的通用脚手架)上跑 Claude Opus 4.8 的'超高推理'档,给一台 Linux 虚拟机、可实时自查 token/算力/剩余时间的接口、可派发子智能体并维护研究日志,再加一个只能看到成稿 PDF 加 NeurIPS 模板的盲审子智能体,以及三类外部 AI 审稿工具。③执行:智能体自主完成文献综述、调试 GPU 环境、跑数百次实验、抓取外部审稿、编译 LaTeX 终稿;期间仅三次人工介入(修 OpenClaw 与 Anthropic thinking 块签名冲突的崩溃、给 24 小时延期、要求重写晦涩文本)。④评审:原作者按 NeurIPS 四维度(质量/清晰度/重要性/原创性,各 1–4)与总分(1–6)打分并给置信度。⑤日志分析:团队逐条分析完整轨迹,归纳失败模式。⑥鲁棒性:用 GPT-5.6 Sol Ultra 加 Codex 原生脚手架在 TabPFN 上重跑。整轮还事先对 12 位合作者做了预期调查以记录先验。
技术新颖性
新颖性在于评估范式而非某个算法。相比 RE-Bench/MLE-Bench 这类用自动验证器打单一指标的基准,影子评估测的是无法被指标压缩的开放式研究判断力;相比 AI Scientist-v2/Zochi 这类把生成论文投盲审的做法,它用'未公开问题加原作者评审'同时消除了训练污染、评审随机性与'只报接收隐瞒拒稿'的注水空间,并把评分颗粒度细化到专家对'是否真推进了这道题'的判断。它还把脚手架做成通用型(OpenClaw/Codex),避免为单题过拟合,并通过发布全部专家评审、调查、智能体仓库与日志来对冲开放世界评估固有的研究者裁量权。
实验结果
核心结论是:两个智能体都完成了研究所需的全部工程,却没能产出顶会级研究,被原作者明确拒稿。打分上(Table 1),Personas 论文质量 2/4、清晰度 1/4、重要性 2/4、原创性 3/4、总分 2/6(Reject)、置信度 4/5;TabPFN 论文质量 1/4、清晰度 2/4、重要性 2/4、原创性 2/4、总分 1/6(Strong Reject)、置信度 5/5。资源利用是显著异常:Personas 仅花 $1{,}130/$3{,}000 API、$392/$500 GPU;TabPFN 花 $1{,}235/$3{,}000 API、$69/$100 GPU,两轮都不到预算一半(Figure 1)。承诺过快同样触目惊心:Personas 计划 42 小时探索却在 5 小时就定方法;TabPFN 头 14 小时内把六条假设全部证伪,之后 110 小时再未改换思路(Figure 2)。自我审稿在十余轮里从未给过接收(Figure 3)。两篇都超 9 页上限写到第 10 页,Personas 正文 0 张图(原作有 15 张),参考文献 16 vs 52(Personas)、36 vs 69(TabPFN)。日志分析归纳出五大失败模式:对发表门槛判断差、对设计缺陷缺乏创造性回应、无法有效回溯死路、资源意识差、指令漂移。值得肯定的是未发现实质性 reward hacking,智能体反而主动把可营销主张撤回为负结果;Personas 还产出一项反直觉发现(仅在错位'风格'上微调并未引发广泛的错位泛化,与 emergent misalignment 预期相反)。用 GPT-5.6 Sol Ultra 加 Codex 在 TabPFN 上重跑,复现了几乎所有失败模式(虽在两天内烧光 $3{,}000、剩约 100 小时)。TabPFN 智能体最像样的结果——一个超越 D3M/Detectron 的检测器——在合成偏移上 AUROC 约 0.76,到真实偏移上却掉到约 0.60。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 独立产出顶会级 Personas 论文 | 原作者 NeurIPS 总评(1–6) | 2/6(Reject),置信度 4/5 | ≥4/6(Borderline Accept 及以上) | 未达标,距接收门槛差 2 档,被明确拒稿 |
| 独立产出顶会级 TabPFN 论文 | 原作者 NeurIPS 总评(1–6) | 1/6(Strong Reject),置信度 5/5 | ≥4/6(Borderline Accept 及以上) | 未达标,距接收门槛差 3 档,被强烈拒稿 |
| API 预算利用率 | 实际花费 / 可用额度 | Personas 约 38%、TabPFN 约 41% | 接近 100%(在未达标时应继续投入) | 大量闲置(<50%),暴露资源意识缺失 |
| 自我审稿识别稿件质量 | 十余轮迭代中的接收次数 | 0 次接收(始终 Weak Reject 及以下) | 应在达标稿件上给出接收 | 一致拒稿,无法证实判别好坏的能力 |
| 跨脚手架/模型鲁棒性 | 失败模式复现情况 | GPT-5.6 Sol Ultra + Codex 复现几乎全部五大失败模式 | — | 结论稳健,排除了单一脚手架/模型artifact的解释 |
局限与改进
作者坦承若干局限。样本极小:核心结果来自五次运行(两次无推理 pilot、两次超高推理主跑、一次 Codex 鲁棒性),远小于动辄数十题的基准评估,尽管失败模式跨运行一致。评审非盲:原作者既已用特定方法答过该题,又知道稿件出自 AI,可能偏向自家思路或对 AI 更苛刻;Personas 评审者甚至直言'this paper basically misses the point of our paper'。还存在研究者裁量权(选题、脚手架、日志解读都带先验)与评估意识(明确告知智能体在按 NeurIPS 标准被评)。此外 6 天虽长于多数既有评估,却远短于原作者投入的数月与其训练所用 GPU 时数;且无法测到 Anthropic 最强模型(Fable 5 在前沿 AI R&D 上被刻意限制)。我的观察是:'无弃权选项'的设计可能系统性诱导智能体写负结果论文,而非像人类那样尽早换路。
独立分析的弱点
第一,n=2 过小且选题可能偏向'需要创造力的实证研究',难以外推到增量式或偏工程的研究;改进方向是建立预注册的、跨子领域的问题库并公开抽样规则。第二,非盲评审引入偏差风险(原作者偏好自家方法、对 AI 更严),可做'去 AI 化'的轻量盲法(统一格式、剥离可识别痕迹)或引入第三方领域专家二次评审。第三,6 天挂钟对'慢科学'不公——某些研究需要更长的训练运行或迭代周期;可按问题类型分级设定预算并报告预算敏感度。第四,'必须交论文、不可弃权'的设计把失败包装成负结果论文;应增加显式弃权/重启选项并奖励及时止损。第五,脚手架投入不对称——OpenClaw 经多轮迭代而 Codex 仅做鲁棒性复现;未来应在每个脚手架上做等量工程后再比较,以免低估 GPT-5.6 的真实上界。
未来方向
作者计划在更大问题集上用 GPT-5.6 Sol、Opus 5、Fable 5/Mythos 5 继续跑,并进一步优化脚手架以厘清结果对模型与脚手架的敏感度,同时欢迎对抗性合作。基于成果可延伸的方向包括:构建预注册的未公开论文问题池形成标准化基准;校准 AI 审稿器(论文发现其一致拒稿却无法证实判别力,需正样本标定 generator-verifier gap);消融'弃权选项/奖励函数'对负结果倾向的影响;把影子评估从 ML 扩展到其他学科的开放式研究;研究'判断力/创造力/认知锁定'等构念的可操作定义,以减少作者团队承认的诠释分歧。
复现评估
透明度较高:作者在 cruxevals.com 发布了专家评审、预期调查、智能体仓库与运行日志;但其中一篇论文尚未公开,故其详细日志与智能体成稿暂不披露,复现该题需等待原文公开。算力门槛中等偏上:单次运行约 6 天挂钟加最多 $3{,}000 API 加数百 GPU 时(Personas 约 $392、TabPFN 约 $69 GPU)加一台 AWS 虚拟机与开放网络。脚手架为通用型(OpenClaw、Codex),降低了为单题过拟合的风险,但 OpenClaw 与 Anthropic thinking 块签名冲突的崩溃需手动 patch(TabPFN 触发 14 次、Personas 5 次)。总体而言,方法学流程可复现,但完整重跑需可观的 API/GPU 预算与对脚手架细节的调试。
论文图表