ASI-Bench:迈向通用超级智能黎明的基准 ASI-Bench: At the Dawn of Artificial Superintelligence
首个逐级撤除人类方法指导、评测AI自主科研能力的跨领域项目级基准
前置知识
项目级研究任务
区别于单轮问答或固定流程编码题,项目级任务要求智能体从科学目标出发,独立经历问题理解、方法选择、实现、实验、失败诊断、迭代修正到结果验证的完整长程流程,最终产出可验证的科学产物(代码、数值结果、图表等)。ASI-Bench 的 60 个任务共涉及 2600+ 交互轮次、2400+ 执行步骤和超过 35 小时的智能体执行时间,单个任务通常包含多个相互依赖的开放决策点。
本文评测的对象正是这种长程、端到端的自主科研能力,理解任务粒度才能明白为什么现有短程基准无法替代它。
B1–B4 指导梯度
同一研究项目在四种信息条件下重复评测:B1 提供完整方法学指导(方法、实现步骤、参数选择全给);B2 只指定方法名称;B3 只给研究目标、观测数据和所需输出,方法须由智能体自行确定;B4 在 B3 基础上再加入貌似合理但与任务无关的干扰信息。论文中诊断性指标记作 $B_2-B_1$、$B_3-B_1$、$B_4-B_3$,逐级差分用于定位能力瓶颈。
这是全文最核心的设计:所有主要结论(如方法操作化是瓶颈)都来自四个等级间的分数差,不懂梯度设计就无法读懂结果。
方法操作化
指把一个抽象的科学方法转化为可执行的完整研究流程的能力,包括选定数值格式、实现求解器、设置参数、诊断失败并验证结果等工程化环节。例如已知『用 PDE 求解非线性动力系统』这一方法名,能否落成可跑通的数值程序。论文通过 $B_1$ 到 $B_2$ 的暴跌(50.91 降至 29.10)与 $B_2$ 到 $B_3$ 的微小变化(仅再降 2.48)来实证操作化才是瓶颈。
这是论文的核心发现与立论关键,混淆『选方法』与『把方法落成流程』会完全误读本文结论。
Agent×Model 配置与 harness
harness 指包裹底层模型的智能体框架(负责推理循环、工具调用、任务组织),如 Codex、Claude Code、Kimi Code、MiMo Code、OpenHands;backbone model 是被包裹的大模型。二者组合构成一个评测配置,本文共评测 18 个配置,多数跑 3 次独立运行取宏平均并报告标准差。同一模型换 harness 分数可差 7 分以上,说明能力是模型与框架交互的涌现结果。
结果表按 harness 分块组织,且『harness 塑造能力』是三大结论之一,不了解这一概念无法理解表格结构。
研究动机
当前 AI 的能力主要来自学习、压缩和应用人类已有知识,而现有评测恰好只考这两端:要么考已知答案(如 Humanity's Last Exam 考前沿学科问答),要么在人类给出方法与流程的前提下考执行(Terminal-Bench 考终端任务、ScienceAgentBench 考数据分析、MLE-Bench 考机器学习工程、PaperBench 考论文复现)。这些基准都有预定义的目标与判分标准,无法回答一个关键问题:当问题本身开放、且没人告诉你该怎么解时,AI 能否自主完成科研?此外它们各覆盖一个维度——跨领域通用性、方法自主性、端到端执行从未被同一基准联合考察,更没有任何基准在同一研究项目内逐级撤回人类方法指导来度量自主性,导致『AI Scientist』类系统的宣传缺乏统一、可信的度量标尺。
本文的目标是构建首个跨领域、项目级的自主科研基准:用 60 个来自 11 个科学领域的真实研究任务(覆盖数学、物理、化学、生物、天文、材料、地球科学、医学与生物统计、计算机、机器人、电子工程),在固定任务、数据、所需输出与评分标准的前提下,通过 B1–B4 四级指导梯度量化『人类方法指导逐级撤除后 AI 还能走多远』;同时建立多阶段构建与验证流程(专家评审、AI 辅助审计、沙盒端到端执行、评分器验证),保证 31,000+ 人工小时投入下的科学效度与评测可靠性,为追踪通向 ASI 的能力涌现提供公共参照点。
与已有工作不同的是,独特切入在于『同一项目内的受控指导梯度』设计:任务、数据与判分完全不变,只改变信息量,从而把三种能力干净地分离——B1 考执行既定流程,B1→B2 的落差考把指定方法翻译成可执行流程,B2→B3 的落差考独立选方法,B4 考抗干扰稳健性。与 PaperBench(仅复现)、RE-Bench(仅 AI R&D 单领域)、DiscoveryBench(仅科学发现)不同,ASI-Bench 首次在统一框架下同时覆盖跨域通用性、方法自主性、端到端执行和指导梯度四个维度(Table 1),并用诊断性差分指标把『瓶颈在哪里』变成可测量的问题,而不只是给一个排行榜分数。
核心方法
直觉是:要测 ASI 所需的『探索未知、创造新知、把想法变成可验证结果』,最直接的办法是给 AI 一个真实科研目标、配套数据和可执行环境,看它在没人告诉它怎么做的情况下能走多远、产物能否通过验证。技术路线上,每个任务由四要素构成:科学目标、任务专用数据、可执行环境(沙盒)、可验证研究产物与评分代码。同一任务在 B1–B4 四种信息条件下评测:B1 给全部方法学指导,B2 只给方法名,B3 只给目标与数据(如一个非线性二维动力系统的时空观测数据,要求反演模型、选数值方法、实现并验证预测),B4 再加干扰信息。评分采用宏平均的科学分数(Scientific Score),跨 18 个 Agent×Model 配置、多数 3 次独立运行,并附带 $B_2-B_1$ 等诊断指标与 token/时间/美元成本剖析。
核心创新是『逐级撤除人类方法指导』的受控实验设计。已有基准要么完全给定方法路径(考执行),要么完全开放(无法定位失败原因),本文在同一个研究项目内让科学责任从人向 AI 连续转移,使『执行』『操作化』『方法选择』『抗干扰』四种能力各自对应一个可分离的分数差。配套的关键洞察是诊断性指标:若 $B_1$ 到 $B_2$ 暴跌而 $B_2$ 到 $B_3$ 变化甚微,则瓶颈在流程构建而非方法选择;若 $B_4 \approx B_3$,则干扰信息不是主要问题。这把基准从『排名工具』升级为『能力归因工具』。此外,任务级产物经沙盒执行验证而非人工打分,保证了判分的客观与可复现。
方法步骤详情
构建分五步。第一步,从可溯源的科学来源收集 1300+ 候选研究想法。第二步,领域专家将候选想法筛选、工程化为可执行任务:撰写科学目标、准备任务专用数据、搭建可执行环境、制作参考产物(reference artifacts)与评分代码,并设计 B1–B4 四级信息版本(附录 D 给出同一非线性动力系统任务四级表述的完整示例)。第三步,AI 辅助审计加四轮人类交叉评审,覆盖科学逻辑、任务规范、参考产物、评分代码、信息泄露和智能体轨迹六个方面,共 5 轮评审、1100+ 评审任务、2000+ 次任务修订。第四步,每个任务在隔离沙盒中端到端执行,累计 1500+ 次沙盒运行,验证运行时稳定性、参考解可复现性、产物生成与评分一致性;存在科学错误、执行不稳定、评估错位或非预期捷径的任务被修订或剔除。第五步,评测:18 个配置各跑 60 任务(无外部工具访问),每配置 3 次独立运行取宏平均并报告标准差,Claude Opus 5 为单次运行。
技术新颖性
技术新颖性有四点。其一,首次把『方法自主性』作为受控变量引入跨领域基准,Table 1 显示没有任何现有基准同时覆盖四维度(PaperBench 缺方法自主与跨域,RE-Bench 缺跨域与指导梯度)。其二,诊断性差分指标($B_2-B_1=-21.82$、$B_3-B_1=-24.29$、$B_4-B_3=+0.36$)使能力归因可量化,这是排行榜式基准不具备的。其三,成本剖析发现指导完整度与计算成本的倒挂关系:B2 反而最贵(每任务 691 万 token、49.7 分钟,比 B1 多 59%/32%),揭示『不完整指导引入额外搜索开销』的非直觉结论。其四,31,000+ 人工小时、1500+ 次沙盒运行的多阶段质检流程,为项目级任务的评测可靠性设立了工程标杆。
实验结果
发现一:自主科研能力不足,瓶颈在方法操作化。18 个配置平均分从 B1 的 50.91 暴跌至 B2 的 29.10($B_2-B_1=-21.82$),撤掉方法名只再降 2.48(B3=26.62),B4 的 26.99 与 B3 几乎相同,说明系统依赖分步流程指导。发现二:最强配置远未饱和。Codex+GPT-5.6 Sol (ultra) 的 B3 为 51.60(唯一超 50),推理力度提至 ultra 使 B3 从 40.86 升至 51.60;Claude Opus 5 单次运行 B3=40.70,最弱的 MiMo Code+MiMo V2.5 Pro 仅 11.50。发现三:harness 塑造能力。MiMo V2.5 Pro 从 MiMo Code 的 16.17 升至 Claude Code 的 23.25,Kimi K2.7 从 19.72 升至 27.34,但 Kimi K3 在两框架下接近(36.22 对 37.09)。发现四:成本与性能脱钩。B1 每任务 435 万 token、37.8 分钟,B2 反而最贵(691 万 token);GPT-5.6 xhigh 约 684 美元达 B3 40.86,Opus 5 花 2728 美元只得 40.70。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| B3 自主选方法(60 任务宏平均、18 配置) | Scientific Score | 平均 26.62;最高 Codex+GPT-5.6 Sol (ultra) 51.60 | 同配置 B1 完整指导 50.91 | 无提升:整体下降 24.29,暴露自主科研短板(此为诊断性结论而非性能提升) |
| B1 完整方法指导 | Scientific Score | 平均 50.91;最高 Codex+GPT-5.6 Sol (ultra) 71.78,Claude Opus 5 达 72.29 | —(作为执行能力上界参照) | — |
| B2 仅给方法名 | Scientific Score | 平均 29.10 | B1 平均 50.91 | 下降 21.82,为四级中最大落差,定位方法操作化瓶颈 |
| B4 加任务无关干扰 | Scientific Score | 平均 26.99 | B3 平均 26.62 | 变化仅 +0.36,抗干扰性接近饱和 |
| 成本-性能(每任务单次完整运行) | B3 分数 / 美元成本 | Codex+GPT-5.6 xhigh:40.86 分 / 约 684 美元;GPT-5.6 Ultra:51.60 分 / 约 1550 美元 | Claude Opus 5+Claude Code:40.70 分 / 约 2728 美元 | xhigh 以约四分之一成本达到同等分数 |
局限与改进
作者承认的局限包括:主结果限定为无外部工具访问的设定(Table 2),与真实科研中文献检索、代码库复用等场景有差距;Claude Opus 5 的结果只有单次运行,无法估计方差;60 个任务规模虽经严格质检仍有限,基准远未饱和也意味着当前分数区分度可能随模型快速进步而失效。我自己的观察是:任务源自可溯源的科学来源并存在参考产物与预期解法,这可能天然偏向『存在可验证正确答案』的问题,对真正开放式、无标准答案的前沿探索代表性不足;harness 与模型的配对网格不完整(每个 harness 只配一到三个模型),『harness 塑造能力』的结论外推需谨慎;此外单次完整运行成本 684–2728 美元、单配置需 3 次运行,加上每任务 35+ 小时代理时间的总量,学术实验室完整复现全部 18 配置的门槛相当高。
独立分析的弱点
弱点一:无外部工具的主设定低估或错估真实科研能力——真实科研者会检索文献、调用符号计算库和模拟器,禁用工具测得的 26.62 可能既低估上限、又掩盖工具使用本身的缺陷。改进方向:增加带检索与计算工具的对照设定,报告工具增伤/增益。弱点二:参考产物+评分代码的判分模式隐含『预期解法』,对偏离标准路线但同样有效的自主方案可能误判低分,而这恰是 B3 要鼓励的创造性。改进方向:引入基于产物属性的成组判分或 LLM 辅助的多解等价性校验。弱点三:静态任务集面临数据污染风险,新模型可能见过任务源头文献。改进方向:建立定期换血的任务池与社区投稿机制(网站已提供 submit 入口,可强化为去重+盲测流程)。弱点四:harness 网格稀疏且商业框架版本更迭快,跨论文比较会迅速失效。改进方向:固定开源 harness 基线并发布可复现的运行配置与随机种子。
未来方向
作者明确提出的方向:把 ASI-Bench 建成开放、持续演进的社区标准,邀请科学家、工程师、模型团队、智能体开发者与基准研究者贡献新研究问题、可执行任务、评估方法与验证结果,并维护公共排行榜以追踪前沿进展。基于本文成果可自然延伸的方向包括:把 $B_2-B_1$ 的落差作为训练信号,针对性强化模型的方法操作化能力(例如用流程重建任务做强化学习);在 B3 设定上细粒度分析失败阶段(知识不足、方法选择、工具执行、结果解读、纠错稳定性),作者在『何时使用』一节已暗示此诊断用途;扩展带外部工具与真实实验接口的版本;研究成本感知的评测协议,报告分数-美元-时间的帕累托前沿;以及跨任务课程化,观察指导梯度上的能力迁移。
复现评估
开源与开放情况良好:论文首页给出 Website、GitHub、HuggingFace 与 Leaderboard 链接,基准任务、沙盒环境与评分代码面向社区开放,并有公开投稿入口(asibench.apexin.ai/submit)。算力门槛是主要障碍:无工具设定下单次完整 60 任务运行需 684–2728 美元 API 费用(按被测模型定价浮动),要估计方差需每配置 3 次独立运行;时间上 60 任务合计超过 35 小时智能体执行、2600+ 交互轮次,还需搭建隔离沙盒并部署对应智能体框架。复现单个配置对有 GPU/API 预算的团队完全可行;完整复现 18 配置的主表成本估计在数万美元量级。数据与评分流程的文档化程度(1500+ 次沙盒运行验证记录)在基准论文中属于较高水准,可信度较好。
论文图表
把 ASI-Bench 的得分与 Humanity's Last Exam、SWE-bench、Terminal-Bench 等知名基准放在同一坐标系对比,展示模型在传统基准上的高分与在 ASI-Bench 上的低分形成的反差。
回答『为什么需要新基准』的最直接证据:现有基准已趋于饱和而 ASI-Bench 仍远未饱和,凸显本文动机。