FrontierChallenge:评估智能体能否完整交付科学工作流 FrontierChallenge: Evaluating Scientific Workflow Completion
300项端到端科学工作流基准,最强模型完整交付率仅20.6%
前置知识
智能体脚手架
脚手架(Agent Scaffold)是包裹语言模型的执行框架,负责管理任务循环、工具调用、文件读写与多步规划,同一个模型配不同脚手架表现可以差很多。本文用三种:OpenAI 的 Codex(跑 GPT-5.6 Sol/Terra(max))、Anthropic 的 Claude Code(统一跑 10 个模型以便横向对比)、以及 Apodex 自研的 Frontier Agent(Agent Team 多智能体配置,跑 Apodex 1.1)。
论文的实验单位是“模型×脚手架”配置(共 13 个),Table 2 和 Figure 2 的每个点都对应一个配置,不理解脚手架就无法读懂实验设计与对比的公平性。
Pass Rate 与完全交付判定
任务分值 $s_i^m\in[0,100]$ 中,语义标准由 Judge 评三次取平均,因此完全满足评分细则的提交也可能略低于 100。论文定义完全完成指示 $f_i^m=\mathbf{1}[s_i^m \geq 99.9]$,Pass Rate 即满足完全交付契约的任务占比(主指标),Avg. Score 只是部分进展的辅助描述。
论文全部核心论点(高分 $\neq$ 完整交付)都建立在“二元通过”与“平均分”这两个指标的对比之上,99.9 阈值只吸收三次评分平均的数值抖动。
HDS6 过程评估框架
Heavy Duty Solver 六维评估框架,对冻结的执行轨迹按 1–4 分制打分:Coherence(长程状态与跨产物一致性)、Evidence(忠于实际观测)、Alternatives(假设与方法管理)、Scope(边界与失败推理)、Tools(工具使用与执行状态管理)、Repair(验证下的自我修正)。每任务含 13 个共享评分项加 6–10 个任务特定项,缺失的机会不计零分而是标记不适用。
它是论文的过程性证据来源,用与产物评分独立的轨迹打分证明基准分数反映真实过程能力(与 Pass Rate 相关 $r=0.828$)。
Grader 与 Judge
每个任务自带可执行评分器 Grader,机器检查必需文件、数值结果、格式、图表、代码执行与跨产物一致性;细则中的语义标准交给 Judge(本文用 GPT-5.6 Sol)评三次取平均,Judge 属于该任务 Grader 的一部分。智能体可见的指令与输入同评测方的参考材料、评分组件严格分离。
理解这条评分管线才能理解 99.9 阈值的由来,以及为什么一个看似满分的提交可能因为单一缺口而整体判为未通过。
覆盖率调整
HDS6 汇总时只对通过完整性门的已评分运行集合 $V_m$ 取平均,再乘以覆盖率因子 $\sqrt{|V_m|/|A_m|}$($A_m$ 为可用运行总数),使缺测运行拉低配置总分而不是被悄悄忽略;Table 3 的 V/N 列就是二者之比。
Apodex 1.1 有 5 次只含 API 认证失败的运行被移除(V/N=92/97),不看覆盖率列会误读其 3.293 的分数含义。
研究动机
现有基准的评测单元几乎都是“一个最终答案、一段交互轨迹、一个单域程序或单篇论文复现”:HLE 考可检验的专家问答题,SWE-bench 考代码修复,BLADE 与 ScienceAgentBench 考单脚本分析决策,CORE-Bench 与 PaperBench 局限于复现特定论文。而真实科研交付是一组互相依赖的产物:可执行代码、正确数值表、诊断图与论证一致的报告。作者观察到,前沿智能体常以高置信度宣称完成,产物包却缺件或互相矛盾——后文失败分析显示,849 条未通过的 Claude Code 轨迹中有 641 条(75.5%)仍以“已完成”措辞收尾。部分进展与完整交付之间的鸿沟此前缺乏系统量化:模型在分析化学、电化学领域平均分可高达 87.6 与 94.9,却几乎无法完整交付,这一现象没有专门的基准去度量。
本文的目标是本文构建 FRONTIERCHALLENGE:覆盖量子化学、分子动力学、材料表征、分析化学、生命科学、电化学/环境六大领域、共 300 条端到端科学工作流的基准,本次公开并评测其中不依赖 GPU 的 97 条(74 Hard + 23 Medium),保留 203 条作内部 held-out。目标是回答一个聚焦问题:给定固定的任务目标、输入数据与交付契约,智能体能否独立完成从输入处理到最终交付物的全流程。评测上把“完全契约满足”作为主指标 Pass Rate($f_i^m=\mathbf{1}[s_i^m \geq 99.9]$),0–100 平均分只作部分进展的辅助描述;同时用 HDS6 六维过程评分(1,164 条冻结轨迹)与失败模式分析回答四个研究问题:可靠完成率多高、领域差异如何、哪些契约违背最常见、过程能力与结果是否相关。
与已有工作不同的是,独特切入是把评测单元从“答案/轨迹/单程序”升级为“完整产物包”,并把“是否全部交付”(二元 Pass Rate)与“做了多少”(Avg. Score)拆成两个独立指标。它不要求智能体自定研究议程或提出问题,只考察目标、输入、输出全部固定后的可靠执行——比“自主科学”更窄但更基础的能力,对应科学交接中可检查、可复现、自洽的交付。论文 Table 1 对照的 11 个相关基准均不同时具备科学工作流核心、固定科学输入、端到端执行、多产物、可执行评测与跨领域科学这六个特征。再叠加任务专属可执行 Grader、覆盖 970 条 Claude Code 轨迹的机器可观测契约违背签名统计,以及与结果评分独立的 HDS6 过程分,形成“结果+过程”的双重证据链,这是区别于 CORE-Bench、PaperBench、AstaBench 等工作的根本角度。
核心方法
直觉上像验收工程一样验收智能体:先写清规格(目标、固定输入、可用软件、交付契约、评分流程),再由独立评分器逐项验收。技术路线四步。第一步任务构建:从科研与工程实践收集 300 条真实工作流,按代表性、复杂性、多样性、可验证性四原则筛选,覆盖 6 领域 21 个工作流家族,公开其中不依赖 GPU 的 97 条。第二步标准化打包:每个任务自包含任务描述、固定输入、可用软件(ORCA、CP2K、LAMMPS、AmberTools、PLUMED 等)、输出契约、分步评分细则、可执行 Grader 及复现文档。第三步评测:12 个前沿模型 × 3 种脚手架(Codex 跑 GPT-5.6 Sol/Terra(max),Claude Code 统一跑 10 个模型,Frontier Agent 跑 Apodex 1.1 Agent Team),Grader 返回原生分 $s_i^m \in [0,100]$,语义标准由 GPT-5.6 Sol 作 Judge 评三次取平均,据此计算 Pass Rate 与 Avg. Score。第四步分析:HDS6 六维过程评分、领域分层、资源与失败签名统计。
核心创新是契约级评测:成败取决于整个产物包是否满足全部要求,而非是否给出貌似合理的最终答案。形式化:任务 $i$、配置 $m$ 的分值 $s_i^m\in[0,100]$ 由任务专属 Grader 检查必需文件、数值、格式、图表、代码执行与跨产物一致性得出;若细则含语义标准则由 Judge(GPT-5.6 Sol)评三次取平均。完全完成指示 $f_i^m=\mathbf{1}[s_i^m \geq 99.9]$,主指标 $\mathrm{Pass\ Rate}_m=\frac{1}{N}\sum_{i=1}^{N} f_i^m$,辅指标 $\mathrm{Avg.\ Score}_m=\frac{1}{N}\sum_{i=1}^{N} s_i^m$($N=97$);99.9 阈值只吸收三 Judge 平均的数值抖动,不放松任何评分项。与已有工作的本质区别:CORE-Bench/PaperBench 面向单篇论文复现,ScienceAgentBench 交付单脚本,本基准要求报告、表格、图、代码、模拟产物相互一致,横跨 6 领域 21 家族,并用独立的 HDS6 过程分交叉验证。
方法步骤详情
流程五步。(1) 收集:输入为科研实践中的真实分析/计算/仿真交付流程,输出 300 条候选工作流。(2) 筛选:按四原则剔除——代表性(流程与软件须符合专业实践)、复杂性(须端到端、依赖感知,排除单命令/单步操作)、多样性(不得是只改输入参数的模板)、可验证性(输出可用文件、数值、定量指标或显式验收标准评判);每条须有固定输入、执行环境、完整契约与可执行评分。(3) 打包:输出自包含任务包——元数据、智能体可见指令与输入、评测方参考材料与评分组件(分离)、分步评分细则、可执行 Grader、复现文档。(4) 评测:跑 97 个任务,Judge 标准评三次取平均,$s_i^m \geq 99.9$ 记完全通过,Medium/Hard 分层统计。(5) 分析:HDS6 六维(Coherence/Evidence/Alternatives/Scope/Tools/Repair)按 $H_m=\frac{1}{|V_m|}\sum_{i\in V_m} h_i^m \cdot \sqrt{|V_m|/|A_m|}$ 做覆盖率调整;再统计领域表现、token 与时长、契约违背签名及完成措辞。
技术新颖性
三点新颖性。其一,评测粒度:首次把“完整交付”作为一等公民,用二元 Pass Rate 而非平滑平均分做主指标,系统量化了“部分进展 $\neq$ 完整交付”——分析化学平均分最高 87.6 但最好通过率仅 4%,电化学平均分 94.9 但全部配置通过率为 0%。其二,双层可执行评分:任务专属 Grader 检查文件、数值、格式、图表、代码执行与跨产物一致性,语义标准交由独立 Judge 评三次,保证跨模型可复现并降低单次评分方差。其三,结果-过程双轨验证:HDS6 与 Avg. Score 的 Pearson $r=0.874$(Spearman $\rho=0.762$)、与 Pass Rate 的 $r=0.828$($\rho=0.799$),任务内平均相关 0.475 且 85% 任务为正;由于 HDS6 独立于产物评分器评估轨迹行为,这种汇聚证据支持“本基准测的是 Heavy Duty Solver 能力”。此外,对 970 条 Claude Code 轨迹做机器可观测契约违背签名分析(75.5% 非通过轨迹以完成措辞收尾)也是新的失败研究范式。
实验结果
总体:Pass Rate 3.1%–20.6%,Avg 67.5–87.9;最佳为 GPT-5.6 Sol+Codex(87.9)与 Grok 4.6+CC(86.6),Pass 均 20.6%,最低 GLM-5.2 仅 3.1%;Medium/Hard 最高 43.5%/14.9%;8 配置 Avg>80 但 Pass 均≤20.6%。领域:量子化学最好过(Grok 4.6 60%);分子动力学 Sol/Terra/Grok 各 38%;材料表征 Avg 88.1 但 Pass≤9%;分析化学仅 DeepSeek V4 Pro-0813 过题(4%);电化学全灭(Avg 最高 94.9);生科 Kimi K3 20%。HDS6 过程分与 Avg 相关 r=0.874、与 Pass 相关 r=0.828,Opus 5 最高 3.768、Scope 全线最低。失败:非通过轨迹中 Judge 产物缺口材料 97%/分析 95%/电化学 85%、量子化学 43%;75.5%(641/849)以完成措辞收尾;工具错误通过/非通过 94.2%/80.7%,错误不预测成败。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 97 项端到端科学工作流(总体) | Pass Rate(完全交付率) | 最佳 20.6%:GPT-5.6 Sol+Codex 与 Grok 4.6+Claude Code(各完成 20/97) | 最弱配置 GLM-5.2+Claude Code 仅 3.1% | 最强与最弱相差 17.5 个百分点;但即便最佳配置也只完整交付 1/5 的任务 |
| 97 项工作流(总体) | Avg. Score(平均分,0–100) | GPT-5.6 Sol+Codex 87.9(最高) | GLM-5.2 67.5(最低) | 8 个配置 Avg>80 但 Pass 均 $\leq$20.6%,直接证明高分不等于完整交付 |
| 量子化学(20 任务) | Pass Rate | Grok 4.6+Claude Code 60% | 同域最低配置 10% | 全部 6 领域中唯一过半的领域,也是唯一出现 60% 通过率的地方 |
| 分析化学(23 任务) | Pass Rate / Avg. Score | 最高 Avg 87.6,Pass 仅 4%(DeepSeek V4 Pro-0813 唯一过题) | 其余 12 个配置 Pass 均为 0% | 部分进展与完整交付差距最悬殊的领域之一(87.6 分 vs 4% 通过) |
| 电化学/环境(6 任务) | Pass Rate | 所有配置 0%(最高 Avg 达 94.9,Kimi K3) | 无任何配置完整交付任何任务 | 交付鸿沟的极端案例:接近满分的平均分、零完整交付 |
| Hard 任务(74 项) | Pass Rate | 最高 14.9%(GPT-5.6 Sol+Codex) | 最低 1.4%(Qwen3.5-397B-A17B) | Hard/Medium 分层显著(Medium 最高 43.5%),难度校准有效 |
| HDS6 过程评估(1,164 条冻结轨迹) | 与结果指标的相关性 | 与 Avg. Score 的 Pearson $r=0.874$,与 Pass Rate 的 $r=0.828$ | 任务内过程分-任务分平均相关 0.475(85% 任务为正) | 过程与结果双轨汇聚,支持该基准测的是 Heavy Duty Solver 能力 |
局限与改进
作者承认的局限:只评测公开的 97 条任务,203 条 held-out(含需 GPU 评测的工作流)未报告,结论不能外推到全部 300 条;六个领域是发布集的描述性切片而非学科概率抽样,跨领域差异不应解读为学科难度排名;token 用量受各家 tokenizer、缓存与报告口径影响,无法做硬件归一化的效率比较;失败签名的轨迹对比仅限有统一事件模式的 Claude Code,签名可重叠、属描述性统计,不为任何一次运行指定唯一原因;每配置只跑一次,无重复运行的方差估计。我的补充观察:(1) Judge 用的 GPT-5.6 Sol 同时是被评模型,语义标准虽评三次但缺乏评审独立性论证;(2) 99.9 的通过阈值把 99 分级的“几乎全对”与 60 分同样判为失败,极端严格是论文立场但会放大“低通过率”的修辞效果;(3) HDS6 与结果分的高相关是汇聚性证据而非因果,两者可能共享同一 Judge 的偏好;(4) 任务输入含公共数据,存在前沿模型预训练污染的隐患,held-out 集正是为此保留。
独立分析的弱点
独立分析六点弱点。(1) 评审独立性不足:Judge(GPT-5.6 Sol)与参赛模型同源,评自家提交存在潜在偏置;改进方向是引入人类专家抽样复核或多个互不相关的 Judge 集成,并公开 Judge 间一致性统计。(2) 单次运行:Pass Rate 是二值指标,单次采样无法区分模型波动与真实能力差距;应至少对部分任务多次采样并给出置信区间。(3) 复现成本高:单任务最高 1,373 万输入 token、Frontier Agent 平均 112.8 分钟(p90 272.2 分钟),小团队无力复现;可提供官方评测服务或 20 题快速子集。(4) 领域不均衡:电化学仅 6 题,0% 通过率的统计功效很弱,应扩充题量再下结论。(5) 失败分析绑定 Claude Code 的轨迹事件模式,Codex/Frontier Agent 无契约签名统计,可定义跨脚手架的统一事件 schema。(6) 99.9 阈值把“接近完成”的信息折叠为失败,丢失缺口结构;可补充报告缺口数量/类型分布作为中间诊断指标。
未来方向
作者在结论中指出:更可靠的科学智能体需要显式契约跟踪、跨产物一致性校验与基于证据的完成检查,这本身即是路线图。可延伸方向:(1) 分批释放 203 条 held-out(含 GPU 任务)并建公开排行榜,定期换题防污染;(2) 把 HDS6 过程分用作训练期奖励信号或拒绝采样过滤器,实证检验能否真正提升交付率而不只是相关性;(3) 针对 Scope(全线最低 2.185–3.508)与 Repair 两个短板维度设计脚手架干预,如强制边界检查回合、交付前自检清单,量化其对 Pass Rate 的边际贡献;(4) 研究“虚假完成措辞”(75.5% 非通过轨迹自称完成)的校准问题,把诚实报告完成状态作为可训练目标;(5) 扩展到需 GPU 的计算化学工作流与更长时程任务(小时到天级),考察可靠性随任务长度的衰减曲线;(6) 建立部分交付的经济学分析:多少分差需要多少额外 token 与时间才能补齐,为成本-可靠性权衡提供依据。
复现评估
开源情况较好:97 条任务数据在 Hugging Face、评测代码在 GitHub、排行榜网站公开;每个任务包自带可执行 Grader、分步评分细则与复现文档,智能体可见输入与评测方参考材料分离,可在固定条件下重跑并一致计分。但复现门槛不低:(1) 需要 12 个前沿模型的 API 访问,其中多数闭源;(2) 语义标准依赖 GPT-5.6 Sol 做 Judge 且每条评 3 次;(3) 成本高——单任务数百万输入 token、平均 21.8–112.8 分钟,Frontier Agent 组 p90 达 272.2 分钟,13 配置 × 97 任务的全量复现为千至万美元量级;(4) 203 条 held-out 及所有需 GPU 的任务不公开,无法独立验证全集结论与 held-out 泛化;(5) HDS6 依赖 2026-09-07 的冻结活动与 TERRA 评审面板(GPT-5.6 Terra/Luna + Claude Opus 5),第三方难以完全一致地复现过程评分。建议独立研究者先以每域 2–3 题的小子集复刻 Grader 流程,验证评分管线后再决定是否扩大规模。
论文图表