Evo-Bench:评测大语言模型能否自主改进智能体执行框架的首个基准 Evo-Bench: Can Language Models Improve Agent Harness?
首个评测LLM自主进化智能体harness能力的基准,顶尖模型最高提升16.6分、逼近人工框架
前置知识
Agent Harness(智能体执行框架)
包裹在 LLM 外围的工程脚手架,包括系统提示、工具集、上下文管理、控制流、验证与失败恢复机制,把模型能力组织成能完成长程任务的完整系统。Claude Code、Codex 就是典型例子:同样的基座模型,配上更强的 harness 往往成绩天差地别。
本文评测的对象不是模型解题能力,而是模型能否写出更好的 harness 代码,因此必须先理解 harness 是什么、由哪些组件构成。
CodeAct
一种智能体交互范式:模型不是逐步输出结构化动作,而是直接写出并执行代码(如 shell 命令),把执行输出追加回上下文,循环直到给出最终答案。本文的种子策略 harness 就是一个极简 CodeAct 循环,只有 shell 和 finish 两个工具。
所有进化实验都从这个几乎裸奔的 CodeAct 种子出发,它是衡量进化增益的统一起点(总体基线 29.7 分)。
Harness 敏感性(Harness Sensitivity)
衡量一个任务的成绩对 harness 质量变化的响应程度,定义为该任务在 12 个辅助 harness 上的分数与各 harness 留一法整体质量之间的 Pearson 相关:Sens(x) = corr({m_h(x)}, {Q_h^(-x)})。高敏感任务能可靠反映 harness 相对优劣,低敏感任务的分数主要由模型强度或运气决定。
这是本文造题与切分的核心统计量,理解它才能明白 Evo-Bench 如何把 harness 进化能力从模型强度中剥离出来。
LLM-as-a-Judge(模型裁判)
对开放式输出(搜索答案、交付物、智能体轨迹)用另一个 LLM 按固定裁判提示词和评分标准打分,代替人工评分。本文统一使用 Qwen3.7-Plus 作裁判(温度 0、1M 上下文),对 BrowseComp/HLE 判语义等价,对 GDPval 用加权评分细则。
Evo-Bench 五个源基准多为开放式任务,裁判协议固定与否直接影响分数可比性和防作弊。
Pass@1 与 Pass^3
Pass@1 是单次尝试的通过率;Pass^3 要求三次独立尝试全部通过,衡量稳定性而非运气。本文 Search/Office 任务跑 1 次 rollout 取 Pass@1,Claw-Eval 按其原生协议跑 3 次取 Pass^3。
论文的指标定义和表格分数都建立在这些原生评分协议上,混用会导致误读。
奖励作弊(Reward Hacking)
智能体绕过任务本意获取分数的行为,如直接检索基准答案、把验证集信息泄漏给策略执行、或伪装绕过检测。本文设了三层防护:沙箱隔离、web/shell 内容答案模式扫描、以及基于 Codex 的全轨迹语义审计。
给了进化器读验证轨迹、用 web 工具的权限,就必须防作弊,否则测出的是检索与作弊能力而非工程能力。
帕累托前沿(Pareto Frontier)
多目标优化中不被其他解同时支配的解集合。在成本-性能二维图上,位于左上方的点构成前沿:要么同样成本下性能更高,要么同样性能下成本更低。
论文 Figure 5 用它刻画进化能力与 API 花费的权衡:GPT-5.6-Sol 在前沿顶端(超 500 美元),GLM-5.2 与 Qwen3.7-Max 位于性价比拐点(不到 40 美元)。
研究动机
现有智能体评测几乎全部停留在静态任务求解:固定一个 harness,测模型能解多少题。但近年最强的智能体系统(如 Claude Code、Codex)的领先很大程度上来自精心工程化的 harness,而非纯粹的基础模型能力。这催生了一个新前沿——harness 进化:让模型自主优化自己的执行框架,它被普遍视为智能体自我改进的第一步。然而系统性评测这一能力存在三个未解决的障碍。其一是 harness 敏感性问题:任务成绩往往被基座模型实力主导,harness 改进在总分中难以显影——例如极简 CodeAct 种子在 Search 域只有 11.7 分而 Office 域有 38.4 分,说明不同任务对框架改进的响应极不均匀,随手抽题无法保证测的是框架能力。其二是跨切分泛化问题:若验证集与评测集对 harness 变化的响应不一致,进化器就会过拟合验证任务,验证分数虚高却无法迁移到保留集。其三是长程进化问题:真实的 harness 工程需要多轮『诊断失败—提出假设—修改代码—正式评估』的迭代,而现有评测要么只允许单轮修改,要么允许无约束的自进化,无法把真正的进化能力与模型强度或任务特定作弊区分开。
本文的目标是本文的目标是构建首个系统性评测大模型内在 harness 进化能力的基准 Evo-Bench:固定策略模型与研究协议,让不同的大模型扮演『长程研究工程师』,从同一个极简 CodeAct 种子 harness 出发,在给定资源预算(20 次迭代、1000 个进化步、48 小时墙钟时间)内自主迭代改进一个跨域通用 harness,最终冻结后在互斥的保留评测集上打分。具体目标有三:(1) 构造对 harness 改进敏感、且验证/评测响应一致的任务套件,覆盖 Search(BrowseComp、HLE)、Office(GDPval、APEX-Agents)、General(Claw-Eval)三个域,共 160 个验证任务和 448 个评测任务;(2) 用同一把尺子横向比较 9 个前沿与开源模型的进化能力,回答『大模型能否真正改进 agent harness』这一核心问题;(3) 刻画进化的时间动态(是否存在早饱和)、域差异(哪类任务容易进化)、以及进化产物在不同策略模型上的可迁移性。
与已有工作不同的是,已有工作分布在三条线上,但都没有回答这个问题。方法线上,从提示词搜索(PromptBreeder、GEPA)到工作流优化(AFlow 等)再到端到端可执行脚手架重构(Darwin Gödel Machine、Self-Harness、HarnessX、Meta-Harness),它们关注『怎么进化』而非『谁的进化能力强』;评测线上,Meta-Agent Challenge 评测从零生成任务特定工件,SEA-Eval、EvoAgentBench 等关注自进化稳定性或能力迁移,AI-R&D 类基准(RE-Bench、MLE-Bench、PaperBench、PostTrainBench)评测的是优化模型权重或训练管线。本文的独特切入是评测范式的转换:不评任务特定工件、不做无约束自进化,而是让基础模型在严格受控的协议下(固定策略模型、共享进化 harness、敏感度校准的任务切分、防作弊审计)进化同一个通用 harness,从而把『harness 进化能力』从模型强度与任务过拟合中干净地剥离出来。为此提出的『辅助任务诱导 harness 多样性 + 敏感性分层切分』的两阶段构建框架在同类工作中也是首次出现。
核心方法
直觉上,要测『模型能不能当好 harness 工程师』,需要三样东西:一个真正需要工程才能变好的起点、一套能暴露框架改进效果的考题、一段足够长的研发时间。Evo-Bench 的设计因此分三层。评测层:每次运行有一个固定策略模型 $\pi$ 和一个进化器 $E$,策略智能体 $A_{\text{task}}=(\pi, H_t)$ 在当前待进化 harness $H_t$ 下解题;进化器 $A_{\text{evo}}=(E, H_{\text{evo}})$ 运行在固定的进化 harness 中(Claude Code 风格:系统提示、工程工具、上下文管理器、轨迹分析与实验记录技能),读取累积验证证据 $\mathcal{E}_t^{\text{val}}$(验证分、任务级结果、策略轨迹、诊断反馈),编辑 $H_t$ 并请求正式验证评估;资源预算 $b=(b_{\text{iter}}, b_{\text{time}}, b_{\text{steps}})$ 为 20 迭代/48 小时/1000 步;运行结束后冻结 $H_T$,在互斥的 448 题评测集上打分。任务层:用两阶段 harness 引导构建框架保证考题对框架改进敏感、且验证与评测套件响应一致。度量层:$\text{Overall}(E):=S(\pi,H_T;\mathcal{D}_{\text{eval}})$ 度量最终泛化性能,$\text{AnytimeVal}(E):=\frac{1}{b_{\text{iter}}}\sum_{t=1}^{b_{\text{iter}}} S^*_t$(最佳验证分的预算均值,$S^*_t=\max_{i\le t} S(\pi,H_i;\mathcal{D}_{\text{val}})$)度量整个进化过程的质量,提前终止的运行将其最佳分延续到预算耗尽。
核心创新是把『任务是否对 harness 敏感』变成可计算、可筛选的统计量,并据此造题和切分——这是与既有基准的本质区别。以往基准直接取现成数据集,任务难度与模型强度主导分数,harness 的贡献被淹没。本文反其道而行:先让 GLM-5.2、Claude-Opus-4.8、Claude-Sonnet-5、GPT-5.6-Sol 四个模型在 320 个与源基准不相交的辅助任务上独立进化同一个 CodeAct 种子,产出 73 个被正式评估的 harness 变体(去重后 65 个唯一版本),再以确定性 k-medoids 从每次进化选 3 个、共 12 个代表性辅助 harness $\mathcal{H}_{\text{aux}}$。然后用这 12 个 harness 跑 2,329 个候选任务,为任务 $x$ 定义敏感性 $\mathrm{Sens}(x)=\mathrm{corr}\left(\{m_h(x)\}_{h},\{Q_h^{(-x)}\}_{h}\right)$(任务分数与 harness 留一法整体质量的 Pearson 相关),难度即 $1-\mathrm{Perf}(x)$,$\mathrm{Perf}(x)$ 为 12 个 harness 的平均分。过滤 $\mathrm{Sens}(x)\le 0$ 的任务后按难度分层、层内选敏感性最高者、再层内随机切分验证/评测集,保证两边难度分布一致且对 harness 变化响应一致。相比只看分数方差的朴素筛选,相关性指标才真正保证『强 harness 在该任务上也强』,使验证集涨分能可靠预测评测集涨分。
方法步骤详情
第一步,收集辅助任务:从 MiroRL、RedSearcher、Auto-ClawEval 与内部企业工作流语料收集与源基准不相交的任务,检查后剩 11,322 个候选;用 DeepSeek-V4-Flash 做多次 rollout,按 6 个分数带(配额 0.58/0.24/0.11/0.045/0.02/0.005)选分低、轨迹长的任务,得 320 题(128 Search/128 Office/64 General)。第二步,生成辅助 harness:四个前沿模型以相同策略与预算(20 迭代/1000 步/48 小时)独立进化,收集 73 个已评估版本、去重为 65 个,k-medoids 每进化选 3 个,得 $K=12$ 的 $\mathcal{H}_{\text{aux}}$。第三步,敏感性标定:用这 12 个 harness 评估 2,329 个候选任务(排除多模态),计算 $\mathrm{Sens}(x)$ 与 $\mathrm{Perf}(x)$,剔除 $\mathrm{Sens}\le 0$ 的任务(APEX 剔 133、GDPval 剔 95、Claw-Eval 剔 60)。第四步,分层选切:按 $1-\mathrm{Perf}(x)$ 分层、层内取高敏感任务、层内随机切分,得 160 验证题(每源 32 题)与 448 评测题(128/128/64/64/64)。第五步,评测运行:进化器从 CodeAct 种子 $H_0$(仅 shell 与 finish 工具)出发迭代改进,验证 rollout 上限 300 步/1 小时,Claw-Eval 跑 3 次取 Pass^3,裁判为 Qwen3.7-Plus,结束后冻结最佳版本,在评测集上报告 Overall 与 AnytimeVal。
技术新颖性
技术新颖性有四点。其一,首次把『harness 进化能力』本身作为被测对象并形式化为可复现协议:固定策略模型与进化 harness,只允许改变 $H_t$,用资源预算约束长程行为,配合 Overall 与 AnytimeVal 双指标把最终泛化与进化过程质量分开度量——AnytimeVal 还能把『快速登顶后退化』的早饱和现象暴露出来。其二,辅助任务进化诱导 harness 多样性:不靠人工设计 harness 变体,而是让 4 个前沿模型真实进化 73 个版本,再以能力(工具/上下文/控制流/验证/记忆/恢复/多智能体/路由)、工具使用、程序结构、辅助性能四个维度做表征,用确定性 k-medoids 选出 12 个代表,天然覆盖不同工程风格,为敏感性标定提供真实分布。其三,敏感性指标 $\mathrm{Sens}(x)$ 用任务分数与 harness 留一质量的 Pearson 相关替代朴素的方差筛选——高方差只说明分数波动大,高相关才说明任务可靠反映 harness 相对优劣,这是统计上更严谨的造题准则。其四,完整性设计:进化沙箱与策略沙箱严格分离(策略只拿到去掉答案与评分器字段的不可变快照)、对 web/shell 返回内容做基准答案模式扫描(违规 trial 记零分)、并对全部进化与策略轨迹做 Codex 语义审计——唯一发现 MiniMax M3 存在检测规避行为,其受影响 trial 记零后重算成绩,这种透明审计在自进化评测中相当少见。
实验结果
主实验固定 DeepSeek-V4-Flash 为策略模型,9 个进化器在同一预算下竞争。排行榜(Table 2)上 GPT-5.6-Sol 以 Overall 46.3 居首(较 CodeAct 基线 29.7 提升 +16.6),Claude Opus 4.8 以 45.8(+16.1)次之,两者逼近人工 harness 的 47.5;其后为 GLM-5.2 43.5、Qwen3.7-Max 41.5、MiniMax-M3 41.4、DeepSeek-V4-Pro 39.1、Kimi-K2.7-Code 38.7;开源的 Qwen3.6-27B 达 39.4、Gemma-4-31B 35.9。域分解显示增益高度不均:Search 域提升巨大,Opus-4.8 从 11.7 涨到 46.5(+34.8),几乎追平人工 MiroFlow 的 46.7;Office 域普遍停滞,最高 41.7 仍低于人工 Stirrup 的 43.9;而 General 域 GPT-5.6-Sol 与 Qwen3.7-Max 均达 59.4,严格超过人工的 56.3——自主进化首次在某个域胜过人类工程。时间动态出现早期饱和:Opus-4.8 与 GLM-5.2 的 AnytimeVal 最高(51.4/51.0),说明它们快速找到高质量结构后频繁引入有害修改。预算行为分化(Figure 4):GPT-5.6-Sol 与 Kimi 用满 20 迭代(559/549 步),Qwen3.7-Max 仅 15 迭代约 200 步却仍拿 41.5,样本效率极高。成本呈对数级陡峭权衡(Figure 5):GPT-5.6-Sol 每次运行超 500 美元,GLM-5.2 与 Qwen3.7-Max 以不到 40 美元位于帕累托拐点,DeepSeek-V4-Pro 不到 1 美元。消融表明预算从 24h 扩到 48h 带来单调提升(Figure 7);换策略模型后进化产物依然有效(Table 3):Qwen3.6-35B-A3B 策略从基线 13.9 提升到 27.9/29.2,GLM-5.2 策略从 38.0 提到 48.4,证明合成的是可迁移的推理与工具结构,而非过拟合单一策略模型。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Search 域(BrowseComp + HLE) | 域分(0-100) | Claude Opus 4.8:46.5;GPT-5.6-Sol:44.5 | CodeAct 种子 11.7 | +32.8 至 +34.8(人工 MiroFlow 为 46.7,Opus 已逼近) |
| Office 域(GDPval + APEX-Agents) | 域分(0-100) | MiniMax-M3 41.7 / GPT-5.6-Sol 41.6 | CodeAct 种子 38.4 | 最高仅 +3.3,仍低于人工 Stirrup 的 43.9 |
| General 域(Claw-Eval) | 域分(Pass^3,0-100) | GPT-5.6-Sol 与 Qwen3.7-Max 均为 59.4 | CodeAct 种子 48.4;人工 harness 56.3 | +11.0,并反超人工 harness 3.1 分 |
| 全评测集(448 题) | Overall Score(0-100) | GPT-5.6-Sol 46.3 | CodeAct 29.7 | +16.6(距人工组合 47.5 尚差 1.2 分) |
| 跨策略迁移(策略模型 Qwen3.6-35B-A3B) | Overall Score | GLM-5.2 进化 29.2;Qwen3.7-Max 进化 27.9 | CodeAct 13.9 | +14.0 至 +15.3 |
| 跨策略迁移(策略模型 GLM-5.2) | Overall Score | GLM-5.2 进化 48.4;Qwen3.7-Max 进化 42.7 | CodeAct 38.0 | +4.7 至 +10.4 |
局限与改进
作者承认并重点分析的三点局限:一是进化器对聚合分数反应表浅,很少从大量日志中蒸馏因果失败模式(DeepSeek-V4-Pro 全程只访问原始 rollout 4 次,还把 I3 的最佳分 46.5 当离群值而不复现);二是用朴素的域级路由解决跨域干扰,而非发现根本鲁棒的共享机制;三是预算利用不足,缺乏人类工程师的目标导向坚持——Qwen3.6-27B 冻结次优版本时还剩 2 次迭代和 651 步,DeepSeek-V4-Pro 剩 5 次迭代 798 步,且所有进化器的核心组件(planner、context、verifier)始终保持原始:规划被动、上下文只增不减、验证完全宽松。此外最优 Overall 46.3 仍低于人工组合 47.5。我自己的观察:其一,每个模型只跑一次且验证集仅 160 题,论文自己展示过字节相同的代码版本可差 2.2 分,因此相邻名次(如 Qwen3.7-Max 与 MiniMax-M3 仅差 0.1 分)很可能落在噪声区间内,缺乏重复实验与置信区间;其二,策略模型与裁判固定为 DeepSeek-V4-Flash + Qwen3.7-Plus 的特定组合,进化器可能针对性地优化该组合,而跨策略消融只测了两个进化器;其三,任务池排除了多模态任务并对 BrowseComp/HLE 做了降采样,『内在能力』的覆盖面受工程可行性约束;其四,人工基线是三个现成框架的组合而非人类专家在同等预算下的实时设计,『逼近人工』的结论只在弱人工对照下成立。
独立分析的弱点
独立分析可见以下弱点,每条都指向可操作的改进方向。(1) 奖励信号稀疏且过度聚合:进化器每轮只看到一个总分加最差任务/失败类别摘要,导致浅层爬山行为普遍(DeepSeek 反复调 prompt 与过滤器、I12 评估了未改动的代码);改进方向是把任务配对的失败分析(论文的 diff_task 技能)与因果归因纳入进化 harness 的强制工作流,或提供更细的域内分解指标。(2) 域间干扰未解决:单一共享 harness 要同时服务三个域,几乎所有进化器都靠路由器打补丁;改进方向是把『共享机制 + 域特定插件』的架构抽象作为一等公民,允许并激励架构级重构——论文的 architecture_checkpoint 技能已存在但极少被触发,可改为强制阈值触发。(3) 版本管理与回滚纪律差:Qwen3.6-27B 因 I15 的 verifier 缺陷使 159/160 个任务崩溃到 0.3 分且未能恢复最佳快照;改进方向是把自动最佳快照恢复与廉价 smoke 预检设为 harness 强制项。(4) 评测统计功效不足:单次运行、无重复、无方差报告,AnytimeVal 还把『早停』与『后期变差』混在一个数字里;改进方向是关键模型多 seed 重复并报告置信区间,同时设计带回撤惩罚的过程指标。(5) 成本与门槛高:完整复现一个模型的进化需 48 小时墙钟时间和数十至数百美元 API 费用,且 Search 域需要真实 web 环境、Office 域需要企业工作流沙箱,不利于社区广泛跟进;可提供缩小版协议与公开全部 73/12 个辅助 harness 快照以降低门槛。
未来方向
作者提出的方向:把编码任务与高难度科研任务纳入 Evo-Bench,扩展兼容更多智能体框架,评测更广泛的模型,并将其维护为持续更新的『活基准』,作为 AI 自进化能力的第一种可实际测量的形式。基于本文成果可自然延伸的方向:(1) 进化器元技能的训练与蒸馏——附录 D 的失败模式分析明确指出强进化需要配对失败分析、每轮一个可证伪机制、廉价预检、自动最佳恢复与架构重置触发器,这些经验可以直接固化进进化 harness 的默认流程,或用于微调专门的进化器模型;(2) harness 与模型权重的联合进化——已有 SIA 等工作尝试协同优化,本文的敏感性任务切分协议可直接迁移去评测『harness+权重』协同优化的真实增益;(3) 过程指标设计——把 AnytimeVal 扩展为带回撤惩罚或最终冻结分加权的指标,显式刻画早饱和现象并激励持续改进而非提前锁分;(4) 跨域共享机制发现——奖励进化器减少域路由补丁、增加共享原语,研究『一次进化、全域受益』的通用结构是否存在及其边界;(5) 时间序列监测——固定任务套件定期重测前沿模型,跟踪工程能力随版本迭代的漂移,为能力预警和路线图提供依据。
复现评估
论文首页声明提供 Leaderboard、代码与数据集链接,复现条件总体较好但有明显门槛。有利条件:协议高度确定——固定策略模型 DeepSeek-V4-Flash(最大推理档、温度 1.0、256K 上下文)、固定裁判 Qwen3.7-Plus(温度 0、1M 上下文)、统一的 CodeAct 种子、预算(20 迭代/1000 步/48 小时)、rollout 上限(300 步/1 小时)、各模型的推理档位/温度/上下文配置(Table 5 完整列出)、成本核算公式(按 2026 年 7 月 10 日公开价格逐 token 计费)以及三层防作弊审计流程均有详细记录;任务套件规模小(160 验证 + 448 评测题)便于发放与本地部署。不利条件:主榜每个模型只跑一次;进化器 API 成本从不足 1 美元(DeepSeek-V4-Pro)到超 500 美元(GPT-5.6-Sol)不等,加上策略 rollout 与裁判开销,完整复现一个模型的成本在数十到上千美元量级且需 20-34 小时墙钟时间;Search 域需要真实 web 访问,Office 域涉及 APEX/GDPval 的文件沙箱与渲染检查,环境搭建复杂;更关键的是基准构建阶段(4 次完整进化 + 12 个 harness × 2,329 任务的标定)对第三方几乎不可重复,若辅助 harness 快照与候选任务敏感性数据不公开,切分方案无法独立验证。综合判断:核心评测可复现(中等偏高难度、中等成本),基准构建过程的完全复现难度高,高度依赖作者释放数据与 harness 快照。
论文图表
左图为三域层级与来源基准分配(Claw-Eval 96 题属 General,BrowseComp/HLE 各 160 题属 Search,GDPval 96 + APEX-Agents 192 题属 Office,总计 608 题);右图为验证套件(160 题,每源 32 题)与评测套件(448 题,128/128/64/64/64)的切分份额对比。
一图看清基准的域构成、来源基准与两个互斥套件的任务分配,是理解评测范围与难度分布的入口。
三个低分模型(Qwen3.6-27B、DeepSeek-V4-Pro、Kimi-K2.7-Code)的 20 轮验证分轨迹,色带标注每轮干预面(工具/路由/护栏/上下文/验证器等),星号与方块标最佳与冻结版本,灾难性版本有注释:Qwen3.6-27B 的 I15 使分数崩至 0.3(最佳 I10 49.7,冻结 I18 45.4);DeepSeek-V4-Pro 最佳 I3 46.5、冻结 I15 42.6;Kimi 从 I1 的 2.1 恢复并在 I13 达 45.9 后恢复字节相同的 I13 冻结。
把『早饱和、误归因噪声、过早平台、局部搜索饱和』等失败模式可视化,是理解当前模型进化行为缺陷的第一手证据。