← 返回 2026-08-25

Task-CoEvolve:基于自适应验证任务选择的高效Harness优化 Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection

Atsuyuki Miyai, Kiyoharu Aizawa, Toshihiko Yamasaki 📅 2026-08-24 👍 11 2026-08-30 18:30
Harness优化 LLM智能体 评测效率 采样估计

验证任务集随harness共同进化,用20%评测预算达到全量搜索效果

前置知识

Harness(智能体脚手架)

围绕固定 LLM 的控制代码,决定模型看到什么、存什么、检索什么:包括提示词模板、记忆管理、工具调用与重试逻辑等。同一模型换不同 Harness 在同一基准上可产生高达 6 倍的性能差,因此 Harness 的设计与模型本身同等重要。

本文优化的对象就是 Harness 而非模型权重,理解这一层的构成和影响是读懂问题设定的前提。

进化式 Harness 搜索与 Meta-Harness

自动化 Harness 优化框架:元智能体根据历史评测结果迭代改写 Harness 代码,生成多个候选,在验证集上评测后保留改进。Meta-Harness 是代表性工作,每轮在完整验证集上评测所有候选,总开销为 $K \times N \times r$ 次任务执行。

Task-CoEvolve 直接构建在 Meta-Harness 之上,只替换其评测环节,对比实验也以其作为全量搜索基线。

伯努利方差

取值为成功/失败 0-1 结果的随机变量方差为 $\bar p(1-\bar p)$,在 $\bar p=0.5$ 时取最大值 0.25,$\bar p$ 趋近 0 或 1 时趋于 0。它度量“结果的不一致程度”,因此可作为任务对候选 Harness 区分力的天然代理指标。

本文方差加权采样(式 2)的核心项就是它,直接决定每轮把评测预算花在哪些任务上。

不等概率抽样与 Hájek 估计

当总体单元被抽中的包含概率 $\pi_t$ 不同时,对子集结果做简单平均是有偏的。Horvitz-Thompson 估计用 $1/\pi_t$ 加权;Hájek 估计进一步用 $\sum x_t/\pi_t$ 除以 $\sum 1/\pi_t$ 归一化,两者都给出总体均值的一致估计。包含概率 $\pi_t$ 通常通过模拟抽样设计(本文用 4,000 次 Monte Carlo)来估计。

Task-CoEvolve 每轮抽取的任务子集都不同,必须靠这类设计型估计量把分数换算到统一尺度,才能跨轮公平比较候选。

研究动机

现有的自动 Harness 优化方法(如 Meta-Harness)每轮让元智能体改写 Harness 代码,再把每个候选在完整验证集上全部评测一遍,带来两个问题。其一是贵:总开销为 $K \times N \times r$ 次任务执行,文本分类设定下即 20 轮 × 130 个验证样本 × 3 次试验 = 7,800 次评测;在 Terminal-Bench 2.1 上每个任务要占用沙箱数十分钟,GPT-5.6 Luna 的全量搜索共执行 890 次任务试验、消耗 2,888M 输入 token、耗时 22.2 小时、花费约 117 美元。其二是静态:随着 Harness 进化,所有候选都能解出或都解不出的任务不再提供区分信号,却仍在消耗预算。作者在 Table 5 中统计发现,历史成功率处于两个极端(从未被解出或几乎总被解出)的任务持续占任务池 70% 以上;文本分类中“几乎人人可解”的任务从第 0 轮的 34 个涨到第 20 轮的 58 个,Terminal-Bench 上“无人可解”的任务从 32 个降到 21 个,说明固定验证集的优化信号随搜索动态退化。

本文的目标是本文的目标是让验证任务集与 Harness 共同进化:每一轮只从 $N$ 个验证任务中抽取 $m = \lceil \rho N \rceil$ 个($\rho$ 取 20% 或 7%)来评测候选 Harness,从而把每轮评测开销从 $N$ 降到 $m$。但要使子集评测真正可用,必须同时解决两个挑战:一是选出的任务要对当前候选最有区分力,把预算集中在能力边界附近,而不是浪费在人人可解或人人不可解的任务上;二是不同轮次抽到的子集不同,必须把部分评测结果换算到统一口径下,才能跨轮比较并在最后公平地选出最优 Harness。最终衡量标准是:用 20% 左右的评测预算匹配全量搜索的最终性能,并把实际搜索成本(token、时间、费用)降低 67%–80%。

与已有工作不同的是,此前的效率改进几乎都集中在候选侧:ShinkaEvolve、TurboEvolve 优化候选生成与选择策略以提高样本效率,DemoEvolve 引入人类演示补充稀疏反馈,HarnessCompass 用约束式组件级优化引导进化。这些方法减少的是候选数量,而每个候选的评测成本不变。Task-CoEvolve 从正交方向切入——优化“用哪些任务来评测”。它与样本高效评估工作(tinyBenchmarks、Active Testing)也不同:后者估计一个固定模型的性能,而本文面对的是不断进化、彼此竞争的候选 Harness,采样分布必须随 Harness 演化而自适应,且估计全量得分时必须校正非均匀抽样带来的偏差。整个方法只依赖历史上成功/失败的观测结果,对任务内容和 Harness 代码本身不做任何假设,因而可以即插即用到任意进化搜索框架。

核心方法

直觉上,一个验证任务值得评测,当且仅当各候选 Harness 在它身上表现不一致:人人都对或人人都错的题目无法告诉你哪个候选更好。Task-CoEvolve 把这个直觉拆成两个模块。第一是方差加权采样:用每个任务历史成功率的伯努利方差 $\bar p_t(1-\bar p_t)$ 度量其区分力——$\bar p_t = 0.5$ 时最大、全对全错时为零——再叠加探索项 $\lambda/\sqrt{n_t}$ 照顾观测次数少的任务,按权重无放回抽取每轮的评测子集。第二是感知采样的全量得分估计:把每个任务被抽中的包含概率 $\pi_t$ 纳入 Horvitz-Thompson 型估计量,使不同轮次、不同子集上的分数可以放在同一尺度上比较。整体流程为 Phase 0 初始化 → Phase 1 方差加权采样 → Phase 2 全量得分估计 → Phase 3 按 $\hat S$ 最大值做最终选择,全程与 Meta-Harness 式的元智能体搜索循环无缝衔接,每轮评测结果又反过来更新任务统计,实现任务集与 Harness 的共进化。

核心创新是“验证集本身成为优化对象”这一共进化视角及配套的两个技术件。其一,用历史结果的伯努利方差代理任务区分力,采样权重 $w_t = \max(\bar p_t(1-\bar p_t), \ell_t) + \lambda/\sqrt{n_t}$:从未被解出任务的下限 $\ell_t=0.125$ 防止其被永久排除(它们可能随 Harness 变强而变得可解),$\lambda=0.025$ 的探索项保护低观测任务;随 Harness 进化,权重分布自动漂移,预算始终跟随能力边界。其二,跨轮可比性靠设计型估计量保证:成功率接近 0/1 的任务池用 Hájek 比率估计;成功率居中时,极少被抽中的“总被解出”任务会以 $x_t(h)/\pi_t$ 形式炸掉估计,故改用锚定差分估计 $\hat S(h)=\frac{1}{N}\sum_{t\in T}\bar p_t + \frac{1}{N}\sum_{t\in S_k}\frac{x_t(h)-\bar p_t}{\pi_t}$。与已有方法的本质区别:候选怎么生成不重要,“评测哪些任务”第一次成为被优化的变量。

方法步骤详情

Phase 0 初始化:搜索前把两个起始 Harness(文本分类为零样本与全量 few-shot;Terminal-Bench 为 Terminus 2 与 Terminus-KIRA)在整个验证集 $T$(130 或 89 个任务)上各评测一遍,得到每个任务的初始成功率 $\bar p_t$ 与观测数 $n_t$;这并非额外成本,元智能体写首批候选本就需要它们。Phase 1 方差加权采样:第 $k$ 轮按权重 $w_t$ 无放回抽取大小 $m=\lceil\rho N\rceil$ 的子集 $S_k$,候选在 $S_k$ 上执行 $r$ 次试验得到 $x_t(h)$。Phase 2 全量得分估计:用 4,000 次 Monte Carlo 模拟估计包含概率 $\pi_t$,按任务池结构选 Hájek(式 3,文本分类)或锚定差分(式 4,Terminal-Bench)估计 $\hat S(h)$,结果反馈给元智能体 Claude Opus 4.6 生成下一批候选。Phase 3 最终选择:全部候选中取 $\hat S$ 最大者,平手选最早迭代的候选。

技术新颖性

技术新颖性体现在三点。第一,问题设定本身是新的:作者首次把“优化评测用哪些任务”形式化为 Harness 优化的子问题,与减少候选数的既有路线正交,二者可以叠加使用。第二,把调查抽样理论(Horvitz-Thompson 1952、Hájek 1964)严谨地移植到进化搜索中:不是简单地“随机抽子集求均值”,而是用包含概率校正后的估计量保证跨轮可比,并首次指出估计量形式必须匹配任务池结构——附录 Table A 显示在文本分类上换用锚定差分会掉 3.3–3.6 分,而在 Terminal-Bench 上换用 Hájek 会失稳(某候选原始分 33.3% 却被估成 85.9%)。第三,整套机制只消费成功/失败观测,不解析任务文本或 Harness 代码,具有良好的通用性;消融实验(Table 4)逐项验证了三个组件的贡献:随机重采样把平均分从 47.2 提到 48.2,全量估计加 $\hat S$-max 选择提到 48.8,方差加权采样最终提到 49.3。

Overview of the Task-CoEvolve procedure.
Figure 2: Overview of the Task-CoEvolve procedure.

实验结果

文本分类(Table 1):三数据集平均,全量搜索 48.6±0.8(7,800 次评测);本文在 7% 预算下达 47.6±0.9,超过 Naive(45.2)与 Random-Resample(47.0),以 1/16 评测逼近全量;20% 预算下达 49.3±0.8,反超全量约 1 分。Terminal-Bench(Table 2):GPT-5.6 Luna 61.8% 对全量 62.9%,Qwen3.6-35B-A3B 41.6% 对 42.7%,差距仅 1.1 分(约 1/89 任务),优于 Naive(55.1/39.3)与 Random-Resample(59.6/37.1)。成本(Table 3):GPT-5.6 输入 token 2,888M→579M(-80%),$117→$30,22.2h→11.5h;Qwen 741M→246M(-67%),38h→20.5h。估计质量(Table 6):20% 预算下 Spearman 0.62,选出者排 12/60(51.3%);7% 下仅 0.13,选出者居 10/60。强模型(DeepSeek-V4)上增益为 0。

Online text classification. Held-out test accuracy of the harness selected by each protocol under evaluation budget ρ.
Table 1: Online text classification. Held-out test accuracy of the harness selected by each protocol under evaluation budget ρ.
Terminal-Bench 2.1. Full-89 task pass rate (%) of the harness selected by each protocol.
Table 2: Terminal-Bench 2.1. Full-89 task pass rate (%) of the harness selected by each protocol.
Cost of the search phase on Terminal-Bench 2.1.
Table 3: Cost of the search phase on Terminal-Bench 2.1.
Ablation on the contribution of each Task-CoEvolve component.
Table 4: Ablation on the contribution of each Task-CoEvolve component.
Distribution of task solvability across iterations.
Table 5: Distribution of task solvability across iterations.
Accuracy of $\hat S$ vs. full-val ground truth.
Table 6: Accuracy of $\hat S$ vs. full-val ground truth.
查看结构化数据
任务指标本文基线提升
在线文本分类(USPTO/S2D/Law 平均,进化 Harness 搜索) held-out 测试准确率(3 次运行均值±标准差) 49.3±0.8%(ρ=20%,1,560 次评测) Meta-Harness 全量搜索 48.6±0.8%(7,800 次评测);Random-Resample 48.2±0.5%;Naive 47.2±0.6% 以 20% 评测预算反超全量搜索 +0.7 分
在线文本分类(极限预算 ρ=7%) held-out 测试准确率 47.6±0.9%(480 次评测) Naive 45.2±3.2%;Random-Resample 47.0±2.2%;全量搜索 48.6±0.8% 比 Naive 高 2.4 分,用 1/16 评测量逼近全量搜索(差 1.0 分)
Terminal-Bench 2.1(89 任务,GPT-5.6 Luna / Qwen3.6-35B-A3B) 89 任务 pass rate 61.8% / 41.6%(平均 51.7%,ρ=20%,180 次评测) 全量搜索 62.9% / 42.7%(平均 52.8%,890 次评测);Random-Resample 59.6% / 37.1% 评测次数 -80%,性能差距仅 1.1 分(约 1 个任务),并超过两个子集基线
Terminal-Bench 2.1 搜索成本 输入 token / 时间 / API 费用 GPT-5.6:579M token、11.5h、$30;Qwen:246M token、20.5h 全量搜索:GPT-5.6 2,888M token、22.2h、$117;Qwen 741M token、38.0h token 成本 -80% / -67%,搜索时间约减半

局限与改进

作者承认的最大限制是每个候选的评测任务数 $m$ 在看到任何结果之前就固定了:无法对明显更差的候选提前止损,也无法在两个候选难分胜负时追加评测,自适应决定 $m$ 被留作未来工作。我自己的观察还有几点:其一,$\rho=7\%$ 时 $\hat S$ 与真实分的 Spearman 相关只有 0.13,每数据集仅 2–3 个样本时排序本质上不可行,方法的价值几乎完全靠“避免选差”而非“选对最优”;其二,方差加权会把预算集中到长时程、多轮对话的昂贵任务上,单次试验平均输入 3.2M token,是 Random-Resample(0.7M)的 4 倍多,token 降 5 倍但时间只降约 1.9 倍,部分收益被抵消;其三,Terminal-Bench 用验证集分数本身作最终成绩,全量搜索天然占优,1.1 分差距的解读需谨慎;其四,$\pi_t$ 靠 4,000 次 Monte Carlo 估计,$\rho$ 很小时个别任务 $\pi_t$ 极小,估计方差被 $1/\pi_t$ 放大;其五,文本分类实验仅 3 次重复,±3.2 的标准差下“20% 反超全量 1 分”这类结论在统计上并不稳固。

独立分析的弱点

第一,小预算下的选择失效:$\rho=7\%$ 时 60 个候选中 $\hat S$ 最高的只排真实第 10 名,说明每数据集 2–3 个样本的加权估计不足以排序,改进方向是把序贯检验(如 SPRT)引入评测循环,对早期已明显落后的候选止损,把省下的预算转投给难分候选,并自适应增大 $m$。第二,区分力只用伯努利方差 $\bar p_t(1-\bar p_t)$ 度量,忽略任务间难度相关与候选家族相似性,可用 Beta-Bernoulli 后验或任务嵌入聚类刻画结构化不确定性。第三,Phase 0 需要两个起始 Harness 的全量评测作初始历史,在单任务数十分钟的沙箱场景仍是数千分钟级固定开销,可用分层抽样缩减。第四,估计量选择规则(成功率近 0/1 用 Hájek、居中用锚定差分)目前靠 Phase 0 统计加人工判断,可自动化为分布形状的统计检验。第五,实验仅 3 次重复、基准规模小(130 个验证样本、89 个任务),且 Terminal-Bench 搜索与最终评估共用同一任务集,结论稳健性需更大规模验证。

未来方向

作者明确提出的方向是让每轮评测的任务数 $m$ 在评测过程中动态决定:对已经明显较差的候选提前停止,对难分候选追加评测。在此基础上可以延伸几条路线:其一,把 Task-CoEvolve 与候选侧效率方法(ShinkaEvolve、DemoEvolve、HarnessCompass)叠加,搜索端与评测端同时省,有望把总成本再压一个数量级;其二,引入内容感知先验,用任务嵌入预测区分力,缓解冷启动对 Phase 0 全量评测的依赖;其三,为 $\hat S$ 给出置信区间并做带保证的选择(类似 best-arm identification),把“选出第 12/60 名”改进为“以高概率选出前 5%”;其四,同样的共进化思想可迁移到 RL 训练的课程选择与其他昂贵评测环节,如长时程代码生成基准、多智能体仿真评估;其五,增加任务池漂移检测,当“几乎人人可解”的任务比例超过阈值时自动重组任务池或引入新任务,保持长期搜索中的信号密度。

复现评估

复现条件中等偏上。代码承诺开源于 GitHub(Agent4Science-UTokyo/Task-CoEvolve);基准全公开:LawBench、Symptom2Disease、USPTO-50k、Terminal-Bench 2.1。关键超参数完整给出(Table D):$\ell=0.125$、$\lambda=0.025$、4,000 次 Monte Carlo 估计 $\pi_t$、$\rho\in\{7\%,20\%\}$。模型依赖较重:元智能体 Claude Opus 4.6,分类器 GPT-OSS-120B,Terminal-Bench 用 GPT-5.6 Luna(费用:全量 $117、本文 $30,11.5–22.2 小时)与可自托管的 Qwen3.6-35B-A3B(38h→20.5h)。协议清楚(文本分类 3 次重复、20 轮每轮 3 候选;Terminal-Bench 10 轮每轮 1 候选、$r=1$),沙箱随机失败按固定列表重试至多两次。总体而言,具备 API 预算与工程能力的团队可复现;个人复现 Terminal-Bench 部分门槛较高。