Task-CoEvolve:基于自适应验证任务选择的高效Harness优化 Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection
验证任务集随harness共同进化,用20%评测预算达到全量搜索效果
前置知识
Harness(智能体脚手架)
围绕固定 LLM 的控制代码,决定模型看到什么、存什么、检索什么:包括提示词模板、记忆管理、工具调用与重试逻辑等。同一模型换不同 Harness 在同一基准上可产生高达 6 倍的性能差,因此 Harness 的设计与模型本身同等重要。
本文优化的对象就是 Harness 而非模型权重,理解这一层的构成和影响是读懂问题设定的前提。
进化式 Harness 搜索与 Meta-Harness
自动化 Harness 优化框架:元智能体根据历史评测结果迭代改写 Harness 代码,生成多个候选,在验证集上评测后保留改进。Meta-Harness 是代表性工作,每轮在完整验证集上评测所有候选,总开销为 $K \times N \times r$ 次任务执行。
Task-CoEvolve 直接构建在 Meta-Harness 之上,只替换其评测环节,对比实验也以其作为全量搜索基线。
伯努利方差
取值为成功/失败 0-1 结果的随机变量方差为 $\bar p(1-\bar p)$,在 $\bar p=0.5$ 时取最大值 0.25,$\bar p$ 趋近 0 或 1 时趋于 0。它度量“结果的不一致程度”,因此可作为任务对候选 Harness 区分力的天然代理指标。
本文方差加权采样(式 2)的核心项就是它,直接决定每轮把评测预算花在哪些任务上。
不等概率抽样与 Hájek 估计
当总体单元被抽中的包含概率 $\pi_t$ 不同时,对子集结果做简单平均是有偏的。Horvitz-Thompson 估计用 $1/\pi_t$ 加权;Hájek 估计进一步用 $\sum x_t/\pi_t$ 除以 $\sum 1/\pi_t$ 归一化,两者都给出总体均值的一致估计。包含概率 $\pi_t$ 通常通过模拟抽样设计(本文用 4,000 次 Monte Carlo)来估计。
Task-CoEvolve 每轮抽取的任务子集都不同,必须靠这类设计型估计量把分数换算到统一尺度,才能跨轮公平比较候选。
研究动机
现有的自动 Harness 优化方法(如 Meta-Harness)每轮让元智能体改写 Harness 代码,再把每个候选在完整验证集上全部评测一遍,带来两个问题。其一是贵:总开销为 $K \times N \times r$ 次任务执行,文本分类设定下即 20 轮 × 130 个验证样本 × 3 次试验 = 7,800 次评测;在 Terminal-Bench 2.1 上每个任务要占用沙箱数十分钟,GPT-5.6 Luna 的全量搜索共执行 890 次任务试验、消耗 2,888M 输入 token、耗时 22.2 小时、花费约 117 美元。其二是静态:随着 Harness 进化,所有候选都能解出或都解不出的任务不再提供区分信号,却仍在消耗预算。作者在 Table 5 中统计发现,历史成功率处于两个极端(从未被解出或几乎总被解出)的任务持续占任务池 70% 以上;文本分类中“几乎人人可解”的任务从第 0 轮的 34 个涨到第 20 轮的 58 个,Terminal-Bench 上“无人可解”的任务从 32 个降到 21 个,说明固定验证集的优化信号随搜索动态退化。
本文的目标是本文的目标是让验证任务集与 Harness 共同进化:每一轮只从 $N$ 个验证任务中抽取 $m = \lceil \rho N \rceil$ 个($\rho$ 取 20% 或 7%)来评测候选 Harness,从而把每轮评测开销从 $N$ 降到 $m$。但要使子集评测真正可用,必须同时解决两个挑战:一是选出的任务要对当前候选最有区分力,把预算集中在能力边界附近,而不是浪费在人人可解或人人不可解的任务上;二是不同轮次抽到的子集不同,必须把部分评测结果换算到统一口径下,才能跨轮比较并在最后公平地选出最优 Harness。最终衡量标准是:用 20% 左右的评测预算匹配全量搜索的最终性能,并把实际搜索成本(token、时间、费用)降低 67%–80%。
与已有工作不同的是,此前的效率改进几乎都集中在候选侧:ShinkaEvolve、TurboEvolve 优化候选生成与选择策略以提高样本效率,DemoEvolve 引入人类演示补充稀疏反馈,HarnessCompass 用约束式组件级优化引导进化。这些方法减少的是候选数量,而每个候选的评测成本不变。Task-CoEvolve 从正交方向切入——优化“用哪些任务来评测”。它与样本高效评估工作(tinyBenchmarks、Active Testing)也不同:后者估计一个固定模型的性能,而本文面对的是不断进化、彼此竞争的候选 Harness,采样分布必须随 Harness 演化而自适应,且估计全量得分时必须校正非均匀抽样带来的偏差。整个方法只依赖历史上成功/失败的观测结果,对任务内容和 Harness 代码本身不做任何假设,因而可以即插即用到任意进化搜索框架。
核心方法
直觉上,一个验证任务值得评测,当且仅当各候选 Harness 在它身上表现不一致:人人都对或人人都错的题目无法告诉你哪个候选更好。Task-CoEvolve 把这个直觉拆成两个模块。第一是方差加权采样:用每个任务历史成功率的伯努利方差 $\bar p_t(1-\bar p_t)$ 度量其区分力——$\bar p_t = 0.5$ 时最大、全对全错时为零——再叠加探索项 $\lambda/\sqrt{n_t}$ 照顾观测次数少的任务,按权重无放回抽取每轮的评测子集。第二是感知采样的全量得分估计:把每个任务被抽中的包含概率 $\pi_t$ 纳入 Horvitz-Thompson 型估计量,使不同轮次、不同子集上的分数可以放在同一尺度上比较。整体流程为 Phase 0 初始化 → Phase 1 方差加权采样 → Phase 2 全量得分估计 → Phase 3 按 $\hat S$ 最大值做最终选择,全程与 Meta-Harness 式的元智能体搜索循环无缝衔接,每轮评测结果又反过来更新任务统计,实现任务集与 Harness 的共进化。
核心创新是“验证集本身成为优化对象”这一共进化视角及配套的两个技术件。其一,用历史结果的伯努利方差代理任务区分力,采样权重 $w_t = \max(\bar p_t(1-\bar p_t), \ell_t) + \lambda/\sqrt{n_t}$:从未被解出任务的下限 $\ell_t=0.125$ 防止其被永久排除(它们可能随 Harness 变强而变得可解),$\lambda=0.025$ 的探索项保护低观测任务;随 Harness 进化,权重分布自动漂移,预算始终跟随能力边界。其二,跨轮可比性靠设计型估计量保证:成功率接近 0/1 的任务池用 Hájek 比率估计;成功率居中时,极少被抽中的“总被解出”任务会以 $x_t(h)/\pi_t$ 形式炸掉估计,故改用锚定差分估计 $\hat S(h)=\frac{1}{N}\sum_{t\in T}\bar p_t + \frac{1}{N}\sum_{t\in S_k}\frac{x_t(h)-\bar p_t}{\pi_t}$。与已有方法的本质区别:候选怎么生成不重要,“评测哪些任务”第一次成为被优化的变量。
方法步骤详情
Phase 0 初始化:搜索前把两个起始 Harness(文本分类为零样本与全量 few-shot;Terminal-Bench 为 Terminus 2 与 Terminus-KIRA)在整个验证集 $T$(130 或 89 个任务)上各评测一遍,得到每个任务的初始成功率 $\bar p_t$ 与观测数 $n_t$;这并非额外成本,元智能体写首批候选本就需要它们。Phase 1 方差加权采样:第 $k$ 轮按权重 $w_t$ 无放回抽取大小 $m=\lceil\rho N\rceil$ 的子集 $S_k$,候选在 $S_k$ 上执行 $r$ 次试验得到 $x_t(h)$。Phase 2 全量得分估计:用 4,000 次 Monte Carlo 模拟估计包含概率 $\pi_t$,按任务池结构选 Hájek(式 3,文本分类)或锚定差分(式 4,Terminal-Bench)估计 $\hat S(h)$,结果反馈给元智能体 Claude Opus 4.6 生成下一批候选。Phase 3 最终选择:全部候选中取 $\hat S$ 最大者,平手选最早迭代的候选。
技术新颖性
技术新颖性体现在三点。第一,问题设定本身是新的:作者首次把“优化评测用哪些任务”形式化为 Harness 优化的子问题,与减少候选数的既有路线正交,二者可以叠加使用。第二,把调查抽样理论(Horvitz-Thompson 1952、Hájek 1964)严谨地移植到进化搜索中:不是简单地“随机抽子集求均值”,而是用包含概率校正后的估计量保证跨轮可比,并首次指出估计量形式必须匹配任务池结构——附录 Table A 显示在文本分类上换用锚定差分会掉 3.3–3.6 分,而在 Terminal-Bench 上换用 Hájek 会失稳(某候选原始分 33.3% 却被估成 85.9%)。第三,整套机制只消费成功/失败观测,不解析任务文本或 Harness 代码,具有良好的通用性;消融实验(Table 4)逐项验证了三个组件的贡献:随机重采样把平均分从 47.2 提到 48.2,全量估计加 $\hat S$-max 选择提到 48.8,方差加权采样最终提到 49.3。
实验结果
文本分类(Table 1):三数据集平均,全量搜索 48.6±0.8(7,800 次评测);本文在 7% 预算下达 47.6±0.9,超过 Naive(45.2)与 Random-Resample(47.0),以 1/16 评测逼近全量;20% 预算下达 49.3±0.8,反超全量约 1 分。Terminal-Bench(Table 2):GPT-5.6 Luna 61.8% 对全量 62.9%,Qwen3.6-35B-A3B 41.6% 对 42.7%,差距仅 1.1 分(约 1/89 任务),优于 Naive(55.1/39.3)与 Random-Resample(59.6/37.1)。成本(Table 3):GPT-5.6 输入 token 2,888M→579M(-80%),$117→$30,22.2h→11.5h;Qwen 741M→246M(-67%),38h→20.5h。估计质量(Table 6):20% 预算下 Spearman 0.62,选出者排 12/60(51.3%);7% 下仅 0.13,选出者居 10/60。强模型(DeepSeek-V4)上增益为 0。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 在线文本分类(USPTO/S2D/Law 平均,进化 Harness 搜索) | held-out 测试准确率(3 次运行均值±标准差) | 49.3±0.8%(ρ=20%,1,560 次评测) | Meta-Harness 全量搜索 48.6±0.8%(7,800 次评测);Random-Resample 48.2±0.5%;Naive 47.2±0.6% | 以 20% 评测预算反超全量搜索 +0.7 分 |
| 在线文本分类(极限预算 ρ=7%) | held-out 测试准确率 | 47.6±0.9%(480 次评测) | Naive 45.2±3.2%;Random-Resample 47.0±2.2%;全量搜索 48.6±0.8% | 比 Naive 高 2.4 分,用 1/16 评测量逼近全量搜索(差 1.0 分) |
| Terminal-Bench 2.1(89 任务,GPT-5.6 Luna / Qwen3.6-35B-A3B) | 89 任务 pass rate | 61.8% / 41.6%(平均 51.7%,ρ=20%,180 次评测) | 全量搜索 62.9% / 42.7%(平均 52.8%,890 次评测);Random-Resample 59.6% / 37.1% | 评测次数 -80%,性能差距仅 1.1 分(约 1 个任务),并超过两个子集基线 |
| Terminal-Bench 2.1 搜索成本 | 输入 token / 时间 / API 费用 | GPT-5.6:579M token、11.5h、$30;Qwen:246M token、20.5h | 全量搜索:GPT-5.6 2,888M token、22.2h、$117;Qwen 741M token、38.0h | token 成本 -80% / -67%,搜索时间约减半 |
局限与改进
作者承认的最大限制是每个候选的评测任务数 $m$ 在看到任何结果之前就固定了:无法对明显更差的候选提前止损,也无法在两个候选难分胜负时追加评测,自适应决定 $m$ 被留作未来工作。我自己的观察还有几点:其一,$\rho=7\%$ 时 $\hat S$ 与真实分的 Spearman 相关只有 0.13,每数据集仅 2–3 个样本时排序本质上不可行,方法的价值几乎完全靠“避免选差”而非“选对最优”;其二,方差加权会把预算集中到长时程、多轮对话的昂贵任务上,单次试验平均输入 3.2M token,是 Random-Resample(0.7M)的 4 倍多,token 降 5 倍但时间只降约 1.9 倍,部分收益被抵消;其三,Terminal-Bench 用验证集分数本身作最终成绩,全量搜索天然占优,1.1 分差距的解读需谨慎;其四,$\pi_t$ 靠 4,000 次 Monte Carlo 估计,$\rho$ 很小时个别任务 $\pi_t$ 极小,估计方差被 $1/\pi_t$ 放大;其五,文本分类实验仅 3 次重复,±3.2 的标准差下“20% 反超全量 1 分”这类结论在统计上并不稳固。
独立分析的弱点
第一,小预算下的选择失效:$\rho=7\%$ 时 60 个候选中 $\hat S$ 最高的只排真实第 10 名,说明每数据集 2–3 个样本的加权估计不足以排序,改进方向是把序贯检验(如 SPRT)引入评测循环,对早期已明显落后的候选止损,把省下的预算转投给难分候选,并自适应增大 $m$。第二,区分力只用伯努利方差 $\bar p_t(1-\bar p_t)$ 度量,忽略任务间难度相关与候选家族相似性,可用 Beta-Bernoulli 后验或任务嵌入聚类刻画结构化不确定性。第三,Phase 0 需要两个起始 Harness 的全量评测作初始历史,在单任务数十分钟的沙箱场景仍是数千分钟级固定开销,可用分层抽样缩减。第四,估计量选择规则(成功率近 0/1 用 Hájek、居中用锚定差分)目前靠 Phase 0 统计加人工判断,可自动化为分布形状的统计检验。第五,实验仅 3 次重复、基准规模小(130 个验证样本、89 个任务),且 Terminal-Bench 搜索与最终评估共用同一任务集,结论稳健性需更大规模验证。
未来方向
作者明确提出的方向是让每轮评测的任务数 $m$ 在评测过程中动态决定:对已经明显较差的候选提前停止,对难分候选追加评测。在此基础上可以延伸几条路线:其一,把 Task-CoEvolve 与候选侧效率方法(ShinkaEvolve、DemoEvolve、HarnessCompass)叠加,搜索端与评测端同时省,有望把总成本再压一个数量级;其二,引入内容感知先验,用任务嵌入预测区分力,缓解冷启动对 Phase 0 全量评测的依赖;其三,为 $\hat S$ 给出置信区间并做带保证的选择(类似 best-arm identification),把“选出第 12/60 名”改进为“以高概率选出前 5%”;其四,同样的共进化思想可迁移到 RL 训练的课程选择与其他昂贵评测环节,如长时程代码生成基准、多智能体仿真评估;其五,增加任务池漂移检测,当“几乎人人可解”的任务比例超过阈值时自动重组任务池或引入新任务,保持长期搜索中的信号密度。
复现评估
复现条件中等偏上。代码承诺开源于 GitHub(Agent4Science-UTokyo/Task-CoEvolve);基准全公开:LawBench、Symptom2Disease、USPTO-50k、Terminal-Bench 2.1。关键超参数完整给出(Table D):$\ell=0.125$、$\lambda=0.025$、4,000 次 Monte Carlo 估计 $\pi_t$、$\rho\in\{7\%,20\%\}$。模型依赖较重:元智能体 Claude Opus 4.6,分类器 GPT-OSS-120B,Terminal-Bench 用 GPT-5.6 Luna(费用:全量 $117、本文 $30,11.5–22.2 小时)与可自托管的 Qwen3.6-35B-A3B(38h→20.5h)。协议清楚(文本分类 3 次重复、20 轮每轮 3 候选;Terminal-Bench 10 轮每轮 1 候选、$r=1$),沙箱随机失败按固定列表重试至多两次。总体而言,具备 API 预算与工程能力的团队可复现;个人复现 Terminal-Bench 部分门槛较高。
论文图表
对比示意图。左侧为现有 Harness 进化:每轮在全部约 100 个任务上评测再更新 Harness,评测成本高;右侧为 Task-CoEvolve:任务池中每轮只评测一个小子集,评测成本低,且随迭代推进,被选中的任务变得更有信息量、更难,搜索在更广范围内收敛,时间和算力大幅下降。图中用易/中/难任务方块与迭代 1 到最终迭代的演化直观呈现“任务集随 Harness 共同进化”。
一图看懂论文核心卖点:不是优化候选生成,而是让验证任务集本身进化,这是全文动机与贡献的浓缩。
附录 A 估计量交换实验:其余组件不变,文本分类上把 Hájek(式 3)换成锚定差分(式 4),平均分从 49.3±0.8 降到 46.0±2.6(ρ=20%)、47.6±0.9 降到 44.0±3.0(ρ=7%);而 Terminal-Bench 上换用 Hájek 会失稳(某候选原始分 33.3% 被估成 85.9%)。
验证了“估计量形式必须匹配任务池结构”这一关键设计规则的必要性,是方法严谨性的重要支撑。
附录 B 平手规则敏感性:平手时选最早候选(正文规则)vs 选最新候选。Task-CoEvolve 不受影响($\hat S$ 连续、无平手);基线受影响明显,ρ=7% 时 Naive 从 45.2 降到 41.8,Random-Resample 从 47.0 降到 45.6;Naive 在 60 个候选中有 13–16 个并列最高分。
说明基线在小子集下存在大量分数并列,而本文方法因连续估计量天然免疫平手问题,是一个被低估的实用优势。
附录 E Phase 0 验证池统计:两个起始 Harness(Zero-shot/Few-shot)在全量验证集上的表现。USPTO(n=30)平均 $\bar p$=0.08,其中 26 个任务 $\bar p=0$;S2D(n=50)平均 0.71,30 个 $\bar p=1$;LawBench(n=50)平均 0.14,39 个 $\bar p=0$——解释了为何文本分类适用 Hájek 估计。
展示估计量选择规则如何依据 Phase 0 数据落地执行,连接方法设计与具体实验配置。
附录 C:不同模型下全量搜索的增益空间。Qwen3.6-35B-A3B:Terminus 2 起点 34.8 → 搜索后 42.7(+7.9);GPT-5.6 Luna:52.8→62.9(+10.1);DeepSeek-V4-Flash:70.8→70.8(+0.0),其余 9 个候选在 64.0–69.7 之间。
划定了方法的适用边界:模型越强、脚手架空间越小,Harness 优化本身能做的事越少——这是解读主结果的重要上下文。
附录 D:Task-CoEvolve 在 ρ=20% 下选出的文本分类 Harness 的检索步骤伪代码。用两个分词器(词 bigram 与字符 n-gram)各建一个 TF-IDF 索引,按余弦相似度分别排序,再用倒数排名融合 score(i)=1/(k+rank_bigram)+1/(k+rank_char),贪心填充提示词并对已入选标签做多样性惩罚。
展示进化出的 Harness 长什么样:一个无需知道数据集来源就能兼顾法律文本与分子字符串相似性的混合检索器,让抽象方法有了具体着陆点。
附录 D:GPT-5.6 Luna 下选出的 Terminal-Bench Harness 的 wait_after 伪代码。对不执行命令的按键(如单独 C-c)保持固定等待;对执行命令的按键,先短暂等待 0.5s,再以指数退避轮询终端画面,仅当命令已回显、终端安静且最后非空行以 # 或 $ 结尾时提前结束等待。
展示进化在真实昂贵基准上发现的改进:元智能体先从日志量化出固定 sleep 浪费了 1/4–1/3 时间预算、约 1/5 试验因超时失败,再提出该修改,是方法价值的实例化证明。