StarHarness:面向企业环境的分层搜索智能体框架演化 StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
冻结模型权重,自动演化智能体框架,三大企业基准提升20-35个百分点
前置知识
智能体框架(Harness)
指包裹语言模型的可执行脚手架,包括系统提示词与任务框架、工具定义与schema、参数预处理、技能、MCP后端提供者、子智能体结构、上下文管理、验证与终止逻辑等。模型权重固定时,框架决定了智能体如何调用工具、解读环境状态、组织推理循环。接口设计可以在不改变模型参数的情况下改变智能体行为和任务成功率。
本文的全部贡献都在框架空间内搜索而非训练模型,理解框架具体包含哪些可编辑组件,是读懂方法、实验和'学到了什么'分析的前提。
MCP(Model Context Protocol)
模型上下文协议,让LLM应用以标准接口连接外部工具和数据源的协议。智能体通过MCP服务器调用企业后端(如ServiceNow数据库)的工具;工具schema的清晰度和参数清洗直接影响调用成功率。论文中相当一部分演化补丁就是修复MCP参数处理、精简误导字段、剥离null和空值参数。
三大企业基准都经由MCP或类MCP后端交互,'接口修复'是演化学习的三大形态之一,不懂MCP就无法理解这类补丁的意义。
防泄漏评估协议(Search/Select/Holdout分离)
将任务集划分为提议者可见的搜索集、对提议者隐藏的选择集、以及完全保留的留出集。提议者只能看到搜索任务的轨迹和结果;候选补丁必须改进隐藏选择集的平均分才被接受;留出集只在最终评估时使用一次。这样可以区分'搜索性能'与'真实泛化',防止把答案编码进框架。
这是StarHarness区别于以往harness演化工作(如Meta-Harness在同一基准上搜索并报告)的核心设计,论文所有泛化和迁移结论都建立在这个协议上。
GEPA与提示词优化
GEPA是一类用生成候选、文本反馈和进化选择自动优化指令与示范的提示词优化方法,代表'只改提示词'的优化路线。StarHarness的搜索空间更大——覆盖工具、技能、MCP提供者、子智能体结构和执行策略,论文用它作为基线来证明框架级演化的增益超出纯提示词优化。
主实验中相对GEPA(Pi)+13.8到+22.3个百分点的对比是核心卖点,理解GEPA只动提示词才能明白这个差距意味着什么。
研究动机
现代LLM智能体必须通过框架与环境交互,而企业服务管理和工作流任务的难点在于:有状态后端、庞大的工具面、跨步骤依赖,以及工具schema通常省略的领域约定。论文用三个企业基准量化了这种'模型—环境错配':ITBench SRE要求智能体从告警、事件、追踪、指标和拓扑中做Kubernetes根因分析(40个场景),GPT-5.4基线仅40.0%;EnterpriseOps-Gym ITSM包含103个ITSM工作流,由SQL验证器检查ServiceNow最终数据库状态,GPT-5.4只有23.3%;AutomationBench Finance有100个横跨47个模拟SaaS应用的财务工作流(AP/AR、报销、报表、记账),按环境状态的程序化断言打分,护栏违规直接零分,GPT-5.4为57.1%。这些低分不是模型推理能力不足,而是交互摩擦:错误的工具schema、缺失的操作约定、脆弱的原始电子表格编辑、过早结束诊断或持续冗余搜索。GEPA这类提示词优化只调整指令,无法修复工具接口或注入操作知识。
本文的目标是目标是在模型权重完全冻结的前提下,为每个企业环境自动演化出专用智能体框架,使全基准性能大幅提升,且增益必须满足三个可检验标准。第一是泛化性:提升必须在演化中从未见过的留出任务上仍然成立(实测留出集+15.1到+31.7个百分点)。第二是可迁移性:演化产物不做重演化就能直接提升其他模型,覆盖GPT和Qwen两个家族(Table 1中12组迁移全部为正,最高+46.3个百分点)。第三是可解释性:通过轨迹分析定位演化究竟修复了哪类交互失败。形式化地,求解 $h^* = \arg\max_{h \in \mathcal{H}} J(h; D_{\text{holdout}})$,其中 $J(h; D)$ 是框架 $h$ 配固定模型 $M$ 在基准 $D$ 上的平均任务得分,搜索过程中不可访问留出集结果,只用搜索集与选择集近似该目标。
与已有工作不同的是,已有的harness级系统(如Meta-Harness)虽在留出集上搜索,却在同一个89任务的TerminalBench-2基准上搜索并报告最终性能,其作者也承认这是'发现 setting'而非泛化验证。StarHarness的独特切入有三点:其一,响应更严格评估的呼吁,用任务级分离、提议者不可见的选择集和留出集把搜索收益与泛化收益明确区分开;其二,聚焦一个更窄的部署问题——为冻结模型适配有状态企业环境,而不是与模型权重共同演化,补丁因此保持为普通代码变更,可测试、可审查、可回滚;其三,任务划分按基线失败模式(wrong_tool、context_loss、missing_evidence、premature_conclusion)、基线得分和验证器通过率三个描述符分层抽样,保证演化池紧凑而信息量大(约 $K \approx N/2$),并辅以护栏禁止按任务ID分支、在提示词中写入验证器内容等任务特定作弊。
核心方法
直觉:企业智能体的失败大多不是模型'不会想',而是框架与环境的接口错配,所以应当把框架本身当作可优化对象,用一个编码智能体做外层循环搜索。技术上,StarHarness的优化器是基于Oh My Pi(Pi智能体框架的变体)构建的编码框架,它托管提议者并执行'编辑—验证—评估'循环,修改的对象是被评估的Stirrup智能体框架。可编辑面包括提示词与任务框架、工具定义与schema、参数预处理、技能、MCP提供者、子智能体结构、上下文管理、验证与终止逻辑;模型权重和基准全程不变。流程分提议、验证、评估三阶段:提议者读取当前框架和搜索集轨迹输出候选补丁,验证器检查范围、导入和单任务冒烟测试,评估器在隐藏选择集上为有效候选打分,接受后成为新前沿。实验中每个环境只需接受4–12个补丁,就带来20–35个百分点的全基准提升。
核心创新是'分层搜索+防泄漏评估'的组合。第一步按基线失败模式、得分和验证器通过率对任务分层,抽出紧凑演化池($K \approx N/2$),再把池分成基线分布匹配的搜索集与选择集:提议者能看到搜索任务的轨迹与结果,但对选择集的内容、轨迹、验证反馈一无所知;接受规则是确定性的——候选必须严格改进选择集均分 $J(h \oplus \Delta; D_{\text{select}})$,或打平且改进验证器通过率。第二个关键设计是廉价的'测试翻转'门:先在提议者自选的单个任务上验证补丁能否翻转结果,失败就直接记录拒绝并跳过昂贵的全量评估。第三个关键是护栏:候选是限定范围的git diff,禁止按任务ID或硬编码答案分支、在提示词中写入验证器内容、访问真值表或隐藏状态、写入基准特定的答案映射——约束目标是可复用的环境行为而非单题解,使补丁与权重无关、可审查、可回滚。
方法步骤详情
完整流程(Algorithm 1)分五步。第一步基线运行:在全部 $N'$ 个可复现任务上跑种子框架 $h_0$,记录每任务得分、失败模式和验证器通过率。第二步构建划分:按三个描述符分层抽样 $K \approx N/2$ 个任务为演化池,切成分布匹配的搜索集 $D_{\text{search}}$ 与选择集 $D_{\text{select}}$,其余为留出集 $D_{\text{holdout}}$。第三步初始化:$h \leftarrow h_0$,$s \leftarrow J(h; D_{\text{select}})$,建立记录前沿分数、每任务结果、已接受假设与被弃尝试的持久化账本 $L$。第四步迭代至预算 $B$:加载账本并收集搜索轨迹 $T$,提议者生成补丁 $\Delta \leftarrow P(h, T, L)$ 并捕获为限定范围的patch;范围/泄漏/导入/冒烟检查或测试翻转失败则回滚记录拒绝;否则在隐藏选择集上评估 $h \oplus \Delta$,严格改进(或打平且验证器指标改进)则提交为新前沿并刷新轨迹,否则回滚。第五步返回 $h$,在留出集和全基准各评估一次。树搜索模式下账本变为解日志,节点保存父指针、累积补丁、验证状态和选择分,支持探索失败模式、调试失败候选、合并兼容节点,之后接爬山阶段做有界局部编辑。
技术新颖性
与提示词优化(GEPA等只搜指令和示范)相比,StarHarness把搜索空间扩展到可执行脚手架:工具schema、MCP预处理、技能、子智能体、执行与终止策略。与共同演化harness和模型权重的系统(如与策略权重共同进化的方法)相比,它刻意冻结权重,研究更贴近真实部署的问题——所有改动都是外部的、可像普通代码变更一样测试和回滚的。评估协议上的新颖性最突出:Meta-Harness在同一89任务TerminalBench-2上搜索并报告,StarHarness则用任务级分离加提议者不可见的选择集度量真正泛化。工程上的新颖点包括:以基线失败模式为分层的紧凑演化池;提议者自选的测试翻转门在昂贵评估前快速淘汰无效补丁;连接补丁-会话-评估产物的持久化账本携带前沿分数和历史假设;以及树搜索加爬山的两阶段设计——EnterpriseOps-Gym的12个接受补丁中8个来自树阶段(暴露相互作用的schema、提示词和工具失败),4个来自爬山阶段(定向的关联与接地修复)。
实验结果
主实验中StarHarness(Stirrup)在三个基准全部第一:GPT-5.4下ITBench从40.0%升至75.0%(+35.0pp)、EnterpriseOps-Gym从23.3%升至43.7%(+20.4pp)、AutomationBench从57.1%升至83.2%(+26.1pp),相对GEPA(Pi)分别+13.8、+22.3、+17.6pp,同时单任务推理成本降17%、53%、29%。冻结迁移(Table 1)12组全为正:ITBench上GPT-5.4-mini从33.1%到79.4%(+46.3pp)、Qwen3.5-27B从25.6%到70.0%(+44.4pp);AutomationBench上GPT-5.4-mini从29.6%到70.0%(+40.4pp)。留出泛化(Table 2)为ITBench演化集+45.0/留出+31.7、EOG +22.0/+15.1、AutomationBench +23.0/+29.3。轨迹分析(Tables 3-5):ITBench误报0.79→0.33、真报0.45→0.78;EOG每任务回合18.12→9.87、验证器通过率34.5%→72.8%;AutomationBench护栏违规任务20→4、零分任务24→6。21个接受补丁(4/12/5)归纳为接口修复、环境约定、操作知识三类,EOG上Codex得41.7%作参照。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ITBench SRE(40个Kubernetes根因分析场景) | 全基准任务得分(GPT-5.4) | 75.0% | 40.0%(默认Stirrup) | +35.0个百分点 |
| EnterpriseOps-Gym ITSM(103个ITSM工作流) | 全基准任务成功率(GPT-5.4) | 43.7% | 23.3% | +20.4个百分点 |
| AutomationBench Finance(100个财务工作流) | 领域目标达成率(GPT-5.4) | 83.2% | 57.1% | +26.1个百分点 |
| ITBench 对比GEPA(Pi) | 相对提示词优化的增益 | 领先GEPA | GEPA提示词优化 | +13.8个百分点 |
| EnterpriseOps-Gym 对比GEPA(Pi) | 相对提示词优化的增益 | 领先GEPA | GEPA提示词优化 | +22.3个百分点 |
| AutomationBench 对比GEPA(Pi) | 相对提示词优化的增益 | 领先GEPA | GEPA提示词优化 | +17.6个百分点 |
| ITBench 冻结迁移至GPT-5.4-mini | 全基准得分 | 79.4% | 33.1% | +46.3个百分点 |
| ITBench 冻结迁移至Qwen3.5-27B | 全基准得分 | 70.0% | 25.6% | +44.4个百分点 |
| ITBench 留出集泛化(GPT-5.4) | 留出任务绝对增益 | +31.7pp | 演化集增益+45.0pp(对照) | +31.7个百分点 |
| EOG 每任务推理成本 | 预估API成本 | $0.58 | $1.23 | -53% |
局限与改进
作者坦承的局限:与GEPA、Codex的对比是描述性的,系统在提示词、工具、执行策略和框架架构上均不同,无法隔离单一因果成分;EnterpriseOps-Gym上的Claude参考分数(Fable 5为48.1%、Sonnet 5为35.9%、Opus 4.8 max为35.5%)不来自受控的基线—StarHarness对照;配对比较无法分离单个补丁的因果贡献;树搜索和爬山顺序执行,只说明互补性而无法给出因果性的头对头比较;AutomationBench的Finance-100子集和Stirrup框架与原论文默认设置不同,分数不可与原文献直接比较。我的补充观察:三个基准规模都不大(留出集仅约20–51个任务),单任务翻转即可改变数个百分点,统计功效有限;实验未披露演化过程本身消耗的GPT-5.4调用次数与成本;提议者与被评估智能体同为GPT-5.4,可能存在同源偏置,这或可解释Qwen迁移增益整体低于GPT家族(EOG上GPT-5.5 high仅+10.7pp);护栏靠验证器静态检查执行,以'环境约定'之名注入任务特定知识这类更隐蔽的过拟合难以自动排除。
独立分析的弱点
第一,演化成本不透明:论文只报告推理端降本17%–53%,但未披露21个接受补丁背后总计多少次提议、验证和选择集评估,每次评估都要在数十个任务上运行GPT-5.4(基线单任务成本$0.14–$3.26),演化总开销可能远超推理节省;改进方向是报告演化预算—收益曲线,或允许用更便宜的模型担任提议者。第二,统计严格性不足:所有对比均为单次运行,无多种子、无置信区间或显著性检验,约二三十个留出任务的均值对个别任务翻转高度敏感;改进方向是跨种子方差与检验。第三,同源提议者风险:GPT-5.4既是被适配的智能体又是提议者,学到的'约定'可能隐含对该模型的偏好——Qwen迁移虽全为正但幅度普遍更低(EOG上Qwen3.6-27B +20.6pp vs GPT-5.4 +20.4pp但ITBench上Qwen3.5-27B +44.4pp例外),改进方向是用与被评估模型异构的提议者复现并对比。第四,护栏的可达性边界:静态规则易被绕过,如ITBench的'取证概览'排序候选上游原因已接近领域先验注入;论文自己也承认无法隔离单补丁贡献,改进方向是对补丁做反事实消融和人工审查抽样。
未来方向
作者明确提出的方向是把框架与模型权重通过强化学习共同演化,让脚手架和策略联合适配企业交互协议,从而可能训练出更小、更便宜的企业专用模型,在更低推理成本下匹配或超越更大模型。基于本文成果还可延伸:其一,把高频补丁模式(MCP schema修复、null/空值参数剥离)内建到MCP客户端层,形成免演化的通用接口修复;其二,建立逐补丁反事实消融协议,量化接口修复、约定注入、操作知识三类各自的贡献,回应该文'无法分离单补丁因果'的自述局限;其三,研究持续演化——企业环境的schema升级和新应用接入会使框架过时,可基于账本做增量演化与回归检测;其四,将分层搜索+隐藏选择集协议推广为harness演化领域的标准评估基准,落实作者引用的更严格评估呼吁;其五,检验操作知识类补丁(日期/财务计算器、取证概览)能否蒸馏回模型权重,系统比较'框架注入'与'权重训练'的成本效益;其六,探索跨环境共享的补丁库,观察接口修复是否可复用于同类企业后端。
复现评估
复现条件较好但有工程门槛。开源方面:代码在GitHub(github.com/ServiceNow/StarHarness);ITBench-AA公开于HuggingFace(ArtificialAnalysis/ITBench-AA),三个基准均按Artificial Analysis的评估描述打分(artificialanalysis.ai/evaluations)。方法描述充分:算法伪代码完整,任务划分、接受规则、测试翻转门和护栏规则均有具体定义。依赖较重:需要GPT-5.4 API同时充当智能体与提议者(基线单任务$0.14–$3.26,演化需数十次基准运行);EOG需要ServiceNow MCP后端与Docker化严格schema服务器;AutomationBench涉及47个模拟SaaS应用;优化器依赖Oh My Pi、被评估框架为Stirrup,均属特定生态。难度评估:中高——复现核心结论(20–35pp提升)可行性较高,协议清晰且基准可得;精确复现分数较难,21个接受补丁的具体内容是否完整开源未在正文说明,且Qwen3.5/3.6-27B、GPT-5.5等模型的可获得性会影响迁移实验复现。
论文图表