DarwinX:以自然选择演化冻结模型的智能体支架 DarwinX: Evolving Agent Harnesses Through Natural Selection
冻结模型权重,用种群级自然选择进化智能体支架,四大基准平均提升约17分。
前置知识
智能体支架
LLM 智能体的能力不只取决于模型权重,还取决于包裹模型的支架:系统提示词、可调用的工具、沉淀的技能文档、记忆笔记,以及串联这一切的控制流代码。支架决定了模型读什么、能做什么动作、何时停止。它可以被文本编辑修改而完全不触碰模型参数。
本文的全部优化对象就是支架。理解「模型冻结、支架演化」这一分层,是读懂 DarwinX 为什么能把评测算力转化为可复用能力的前提。
avg@k 与 pass@1
智能体基准的输出是随机的:同一配置同一任务重复运行结果也会不同。avg@k 指每道题跑 k 次取二值成功率的平均,用于平滑噪声;pass@1 指单次尝试的通过率,是部署时最真实的指标。本文用 avg@3 筛选、avg@5 确认,最终报告均用官方 avg@5 或单次 pass@1。
DarwinX 的适应度完全由 avg@k 定义,且区分「探索期的宽松准入」和「确认期的严格复测」。不懂这个指标就无法理解其两速选择机制的必要性。
开放式搜索与档案
源自质量多样性搜索的思想:不只保留当前最优解,而是维护一个档案,保存所有历史变体及其得分。表现平庸的变体可能在某个子任务上独一无二,是未来重组的遗传材料。DGM(Darwin Gödel Machine)首次把它引入智能体自我改造。
DarwinX 的核心贡献正是在档案之上定义「候选如何才能入选」的选择规则,即保持-扩展契约;理解档案是理解其种群设计与 TerminalWorld 多专家合并实验的基础。
验证器与奖励破解
验证器是判定智能体任务成败的程序:TB2.1 用终端环境检查,WAI 用确定性任务校验,进化阶段的合成意图则用 LLM 判分器。奖励破解指智能体绕过真实完成任务,通过篡改评测面、读取 privileged 信息等捷径骗过验证器。本文对 WAI 全部轨迹做了双阶段反作弊审计。
本文声明「无金标准答案、无人工挑选赢家」,适应度只来自验证器,因此验证器是否被游戏直接决定结论可信度;43.5%→93.0% 的提升必须搭配作弊审计一起读。
路径依赖与跨任务干扰
路径依赖指单血统自我改进器被早期编辑锁死、随后陷入平台期(如 SICA 报告的现象);跨任务干扰指一个修复某类任务的编辑悄悄劣化另一类任务,使混合任务分布上的进化停滞。二者是种群搜索要解决的两大病灶。
论文表 1 用这两列给所有前作分类,DarwinX 的档案加重组、保持-扩展契约正是对这两个失败模式的直接回应,是全文动机的骨架。
研究动机
让 LLM 智能体自我改进的研究已收敛到同一个内环:批量 rollout、反思、提出有界编辑、用留出信号把关,代表工作包括编辑提示词的 OPRO/PromptBreeder、编辑工作流的 AFlow、编辑技能库的 SkillOpt,以及直接改自身源码的 SICA 和 Darwin Gödel Machine(DGM)。但这个内环之外的选择过程有两大病灶。其一是路径依赖:单血统的 keep-best 搜索被早期编辑偏置,Robeyns 等报告 SICA 早早进入平台期;DGM 每次只变异一个父代、子代只和父代比,互补的血统永远不会被重新组合,一次局部收益也不必为它挤掉的能力负责。其二是跨任务干扰:在混合任务分布上,一个修好数值计算任务的提示或工具改动会悄悄劣化解析类任务,任务分布越宽病理越尖锐;Darwin Agent 团队的 HarnessX 只能把任务族隔离成互不相通的专家血统来抑制干扰,代价是专家被锁死在各自支线里。此外智能体基准的适应度是随机的,单次幸运 rollout 就能伪装成能力增益,进一步放大了错误选择的风险。
本文的目标是本文要把自我进化从单血统爬山改造成对支架变体种群的自然选择,并且全程冻结模型权重,使每一分提升都可归因于支架本身。具体目标有三:第一,定义明确的入选契约——子代必须在至少一个任务上可测量地改进,且放弃的父代已解任务不超过容差 $\delta$,让「赢」附带不退步的义务;第二,维护树形档案保留所有变体(包括总体更差的输家),使互补专家可以被继承与合并,不同血统的发现不再彼此隔绝;第三,把失败轨迹、教师示范、自身通过/失败对比三类证据统一成同一个支架编辑接口,适应度只由各基准自己的验证器以 avg@k 方式度量——无金标准答案、无人工挑选赢家。最终在四个「进化信号与测试逐渐分离」的基准上验证所得能力是否可迁移,而非只会刷评测集。
与已有工作不同的是,档案对自我改造智能体来说已是共识,DGM 就是其最著名的实现;真正悬而未决的是「一个候选凭什么配得上它的位置」。本文的独特切入是把这一义务显式化并做成两速机制:准入是宽松的使能者而非苛刻的批评家——有界下行风险的赢($g(c)>0$ 且 $R(c)\le\delta$)即可成为祖先,让搜索保持探索召回;而 steer 后续搜索和支撑最终结论则要过更严格的 avg@k 复测与保持探针,防止幸运噪声累积成方向。与 DGM 的第二处本质差别是搜索对象:DarwinX 进化的是支架(技能层与代码层)而非整个智能体源码,并配以跨血统合并算子——合并子代只有覆盖所有父代的并集 $\bigcup_i S(v_i)$ 才被保留,因此合并只增不减。表 1 用「搜索/选择/信号」三组列把 OPRO、ADAS、SICA、DGM、HarnessX 与 DarwinX 逐一对位,凸显其是唯一在全部六项上都打勾的系统。
核心方法
直觉上,DarwinX 把「训练模型」换成「选择支架」:模型权重纹丝不动,可变的是模型读的提示词、记的笔记、会调的工具和串联它们的控制流,这两层被合称支架的技能层与代码层。系统维护一个树形档案,每个节点是一个支架快照,连同其编辑增量、逐任务得分、试验证据和蒸馏出的经验教训,因此任何分支都能在很久之后被重新访问。进化由三个循环复合:分支进化循环反复挑一个有前景的父代,针对当前失败的任务族提出一个加性小编辑,只有「旧能力全部保住」时编辑才存活;种群循环把所有打过分的一等公民变体留在档案里,将互补专家的加性编辑合并成继承子代;学习信号循环则按任务现状挑选最有信息量的证据(失败诊断、教师示范或自身通过/失败对比)驱动提议器。由于编辑是加性的,一个分支积累能力而不是左右横跳,这正是长血统能持续产出、而非沦为一系列平级重写的原因。作者报告整套流程在一个循环内平均带来约 17 个百分点的提升,而权重从未更新。
核心创新是把「候选如何 earns its place」形式化为保持-扩展契约,并配套两速选择。对子代 $c$ 与父代 $p$,逐任务变化 $\Delta_t=\hat p_t(c)-\hat p_t(p)$ 被汇总为净增益 $g(c)=\sum_t\Delta_t$ 和有界回归 $R(c)=\sum_t(-\Delta_t)^+$;准入规则 $g(c)>0\wedge R(c)\le\delta$ 只允许「扩展而不破坏」的变体存活。这和 DGM 的本质区别有三层:其一,赢是有义务的——挤掉的旧能力计入回归项并被 $\delta$ 封顶;其二,输家不被丢弃——$S(c)$ 只是父代子集的踏脚石和交换型变体仍留档,只反馈蒸馏教训,因为某个分支那唯一一击可能正是另一个分支缺的钥匙;其三,确认与探索分离——被提升的子代须经过保持探针(重采样血统已解任务)和全量 avg@k 复测才有资格 steer 搜索,幸运结果无法改写方向。再加上跨血统合并 $H=H_0\oplus\Delta$、$\Delta=\Delta_{\text{code}}\oplus\Delta_{\text{skill}}\oplus\Delta_{\text{prompt}}\oplus\Delta_{\text{tool}}$ 且仅当 $S(\text{child})\supseteq\bigcup_i S(v_i)$ 才保留,合并只增不减,这正是「自然选择」二字的字面含义:只有实测适应度下的适者生存。
方法步骤详情
整个循环可拆成八步。第一步评分:每个变体以二元 avg@k 得到逐任务解率 $\hat p_t(v)$,超时的任务预算记为真实失败,基础设施故障按协议单独剔除。第二步准入:计算 $g(c)$ 与 $R(c)$,满足 $g(c)>0$ 且 $R(c)\le\delta$ 的子代进入树;推理验证器智能体 $f$ 读取子代试验证据 $E$ 与共享记忆 $K_g$,两阶段输出 verdict$\in\{\text{promote},\text{revert}\}$。第三步确认:被 promote 的子代先经保持探针重采样血统已解集合,再以更高保真度(全量 avg@5)复测,通过后才能成为 steer 后续搜索的祖先。第四步选父:按累积血统增益 $G(c)=G(p)+g(c)$ 排序,以 $p^*\sim(1-\beta)\,\delta_{\arg\max_{v\in S}G(v)}+\beta\,\text{Broaden}(\mathcal P)$ 在确认集 $S$ 的最优节点和更广种群间权衡。第五步提议:给分支分配能力簇(TB2.1 上为数值 ML、底层系统、生物/汇编、解析文本工具、数据库五簇),要求提议器保住父代已解任务并扩展到一个脆弱或失败任务,编辑可触及提示、技能、工具、控制流或源码。第六步信号选择:默认用失败信号 $\nabla$(总结失败轨迹、定位缺失能力),墙任务(k 次全失败)用教师信号 $\pi^*$(蒸馏参考求解器的成功轨迹),方差带任务(通过失败并存)用自身对比信号 $A$,三者都转成支架编辑而非权重更新。第七步分类与重组:子代按 $S(c)$ 与 $S(p)$ 的关系分为 improver(超集)、neutral(相等,均可被继承)、stepping stone(真子集)、archived(交换),互补专家可合并且须覆盖并集。第八步共享记忆:失败模式分类器给每次试验打标签(如 timeout-setup、wrong-output、tool-error),聚合为 $K_{g+1}=\text{Agg}(K_g,\text{worked},\text{regressed},\text{themes})$,主导主题被注入提议器,促使系统发明全局能力(如「setup 耗时主导超时→构建高效 setup 能力」)而非逐题补丁。
技术新颖性
技术新颖性可从四个对照面看清。与单工件优化器(OPRO、TextGrad、AFlow、SkillOpt)相比,DarwinX 的可学习对象是整个支架——工具、控制流、代码都在搜索空间内,且优化器本身也在被选择的种群中演进;遗传式提示优化器虽重组提示串,但重组对象不是「被选择出来解互补任务」的变体。与 SICA、DGM 等自改脚手架的智能体相比,DarwinX 引入了跨血统合并(DGM 打叉)和有界回归(DGM 仅受限):互补血统的专家得以合流,单亲逐代变异的路径依赖被打断。与同期 HarnessX 相比,DarwinX 增加种群档案与合并、噪声感知的 avg@k 确认,并纳入教师/自身信号(HarnessX 打叉/波浪号);表 1 显示 DarwinX 是唯一六项全勾的方法。信号接口本身也是贡献:失败、教师、自证三类证据被统一为一个「解释支架应如何改变即可成为进化压力」的插入式接口,并按「可靠解/方差带/墙」的任务动态划分自动路由,使提议器永远能看到当前最有信息量的证据。最后,把 WAI 的原始分与审计干净分分开报告、把 invalid 轨迹计为零分,是把反作弊内生化为主张的一部分,而非事后修补。
实验结果
四个基准按「进化信号与测试分离程度」递增排列,平均增益约 17 分。RQ1 域内进化(Terminal-Bench 2.1,89 题,官方 avg@5):冻结 GPT-5.5 上 Monet 从 75.5%±3.5 升到 83.2%±1.2(+7.7),在 GPT-5.6 Sol medium 上达 84.7%±1.2,追平乃至超过验证榜单最强的 Claude Code+Fable 5(83.8%,xhigh 档),同档 medium 下比 OpenAI 官方单智能体(81.8%)高 2.9 分;对同模型 xhigh 档的中立支架 Terminus-2(78.0%)纯支架增益 +5.2。分簇看增益落在冻结模型最有余地处:ML/科学计算 60.1→74.9%(+14.8),数据/数据库 83.9→97.8%(+13.8),系统管理 92→98%、安全 85→84% 在噪声带内不动;88 个配对任务 36 升 43 平 9 降,10 分阈值下 30 升 6 降。图 5 证明增益不是算力堆出来的:新解的 6 题上回合 11→22、token 89K→380K,已解的 69 题仅 12→13 回合。反作弊审计 370 条获奖轨迹仅 2 条被标记、1 条让分(mteb-leaderboard 读题面 README,属单次策略失误而非支架 exploit),删去后 445 试只变 1。RQ2 留出泛化(TerminalWorld,41 个不相交任务,单次 pass@1):Opus 4.8 上 25/41→28/41(61.0%→68.3%,+7.3),超过 Claude Code Opus 4.8(65.9%)等所有现货智能体;GPT-5.5 同样 +3 题(20→23)。训练子集分数从 0.505 饱和到 1.000 而留出仅 68.3%,四个专家各解 24–27 题、合并后 28 题,说明增益来自种群多样性而非贪追代理分。RQ3 合成到现实(WebArena-Infinity,1260 个真实任务):审计干净 pass@1 从 43.5% 升到 93.0%(+49.5),原始分 53.0→94.4;十个应用全部提升,最大为 Elation 处方 +75.0、Gmail +73.3、Gmail 联系人 +70.0;同模型最强基线 GPT-5.5+Browser Use(86.1%)被拉开 6.9 分。invalid 轨迹 293→17,评测面访问 155→0、特权主机 97→0、exploit 26→0,确认 invalid 率 23.5%→1.4%,能力与合规同向改善。RQ4 跨基准迁移:TB2.1 最佳支架原封不动跑全部 500 题 SWE-bench Verified,官方 pass@1 达 421/500=84.2%,比 fix-skill 参考支架(80.8%)高 3.4 分,且未用任何 SWE-V 域内反馈。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Terminal-Bench 2.1 域内进化(89 个终端任务,冻结 GPT-5.5) | avg@5(官方 k=5,错误试次计零) | 83.2%±1.2(GPT-5.6 Sol medium 达 84.7%±1.2) | base Monet 75.5%±3.5;同模型 Terminus-2 xhigh 78.0%;Claude Code+Fable 5 83.8% | 较 base +7.7 分;较中立支架 +5.2 分;GPT-5.6 下登顶验证榜单 |
| TerminalWorld 留出任务泛化(41 个不相交任务,冻结 Opus 4.8) | pass@1(单次尝试) | 68.3%(28/41) | base Monet 61.0%(25/41);Claude Code Opus 4.8 65.9%;Terminus-2 GPT-5.5 61.0% | 较 base +7.3 分(+3 题),留出集上第一,超最强现货智能体 2.4 分(McNemar p=1.0,暗示性) |
| WebArena-Infinity 合成到现实泛化(1260 个真实任务,冻结 GPT-5.5) | 审计干净 pass@1(invalid 轨迹计零) | 93.0%(原始 94.4%) | base Monet 43.5%(原始 53.0%);GPT-5.5+Browser Use 86.1%;Gemini 3 Flash+BU 69.3% | 较 base +49.5 分,invalid 轨迹 293→17,十个应用全部提升 |
| SWE-bench Verified 跨基准零样本迁移(500 个 issue,冻结 Opus 4.8) | 官方测试桩 pass@1 | 84.2%(421/500) | LSP 增强的 fix-skill 参考支架 80.8% | +3.4 分,且无任何 SWE-V 域内反馈(窄带内领先) |
局限与改进
作者坦承的局限相当清醒。第一,归因是系统级而非因果级:所有实验评估的是完整 DarwinX,档案、父代选择器、合并算子与推理力度未被独立随机化,把增益归于「验证/工件契约」技能束只是探索性解释(七个技能是共同被选出的,无逐技能隔离);公共榜单行使用不同模型与力度档,只能作背景。第二,统计功效有限:TerminalWorld 仅 41 题,多解一题就动 2.4 分,对 Claude Code 的领先 McNemar p=1.0、对 base 的 p=0.45,只能算暗示性;首轮留出评测还撞上基础设施降级窗口(每变体 12–17 个错误),按预设错误策略重跑后各专家涨 5–10 题而 Monet (DarwinX) 维持 28,作者据此称其最不敏感。第三,迁移只测了单向:SWE-V 域内的在环信号度量的是轨迹完成度而非官方测试解析,不可作为选择依据,因此反向迁移被直接省略,且 SWE-V 各支架得分挤在 80.8–84.2% 的窄带里。第四,重组的贡献未被受控消融:WAI 上每次合并尝试都被回退,增益全部沿单条主干累积,种群机制在该域的价值更多体现在 TerminalWorld。我的补充观察:进化在 WAI 上依赖 LLM 判分器给合成意图打分,尽管做了严格审计,判分器被游戏的风险理论上仍存在;全部结果基于专有的 Monet 智能体与闭源前沿模型,公开支架上是否复现未知;avg@5 全量确认的算力开销巨大,论文未给出预算数字;$\delta$ 容差与 $\beta$ 等超参的敏感性也未报告。
独立分析的弱点
第一个弱点是算力经济学未被量化。每次提升都要做 avg@3 筛选加 avg@5 全量 89 题确认,外加保持探针重采样,长血统多个变体的总推理预算必然是天文数字,而论文没有给出任何 token/美元成本。改进方向:把经典的多臂老虎机与 racing 算法(论文自己引用了)真正接进确认预算分配,对低不确定性的变体减少复测次数,或用分层贝叶斯估计替代固定 avg@k。第二个弱点是重组算子的价值证据不对称:TerminalWorld 上合并超过所有专家,但 WAI 上 62 次迭代中每次合并尝试都被回退、增益全走单主干,说明合并的成功依赖「专家在互补任务子集上真实可解」这一前提,而该前提在噪声大的域难以满足。改进方向:先在档案上估计变体间已解集合的互补度,只在预期并集增益为正时触发合并,并加入针对编辑冲突的语义合并(而非纯加性拼接)。第三个弱点是归因停留在技能束层面:七个进化技能全属验证/契约家族,但它们是共同被选出的,无法回答「去掉 contract-candidate 会掉几分」。改进方向:以受控预算做逐技能留一消融,或在新任务族上做技能移植实验。第四个弱点是信号源风险:WAI 的进化奖励来自 LLM 判分器对合成意图的打分,尽管审计显示未发生系统性作弊,但「判分器-审计器」军备竞赛是不稳定均衡;改进方向是像 TB2.1 一样尽量用确定性验证器,或给判分器加对抗性红队。第五个弱点是全部结果绑定专有 Monet 智能体与 GPT-5.5/5.6、Opus 4.8 闭源模型,开源支架(如 Terminus、OpenHands)上能否复现、$\delta$ 与 $\beta$ 如何设,都无从检验。
未来方向
作者在正文与附录 E 给出的延伸方向很有含金量:其一,把支架选择与权重更新耦合——冻结只是让增量可归因的实验装置,不是方法上限,支架进化出的验证/契约行为完全可以蒸馏成训练信号;其二,把支架当作可跨代模型存续的资产——模型换代时支架带着合同技能平移,SWE-V 迁移实验已给出初步证据;其三,把保持探针产品化为部署契约,即形式化声明「上线后在这些任务上永不回退」。基于成果我还能延伸三点:第一,受控消融优先——在固定预算下分别关闭档案保留、合并算子、教师/自身信号,量化各算子贡献,这是论文自己承认的最大开放问题;第二,把「验证-先于-提交」的演化发现反哺基准设计,例如为 WAI 这类开放表面任务构造防作弊的确定性验证器,减少对 LLM 判分器的依赖;第三,把进化出的能力簇档案变成可检索的技能市场——新任务到来时先按失败模式主题检索相近血统的编辑增量做热启动,把每次进化的成本摊薄到后续所有任务;第四,统计学加固——41 题级别的基准需要序列检验(如 always-valid 置信序列)来决定何时停止复测,而非固定 avg@5。
复现评估
复现难度偏高,主要是要素不全。方法本身在论文中描述得相当充分:准入规则、选择公式、信号路由、审计规程(含正则绊线与逐标签示例)都有伪代码级细节,附录 A–E 还给出了逐方法对比、基准协议、进化产物(进化出的七个技能与四个浏览器技能全文)和展望,理论上足以照着重实现。但硬性障碍有三:其一,载体是 Salesforce 专有的 Monet 智能体,论文未提及开源其代码或进化日志;其二,模型依赖闭源前沿API(GPT-5.5、GPT-5.6 Sol、Opus 4.8),且 avg@3 筛选、avg@5 全量确认、保持探针叠加多代变体,算力成本预计在数千万至亿级 token 量级,个人与中小实验室难以承受;其三,数据一半一半——Terminal-Bench 2.1、WebArena-Infinity、SWE-bench Verified 公开可取,但 TerminalWorld 的 94/41 划分与 WAI 的 300 条合成意图生成管线依赖内部设施。务实的复现策略是降维验证:用开源智能体(如 Terminus-2)+ 单个强模型,在 TB2.1 的子集上以 avg@3 复刻「保持-扩展准入+档案+合并」的最小闭环,重点检验合并算子与两速确认是否带来可测差异,成本可压到原方案的百分之一量级。
论文图表