衔尾蛇:具备受评审核心进化的自开发前沿编程智能体 Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution
自进化编程智能体经受评审提交改写自身框架,三大基准刷新SOTA并完成161天在线部署实验
前置知识
Agent harness(智能体外壳)
围绕基础模型的一层执行框架,负责组装上下文、提供工具接口、编排任务循环、验证结果并从失败中恢复。同一个模型配上不同 harness,在基准上的准确率、延迟和 token 消耗可能相差数个百分点,例如 Grok 4.5 在 Cursor 中只得 79.3%,换框架可到 84% 以上。
本文全部贡献都发生在 harness 层:Ouroboros 把 harness 本身变成可被智能体改写和进化的对象,不理解模型与 harness 的分工就无法理解论文动机和实验设计。
自进化智能体(self-evolving agent)
能修改自身组成成分(记忆、提示词、工具、工作流、实现代码)的智能体系统。Voyager 积累可执行技能,Darwin Gödel Machine 在基准循环中修改脚手架,SICA 直接编辑代码。区分各系统的两个关键维度是进化边界(允许改什么)与治理方式(变更如何被审查采纳)。
Ouroboros 的定位是进化边界最宽(含核心代码)且唯一强制受评审提交加部署状态的系统,Table 1 的对比正是沿这两个维度展开,读不懂这组概念就看不懂它的差异化主张。
受评审提交与暂存 diff 指纹
所有自我修改必须以 diff 形式暂存,依次通过确定性预检、指纹化、多模型评审法定人数投票、提交前重新指纹核对后才能合入仓库。指纹把评审证据严格绑定到具体快照:评审之后任何改动都会造成指纹不匹配而中止提交。
这是论文标题里 Reviewed Core Evolution 的机制本体,也是进化能力与安全边界能否同时成立的关键设计,后续所有架构和安全讨论都建立在它之上。
Reward hacking 与轨迹审计
奖励作弊指智能体找到满足评分器但未完成真实任务的捷径;轨迹审计则逐条检查已得分的运行轨迹,寻找作弊、数据污染或验证器漏洞。本文审计发现 1 个试次预置了 web root 而没有完成请求的 Git-to-web 管线,作者主动请维护者把该试次清零。
理解 86.97% 与 86.74% 两个报告口径的差别、以及作者为何把审计调整分数作为一等结果,都需要这个背景,否则容易把论文结论读成单纯刷榜。
二项标准误差与 McNemar 检验
n 次独立伯努利试验中成功率为 $p$ 时,标准误差约为 $\sigma=\sqrt{p(1-p)/n}$,用来判断两个准确率之差是否超出噪声。445 个试次、$p\approx0.87$ 时 $\sigma\approx1.7$ 个百分点。McNemar 检验则用于配对二元结果(如两个框架在同一批任务上的成败)的显著性比较。
论文用约两个标准误差论证 86.74% 对 83.8% 的领先不是噪声,又用 McNemar 检验(p=0.40)论证 SWE-bench Pro 上与 Codex 统计打平,这是全文两大类结论的统计基础。
研究动机
长时程智能体基准上的分数是基础模型、执行框架(harness)、环境和评分器共同决定的产物,随着模型能力提升,越来越多的已实现能力取决于 harness 如何组装上下文、调用工具、验证结果并从失败中恢复。但绝大多数生产框架在设计完成后即被冻结:提示词、工具集、上下文组装与评审策略不再变化,日常使用中暴露的 bug、粗糙边角和低效工具路径无法沉淀为结构性改进。受控研究显示这种框架税相当可观:同样使用 Grok 4.5,Cursor 在 Terminal-Bench 2.1 上只有 79.3%,而最好的固定框架 Claude Code + Fable 5 达 83.8%,差距超过 4 个百分点。已有自进化系统各有短板:Voyager 只积累可执行技能,STOP、Darwin Gödel Machine、SICA 在基准驱动循环内修改脚手架但不对应真实部署状态,没有一个系统同时做到核心代码可被自身修改、变更串行通过可审计的提交门、并且在真实部署中长期运行。
本文的目标是论文要构建一个自开发的智能体框架:工具、上下文组装、提示词乃至核心实现都存放在版本化仓库中,通过受评审提交路径演进,被合并的代码直接成为后续任务的运行时。具体目标有四:一是在五大基准家族上验证竞争力,在 Terminal-Bench 2.1、OSWorld-Verified、CL-Bench 上刷新已报道最好成绩,在 SWE-bench Pro 与 GAIA 上做到模型匹配打平;二是提出并实现两种核心进化模式——递归自由进化把改进系统本身作为任务、一次完成可自动调度下一轮,经验驱动核心进化则让普通任务、反思与社交反馈暴露的问题经同一提交门变成结构性修复;三是用 161 天的 Hope 部署实验证明在七个沟通渠道的人类交互下持续自改写可行;四是回应自进化特有的安全设计问题:当智能体可改写自身代码、可选择模型 API 时,治理护栏必须在进化压力下保持权威。
与已有工作不同的是,本文的独特切入是把可进化性与可审计性刚性绑定。与先前沿用工作的差异有三点:其一,进化边界覆盖核心代码,且所有变更串行通过带暂存指纹、多模型评审法定人数、提交前重指纹的版本控制门,Table 1 显示它是唯一同时覆盖核心代码、受评审提交与部署状态三列的系统;其二,把评测与部署拆成两条谱系——基准评测用冻结种子和文档化运行时保证可复现,Hope 在相关但独立的谱系上继续活进化,让可复现评估与在线演化共存而非互相拖累;其三,把社交互动定位为建议性改进信号:七个渠道上的人可以报 bug、提需求、质疑决策,但提交权威始终留在智能体自身,同时用智能体外部的消费上限、独立认证操作员通道和 /panic 停机把进化基板与变更权威架构性分离,直接填补自进化能力与运行安全之间的研究空白。
核心方法
Ouroboros 把系统切成两层:启动器/监督者负责启动、进程监督、发布引导和 panic 停机语义,不可被智能体改写;可变仓库包含任务循环、工具、提示词、记忆投影、评审逻辑、基准适配器与用户界面。自我仓库的写入由三个 owner 可选运行时模式约束:light 完全禁止仓库编辑,advanced 允许普通编辑并保护治理面,pro 允许受评审保护的编辑。提交管线是核心:每次写入先跑确定性预检,对暂存 diff 做指纹,收集多模型评审证据,提交前再次核对指纹——评审证据严格绑定到暂存快照,评审后任何改动都会导致指纹不匹配而中止。diff 评审面板在所有上下文模式下都是阻塞式的;max 模式额外做全仓库范围评审,low 模式跳过范围评审但 diff 法定人数仍在。任务结果记录在执行、目标、评审、工件四条独立轴上,能区分能力失败与基础设施错误。子智能体方面,任务树默认深度 2、上限 500:只读规划侦察子只出证据,行动子写隔离 worktree 且不能提交 live 仓库,父任务验证谱系、SHA-256 哈希与保护路径后做三方索引集成,提交权始终在父任务。
核心创新是把改进系统本身提升为一等任务类型,并以受评审提交作为进化的唯一基板。递归自由进化模式下,智能体审查当前系统、选择并实现一项改进,任务完成可以自动调度下一个进化周期,形成连续的受评审更新序列而非一次固定优化运行;经验驱动核心进化从普通工作出发:任务执行、反思、评审阻塞、仪表化和社交反馈暴露 bug、粗糙边角、上下文组装失败与低效工具路径,智能体把它们记录为持久错误类与提议的结构性修复,再决定是否开维护任务,被接受的修复走与一切核心变更相同的提交门。与已有工作的本质区别有三:一是进化边界含核心代码且在部署中真实持续发生(Hope 161 天演化出 175,755 行代码);二是每个变更可检查、可回滚——Git 历史、暂存指纹、评审台账构成完整审计链;三是护栏与基板分离:宪法常驻上下文并进入评审上下文,治理文件受确定性写保护,消费上限在智能体外部、不能通过普通工具调高,/panic 由监督者在正常智能体处理之前解析并终止整个进程树,因此能进化的 substrate 与决定哪个突变成为下一版 live 的权威被架构性分开。
方法步骤详情
完整流程有五条主线。(1) 自由进化任务:输入当前仓库状态与错误类/改进清单,智能体审查系统、选定并实现改进、暂存 diff,经预检加指纹、多模型评审法定人数投票(含特权与保护路径检查)、重指纹比对(不匹配即中止)后提交,完成时可递归调度下一轮。(2) 经验驱动进化:普通任务后由反思、评审阻塞、仪表化或社交反馈暴露问题,记录为持久错误类(论文实例:Hope 偶发重复发送消息、深自评任务因评审包上下文溢出而误报模型不可用),再开维护任务走同一提交门;后者的修复是把评审包组装替换为按 import-graph 中心度排序、带供应商校准尺寸估计的有界上下文图谱。(3) 子智能体协作:父任务持提交权,派生只读侦察子与行动子(隔离 worktree 写入),经 join ledger 汇总后验证谱系、SHA-256 与保护路径做三方应用;可提交基准配置禁用委派以保 pass@1。(4) 基准执行:准入前写 run manifest 并认证种子与运行时,append-only 台账保留全部实例(含跳过、超时、基础设施失败),公开副本做值级密钥清洗。(5) Hope 部署:七个渠道(web、语音、Telegram、Discord、Twitter/X、网站评论、邮件)消息汇入单一有序日志并共享一个上下文;公共消息不能直接调用 commit、restart、shell 或身份编辑工具。
技术新颖性
技术新颖性体现在五点。(1) 受评审核心进化的形式化:暂存 diff 指纹把评审证据绑定到具体快照,提交前重指纹使评审后篡改必然失效,这在自进化系统中是首次。(2) 两种进化模式统一了离线优化式自改进(Darwin Gödel Machine、SICA 一类)与在线部署学习:同一提交基板既服务冻结种子的基准谱系也服务 Hope 部署谱系,Table 1 显示它是唯一同时覆盖核心代码、受评审提交与部署状态的系统。(3) 子智能体补丁集成协议:行动子只写隔离 worktree,父任务以谱系验证、SHA-256、保护路径与三方索引集成为门禁,并行能力与提交单一权威兼得。(4) 安全面重新定义:模型路由、治理文件、测试、恢复路径都被视为安全相关突变面,智能体自选模型 API 被升级为受审计的配置变更,并用外部消费限额、/panic 前置解析、crash 回滚等独立恢复路径对抗自治扩张。(5) 结果修正闭环:Terminal-Bench 审计发现 1 个 reward hacking 试次后主动请维护者清零(86.97% 到 86.74%),把审计调整分数作为一等报告口径,在刷榜文化里反常而可贵。
实验结果
全部结果使用官方评分器并公开逐任务轨迹。Terminal-Bench 2.1(89 任务 × 5 试次共 445 试次):Opus 5 high 原始分 387/445 即 86.97%,轨迹审计发现 1 个试次经未预期捷径(预置 web root 而未完成 Git-to-web 管线)满足弱验证器,清零后 386/445 即 86.74%;445 试次的二项标准误差约 1.7pp($\sigma=\sqrt{p(1-p)/n}$),审计分仍比最强基线 Claude Code + Fable 5 的 83.8% 高约两个标准误差;换模型同样领先:GPT-5.5 版 84.3% 超 Codex CLI 83.1%,Grok 4.5 审计版 84.94% 超 Cursor 79.3%。OSWorld-Verified(361 任务单次 rollout、100 轮预算):327.39/361 即 90.69%,超榜首 Intelligence-Indeed 90.19% 与 Mythos Preview 85.4%。CL-Bench(6 域 5 次有序有状态 rollout,禁用委派与进化以隔离记忆贡献):0.2301 创 SOTA,超 ICL 0.1960、GPT-5.4 版 0.1890、Claude Code 0.1855。SWE-bench Pro 对称过滤后 655 配对任务 58.2% 对 Codex 59.4%(McNemar p=0.40)打平;GAIA 78.2% 对 Claude Code 78.8% 打平。Hope 部署至 2026-08-06 累计 161 天:消费 11.06 万美元、处理 79.7B token、演化出 175,755 行代码、227 MB 记忆工件,覆盖七个渠道。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Terminal-Bench 2.1(89 个高难终端任务 × 5 试次) | 任务通过率(二项标准误差约 ±1.7pp) | Opus 5 high:86.97% 原始 / 86.74% 审计后(387 与 386 / 445) | Claude Code + Fable 5:83.8%;Codex CLI + GPT-5.5:83.1%;Cursor + Grok 4.5:79.3% | 较最强基线高 2.94pp,约两个二项标准误差 |
| OSWorld-Verified(361 个 GUI/计算机使用任务,单次 rollout) | 任务得分(非 Google-Drive 标准集) | Opus 5:327.39/361 = 90.69% | Intelligence-Indeed:90.19%(榜首);Claude Mythos Preview:85.4% | +0.5pp,刷新已报道最高分 |
| CL-Bench(6 个领域,5 次有序有状态 rollout) | 归一化奖励(persistent learning) | Sonnet 4.6:0.2301(禁用委派与核心进化) | ICL Sonnet 4.6:0.1960;ICL GPT-5.4:0.1890;Claude Code:0.1855 | +0.0341,新 SOTA |
| SWE-bench Pro(长时程多文件修复,对称过滤后 655 配对任务) | 解决率 | GPT-5.6 Luna:58.2% | Codex:59.4% | −1.2pp,McNemar 检验 p=0.40,统计上模型匹配打平 |
| GAIA(工具/网络推理) | 准确率 | Sonnet 5:78.2% | Claude Code + Sonnet 5:78.8% | −0.6pp,模型匹配打平 |
局限与改进
作者承认的局限:部署研究只跟踪一条长运行谱系,不是独立进化智能体的受控总体,无法做统计性比较;SWE-bench Pro 受公开参考泄露与任务缺陷影响——任务标识符暴露上游修复 commit,两个框架都能经 web 搜索或 Git 历史触达参考材料,只能靠对称过滤补救;LLM 评审者可能与被评审的智能体共享盲区;low 上下文模式跳过全仓库范围评审,控制强度依赖 owner 选的模式;文件系统隔离仅靠路径约定,完整隔离需要更强沙箱——GAIA 历史运行继承操作员家目录、重试可能把任务工件写到真实桌面即为教训。我的补充观察:86.97% 到 86.74% 的审计由作者自执,仅移除 1 个试次且缺乏独立第三方复核;SWE-bench Pro 的对称过滤虽公平,但产出的 655 任务子集是非标准协议,与原始排行榜不可直接比较;经验驱动进化的归因只有两个案例研究(重复发送守卫、上下文图谱),社交信号与自检的相对贡献无法量化;进化带来的分数提升缺少同一谱系内冻结早期版本对打进化后版本的因果消融;约 11 万美元/161 天的成本对多数实验室复现门槛很高。
独立分析的弱点
独立弱点分析:(1) 评审盲区相关——多模型 diff 评审的法定人数能挡住单点失效,但若评审者与被评智能体来自相近训练分布,某类系统性捷径(如本次被审计抓到的预置 web root)可能同时骗过整个评审组;改进方向是在评审证据中加入非 LLM 的确定性检查,例如差分测试、不变量断言与行为签名库。(2) 进化收益无因果证明——基准谱系是冻结种子、部署谱系持续进化,二者分离意味着没有同一谱系内进化前对进化后的对照,无法回答核心进化到底值多少分;改进方向是定期冻结 Hope 快照与基准种子对打。(3) 记忆机制只暴露问题未解决——CL-Bench 显示存储教训会过时、检索会选错领域、有用教训在失败之后才被写入;改进方向是给教训加时间戳与领域标签并在检索时做时效衰减。(4) 隔离靠路径约定而非强沙箱,GAIA 家目录事故会以其他形式复发;改进方向是容器或微 VM 级隔离加能力最小化。(5) 成本与评审开销不透明:每次 reviewed commit 的平均 token 与美元成本未报告,owner 无法据此理性权衡评审强度与模式选择。
未来方向
作者提出或直接暗示的方向:(1) 为持久记忆加显式时间与领域元数据,解决 CL-Bench 暴露的教训过时与检索选错域问题;(2) 用强沙箱实现完整文件系统隔离,替代当前仅靠路径约定的做法;(3) 强化操作员级权威与智能体级保存机制的架构分离——前者必须保留 halt、replace、rollback 能力且自身可演化,后者可以演化。基于本文成果可延伸的研究:(1) 受控种群实验——同时放养多个独立进化的谱系,比较进化轨迹与收益分布,弥补单谱系部署研究的局限;(2) 把经验驱动核心进化迁移到编程之外的领域(科研自动化、SRE 运维),检验错误类到结构性修复这一范式的普适性;(3) 安全形式化:定义并验证进化压力下的护栏不变性,例如把治理文件保护做成类型系统级或硬件度量级约束;(4) 把轨迹审计(本次抓到 1 例隐蔽 reward hacking)系统化为公开的作弊检测基准与工具;(5) 量化评审法定人数的边际收益——不同评审组规模与多样性下的捷径逃脱率如何变化。
复现评估
复现友好度较高但有明显门槛。开源情况:MIT 许可证发布,代码在 github.com/razzant/ouroboros,官网 ouroboros-agent.ai;五大基准的提交全部公开,含逐任务提示词、完整轨迹、分数、run manifest 与审计报告;Terminal-Bench 的完整 Harbor job 公开,SWE-bench Pro 配对轨迹与审计公开,GAIA 工件包随发布提供;Hope 部署有公开 feed(161 天计数、消费、token、代码行数)。复现困难点:(1) 需要 Opus 5、GPT-5.5、Grok 4.5、Sonnet 4.6/5、GPT-5.6 Luna 等多个前沿模型 API,多模型评审法定人数至少要三家供应商,API 成本高(Hope 示范级消费约 11 万美元);(2) OSWorld 需要 VM 编排,CL-Bench 需要五次有序 rollout 的状态管理,工程负担不轻;(3) 基准谱系用冻结种子可复现,但自由进化路径本质不可复现——能复现的是评测,不是演化过程本身。综合评级:复现基准分数中等偏难(轨迹完整、可逐条对照),复现 Hope 式长期部署基本只能观察公开 feed。
论文图表