← 返回 2026-08-28

PILOT:长程智能体的实时自我改进 PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents

Yang Xiao, Yusong Sun, Haoyi Wu, Wenyang Hui, Wen Da, Zhaokai Luo, Mu Chuan, Yao Hu, Wenjie Li, Chengyue Jiang 📅 2026-08-27 👍 30 2026-09-01 18:30
智能体 监督者-工作者架构 自我改进 长程任务

监督者-工作者架构让智能体在执行中实时纠偏并把经验沉淀为可复用技能

前置知识

Supervisor–Worker(监督者-工作者)架构

一种多智能体编排模式:一个监督者会话负责任务分解、进度监控与知识沉淀,一个或多个工作者会话在各自隔离上下文中实际执行子任务。与普通子代理委派不同,PILOT 要求监督者在工作者整个生命周期内保持双向实时连接,而不是等工作者返回后才拿到最终摘要。

PILOT 的全部贡献都建立在这个架构上:理解 live steering 如何通过通道改写活跃 worker 的下一步、live self-evolution 如何由 supervisor 执行,都必须先掌握两种角色的职责边界与通信方式。

Agent Harness(智能体运行时框架)

围绕冻结模型外层的一整套执行基础设施:提示模板、工具调用循环、技能库、长期记忆、会话管理等。harness 与模型参数 $ heta$ 严格分离,改进 harness 不需要微调模型。Pi、OpenCode、Terminus-2、Hermes、Mini-SWE-Agent 都是这类系统。

论文反复强调 self-improvement 指的是持久 harness $H$ 的演化而非模型更新,实验也通过固定骨干、只换 harness 来隔离架构带来的增益,不懂 harness 概念就无法理解其实验设计。

事后式自我改进(Post-hoc reflection)

主流自改进范式:等一次运行结束后,用反思(Reflexion)、评审模型打分或自演化方法(ACE、EvoSkill 等)从完整轨迹和评估反馈中提炼经验,写入提示、技能或记忆供下次使用。

这是 PILOT 批判的靶子:事后方法无法挽救产生经验的当前 run,新知识也无法立即被验证。理解其'慢一拍'的本质,才能体会 PILOT 把更新时机前移到执行期间的创新点。

长程智能体基准(Terminal-Bench 2.0 / SWE-bench Pro)

评估智能体长链条任务能力的基准:Terminal-Bench 2.0 含 89 个可运行任务,要求智能体通过交互式 shell 多步操作系统达成工程目标,每任务上限 3 小时;SWE-bench Pro 提供比原版更长更难的仓库级修复问题;SWE-bench Multilingual 把仓库修复扩展到多语言。

论文所有数字(71.9%、+14.6pp 等)都在这三个基准上测得,其'长程'特性(错误会复合、轨迹会漂移)正是实时纠偏能够产生价值的场景背景。

研究动机

现有智能体自我改进方法几乎全部是事后式的:Reflexion 式反思 critique 已完成的轨迹,judge 式评估只看最终结果,自演化 harness 从完结的 trace 修订提示、技能或记忆。这类方法无法重定向正在运行的 run——新提炼的知识既帮不了产生它的这次执行,也无法立即在真实执行中得到验证,只能留到后续 rollout 再检验,改进的时效性和可靠性都打了折扣。单智能体自纠错虽然及时,但同一个智能体在塞满执行细节的上下文里既干活又给自己诊断,注意力被工具输出和死胡同占满,很难识别并纠正已失效的策略。子代理委派把执行与主代理分开,但主代理通常要等子代理返回后才拿到最终摘要,运行中途无法干预。论文的出发点是:当任务动辄需要数小时、成百上千次工具调用时(Terminal-Bench 2.0 每任务上限 3 小时),事后纠偏意味着整段失败轨迹的算力全部浪费。

本文的目标是论文主张自我改进应当是'活的'(live):构建一个闭环系统,用正在涌现的经验同时做两件事——一是重定向当前活跃的 run,在错误造成不可挽回的浪费之前把轨迹拉回正轨;二是把执行中暴露的成功流程、项目约定与失败模式即时蒸馏进持久的 harness(技能库与记忆),让同一 episode 内或后续 episode 的新 worker 立即加载并验证这些更新。具体目标是在模型参数完全冻结、各 harness 接收完全相同输入的前提下,仅靠 harness 层架构设计,同时提升一次性(one-shot)通过率与跨迭代(self-improvement)最佳通过率,并降低每个评估任务的平均输出 token 消耗,最终在 Terminal-Bench 2.0、SWE-bench Multilingual、SWE-bench Pro 三个长程基准上用两个冻结骨干与四个主流 harness 公平对比并占据第一。

与已有工作不同的是,论文识别出一个明确的架构空白:没有任何现有智能体架构能同时提供'实时纠偏'和'专职的自我改进角色'。单智能体自纠错能修订活跃 run,但执行与监督挤在同一个上下文里互相争夺注意力;子代理委派分离了执行,但主代理拿不到子代理的中间状态,只能在事后读摘要。PILOT 的独特切入是把监督做成一个独立会话,在 worker 整个生命周期内保持连接:worker 的探索、死胡同和冗长工具输出留在其隔离上下文中,supervisor 的上下文始终只保留目标、近期事件和偏离计划的信号。这样监督者既有局外人视角能及时发现问题,又能直接把指令推进 worker 的下一轮决策——执行与监督解耦但反馈闭环不断。这种'监督独立于运行且活在其上'的组合,正是区别于 ReAct、AutoGen、Reflexion、ACE 等所有已有路线的地方。

核心方法

PILOT 是一个监督者-工作者 harness,把'活的自改进'实现为两个耦合机制的闭环。形式化地:任务 $\tau$ 在环境 $E$ 中以单 episode 尝试,模型参数 $\theta$ 冻结,持久 harness $H$ 包含技能库 $K$ 与记忆 $M$,跨 episode 存续;论文中的自我改进专指 $H$ 的演化而非 $\theta$ 的更新。Supervisor 可随时派生 worker $W_j \leftarrow \mathrm{SPAWN}(\theta, \tau_j, H)$,worker 加载派生时的 harness、在隔离上下文中产出轨迹 $\xi_j$。直觉上,worker 像埋头干活的工程师,supervisor 像全程盯进度但不抢键盘的技术主管:通过双向实时通道,worker 主动汇报或提问,supervisor 根据最终结果、执行错误和闲置告警决定是给指导(Steer)、终止换路(Abort),还是把学到的流程沉淀为技能。supervisor 只在诊断需要时读取 $\xi_j$ 的相关片段,让上下文只保留目标、近期事件与重复失败模式。实现上 PILOT 是 Pi coding-agent runtime 的扩展,实验中同一冻结模型兼任两种角色。

核心创新是'双向实时通道 + 执行期沉淀'。每个 worker 会话的通道支持三类 worker→supervisor 事件和两类 supervisor→worker 动作:Notification(worker 自主决定何时报告进度、中间结果或风险,发完继续执行)、Question(worker 判断下一步需要监督输入时暂停等待答复)、Result(运行时自动把最终结果连同索引 $j$ 送交 supervisor)、Steer(supervisor 认为方向该变时,检查 $\xi_j$ 的相关部分并把指导排入 worker 下一轮队列,当前轮先跑完)、Abort(继续无益时中断该 worker)。与单智能体自纠错的本质区别:诊断发生在另一个更干净的上下文里,不被执行细节淹没;与子代理委派的本质区别:不等 run 结束,可在 worker 仍存活时改写其下一步;与事后自演化方法的本质区别:技能与记忆的写入发生在执行期间、验证结果出来之前,新知识当轮即可被同 episode 或下一 episode 的 worker 加载使用并接受真实执行的检验,从而把纠正与积累拧成一个连续回路。

方法步骤详情

完整流程按两个循环展开。Supervisor 循环:输入任务 $\tau$、冻结模型 $\theta$、含 $K$ 与 $M$ 的 harness $H$;需要新 worker 时选定子目标 $\tau_j$ 并 SPAWN;随后持续接收事件——收到 Question 就答复;需纠偏时检查轨迹并 Steer(指导进入该 worker 下一轮);继续无益就 Abort;在活跃轨迹 $\xi_j$ 中发现可复用知识(成功流程、约定或失败模式)就执行 $H' \leftarrow \mathrm{UPDATE}(H, \xi_j)$ 并替换 $H$;收到 result/error/abort 就把该 worker 标记为已结算,直到任务解决。Worker 循环:派生时加载当时的 $H$,每轮先吸收排队的 supervisor 指导,再在 $E$ 中推理、行动并扩展 $\xi_j$;自行决定是否发 Notification;需要输入时发 Question 并暂停直至收到回复,直至完成、报错或被中断。自我改进设置中,迭代 $i$ 的所有任务共享同一状态 $H_i$,全部跑完后仅成功 run 的更新被保留合并进 $H_{i+1}$,verifier 结果从不参与生成或修改更新内容。

技术新颖性

技术新颖性体现在三点。第一,监督的'活性':把 oversight 从事后审计前移到运行中,这在文献中没有先例——ADAS、ACE、EvoSkill、Continual Harness 等自演化方法都在已完成的轨迹上做生成与筛选,Meta-Harness、Self-Harness 也依赖评估反馈,而 PILOT 的 UPDATE 发生在 worker 还在跑的时候。第二,通道协议的极简与完备:仅用 3 种事件加 2 种动作就覆盖了'汇报—提问—交付'与'指导—终止'的全部交互;worker 对何时上报、何时提问保有自主权,supervisor 的 Steer 只排队不打断当前轮,避免了上下文撕裂,保护各自的注意力分配。第三,更新筛选协议的严谨性:自我改进设置严格规定候选更新只能来自活跃轨迹与环境反馈,verifier 结果仅决定去留而不参与生成,这使增益可以归因于'知识被提前蒸馏并复用'而非'偷看答案'。效果上,GLM-5.1 经 20 轮迭代技能库从 62 条增至 83 条,同时单任务平均输出 token 从 28.5K 降至 16.3K,证明知识复用确实减少了重复探索。

PILOT implements live self-improvement through two mechanisms: live steering and live self-evolution
Figure 2: PILOT implements live self-improvement through two mechanisms: live steering and live self-evolution

实验结果

一次性设置:Terminal-Bench 2.0 上 PILOT 双骨干登顶,GLM-5.1 达 71.9%、Kimi-K2.6 达 71.3%,双骨干平均 71.6%,对最强单智能体基线 Pi 的 66.3% 领先 5.3pp;Hard 任务两个骨干均为 55.0%,分别超 Pi 5.0 与 6.7pp。SWE-bench Multilingual 上平均 72.7%,以 0.2pp 之差列第二(Pi 为 72.9%);SWE-bench Pro 上平均 59.9%,超 Pi 的 55.5% 达 4.4pp,其中 Kimi 达 65.1%。六个骨干-基准组合中五个第一。自我改进设置(Terminal-Bench 2.0,20 轮迭代):GLM-5.1 最佳通过率从 66.3% 升至 80.9%(+14.6pp),Kimi 从 68.5% 升至 80.9%(+12.4pp),同期 OpenCode 仅 +7.9pp、Pi 仅 +2.3pp。增益集中在 Hard 任务(Kimi 多通过 12 题、GLM 8 题),技能库从 62→83 与 50→81 持续增长,平均输出 token 每任务下降 42.9%(28.5K→16.3K)与 47.4%(41.9K→22.1K),每百万输出 token 的成功评估数提升 110.3% 与 134.0%。人工核查显示实时纠偏贡献随难度陡增:Easy 为 0%,Hard 上 GLM 6.1%、Kimi 19.7%。

Pass rate (%) across three long-horizon agent benchmarks
Table 1: Pass rate (%) across three long-horizon agent benchmarks
Live-steering analysis in the one-shot setting
Table 2: Live-steering analysis in the one-shot setting
Main results in two evaluation settings
Figure 1: Main results in two evaluation settings
PILOT across iterations in the self-improvement setting
Figure 3: PILOT across iterations in the self-improvement setting
查看结构化数据
任务指标本文基线提升
Terminal-Bench 2.0(一次性,89 个终端长程任务) 通过率(两次运行均值) GLM-5.1 71.9%,Kimi-K2.6 71.3%,双骨干平均 71.6%;Hard 任务均为 55.0% 最强基线 Pi 平均 66.3%(GLM 65.7%、Kimi 66.9%);OpenCode 平均 65.8% 平均 +5.3pp(对 Pi);Hard 任务 +5.0/+6.7pp
SWE-bench Multilingual(多语言仓库修复) 通过率(排除 43 个环境不兼容任务) 平均 72.7%(GLM 71.6%、Kimi 73.7%),两个骨干中位列第二 Pi 平均 72.9%(GLM 69.8%、Kimi 75.9%) -0.2pp(仅此一项未超过 Pi)
SWE-bench Pro(更难仓库级修复,排除 198 个任务) 通过率 平均 59.9%(GLM 54.7%、Kimi 65.1%) Pi 平均 55.5%;Mini-SWE-Agent 平均 55.2% +4.4pp(对 Pi);Kimi-K2.6 领先第二名 6.0pp
Terminal-Bench 2.0(自我改进设置,20 轮迭代) 最佳观测通过率 / 技能数 / 每任务平均输出 token GLM-5.1 66.3%→80.9%(+14.6pp),Kimi 68.5%→80.9%(+12.4pp);技能 62→83 与 50→81;token 28.5K→16.3K 与 41.9K→22.1K;每百万 token 成功评估 +110.3%/+134.0% OpenCode 仅 +7.9pp,Pi 仅 +2.3pp(同为 GLM-5.1、相同 $H_0$ 与相同指令) 提升幅度约为 OpenCode 的 1.8 倍、Pi 的 6.3 倍
实时纠偏贡献分析(Terminal-Bench 2.0 一次性成功 run 人工分类) 被判定为受 live steering 协助的成功 run 占比 Easy 0%;Medium 1.1%/8.1%;Hard 6.1%/19.7%(GLM/Kimi) Easy/Medium 任务几乎无需外部重定向 贡献集中于 Hard 任务,验证长链条执行更易漂移的假设

局限与改进

作者承认的局限:迭代式自我改进要在多轮中重复每个任务,成本远超单次推理,因此评估只覆盖三个基准和两个开源权重骨干,专有模型与更广覆盖留作未来工作;supervisor 与 worker 共用同一骨干,异构配对(如强模型监督弱模型)在监督质量、任务性能与成本之间的权衡未被探索。我的补充观察:其一,实时纠偏的直接贡献率并不高(GLM 全部成功 run 中仅 2.3%,Kimi 10.6%),大部分增益实际来自技能积累与 worker 自身能力,live steering 的叙事略强于数据支撑;其二,自我改进设置依赖一段精心设计的自我改进指令(附录 A.3,要求按任务名保存技能、先查重再更新等),这种提示工程本身可能贡献了部分增益——虽然所有 harness 拿到相同指令,但 PILOT 的 supervisor-worker 结构对该指令的利用方式与其他 harness 并不同构;其三,报告的最佳观测通过率是 20 轮中的峰值,存在选峰偏差;其四,SWE-bench Multilingual 上未能超过 Pi,说明实时重定向在仓库修复类任务上的收益可能有限。

独立分析的弱点

第一个弱点是监督触发机制不透明:论文未量化 supervisor 何时判断'方向该变',Steer 依赖其对闲置告警的被动反应,误报与漏报率均无测量,改进方向是引入显式的进度偏差检测器或对 Steer 时机做置信度校准。第二个弱点是技能库只增不减:20 轮后技能已达 83 条,迭代继续则检索噪声与技能冲突会上升,应加入技能淘汰、合并与冲突检测机制。第三个弱点是评估报告方式:只报告 20 轮中的最佳观测通过率,应补充末轮或多轮均值以排除运气峰值。第四个弱点是同源自监督的盲区:supervisor 与 worker 共享同一骨干意味着系统性偏差会被放大,Hard 任务上 Kimi 纠偏率 19.7% 远高于 GLM 的 6.1% 恰暗示纠偏能力与骨干强相关,应做异构配对实验并把监督能力单独基准化。第五个弱点是因果归因不足:缺少'仅 live steering'与'仅 self-evolution'的单机制消融,且 2.3% 对 10.6% 的跨骨干差异说明该机制收益对模型敏感,需要更细的归因分析。

未来方向

作者提出的方向:把评估扩展到更多基准与专有模型,检验泛化性;探索 supervisor-worker 异构配对,在监督质量、任务性能与推理成本之间做系统权衡。基于论文成果可以延伸的方向:第一,把 Steer 时机自动化——训练或提示一个专门的偏差检测组件,替代 supervisor 对告警的被动响应,把 Hard 任务 19.7% 的纠偏率进一步推高;第二,技能库的终身管理——研究技能合并、去重、置信度加权与陈旧淘汰,让 harness 在数百轮迭代后仍保持检索质量;第三,多 worker 并行下的跨 worker 知识即时转移——一个 worker 刚踩过的坑立即成为另一个 worker 的避坑提示,这是现有'经验共享智能体群'(Group-Evolving Agents)与 live 机制的自然交汇点;第四,自我改进元指令的自动化——附录 A.3 显示增益部分依赖精心撰写的技能保存指令,可让 supervisor 自行学习并进化这段元指令;第五,把范式迁移到代码之外的长程领域(科学实验自动化、数据分析流水线),检验执行期沉淀对非代码类可复用知识的适用性。

复现评估

复现条件较好但有隐性门槛。有利因素:论文给出 GitHub 地址(github.com/XiaoYang66/Pilot)并承诺发布完整排除任务列表;PILOT 是 Pi coding-agent runtime 的扩展,对比的 OpenCode、Mini-SWE-Agent、Terminus-2、Hermes 均公开;两个骨干 GLM-5.1 与 Kimi-K2.6 为开源权重模型,采样配置完全公开(enable-thinking 与 preserve-thinking 开启、最大生成长度 32k、其余用官方默认);每配置跑两次取均值,任务在隔离容器沙箱运行,每任务上限 3 小时;所有配置共享同一初始状态 $H_0$,附录 A.3 给出完整的自我改进指令文本与各 harness 的路径替换表,附录 A.2 给出双循环伪代码。门槛在于算力:20 轮迭代乘以 89 个任务再乘多个配置,且 token 统计包含全部 supervisor 与 worker 辅助轮,单配置完整迭代实验的输出 token 以千万计;SWE-bench 侧还需正确应用 43+198 个排除任务才能对齐数字。总体属中等偏难:方法可复现,完整自我改进实验需可观推理预算。