智能体框架与模型的协同进化:在线策略修正帮助弱模型在模仿失效处实现追赶 Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails
专家轨迹模仿在进化框架下令弱模型全面退步,在线策略单回合修正可保框架适配并持续增益
前置知识
Agent Harness(智能体框架)
包裹在 LLM 外层的运行时系统,包括系统提示词、工具集、执行钩子和上下文管理脚手架。它决定模型能看到什么观察、拥有什么行动空间。自动框架进化把 harness 当作可编辑程序,用搜索算法迭代修改这些组件,保留使验证性能提升的编辑,从而让小模型在领域任务上接近前沿模型表现。
本文的核心研究对象就是 harness:它先围绕弱模型进化并与该模型的规划风格耦合,后续任何模型微调都必须保持与它的适配,这一耦合正是全文问题的根源。
LoRA-SFT(低秩适配监督微调)
冻结原模型权重,只训练注入的低秩矩阵,用示范数据做下一 token 预测,损失 $\mathcal{L} = -\sum_{t} \log \pi_\theta(a_t \mid s_t)$。几 GPU 小时即可把中小模型适配到窄任务,是业界对小型/中型模型最常用的轻量微调手段,但数据风格会被整体注入模型。
论文的模型侧杠杆就是 LoRA-SFT,无论整轨迹模仿还是在线修正都用它训练。理解其轻量但易被数据风格带偏的特性,才能理解为何会发生规划风格漂移。
On-policy 与 Off-policy(在策略与离策略)
off-policy 模仿直接在专家自己的轨迹(专家访问的状态序列)上训练;on-policy 则在当前策略自己采样访问的状态上获取监督信号,经典如 DAgger:让学生跑,专家在学生访问的状态处标注正确动作。在策略数据的分布与学生实际会遇到的状态分布一致。
论文证明在进化框架这一特殊设定下,off-policy 的全轨迹模仿有害,必须改用 on-policy 的局部修正,这是全文方法论的核心分野。
GEPA 风格搜索(框架进化算法)
一种失败驱动的编辑搜索:反思模型(此处为 gemini-3.1-pro-preview)查看小批量 rollout 的失败,提出对系统提示、工具或钩子的编辑,只有当验证性能提升时才保留,保留的候选进入 Pareto 池继续迭代,直到选出验证分最高的框架。
论文七个任务的框架 $h^*$ 都是这样进化出来的,理解该流程才能明白 $h^*$ 为什么会与弱模型的规划风格深度耦合,进而理解模仿为何冲突。
模型-框架适配性(model-harness fit)
指模型的规划与执行风格同框架脚手架的期望节奏相匹配的程度。当框架围绕某模型『计算-验证-完成』的节奏进化后,该模型的原生行为被脚手架放大;若微调改变了模型的规划风格,脚手架的隐含假设失效,性能反而崩塌,即使知识没有丢失。
这是解释模仿退步的关键概念:模仿让弱模型学到了知识,却丢掉了自身的规划节奏,与为其定制的框架失去适配,导致全面回归。
研究动机
企业级智能体任务(内部 API 工具调用、代码重构、长视野数据审计)上,自动框架进化已能让小开源模型以极低成本接近前沿模型:在七个任务上,Qwen3-Coder-30B-A3B 的平均成功率从基线框架 $h_0$ 下的 29.2% 升到进化框架 $h^*$ 下的 78.0%(+48.8)。但框架只是杠杆之一,业界普遍把『更强专家模型的完整成功轨迹』当作教学的黄金标准:本文先证实专家 gemini-3.1-pro-preview 在 $h^*$ 上确实更强(93.6% vs 78.0%),暗示可以用它教学。然而直接照此自然配方执行会出大问题:在为弱模型进化的框架下,用专家轨迹做 LoRA-SFT 使弱模型在全部七个任务上退步,平均从 78.0% 跌至 63.1%(-14.9,单任务最惨 -29.9),而完全相同的配方在未进化的 $h_0$ 下却是有效的(29.2%→35.5%,+6.3),且该退步在 Qwen3-Coder 与 Gemma 4 两个模型族上复现。也就是说,问题不在模仿信号本身,而在模仿与框架进化的交互,此前没有工作揭示过这一冲突。
本文的目标是本文的目标是在『合理预算、任务特定领域适配』的设定下,回答框架进化与轻量级权重微调(LoRA-SFT)应当如何组合:两者能否产生协同增益而非相互干扰,以及能否纳入一个可迭代的协同进化循环。具体拆成三步:第一,验证为弱模型进化的框架能否向上迁移给更强的专家模型,从而暴露模型侧的剩余提升空间(headroom);第二,精确定位模仿失败的原因——到底是知识没学到、框架组件用得少了,还是规划风格被整体带偏;第三,设计一种能引入专家教学信号、又不破坏『模型-框架适配性』的训练方法,使模型更新建立在框架改进之上,并证明它可以安全地堆叠进下一轮框架进化循环。
与已有工作不同的是,已有研究分别优化框架或模型:SIA 在分类与科学优化任务上交错更新两者;Co-Harness 在改进框架下用自验证成功轨迹微调;HarnessForge、HarnessX 联合优化策略与框架,但它们都没有回答『当框架已经为特定模型特化之后,后续权重更新何时叠加增益、何时破坏适配』。另一方面,teacher continuation、学生状态上的教师干预等非纯模仿方法虽然也在学生诱导的状态上取监督,但都是在固定的智能体接口下研究的,从未考察教学信号与一个『为某模型量身进化』的框架之间的交互。本文的独特切入正是这个交互效应:用七个客观可验证的企业级任务、两个模型族做系统消融与失败归因,把失败源隔离到『模仿×框架进化』的耦合上,并据此给出『教学信号必须保持在策略上』的普适设计原则。
核心方法
直觉上,框架 $h^*$ 是围绕弱模型 $M_t$ 的原生规划风格进化出来的,两者已经耦合;全轨迹模仿会把专家的规划风格整体注入学生,破坏这种耦合。因此教学信号必须在学生自己访问的状态上、只做最小化的局部修改。技术路线分三段:首先用 GEPA 风格搜索为七个企业级任务各进化一个框架(弱模型执行、gemini-3.1-pro-preview 反思提编辑),弱模型平均成功率 29.2%→78.0%,专家在同一 $h^*$ 上达 93.6%,说明存在模型侧空间;其次做诊断实验——用专家成功轨迹 LoRA-SFT 弱模型,复现 -14.9 的退步,并用失败组成分析和框架组件触发率扫描定位病因,发现坏的是规划适配而非知识;最后构建 on-policy expert correction 管线:由自主 MLE 智能体定位每个失败 rollout 的出错回合 $t^*$,专家只重写该回合,其余步骤原样保留,得到约 500 行训练数据再做 LoRA-SFT,在同一个 $h^*$ 下评估,得到 78.0%→79.7% 的安全增益,且该增益可堆叠回协同进化循环。
核心创新是 on-policy expert correction:不拿专家轨迹当训练数据,而是让专家在弱模型自己的 rollout 上『就地改写一个回合』。它与 DAgger、教师干预类方法的本质区别在于设计目标不同——目标不是一般性地改进策略,而是显式地保持学生的规划分布不变,以免破坏与进化框架的适配;因此只允许修改定位到的单个失败回合(一句修正策略+修正后的工具调用),前后所有步骤原样保留。论文另一半核心贡献是反直觉的诊断:模仿后学生的知识其实变好了(隐式知识失败桶 46.2%→44.5%,领域计算配方触发率 30.8%→76.1%),框架组件也在更多使用(各编辑触发率 89.6%–99%),坏的只是规划——规划失败桶从 1.1% 暴涨到 14.6%(+13.5)。『模仿传递了知识却破坏了规划适配』这一定性,把失败从『教学信号不好』重新定义为『信号与定制化脚手架冲突』,是全文最有洞察力的部分。
方法步骤详情
第一步,框架进化:以弱模型为执行者、gemini-3.1-pro-preview 为反思模型,对系统提示/工具/钩子做失败驱动编辑;每轮在小批量上反思提议,验证提升才保留并入 Pareto 池;3 个随机种子、每个 rollout 预算 20 美元、600 秒时限,选验证分最高者为 $h^*$。第二步,向上迁移验证:把 $h^*$ 给专家使用,确认 84.4%→93.6%(+15.6),并扫描专家对各编辑组件的触发率(93.6%–100%)。第三步,模仿实验:收集专家在 $h^*$ 下得分 1.0 的轨迹,转换为 Qwen 的聊天/工具调用格式并与弱模型自身成功轨迹混合,LoRA-SFT(rank 16 或 64、2 epoch、学习率 $10^{-4}$、bf16、有效批 8、序列长 49152,截断超 5% 则加长至 98304),3 个训练种子取均值,结果 78.0%→63.1%。第四步,失败归因:用 LLM-as-judge 把失败 rollout 归入六类适配失败本体,重点观察隐式知识与规划两桶的变化。第五步,在线修正:MLE 智能体定位失败回合 $t^*$,把任务说明、截至该回合的轨迹与失败检查点交给专家,要求只重写该回合;每回合采 $N=3$ 个候选由质量裁判选优;混合约 400 条专家修正与 50 条自成功样本(能力边界题优先),再做 LoRA-SFT 并在同一 $h^*$ 下评测,得 79.7%(+1.7)。
技术新颖性
新颖性有三层。其一,实证发现本身:『在进化框架下模仿更强专家反而令七个任务全面退步(-4.2 到 -29.9),而同一配方在基线框架下有效(+6.3),且在 Gemma 4 上复现(WebArena 任务 46.7%→55.6% 后模仿跌至 41.1%,比默认基线还低 5.6)』——首次把失败隔离到模仿与框架进化的交互效应,反直觉且可复现。其二,归因方法:把失败组成按六类适配失败本体拆分,配合框架编辑触发率扫描(表 2、表 3),证明知识被学到、脚手架被更频繁使用(30.8%→76.1%),坏的只是规划桶(1.1%→14.6%),排除了『知识丢失』『弃用框架』等常见解释。其三,解决方案:on-policy expert correction 并非 DAgger 的简单变体,它以『保持规划分布』为显式约束、只重写单一定位回合,并由端到端的自主 MLE 智能体完成数据合成,使整个训练(不到 1 小时)能安全堆叠进协同进化循环,形成可组合的 recipe:第 $t$ 轮进化出 $h^*_t$ 并围绕它更新出 $M_{t+1}$,$M_{t+1}$ 再进入下一轮进化。
实验结果
七个企业级任务(薪资/考勤审计、预算审批、库存告警、IoT 异常检测、浏览器自动化、网站管理、代码重构)上的核心数字如下。第一,框架进化把 Qwen3-Coder-30B-A3B 从 29.2% 提到 78.0%(+48.8),最大单项提升是异常检测 +88.8。第二,进化框架向上迁移:gemini-3.1-pro-preview 从 84.4%→93.6%(+15.6),且在 93.6%–100% 的 rollout 中触发各编辑组件。第三,模仿灾难:在 $h^*$ 下 SFT-imitation 使 Qwen 跌至 63.1%,七任务全跌(-4.2 到 -29.9,均值 -14.9);Gemma 复现:WebArena 任务 46.7%→55.6%(+8.9)后模仿跌至 41.1%,比进化基线低 14.5、比默认基线还低 5.6。第四,同一模仿配方在 $h_0$ 下有效:29.2%→35.5%(+6.3),证明失败源于交互而非模仿本身。第五,归因:模仿后知识失败桶 46.2%→44.5% 下降、领域配方触发率 30.8%→76.1% 上升,但规划失败桶 1.1%→14.6%;基线框架下规划桶同样涨(0.9%→11.5%)但因无适配可失,知识收益占优,净收益为正。第六,在线修正:79.7%(+1.7),五个任务上涨(网站管理 +5.6、库存 +2.2、重构 +2.2、异常 +1.7、浏览器 +1.2),预算审批 -0.6 与薪资审计 -0.4 在噪声内(框架已近饱和);规划桶仅 1.1%→1.8%,知识桶续降至 43.2%,总失败率 28.9%→26.8%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 七个企业级任务平均 | 测试任务成功率(三种子均值) | 79.7%(SFT-corr,$h^*$ 下) | 78.0%(Qwen base,$h^*$);63.1%(SFT-imit,$h^*$) | +1.7 对比进化框架基线,+16.6 对比模仿微调 |
| 薪资/考勤审计 | 成功率 | 81.3%(SFT-corr) | 81.7%(base,$h^*$);51.9%(SFT-imit) | -0.4(在噪声内,避免了模仿的 -29.9 崩溃) |
| 网站管理 | 成功率 | 48.9%(SFT-corr) | 43.3%(base);23.0%(SFT-imit) | +5.6(修正增益最大的任务) |
| 库存告警 | 成功率 | 78.9%(SFT-corr) | 76.7%(base);62.6%(SFT-imit) | +2.2 |
| 代码重构 | 成功率 | 72.2%(SFT-corr) | 70.0%(base);60.9%(SFT-imit) | +2.2 |
| IoT 异常检测 | 成功率 | 91.1%(SFT-corr) | 89.4%(base);85.2%(SFT-imit) | +1.7 |
| 浏览器自动化 | 成功率 | 98.5%(SFT-corr) | 97.3%(base);81.3%(SFT-imit) | +1.2 |
| WebArena(Gemma 4 复现) | 成功率 | 55.6%(gemma-4-26b-a4b-it,$h^*$) | 46.7%($h_0$);模仿后跌至 41.1% | +8.9(模仿则退步 -14.5,跨模型族确认冲突) |
局限与改进
作者承认的局限:在线修正的 +1.7 远小于框架进化的 +48.8,也未弥合与专家 93.6% 的差距,作者归因于轻量 LoRA 的表达上限;修正管线依赖 MLE 智能体定位失败回合与 LLM 质量裁判,定位错误传播的风险未系统评估;实验限于七个企业级任务与 Qwen/Gemma 两个学生模型族。我的补充观察:其一,+1.7 的平均增益与 ±0.67 的三种子 SEM 相比优势有限,除网站管理 +5.6 外多数任务变化在噪声边缘,统计显著性存疑;其二,未与 RL(GRPO 等)或全参微调对比,『LoRA 是瓶颈』的说法缺乏直接证据;其三,修正数据仅约 500 行,未做数据规模与混合比例的敏感性分析;其四,框架进化与模型训练仍是串行两步,每轮模型更新后需重新进化框架,整体循环成本未量化;其五,失败回合定位假设『单一错误回合』,而案例 1 中的失败恰是 78 步不终止的级联行为,单点修正范式对这类失败可能失效;其六,全流程依赖闭源 Gemini-3.1-pro 做专家与裁判,API 成本与长期可复现性受限。
独立分析的弱点
第一,增益幅度小且接近噪声:+1.7 对比 ±0.67 的三种子 SEM,仅网站管理 +5.6 明确显著;改进方向是增加种子数、引入按任务难度或剩余 headroom 加权的评估,或只在框架未饱和的任务上单独报告修正收益。第二,单回合定位假设过强:真实失败常是前缀级联(如薪资审计案例中模型重复同一查询 29 次、78 步不终止),改进方向是允许『从 $t^*$ 起重写整段后缀』或结合反向回溯定位最早偏离点。第三,质量裁判也是 LLM:best-of-$N$ 选优可能偏向表面流畅而非真正修复,而这套任务本身客观可验证却未用于过滤;改进方向是用任务自带的验证器得分直接筛选修正候选。第四,机制解释停留在行为层面:没有分析 LoRA 更新在哪些层、哪些 token 位置上改变了规划节奏;改进方向是对微调前后规划动作分布做 KL 散度分析或探针实验,给出权重层面的证据。第五,两臂串行低效:每轮模型更新后需重新进化框架,改进方向是作者提出的『框架进化感知未来微调』,或在小步交替的联合搜索中同时更新 $h$ 与 $\theta$。
未来方向
作者提出的方向:把强化学习与在线专家指导结合,在框架已饱和之外的剩余空间继续推高弱模型;让框架进化过程感知到模型随后会被微调,实现两臂的联合优化而非顺序执行。基于本文成果还可延伸:其一,把单回合修正推广为错误前缀修复,处理级联失败与不终止行为;其二,在更广的公开智能体基准(完整 WebArena、SWE-bench、GAIA)上检验『模仿×框架进化』冲突是否普遍存在;其三,用任务自带的客观验证器替代 LLM 裁判做 best-of-$N$,降低成本与偏置;其四,定义『模型-框架适配性』的可度量代理指标(如当前策略规划动作分布相对 $h^*$ 校准期分布的 KL 散度),实现在线监控与训练早停;其五,探索协同进化循环与测试时扩展(自一致性、反思回滚)的组合;其六,研究在策略修正数据的最优规模、课程与混合比例,逼近专家上限 93.6%。
复现评估
复现难度中等偏上,但关键要素可得。有利方面:任务套件与框架优化框架来自 Yang et al. [2026](公开代码库可循);学生模型 Qwen/Qwen3-Coder-30B-A3B-Instruct 与 gemma-4-26b-a4b-it 均为开源权重;LoRA 配方完全给出(rank 16/64、2 epoch、学习率 $10^{-4}$、bf16、有效批 8、序列长 49152,必要时 98304),单次训练不到 1 小时,合并后 57–61GB 需两张 H200 做张量并行;修正数据约 500 行(约 400 条专家修正 + 50 条自成功),$N=3$ best-of-$N$ 选择规则明确。不利方面:框架进化需要可观的 API 预算(每任务 3 种子、单 rollout 上限 20 美元、600 秒时限),模仿基线还需采集专家满分轨迹;论文未声明数据集、修正 prompt、MLE 智能体管线与质量裁判是否开源;专家轨迹到学生聊天格式的转换实现细节有限。拥有 H100/H200 资源与 API 预算的团队预计数周可复现主干结果,缺乏 GPU 或 API 预算则难以进行。
论文图表