FlowEvo:通过工作流与可执行技能协同进化实现智能体自进化 FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills
把成功工作流在线编译为可调用技能库,以直接复用与上下文引导双路径实现训练无关的智能体自进化
前置知识
推理时工作流构造
LLM 智能体在推理阶段动态生成解决任务的流程,包括任务分解、工具调用、代码生成、中间检查与修复,而不是依赖固定的 prompt 或固定的工具调用序列。代表性系统如 ADAS、AFlow 会在一个离线优化循环中搜索工作流图结构,再把优化出的拓扑用于任务求解。
FlowEvo 的处理对象正是这些动态工作流:它把执行成功的工作流提炼为技能。理解本文必须先明白工作流是推理时构造、随任务可变的过程,而非静态提示词。
技能库
存放可复用例程的持久化存储,每个条目是可执行工件加使用说明的组合,例如函数体、显式调用接口、验证测试和元数据。智能体后续通过检索调用这些例程,无需重新推导解法。已有技能库方法(如 Voyager 类系统)通常在固定任务分布上离线预制,与智能体自身解题轨迹脱节。
FlowEvo 的核心贡献是把技能库的构建从离线搬到在线,技能直接从智能体自身验证通过的成功轨迹中编译而来,这是全文的中心机制。
ReAct
一种经典的 LLM 智能体范式,让模型交替输出推理思考与环境动作,根据环境反馈逐步决策。它不携带任何跨任务的技能或记忆积累,每个任务都从零开始探索,是衡量经验积累价值的天然基线。
ReAct 是本文消融实验的起点(ALFWorld 上 33.6%),编译、技能反馈、治理三级增益都相对于它逐层叠加,是读懂消融表格的参照系。
负迁移
复用历史经验反而损害当前任务表现的现象:一个在旧任务上有效的技能在新任务上并不适用,却被检索并应用,导致成功率下降。检测它通常需要对照实验,比较应用与不应用该技能时的表现差异。
技能积累并非总有益,FlowEvo 用对比效用评估自动发现并抑制负迁移技能(消融中贡献 +5.0 分),这是其生命周期治理的关键设计。
McNemar 检验
针对配对二元结果(如同一批任务上每个样本的成功/失败)的统计显著性检验,比较两种方法在同一批任务上的成败差异是否超出随机波动,常用于逐任务对比的分类与生成实验。
论文用 McNemar 检验支撑结论严谨性,例如弱监督鲁棒性消融中 p>0.1 说明改动不显著、主对比显著,读懂实验可信度需要这个概念。
研究动机
LLM 智能体虽然能在推理时动态构造工作流解决复杂任务,但一个回合中发现的有用流程通常在执行后就被丢弃,后续相关任务只能反复重新推导相似例程,推高 token 成本与结果方差。现有补救分两条线且各有硬伤:其一是文本记忆,如 Agent Workflow Memory 把先前计划与轨迹存为文字供后续生成参考,但文字只能描述有效做法,既不能被调用也无法验证,复用仍依赖模型重新推导——这类代表 ExpeL 在 ALFWorld 上只达 46.3%;其二是可执行技能/工具库,虽然可调用可检查,但通常离线构建、面向固定任务分布,与智能体自身解题轨迹脱节。工作流优化方法 ADAS 与 AFlow 则只为当前任务或基准优化,优化出的单一拓扑在 ALFWorld 的 6 种任务类型上分别只有 53.0% 和 59.2%,无法适应逐步反馈。成功工作流恰好处于两者之间:比文本记忆含更多可执行结构,又比手工设计的工具更灵活,如何将其持久化为可复用能力是悬而未决的基本问题。
本文的目标是本文要回答的核心问题是:当智能体通过工作流解题时,成功的工作流应如何转化为可复用的技能,以及在基座模型参数完全固定的前提下,这些技能又应如何反过来影响后续工作流的构造。具体目标是一个 training-free 的推理时自进化框架:任务流按序到来,智能体维护一个持久的可执行技能库;每个成功回合中工作流的可复用部分被在线编译为技能记录入库;后续任务检索到技能后,既可直接执行已验证的调用工件,也可将其作为结构化上下文引导新工作流生成。作者还要求机制层面可归因——技能积累带来的提升必须能与简单重放旧答案区分开,并能在技能产生负迁移时自动抑制,而非让库无差别膨胀。最终在 ALFWorld、HumanEval、MBPP、GSM8K、MATH-500 五个完整标准划分上,用统一 GPT-4o-mini 骨干与 8 个基线比较准确率与每任务 token 成本。
与已有工作不同的是,本文的独特切入是把两条割裂的研究线焊成一个闭环:工作流-技能-工作流循环。与文本记忆不同,成功工作流被编译为带接口、重放测试和元数据的可执行工件,可调用、可验证、可审计;与离线工具库不同,编译完全在线进行、只从验证通过的成功轨迹提取、无需任何参数更新。第二个差异点是分层的技能到工作流复用:作者刻意区分直接执行与技能条件生成两条路径——前者要求兼容性与重放证据,后者只注入紧凑的结构化视图(签名、任务模式、代码摘录),这一区分让消融能证明增益不止来自重放。第三个差异是对比效用生命周期:周期性比较应用某技能与扣留该技能的匹配回合成功率,差值持续为负就触发抑制,用轻量因果信号替代昂贵的留出实验。三个设计合起来回答了工作流优化如何留下持久可执行资产这一现有方法都未覆盖的空档。
核心方法
FlowEvo 是一个 training-free 的推理时自进化框架,直觉上像一个边干活边攒工具的工匠:每解好一道题,就把解法中稳定的部分铸成带接口的工具入库,下次遇到相似的活先翻工具箱。技术上由 4 个紧耦合组件构成:工作流规划器、带验证的执行器、轨迹-技能编译器、带生命周期治理的技能注册表。形式化地,任务流为 $\{x_t\}_{t=1}^{T}$,推理时上下文 $C_t = (B_t, M_t, R_t)$ 分别是技能库 $B_t$、辅助记忆 $M_t$、累积的检索/路由/失败状态 $R_t$。每个回合依次执行 $W_t = G(x_t; C_t)$(生成工作流)、$(\tau_t, y_t) = E(x_t, W_t)$(执行验证得到轨迹与结果)、$(B_{t+1}, M_{t+1}, R_{t+1}) = U(B_t, M_t, R_t, \tau_t, y_t)$(更新记忆状态)。技能记录为 $s = (f, \sigma, \mathcal{T}, m, \ell)$:函数体 $f$、接口 $\sigma$、重放测试 $\mathcal{T}$、元数据 $m$(来源、任务模式标签、复用资格、负证据)与生命周期状态 $\ell$。进化只发生在记忆层,基座模型权重不变。
核心创新是编译而非记录:成功的工作流不是存成文字摘要,而是被提炼为可通过已知接口调用、可用存储测试校验的可执行工件,这是与 Agent Workflow Memory 等文本记忆的本质区别——文本无法被调用或验证,而工件可以重放。由此产生两种性质不同的复用模式:直接执行依赖接口、前置条件、直接复用资格与重放证据,可靠性要求高;技能条件生成只暴露同一工件的紧凑结构化视图(签名、任务模式、脚手架提示、短代码摘录)来引导规划,可靠性要求低。第二个关键想法是对比效用评估:对每个在用技能,周期性比较应用该技能的回合与匹配的扣留回合的成功率,当对比差值持续为负(如论文实例中 $-0.19$ 低于 $-0.1$ 抑制阈值)就抑制该技能。这为识别有害技能提供了不依赖逐技能真值标注、也无需显式留出实验的轻量因果信号。与 ADAS/AFlow 只优化当前任务拓扑不同,FlowEvo 保留的是成功工作流中跨任务稳定的部分,使其成为持久的推理时能力层。
方法步骤详情
每个回合的完整流程如下。第一步检索:对任务 $x_t$,用词汇重叠、任务模式兼容性、接口兼容性和历史效用信号为候选技能打分,并施加负证据惩罚,使曾有害或失配的技能被降权。第二步路由:分三种模式——无技能时动态生成;技能过滤与验证后仍兼容时直接执行;检索信息量足以指导规划但不足以直接执行时,把技能的紧凑结构化视图注入规划上下文做技能条件生成,直接执行的准入或验证失败会自动回退到条件生成。第三步执行与验证:运行工作流得到轨迹 $\tau_t$ 与结果 $y_t$,如 ALFWorld 只有二值终局成功信号、最多 50 步。第四步编译:仅在验证通过的成功回合上,识别入口点、推断可调用签名、尽量提取重放测试,并记录来源任务、任务模式标签、复用约束与首选使用模式等元数据。第五步准入:先查重,再过三道诊断——接口合规(能否按声明签名与前置条件调用)、功能正确(重放测试与留出检查支持所声称行为)、安全合规(禁用 import 与禁用调用);不合格者不暴露直接执行,临界者只保留上下文暴露或进入影子状态。第六步生命周期:持续跟踪下游效用,对反复负迁移的技能先做针对性审计、降级直接使用权限,最后才移除。
技术新颖性
技术新颖性体现在四处。第一,在线编译:现有技能库方法为固定任务分布离线预制工具,或把工具创建与自身解题轨迹解耦;FlowEvo 的技能完全从自身验证通过的轨迹中实时编译,且不更新任何权重,属于训练无关自进化。第二,分层复用路由:把直接执行与技能条件生成设计为显式区分的两条路径并配套不同可靠性门槛,使消融实验能把增益归因到结构化复用而非无限制重放——固定库 MBPP 分析正是利用这一区分完成机制隔离。第三,对比效用生命周期:准入三维度(接口、功能、安全)在入库时可评估,但下游效用无法在准入时判断,FlowEvo 用应用/扣留对比给出持续因果信号,自动抑制负迁移技能,论文给出了 pick_two_obj_and_place 在 14 个引导回合内被抑制的完整实例。第四,可观测性:整个循环在轨迹层可直接观测,增益可归因到具体入库技能,而非基座模型上下文里无账目的提示历史,这让技能学习从隐喻变成可审计的工程机制。
实验结果
主实验(表 1)在共享 GPT-4o-mini 骨干下,FlowEvo 在 5 个完整标准划分全部第一:ALFWorld 85.6%(3 seeds,±3.8),超最强基线 AFlow 59.2% 达 26.4 分,每回合 9,329 tokens 约为基线 29,671–32,958 的三分之一;HumanEval 95.1% @880 tokens,超 ExpeL 89.0%;MBPP 79.6%,超 ExpeL 73.8%;GSM8K 97.1% @541 tokens,超 ORCH 93.9%;MATH-500 75.9±0.3,超 EvoAgentX 73.6%。泛化实验(表 3)横跨 7B 到 671B 共 10 个基座模型,50 个模型-数据集配对格中 49 格胜 ExpeL,均值 +11.0、中位 +7.0;GPT-4.1 阶梯显示模型越小增益越大,GPT-4.1-nano 在 ALFWorld 提升 +53.2 分,唯一失败格是 Qwen3-8B 的 MATH-500(−10.0),原因是接口违规技能体被准入拒绝、库太稀疏。消融(表 4)从 ReAct 33.6% 出发逐级叠加:编译 +5.2、技能反馈 +41.8(至 80.6%)、治理 +5.0(至 85.6%)。动力学上首个技能复用约在第 10 回合出现后 token 骤降,101/134 回合走直接复用、命中率约 75%、成功 99 次(98%)。弱监督鲁棒性:去掉轨迹成功门槛仅损失 1.5 分(85.6→84.1),翻转 20% 成败标签损失 1.7 分,McNemar 检验 p>0.1 均不显著。库规模饱和于 7 个工作流模板加 18 个示例。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ALFWorld(文本家庭环境,134 任务,6 种任务类型) | 成功率 | 85.6%(9,329 tokens/回合) | AFlow 59.2%(30,137 tokens/回合) | +26.4 分,token 成本约为基线的三分之一 |
| HumanEval(164 题,代码生成) | pass@1 | 95.1%(880 tokens/题) | ExpeL 89.0%(883 tokens/题) | +6.1 分,成本持平 |
| MBPP(500 题标准评测划分,代码生成) | pass@1 | 79.6%(2,230 tokens/题) | ExpeL 73.8%(787 tokens/题) | +5.8 分(以更高的 token 成本换取) |
| GSM8K(1,319 题,数学应用题) | 解题率 | 97.1%(541 tokens/题) | ORCH 93.9% | +3.2 分,token 成本最低 |
| MATH-500(500 题,竞赛数学) | 解题率 | 75.9%(±0.3,3 seeds) | EvoAgentX 73.6% | +2.3 分 |
局限与改进
作者明确承认的局限有三:一是依赖可验证信号,实验集中在环境反馈或隐藏测试能判定对错的领域,自由对话、长文写作等完全无信号的设定不在范围内,延迟、部分或对抗性反馈也是未解挑战;二是需要足够的基座能力来启动循环,Qwen3-8B 在 MATH-500 上因技能过不了准入、库太稀疏而落后 10 分,说明存在能力下限;三是长期运行下的库维护——技能的修订、合并、退役与检索干扰——被留作开放问题。我的观察补充四点:其一,ALFWorld 的 6 种任务类型带参数化变化,直接复用的巨大优势(命中率 75%)建立在强结构同构上,遇到真正新颖的任务类型时泛化性未知;其二,对比效用评估需要匹配的扣留回合,早期样本少时(抑制案例中引导仅 14 回合、扣留仅 3 回合)差值 $-0.19$ 这类估计噪声大,抑制决策的统计功效未讨论;其三,各基准独立从空库开始,论文没有展示跨域技能迁移,而那才是技能库最有想象力的场景;其四,基线按官方默认配置运行,部分近期方法在弱骨干下可能欠调优,横向比较存在一定有利偏差。
独立分析的弱点
独立分析出的弱点与改进方向:第一,任务模式标签是检索与路由的枢纽,但论文未说明标签如何泛化到分布外任务,跨域或长尾任务可能检索失灵——改进方向是引入语义级技能嵌入与层次化技能抽象,让技能按目标结构而非表面模式匹配。第二,对比效用评估的样本效率:被抑制技能的引导样本仅 14 个、扣留仅 3 个,小样本差值极易误判,可能错杀有用技能或漏杀有害技能——可改用贝叶斯效用估计或序贯显著性检验,给出置信区间后再降级。第三,直接执行要求任务间结构同构,look_at_obj_in_light 类型 15 次匹配却 0 次直接完成,说明参数化模板覆盖不了意图相同但步骤不同的任务——可加入技能的参数化改写器,把固定模板升级为可组合原语。第四,安全合规目前是禁用 import/调用的静态规则,无法防御语义级副作用(如删文件、发网络请求的间接组合)——应配合沙箱执行与运行时权限模型。第五,代码/数学上的自适应升级策略有效,但论文未报告升级路径的 token 上限与最坏成本,生产部署需要成本上界保证。
未来方向
作者提出的两个方向:一是把自进化从解题技能扩展到智能体骨架的其余部分,包括验证辅助器、重试策略和检索启发式,并通过标准化协议接入更广阔的工具生态;二是长期运行下的技能库维护本身就是一个研究问题,需要在限制检索干扰的同时对技能做修订、合并与退役。基于本文成果可以自然延伸的方向:其一,技能的自动抽象与合并——当库中出现多个相似模板时自动归纳出更高层原语,形成层次化技能树,突破 ALFWorld 上 7 个模板的粒度上限;其二,跨域与多智能体技能共享——让一个领域编译的技能库作为另一个领域的初始化,或构建多用户技能市场,相关工作已有跨人群技能进化的先例可对接;其三,技能层与权重层协同——用技能使用统计指导微调数据选择,把 training-free 与参数更新结合;其四,把对比效用评估推广为在线因果归因框架,服务于多智能体系统的失败归因;其五,在无外部验证器的开放域(写作、对话)用自一致性或评审模型替代准入门槛,检验框架的适用边界。
复现评估
复现条件较好:代码已在 GitHub(DEFENSE-SEU/FlowEvo)开源;五个基准全部公开且使用完整标准划分,无需私有数据;所有基线用官方发布代码默认配置、同一共享 API 端点,附录 B 报告了匹配优化预算的保真度检查,附录 C 给出完整回合伪代码。算力方面主要成本是 API 调用而非训练:ALFWorld 134 个任务、FlowEvo 每回合约 9,329 tokens、基线约 3 万,单基准主实验在千万级 token 量级;10 个骨干的扫描与 3 seeds 方差分析会翻几倍,且需要 DeepSeek、Qwen、Llama、Gemini 等多家族 API 配额(部分可走开源权重自部署)。统计报告规范(McNemar 检验、均值±样本标准差、3 seeds)提升可信度。难度评估:单基准复现属中等难度,主要是 ALFWorld 交互环境搭建与 API 预算;完整复现 10 模型面板与全部消融成本较高,建议优先复现表 1 主结果与表 4 消融。
论文图表
技能积累动力学图:左图画每回合 token 成本,约第 10 回合首次技能复用(虚线标记)后成本骤降,并持续低于或等于无技能的 ReAct;右图画累计直接复用次数(近线性增长至 134 回合中的 101 次)与复用命中率(稳定在约 75%)。
直观展示了技能积累如何转化为成本优势:token 从约 3 万降到 9,329 的拐点与直接复用的出现精确对应,是理解为什么编译技能能省钱省时的关键证据。