← 返回 2026-09-09

程序性图:LLM 智能体的自演化执行结构 Procedural Graphs: Self-Evolving Execution Structures for LLM Agents

Yuxing Lu, Yicheng Chen, Shanchan Wu, Sercan Ö. Arık 📅 2026-09-08 👍 37 2026-09-12 18:30
LLM Agent 图结构 智能体记忆 程序性知识 自演化

用可自我演化的“程序三元组”图为 LLM 智能体逐步导航

前置知识

ReAct 智能体范式

ReAct 是 LLM 智能体的主流执行框架:模型在“思考-行动-观察”循环中交替进行自由文本推理与环境交互(调用搜索、API 等工具),每一步动作都基于不断增长的历史轨迹自由生成,程序性知识完全隐含在模型权重与上下文里。

本文所有实验与七个基线都建立在同一个 ReAct 求解器之上,理解这一范式才能看清 Procedural Graph 在哪个环节介入、如何改变动作选择。

知识图谱三元组

知识图谱把事实知识组织成(实体, 关系, 实体)三元组,例如(蒙娜丽莎, 被创作, 达芬奇),通过图结构支持存储、检索与多跳推理,是回答“是什么”类问题的经典符号化知识表示。

本文的核心类比就是把这一范式镜像推广为(程序, 关系, 程序)三元组来回答“下一步做什么”,理解 KG 三元组才能领会 Procedural Graph 的设计哲学。

有向属性图与 h 跳邻域

有向图中边带方向,属性图中每条边附带键值属性;$h$ 跳邻域指从某节点出发沿出边扩展 $h$ 步所能到达的连通子图。本文在线引导时提取活跃节点的 $h=2$ 跳邻域作为拓扑上下文。

在线引导的关键操作就是“定位活跃节点-提取 2 跳子图-生成引导”,不熟悉邻域概念就无法理解局部检索为何能保留程序步骤间的先后依赖。

记忆型/经验型智能体方法

MemoryBank、ExpeL、AutoGuide、AWM、KnowAgent 等方法从历史轨迹中蒸馏自由文本洞察、状态条件指南或线性工作流,供后续任务检索复用,是当前增强 LLM 智能体执行可靠性的主流路线。

论文的全部对比基线都来自这一家族,PG 与它们的对比(连通结构图 vs 平坦文本记忆)正是全文实验主线,理解它们才能读懂 Table 1 和 Table 3。

验证门控与拒绝记忆

验证门控要求候选修改必须在与训练集独立的验证集上分数不降才被采纳,否则回滚;被拒绝的候选连同轨迹写入“拒绝记忆”,作为负证据防止精炼器反复提出同样失败的编辑。

这是自演化循环不退化的两道安全机制,论文靠它们实现验证生存率 0%→45%→80%→90% 的单调提升,并在 Round 3-6 的停滞期后继续改进。

研究动机

主流 LLM 智能体(ReAct 及其后继)通过在平坦、不断增长的动作-观察日志上做无约束自由生成来选择动作,程序性知识——“做什么、按什么顺序做、在什么条件下做”——完全隐含在模型权重与上下文中。随着轨迹变长,智能体会出现三类典型失败:丢失目标、乱序调用工具、重复无效动作。现有补救各有缺陷:MemoryBank、ExpeL 等把经验存成自由文本,求解器每一步都要自行重构“这条经验如何约束我接下来的步骤”;AutoGuide 的状态条件指南能给出针对性建议,但检索规则时不连接先后程序步骤——例如为 submit 检索指南却漏掉前置的 check_answer 校验;AWM、KnowAgent 等工作流方法把步骤显式化并约束执行,但结构常需人工设计,自动工作流搜索又只能离线一次性优化结构,无法响应智能体的当前进度。作者认为需要一种既结构化又灵活、能感知进度、可从经验改进的程序性知识表示。

本文的目标是本文的目标是给 LLM 智能体一个显式、可编辑的程序性知识库,使其在每步决策时能回答“我现在处于流程哪个节点、下一步合法的转移有哪些、转移时要注意什么”,同时不剥夺模型自由推理的空间。具体拆成四个要求:一是结构化程度足以把智能体引向合法的工具调用与动作序列;二是保持柔性引导而非硬性约束;三是引导必须随智能体当前进度(最近轨迹窗口)动态生成;四是无需更新模型权重,仅凭执行反馈即可让知识库自我改进。作者希望从最小骨架出发的自动演化能追平甚至超越人工设计的程序结构,并能修复有缺陷的专家先验,最终在多种任务类型与多个 LLM 上稳定优于记忆型基线。

与已有工作不同的是,独特切入是“把组织事实知识的成熟方式迁移到程序知识”:知识图谱用(实体, 关系, 实体)三元组回答“是什么”,本文提出 Procedural Graph 用(程序, 关系, 程序)三元组回答“下一步做什么”,节点抽象工具动作、推理步骤与任务状态,类型化边上附带 condition/guidance/pitfalls 三个文本属性。与已有工作相比有三点本质差异:其一,检索以当前活跃节点的连通邻域为单位而非独立 top-k 相似检索,天然保留步骤间前置依赖;其二,图不是静态注入 prompt,而是由引导模型读入拓扑上下文后生成情境化文字引导,是软约束;其三,图拓扑与属性可由 LLM 精炼器基于失败/成功轨迹对比进行增删改,经验证门控与拒绝记忆保护形成在线+离线闭环。附录 A 还提供了 24 种方法的八维对比综述。

核心方法

Procedural Graph 定义为有向属性图 $G = (V, R, E, \Phi)$:$V$ 是抽象节点集(工具函数、技能、推理步骤或任务状态),$R$ 是转移关系词表,每条边 $e = (u, r, v)$ 声明“在关系 $r$ 下节点 $v$ 可跟在 $u$ 之后”,$\Phi$ 为每条边关联 condition(何时适用)、guidance(如何进行)、pitfalls(避免什么)三个文本属性。框架分两个互补阶段:在线推理时图被冻结,系统先把最近动作(如工具调用)精确匹配到图中节点定位 $u_t$(第一步初始化为 Start),提取 $h=2$ 跳出边邻域 $G_t$(匹配失败回退全图),引导模型 $\Psi$ 结合查询 $q$ 与最近 $w=3$ 步轨迹窗口,把邻域边的静态属性翻译成情境引导 $g_t = \Psi(G_t, q, T_{t-w:t})$,追加进求解器 prompt,动作采样自 $a_t \sim P_{\text{solver}}(\cdot \mid q, T_t, g_t)$。离线自演化则以四步循环更新图本身:诊断 rollout、反馈驱动变异、验证门控、拒绝记忆。

核心创新是把程序性知识做成“显式、可编辑、可局部检索、可自我演化”的图,且引导生成于连通的拓扑上下文而非孤立条目。与记忆型方法(ExpeL 洞察、AutoGuide 指南)的本质区别:独立 top-k 检索会切断程序步骤的先后依赖——为 submit 检索指南却丢掉前置的 check_answer;PG 以活跃节点为锚提取 2 跳连通邻域,动作与其程序性前置条件天然一起出现。与工作流方法(AWM、KnowAgent、离线工作流搜索)的区别:它们要么线性、要么离线一次性优化,而 PG 的边是带类型和文本属性的一般转移,在线每一步都由引导模型根据当前进度把静态属性“翻译”成 situational guidance,是软引导而非硬约束,保留推理自由。自演化方面,LLM 精炼器对比高分与低分轨迹提出 Add/Delete 及属性修订(属性修订通过删除-重加接口实现),验证集分数不降才采纳,被拒候选记入拒绝记忆以防重复失败提议。

方法步骤详情

离线自演化是四步循环。第一步诊断 rollout:用当前保留图 $G_{k-1}$ 在训练批 $\mathcal{B}_k$ 上运行求解器,记录轨迹与得分 $E_k = (q_i, T_i^{(k)}, S_i^{(k)})$,$S_i^{(k)} \in [0,1]$。第二步反馈驱动变异:精炼器对比高分与低分轨迹(二值任务即成功 vs 失败),找出失败轨迹中的重复错误循环与成功轨迹中的多步捷径,生成编辑集 $\Delta G_k$:Add 插入缺失的校验节点/边,Delete 删除反复导致失败的节点/边;属性修订走删除-重加接口;候选图 $G_{\text{cand}}^k = G_{k-1} \oplus \Delta G_k$,$\oplus$ 在副本上应用编辑并做环修复。第三步验证门控:结构无效的候选在 rollout 前即被丢弃;有效候选在独立验证集上计算 $S_{\text{val}}(G) = \frac{1}{|D_{\text{val}}|}\sum S(f_{\text{solver}}(q \mid G), y)$,仅当 $S_{\text{val}}(G_{\text{cand}}^k) \ge S_{\text{val}}(G_{k-1})$ 才提交,否则回滚且缓存分数不变。第四步拒绝记忆:被拒候选连同轨迹与验证结果写入 $H_{\text{rejected}}$,下一轮提议采样自 $\Delta G_{k+1} \sim P_{\text{refiner}}(G_k, C_{k+1}, H_{\text{rejected}})$,超长上下文保留末尾 $L_{\max}$ 个 token 以保住轨迹结尾。

技术新颖性

技术新颖性体现在四个层面。表示层:(程序, 关系, 程序)三元组加每边 condition/guidance/pitfalls 属性模式,是既非自然语言记忆也非刚性状态机的新程序知识编码,把程序知识放在模型权重之外、可检查可编辑。检索层:“精确匹配最近动作定位节点 + 有向 $h$ 跳邻域 + 失败回退全图”是结构感知的检索,效率消融显示其相对全图生成式引导在 ALFWorld 上省 70.9% token 且成功率从 54.48% 升至 81.53%。生成层:引导模型把静态边属性与动态轨迹窗口合成情境引导,附录 D 显示相对专家图解析失败率降低 45.7%。演化层:验证门控加拒绝记忆的组合让从零演化(Mode 5)在 HotpotQA 达 78.79 F1、超过手工专家图的 76.61,并把 MultiChallenge 成功率从专家图的 58.93% 修复到 92.86%——证明循环不仅能从零构建,还能纠错有缺陷的人类先验,这是离线一次性工作流搜索不具备的能力。

Overview of the Procedural Graph framework
Figure 2: Overview of the Procedural Graph framework

实验结果

主实验(Table 1):6 基准 × 4 LLM 共 24 个设置中,PG 21 次排名第一或并列第一;对最强基线 19 胜 2 平 3 负(单侧符号检验 $p = 4.3 \times 10^{-4}$)。最大优势:Gemini 3.5 Flash 上 BFCL v3 67.00% vs 58.00%(+9.00),Gemini 3.1 Pro 上 GDPval 78.78 vs 71.37(+7.41)、τ-bench 80.00% vs 73.04%(+6.96)。长程决策(Figure 3,EnterpriseArena 132 个月、3 次隐藏危机):全周期生存率 Claude 44.0%→58.0%,Gemini 3.1 Pro 6.0%→34.0%,Grok 26.0%→40.0%;Flash 基线月均 18.94 次工具调用被降至 12.53;生存关键行为是提前融资——Flash 基线平均融资 $0.00M,PG 引导下达 $9.39M(Grok $30.11M)。构建策略(Table 2):从零演化 Mode 5 在 HotpotQA 达 78.79 F1 / 66.30 EM(+7.58 / +7.50),超过手工专家图的 76.61;专家图单独使用反而把 MultiChallenge 从 87.50% 拉低到 58.93%,迭代演化 Mode 3 修复到 92.86%。自演化动态(Figure 4):Round 1 发现“先审计现金并预测跑道、再融资”骨架使验证生存率 0%→45%,Round 2 加 recall_notes 至 80%(月均工具调用 17.23→3.08),Round 8 达 90%;返回图测试生存率 85% vs 基线 0%(Fisher $p = 2.6 \times 10^{-8}$)。效率消融(Table 3):局部子图+生成式引导三项全部最佳(89.31 / 63.99 / 81.53),比全图生成式引导省 14.8%–70.9% token。

Main results across LLMs and benchmarks
Table 1: Main results across LLMs and benchmarks
PG construction modes on HotpotQA and MultiChallenge
Table 2: PG construction modes on HotpotQA and MultiChallenge
PG usage ablation with Gemini 3.5 Flash
Table 3: PG usage ablation with Gemini 3.5 Flash
Ensemble cash trajectories and Kaplan–Meier survival curves across four LLMs
Figure 3: Ensemble cash trajectories and Kaplan–Meier survival curves across four LLMs
Mean lifespan and capital raised across ten rounds of PG self-evolution
Figure 4: Mean lifespan and capital raised across ten rounds of PG self-evolution
查看结构化数据
任务指标本文基线提升
BFCL v3 多轮函数调用(Gemini 3.5 Flash) Accuracy 67.00% 58.00%(最强基线) +9.00
GDPval 开放式专业任务(Gemini 3.1 Pro) Rubric Score 78.78 71.37(RAP) +7.41
τ-bench 策略合规工具使用(Gemini 3.1 Pro) Pass@1 80.00% 73.04%(RAP) +6.96
EnterpriseArena 长程金融决策(Gemini 3.1 Pro) 全周期生存率 34.0% 6.0%(无引导基线) +28.0
HotpotQA 多跳问答(Mode 5 从零演化) Ans F1 78.79 71.21(无引导基线) +7.58
MultiChallenge 多轮指令保持(Mode 3) Overall Success 92.86% 87.50%(无引导基线) +5.36
ALFWorld 具身任务(Gemini 3.5 Flash,Table 3) Success 81.53% 72.58%(无图基线) +8.95

局限与改进

作者承认两点局限:一是引导增加 token 消耗——即使求解步数减少(GDPval 上平均步数 28.20→18.57),总 token 仍比无图基线高 33.4%(GDPval)与 55.4%(ALFWorld);二是收益幅度高度依赖任务类型,HotpotQA 上相对最强基线的增益在 −0.90 到 +1.30 点之间,说明对简单检索类任务结构化引导帮助有限。我自己的观察还有:EnterpriseArena 每个划分仅 20 个 episode,接受/拒绝决策可能由一两个 episode 翻转,作者也坦承应把演化曲线读作“搜索轨迹”而非显著性检验,小验证集上的门控存在噪声过拟合风险;主实验全部使用闭源商用模型(Claude Sonnet 4.6、Gemini 3.1 Pro/3.5 Flash、Grok 4.1 Fast),缺少开源模型验证;节点定位依赖最近动作与图中节点的精确匹配,遇到未见工具组合即回退全图,此时退化为全图引导并失去定位优势;每轮演化都要在验证集上完整 rollout,计算与 API 开销不小。

独立分析的弱点

第一,验证门控的统计功效不足:20 个 episode 的验证集上“不降即采纳”的准则对随机波动极敏感,可能把噪声涨落误判为真实改进,改进方向是引入置信下界或贝叶斯序贯检验并扩大验证集。第二,每步都调用一次引导模型带来 14.8%–55.4% 的额外 token 与延迟,且相邻步骤引导内容高度重复,可按节点转移缓存复用引导,或仅在低置信度/进入未见节点时选择性触发。第三,定位机制脆弱:精确匹配失败即全图回退,长轨迹中工具参数的细微变化就可能失配,可改用嵌入相似度匹配加阈值,或让求解器显式报告当前节点。第四,属性 schema 固定为 condition/guidance/pitfalls 三个文本字段,未必适配所有任务域(如具身控制或代码生成),可让 schema 随演化自我调整。第五,学习到的图与具体求解器、工具接口和命名耦合,跨求解器迁移与工具重命名的鲁棒性完全未验证,工程落地价值受限。

未来方向

作者在结论中提出两个方向:跨步复用引导或仅在必要时选择性生成,以摊薄引导调用的 token 开销(论文数据显示即便步数减少 token 仍增加 33.4%–55.4%);以及评估学习到的程序图跨求解器与工具接口的迁移能力,检验通用性。基于本文成果还可延伸:其一,把验证门控换成统计更稳健的准则(如置信下界比较、多种子重复评测),让 10 轮之外的长程搜索更可靠;其二,研究多任务共享图与任务条件子图,探索程序知识的组合与复用;其三,将 PG 与参数化训练结合,比较图编辑与微调引导模型的样本效率;其四,把拒绝记忆升级为显式的负约束建模,甚至训练一个“编辑提议器”策略;其五,扩展到多智能体协作,让各智能体维护独立 PG 并通过图合并共享程序知识;其六,在 EnterpriseArena 上检验图能否学到跨市场体制的策略而非过拟合三次特定危机。

复现评估

复现难度中等偏高。七个基准(HotpotQA、MultiChallenge、GDPval、ALFWorld、τ-bench、BFCL v3、EnterpriseArena)均为公开数据集或环境,四个求解 LLM 均为商用 API,全部调用用 temperature 0 贪心解码保证可复现;附录 B 给出实现细节、数据划分与预处理、七个基线的适配方式,附录 B.4 给出各基准图的节点数/三元组数/关系类型/属性覆盖率,附录 D、E 还提供五种构建模式的资源统计(含解析失败率降低 45.7%)与逐轮演化结果。但正文与附录均未提及开源代码或释放演化得到的图,而图的初始化质量对结果影响巨大——Mode 1 专家图在 MultiChallenge 上 58.93% vs Mode 3 的 92.86%——缺少图资产会显著抬高复现门槛。主要成本在自演化循环:每轮需训练批与验证集两次完整 rollout,外加精炼器与逐步引导调用,在长程环境(GDPval 单样本最高约 44.9 万 token)上 API 费用可观,粗估完整复现全部实验需要数千至数万美元级别的推理预算。