AgentGrad:面向多智能体系统的干预引导提示词优化 AgentGrad: Intervention-guided Prompt Optimization for Multi Agent Systems
以顺序干预定位失败责任智能体,再聚类抽象文本梯度以优化多智能体提示词
前置知识
多智能体系统(MAS)
由多个大模型驱动的智能体协同解决复杂任务的系统。每个智能体负责一个子任务(如检索、推理、隐私改写),前序智能体的输出作为后续智能体的输入,最终产出系统级答案。每个智能体的行为由其提示词决定,因此提示词设计直接决定系统整体性能。文中形式化为 $\Pi=(\pi_1,\dots,\pi_N)$ 与提示词集合 $P=(p_1,\dots,p_N)$。
本文的优化对象就是这类系统中每个智能体的提示词,理解流水线结构与中间输出的传递方式是理解干预定位机制的前提。
文本梯度(Textual Gradient)
数值梯度的自然语言类比:由 LLM 充当梯度提取器,根据失败样例生成一段自然语言批评,描述提示词应如何修改以降低损失,形式化为 $\nabla_{\partial p}\mathcal{L}=\mathrm{LLM}_\nabla(p,\hat{y},\mathcal{L})$,随后由优化器 LLM 据此改写提示词。TextGrad、GEPA 等方法共享这一抽象。
AgentGrad 的两个核心创新(干预引导的梯度提取、语义梯度抽象)分别针对文本梯度方法的提取与聚合两个阶段,不懂这个范式就无法理解改进点。
自动提示词优化(APO)
在不修改模型权重的前提下,自动搜索或改写提示词以最大化任务奖励。由于 rollout(运行系统并评估)代价高,通常形式化为预算约束下的优化:$P^*=\arg\max_P \mathbb{E}_{(x,y)\sim\mathcal{D}_{val}} r(\Pi(x;P),y)$,约束 rollout 次数 $\le B$。代表方法有 MIPROv2(贝叶斯优化)、TextGrad(文本梯度)、GEPA(轨迹反思+进化搜索)。
本文是该范式的最新进展,实验对比对象正是这三个基线,且以 rollout 预算和 wall-clock 时间作为核心效率指标。
反事实干预与失败归因
通过修改系统中某个环节的行为并重放执行,观察最终结果是否改变,从而验证该环节对失败的责任。多智能体失败归因研究指出系统级错误可能源自多个智能体的交互,形成信用分配难题:最终失败对'该怪谁'给出的证据很有限,而干预是验证因果的实用调试工具。
本文把干预从'事后调试分析'改造成'优化监督信号的来源',顺序干预是其定位目标提示词的核心机制,也是与已有优化方法的根本区别。
语义小批量(Semantic Minibatch)
本文提出的聚合概念:按纠正模式的语义相似性(而非随机抽样)把样本级文本梯度聚成组,每组对应一批共享同一失败模式的训练样本,再抽象为一个广义梯度。类比 SGD 中的 minibatch,但分组标准从随机变为语义相关,保证聚合后的更新方向一致。
它是聚合阶段的核心创新,理解'随机分组 vs 语义分组'的对比才能把握本文与 TextGrad 在泛化性上的本质差异。
研究动机
LLM 多智能体系统(MAS)的性能高度依赖每个智能体的提示词设计,而现有文本梯度类自动提示词优化方法在'梯度提取'与'梯度聚合'两个阶段存在系统性缺陷。梯度提取阶段有两个问题:一是目标提示词的选择是盲目的——要么同时更新所有智能体的提示词(成本极高),要么按轮转方式轮流更新却不验证修改该提示词是否真能修复失败;二是梯度只基于系统级最终输出与标准答案的对比来生成,缺少对单个智能体中间输出的直接监督,更新信号粗粒度。梯度聚合阶段则把不同样本的梯度随机分组后直接拼接,经常把互不相关的失败模式混在一起,产生方向矛盾、泛化能力差的提示词。实测后果很明显:在 HotpotQA 上 GEPA 需要超过 6,000 次 rollout 才接近 70% 的验证性能,TextGrad 和 MIPROv2 在此之前就进入平台期,优化既慢又不稳定。
本文的目标是本文的目标是构建一个面向多智能体系统的提示词优化框架,同时修复梯度提取与梯度聚合两个阶段的缺陷。具体目标有四:(1) 对每个失败样例,自动识别出'只修正这一个智能体即可修复系统失败'的目标智能体,避免盲目更新所有提示词,同时解决信用分配问题;(2) 利用干预后的修正输出作为智能体级别的伪标签,为梯度提取提供细粒度监督,无需人工标注中间输出;(3) 把语义相近的样本级梯度聚类成语义小批量并抽象为广义梯度,防止混合无关失败模式,提升提示词泛化性;(4) 在同等甚至更少的 rollout 预算下取得更高的任务性能,并大幅缩短 wall-clock 优化时间——最终实现质量与效率的联合提升。
与已有工作不同的是,本文的独特切入角度是把'失败归因/干预式调试'这一原本用于事后分析的研究方向,改造成提示词优化的监督信号来源。以往干预式调试工作(编辑、重放、扰动智能体执行)只停留在定位和验证失败原因;AgentGrad 则把干预揭示出的'被修正的行为'直接当作智能体级伪标签,把归因证据转化为局部化的提示词更新目标。在聚合侧,它把 SGD 中 minibatch 的类比推进一步:已有文本梯度方法用随机分组模拟小批量,本文提出按语义聚类分组的'语义小批量',并把聚类规模下界设计成 5→3→1 的循环调度,在'粗粒度通用模式'与'细粒度具体修正'之间交替,兼顾收敛速度与泛化性。这一'先归因、再监督、后抽象'的组合视角是已有方法(TextGrad/GEPA/MIPROv2)都没有覆盖的。
核心方法
AgentGrad 把多智能体提示词优化形式化为带预算约束的奖励最大化:给定由 $N$ 个智能体 $\pi_1,\dots,\pi_N$ 组成的系统 $\Pi$ 与提示词集合 $P=(p_1,\dots,p_N)$,在 rollout 次数不超过 $B$ 的约束下寻找 $P^*=\arg\max_P \mathbb{E}_{(x,y)\sim\mathcal{D}_{val}} r(\Pi(x;P),y)$。直觉上,与其对着最终错误猜测该改谁的提示词,不如先动手'修'一次,看谁能把系统救回来。技术路线分两步:梯度提取阶段通过顺序干预(按逆执行顺序依次向单个智能体的提示词注入提示 $H$)找到目标智能体,其干预修正输出 $\tilde{y}$ 作为伪标签,与原始错误输出 $\hat{y}$ 在同一输入下对比,由梯度提取器 LLM 生成样本级文本梯度 $\delta$;聚合阶段由聚合器 LLM 把语义相近的梯度聚成语义小批量,抽象出捕捉共性纠正模式的广义梯度 $\bar{\delta}$;最后按小批量规模从大到小依次用优化器 LLM 更新提示词,候选提示词需先后在小批量和验证集上双重验证通过才被接受。
核心创新有二。其一是'干预引导的目标识别 + 智能体级监督':现有方法(如 TextGrad)只拿系统最终输出对标准答案的损失做文章,既不知道该改哪个智能体,也不知道中间输出'应该'长什么样;AgentGrad 对每个失败按逆序逐个干预智能体,定义被干预后能修复的失败集合 $T^n=\{(x_i,y_i)\in F^{n+1}: r(\Pi^{(n,H)}(x_i;P),y_i)=r_{max}\}$,把'谁的修改能解决问题'变成可验证的事实;同一输入 $x^n$ 下 $\hat{y}$ 与 $\tilde{y}$ 的差异恰好隔离了干预引起的行为变化,因此 $\tilde{y}$ 天然就是伪标签,梯度 $\delta^n_i=\mathrm{LLM}_\nabla(p_n,x^n_i,\hat{y}^n_i,\tilde{y}^n_i)$ 不再需要显式损失函数。其二是'语义文本梯度抽象':把共享纠正模式的梯度聚成语义小批量再抽象为广义梯度,替代随机分组直接拼接,避免混合无关失败模式,使优化器拿到的是单一、连贯的更新方向。
方法步骤详情
完整流程见算法 1。第一步,失败集构建:在 $\mathcal{D}_{train}$ 上运行当前提示词集 $P$,收集所有满足 $r<r_{max}$ 的失败样例构成 $F$。第二步,顺序干预:从最后一个智能体 $\pi_N$ 开始逆序逐个干预(作者观察到失败集中在后期智能体,逆序可减少期望干预次数),在步 $n$ 向 $\pi_n$ 的提示词追加提示 $H$——由标准答案 $y_i$ 或输出约束,加上数据集、系统与各智能体角色的描述构成,且仅在训练期使用,推理时部署的提示词不含提示;干预后能修复的子集 $T^n$ 归属 $\pi_n$,其余进入 $F^n$ 继续向前;直到 $n=1$ 仍无法修复的困难样本本轮剔除,下一轮以更新后的提示词重新评估。第三步,梯度提取:对每个 $(x_i,y_i)\in T^n$,取同输入下的原始输出 $\hat{y}^n_i$ 与干预修正输出 $\tilde{y}^n_i=\pi_n(x^n_i;p_n,H)$,生成样本级梯度 $\delta^n_i=\mathrm{LLM}_\nabla(p_n,x^n_i,\hat{y}^n_i,\tilde{y}^n_i)$。第四步,语义抽象:聚合器 LLM 单次调用完成聚类与抽象,输出 $\{\bar{\delta}^n_j\}_{j=1}^{M_n}=\mathrm{LLM}^{Aggregator}(\Omega^n)$,聚类规模下界按 5→3→1 循环调度且为软约束。第五步,更新与验证:按 $|\mathcal{D}^n_j|$ 降序生成候选 $p^{new}_n=\mathrm{LLM}^{PromptOptimizer}(p_n,\bar{\delta}^n_j)$,先在其语义小批量 $\mathcal{D}^n_j$ 上验证,通过后再在 $\mathcal{D}_{val}$ 上验证,双重通过才替换 $p_n$,否则丢弃。
技术新颖性
技术新颖性体现在四点。第一,AgentGrad 首次把干预式调试中的'编辑-重放'机制变成优化回路的内生日信号源,把归因证据转化为伪标签——这是与 TextGrad(跨组件反向传播文本反馈)、GEPA(轨迹级反思+进化搜索)、MIPROv2(贝叶斯优化联合搜索指令与示范)的本质区别:后三者都没有智能体级别的中间监督。第二,逆序干预利用'失败集中在后期智能体'的经验规律,把每个失败的额外干预开销从最坏 $N$ 次降到期望更少,是一个简单但有效的工程洞察。第三,语义小批量加循环规模调度(5→3→1)构成一种课程化的聚合策略:先学共享面广的粗模式、再学精细修正、交替进行,消融显示它专门提升验证集通过率。第四,双重门控验证(先语义小批量、后验证集)让每次昂贵的验证调用都更可能有效,这直接解释了 2.5 倍 wall-clock 加速的来源;消融还表明 TI 与 AS 主要提升小批量改进率(0.51→0.87),STGA 用少量小批量率换取验证率,三者分工明确、互补而非冗余。
实验结果
在五个基准(HotpotQA 多跳问答、HoVer 声明验证、IFBench 指令遵循、PUPA 隐私改写、MATH 数学推理)上的发现如下。主结果:GPT-5-mini 上 AgentGrad 相对无优化基线平均提升 +11.76 分,超过 GEPA(+9.24)、TextGrad(+6.33)、MIPROv2(+5.66),其中 HotpotQA 73.89 对 GEPA 的 68.33,PUPA 95.17 对 91.87,HoVer 64.78、IFBench 76.08、MATH 87.62 均为最佳;Qwen3-8B 上平均 +9.67 同样全面领先(HotpotQA 60.45、HoVer 52.11、PUPA 91.51、IFBench 41.42、MATH 85.81)。消融(Table 3):单独目标识别 TI 在 HotpotQA/PUPA 上带来 +1.44/+3.84,加智能体级监督 AS 再 +1.56/+2.65,加语义抽象 STGA 再 +2.56/+3.55,完整模型 73.89/95.17。效率(Table 4):平均优化时间 136 分钟,为次快基线 GEPA(337 分钟)的 2.5 倍速、TextGrad(647 分钟)的 4.7 倍速,五个基准全部最快(HotpotQA 3.2×、IFBench 3.0×、PUPA 2.0×、HoVer 1.6×、MATH 1.4×);HotpotQA 上约 1,000 rollouts 即达约 70%,GEPA 需超 6,000。机理(Figure 4):小批量改进率 0.72 对 TextGrad 0.44、GEPA 0.28;验证改进率 0.27 对 0.21/0.14。迁移(Table 5):零再优化迁移到五个同域未见基准全部第一,如 2WikiMultiHopQA 51.22 对 GEPA 44.89。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| HotpotQA 多跳问答(GPT-5-mini) | 任务得分(%,3种子均值) | 73.89 ± 1.09 | GEPA 68.33 ± 1.55 | +5.56 |
| PUPA 隐私意识委派(GPT-5-mini) | 任务得分(%,3种子均值) | 95.17 ± 0.49 | GEPA 91.87 ± 1.55 | +3.30 |
| HoVer 声明验证(GPT-5-mini) | 任务得分(%,3种子均值) | 64.78 ± 1.44 | TextGrad 63.22 ± 1.47 | +1.56 |
| IFBench 指令遵循(GPT-5-mini) | 任务得分(%,3种子均值) | 76.08 ± 0.45 | GEPA 75.23 ± 0.32 | +0.85 |
| MATH 数学推理(GPT-5-mini) | 任务得分(%,3种子均值) | 87.62 ± 0.09 | GEPA 86.37 ± 0.50 | +1.25 |
| 五基准平均(GPT-5-mini,相对无优化基线) | 平均提升(分) | +11.76 | GEPA +9.24 / TextGrad +6.33 / MIPROv2 +5.66 | 高出最强基线 +2.52 |
| 五基准平均(Qwen3-8B,相对无优化基线) | 平均提升(分) | +9.67 | GEPA +7.62 | +2.05 |
| 平均 wall-clock 优化时间(五基准,GPT-5-mini) | 分钟(越低越好) | 136 | GEPA 337 / TextGrad 647 / MIPROv2 608 | 较 GEPA 加速 2.5×,较 TextGrad 4.7× |
| Prompt 迁移到 2WikiMultiHopQA(未见基准) | 任务得分(%) | 51.22 ± 1.63 | GEPA 44.89 ± 4.96 | +6.33 |
| Prompt 迁移到 PUPA-TNB(未见基准) | 任务得分(%) | 94.38 ± 0.83 | GEPA 91.51 ± 3.11 | +2.87 |
局限与改进
局限性方面:首先,方法依赖带奖励函数和标准答案(或明确输出约束)的训练数据来构造提示 $H$,在缺乏标注或奖励难以定义的任务上无法直接使用。其次,逆序干预基于'失败集中在后期智能体'的经验假设,若失败根源在早期智能体,逆序扫描会浪费 rollout;每轮仍无法通过干预修复的'困难样本'被暂时剔除,其能否最终解决取决于后续轮次的重新评估。第三,实验全部采用 GEPA(及文献 [6])提供的顺序流水线 MAS 拓扑,未验证并行分支、动态路由、带工具循环等更复杂的智能体结构。第四,语义聚类由聚合器 LLM 在单次调用内完成,未与基于 embedding 的聚类等替代方案对比,聚类质量难以保证;聚类规模下界的循环调度(5→3→1)是启发式设定,缺乏理论支撑。第五,任务模型与所有优化组件共用同一骨干(GPT-5-mini 或 Qwen3-8B),未探索异构配置;作者也承认干预提示只在训练期使用这一设计虽然干净,但隐含假设失败可以通过提示层面修复。
独立分析的弱点
独立分析的弱点:其一,归因开销随智能体数量线性增长——最坏情况下每个失败需要 $N$ 次额外干预 rollout,在数十个智能体的大系统里会显著吞噬预算 $B$,可先用失败模式检索或轻量分类器粗筛,只对高概率环节做干预验证。其二,提示 $H$ 的构造本质是任务特定工程(从标准答案提取线索或人工写约束),泛化到无明确标准答案的开放任务(开放式写作、仓库级代码修改)会很困难,可训练一个端到端的'提示生成策略'。其三,LLM 单次调用同时完成聚类与抽象,当样本级梯度很多时输出长度受限,可能粗糙处理或遗漏长尾失败模式,可引入 embedding 预聚类加 LLM 精炼的两阶段方案并对比质量。其四,只优化提示词、不动权重:当行为缺陷源于模型能力不足而非提示不清时天花板明显,而干预得到的($x^n,\tilde{y}^n$)对其实非常适合作为 SFT/DPO 数据微调智能体权重,论文未尝试这一更彻底的路径。其五,接受准则依赖 $\mathcal{D}_{val}$ 的点估计比较,小验证集上有过拟合验证集的风险,论文未报告相应的方差控制或早停策略。
未来方向
未来方向:作者层面可自然延伸的是把干预伪标签用于权重训练(SFT 或偏好优化),实现提示与参数的联合优化;将方法扩展到非顺序拓扑(并行分支、动态路由、带记忆与工具调用的循环智能体);探索异构骨干配置,例如用强模型优化弱模型系统的提示。基于本文成果可延伸的:把'语义小批量+循环规模调度'的聚合思想迁移到单智能体提示优化与指令微调数据筛选;建立跨任务持久化的失败模式记忆库,复用广义梯度以实现新任务上的少样本快速适配;以干预成功率本身为奖励训练归因策略,进一步压低每个失败的干预次数;研究优化后提示在跨域(而非仅同域)任务上的迁移规律,以及验证集有限的场景下更稳健的双门控接受准则。
复现评估
复现评估:论文为预印本,未明确给出开源代码链接,但复现材料较为充分——算法 1 给出完整伪代码,关键超参数(rollout 预算 $B$、聚类规模循环调度 5→3→1、提示 $H$ 的构造来源)均有说明;五个基准(HotpotQA、HoVer、IFBench、PUPA、MATH)全部公开,MAS 拓扑、数据划分与奖励函数沿用 GEPA 论文及文献 [6] 的公开设置,可直接对齐比较;骨干为 GPT-5-mini(API)与 Qwen3-8B(开源权重)。主要成本是 API 调用:每基准完整优化约 90–250 分钟、每个结果三个随机种子,总体预算可控。难点在于需要自行实现干预调度、聚合器与优化器的提示模板以及双重验证逻辑,而这些提示词的具体文本论文未完整披露,复现精度可能有一定折损。总体评估:复现难度中等,适合有 LLM API 工程经验的团队。
论文图表
四面板对比图。(a) 传统方法的梯度提取:盲目选目标提示词、只有系统级监督,☹ 标注'不知道改哪个提示词能修复失败';(b) AgentGrad 通过干预锁定目标智能体(如 Agent 3),用其干预修正输出做智能体级监督,🙂 '精确定位能修复失败的提示词';(c) 传统聚合:随机分组直接拼接(1+1=3 式的虚假信号),☹ '更新方向不连贯、泛化差';(d) AgentGrad 聚类共享模式并抽象成广义梯度,🙂 '语义连贯的更新方向与高泛化性'。
一图总览论文对现有方法两个阶段缺陷的诊断及对应解法,是理解全文动机与方法设计逻辑的入口。