← 返回 2026-08-19

Agentic ESOpt:只需最低GPU需求的长程LLM智能体进化策略微调框架 Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements

Zhi Zheng, Rongsheng Chen, Yunpeng Ba, Zhenkun Wang, Yee Whye Teh, Wee Sun Lee 📅 2026-08-18 👍 104 2026-08-24 18:30
Agentic RL LLM智能体 全参数微调 测试时计算 进化策略 长程推理

用进化策略替代反传式RL,以推理级显存全参数微调长程智能体,且horizon越长优势越大

前置知识

进化策略(Evolution Strategies, ES)

黑盒零阶优化:在参数 $\theta$ 周围采 $G$ 个高斯扰动 $\epsilon_i\sim\mathcal{N}(0,I)$,各前向评估得奖励 $R_i$,按 $\theta\leftarrow\theta+\frac{\alpha}{G}\sum_i\hat{R}_i\epsilon_i$ 更新。相当于估计高斯平滑目标的梯度,只需标量奖励、无需反传。

全文的方法、显存优势和 σ 调度都建立在 ES 估计量上,不熟悉 ES 的采样-评估-更新循环就读不懂正文。

GRPO/PPO 与 credit assignment

GRPO 对同一任务采 $G$ 条轨迹,用组内相对优势 $A_i=(R_i-\mathrm{mean})/(\mathrm{std}+\epsilon)$ 把奖励分到各 turn 的 score 项 $\nabla_\theta\log\pi_\theta(a_t|s_t)$;多轮版常改用 PPO 加 critic。终局奖励归因到各步决策即 credit assignment。

论文核心论点是 PG 要对 $H$ 个动作 score 求和、方差随 horizon 线性增长,而 ES 不累积;必须懂 PG 结构才能理解该对比。

长程稀疏奖励与 horizon

智能体交互 $H$ 轮形成轨迹 $\tau$,回报 $R(\tau)=\sum_t\gamma^{t-1}r_t$;稀疏奖励指中间 $r_t=0$、只有终局有分。论文用最小成功 horizon $H^*$(如数独遮 15 格)控制难度,每步正确率 $p$ 按 $S=p^{H^*}$ 复合放大。

$H$ 与 $H^*$ 是全部实验的自变量,「horizon 增长时 ES 反超 RL」是全文核心主张。

Prompt 空间优化与测试时计算

冻结 LLM、只优化外部上下文的方法族:Trace2Skill 从轨迹蒸馏技能文档、EoH 进化启发式代码种群、Reflexion/Voyager 等记忆技能系统,以及测试时采样搜索。它们轻量,但只能重组冻结策略已有的行为,无法改变策略本身。

ESOpt 的第二卖点是经黑盒接口与这些方法共享 rollout、实现 prompt–parameter 共进化,实验与 Trace2Skill、EoH 的组合是关键结果。

高斯平滑偏差与正则化

ES 实际优化 $J_\sigma(\theta)=\mathbb{E}_\epsilon[J(\theta+\sigma\epsilon)]$,展开为 $J_\sigma=J+\frac{\sigma^2}{2}\mathrm{Tr}\nabla^2J+O(\sigma^4)$。二阶迹项惩罚尖锐局部最优、偏好平坦区域;$\sigma$ 越大正则越强但偏差也越大。

这是理解 σ 余弦退火设计的理论基础:训练保留 $\sigma_T>0$ 作正则,测试时衰减到 0 消除偏差。

研究动机

RL 微调 LLM 智能体在单轮任务上很成功,但放进长程智能体场景就暴露两大硬伤。其一是显存:Agentic GRPO/PPO 要沿整条交互轨迹保存激活、维护参考模型与优化器状态并反传——Qwen3.5-4B 推理只需 8.41GB,其 GRPO 训练却要 58.88GB、Turn-PPO 高达 89.40GB;到 27B 规模,全参数 Agentic RL 在 4×H100 80GB 上已完全不可行。其二是长程 credit assignment:任务只有稀疏终局奖励,轨迹越长、分支越多,把一个标量回报分解回 $H$ 个决策越难——GRPO 的组相对优势覆盖不了多轮,PPO 依赖 critic 预热且稀疏奖励下早期优势不可靠,而策略梯度须对 $H$ 个动作 score 求和,方差在弱相关假设下近似随 $H$ 线性增长($\mathrm{Var}[\hat{g}_{PG}]\propto H$)。数独 $H^*=15$ 实验清晰呈现了这些困难:PPO 崩溃到 0%,GRPO 训练轨迹膨胀到 45 轮预算上限。

本文的目标是本文的目标是论证并实现一个命题:对长程、稀疏反馈的 LLM 智能体,进化策略(ES)不是 RL 的廉价替身,而是更匹配的全参数微调范式。具体构建名为 Agentic ESOpt 的框架,同时达成三点:一是只需推理级 GPU 显存即可全参数优化,把微调 Qwen3.5-27B 级别网页智能体的门槛降到 4×H100 80GB;二是提供轻量的黑盒标量反馈接口,能与 Trace2Skill 等技能空间优化、EoH 等测试时计算方法即插即用地组合,实现参数与提示的共进化;三是通过扰动尺度 σ 的余弦退火改善探索–利用权衡。最后在可控长程数独、ReAct 风格工具调用(Math/DocVQA)、WebArena-Lite 网页智能体和自动启发式设计四类任务、4B–27B 模型上系统性验证:ES 的优势随 horizon 增长而扩大。

与已有工作不同的是,已有单轮场景的 ES 微调工作(Qiu et al. 2026 等)给出的结论是:ES 更省显存但性能略逊于 RL,只是「便宜的替代品」。本文的独特切入点是指出这一结论会随 horizon 增长而反转:RL 估计量的方差结构里含有对 $H$ 个动作 score 的求和,而 ES 的参数 score $\epsilon/\sigma$ 对整条轨迹只采样一次、不随 $H$ 累积——因此长程恰恰是 ES 的主场,ES 可以「显著优于」而不只是「不差于」RL。为干净地验证这一点,作者构造了最小成功 horizon 严格可控(遮 5/10/15 格)的多轮数独环境,观察到教科书式的排序交叉:$H^*=5$ 时 PPO 最强、$H^*=10$ 时 GRPO 最强、$H^*=15$ 时 ESOpt 反超最强 GRPO 12.5 个百分点。另一个差异化设计是利用 ES 的黑盒接口做 prompt–parameter 共进化:参数更新可以作为「算子」嵌入现有测试时搜索脚手架(EoH 的变异算子 m1/m2)而不改动外层结构,这是需要完整计算图的梯度式 RL 难以做到的。

核心方法

直觉上,Agentic ESOpt 把微调变成参数空间的群体随机搜索:不反传梯度,而是同时试 $G$ 份「加了参数噪声的模型」,谁在环境里奖励高,就把参数朝那些方向加权挪一步。技术上,ES 优化目标的高斯平滑版本 $J_\sigma(\theta;c)=\mathbb{E}_{\epsilon\sim\mathcal{N}(0,I)}[J(\theta+\sigma\epsilon;c)]$,其伪梯度为 $\nabla_\theta J_\sigma=\frac{1}{\sigma}\mathbb{E}_\epsilon[J(\theta+\sigma\epsilon)\epsilon]$。实现上每代采 $G$ 个全参数扰动 $\epsilon_i$,各自 rollout 得奖励 $R_i$,组内 z-score 归一化后更新 $\theta\leftarrow\theta+\frac{\alpha}{G}\sum_i\hat{R}_i\epsilon_i$。工程上用 one-sided 扰动:原地加 $\sigma\epsilon_i$ 评估后减回,只存整数种子即可重放方向,训练显存与推理相同;再配合 σ 的余弦退火,前期大半径广探索、后期小半径精细适应。

核心创新是与 Agentic RL 的三点本质区别。第一,模型可扩展性:RL 必须存轨迹激活、参考模型和优化器状态,而 ES 更新是 forward-only 的,显存即推理显存——4B 模型上 8.41GB 对 GRPO 的 58.88GB(低 85.7%),并首次让 27B 网页智能体的全参数微调在 4×H100 上可行。第二,长程可扩展性:策略梯度估计量 $\hat{g}_{PG}=(R-b)\sum_{t=1}^{H}\nabla_\theta\log\pi_\theta(a_t|s_t)$ 的方差在弱相关假设下 $\approx H\,\mathrm{Var}[R]\,\Sigma_u$,随 horizon 线性增长;而 ES 估计量 $\hat{g}_{ES}=(R-b)\,\epsilon/\sigma$ 对整条轨迹只采样一个连贯的参数变异,把终局奖励直接归因到这个变异上,不需要让一个标量去区分 $H$ 个决策。第三,灵活性:标量奖励黑盒接口使 ES 更新可与技能优化共享同一批 rollout,交替执行 $\theta_{t+1}=U_{ES}(\theta_t;c_t,D_t)$ 与 $c_{t+1}=U_c(c_t;D_t)$,实现 prompt–parameter 共进化——这是需要穿过整条轨迹反传的 RL 做不到的。

方法步骤详情

流程五步。(1) 初始化:固定外部上下文 $c$,设定群体 $G$、调度 $\sigma_0\to\sigma_T$、步长 $\alpha$(配置见 Table 20)。(2) 扰动 rollout:第 $t$ 代由种子重放 $G$ 个方向,各扰动模型 $\pi_{\theta+\sigma_t\epsilon_i}$ 在同一批任务上交互采样,输出轨迹与标量奖励——数独每方向 32 题成功率、WebArena 每方向 8 任务、AHD 每方向一个启发式目标。(3) 归一化:组内 z-score $\hat{R}_i=(R_i-\mu_R)/(s_R+\varepsilon)$,统一异质奖励,全无效批次跳过更新。(4) 更新:$\theta\leftarrow\theta+\frac{\alpha}{G}\sum_i\hat{R}_i\epsilon_i$,省略显式 $1/\sigma$。(5) σ 调度:$\sigma_t=\sigma_T+(\sigma_0-\sigma_T)\frac{1+\cos(\pi t/T)}{2}$;训练保留非零 $\sigma_T$ 作正则(数独 $10^{-3}\to2.5\times10^{-4}$),测试 $\sigma_T\to0$ 消除偏差(AHD)。典型规模:数独 $G=32$、100 代;Math/DocVQA $G=16$;WebArena $G=8$、70 批。

技术新颖性

新颖性有四。其一,定位创新:不同于把 ES 视作「省显存的次优选择」的单轮 ES 工作(Qiu et al. 2026 等),本文首次给出「ES 在长程下结构性优于 RL」的方差分析(附录 C.3:$\mathrm{Cov}(\hat{g}_{PG})\approx H\,\mathrm{Var}(\tilde{R})\Sigma_u$,而 ES 参数 score 不对 turn 求和),并用可控 $H^*$ 实验验证排序交叉,把 ES 从 cheaper alternative 升格为 better-matched paradigm。其二,σ 余弦退火:基于平滑偏差引理 $J_\sigma=J+\frac{\sigma^2}{2}\mathrm{Tr}\nabla^2J+O(\sigma^4)$,首次区分两种目标——训练保留 $\sigma_T>0$ 作正则(消融证明去掉会过拟合),测试 $\sigma_T\to0$ 消除偏差。其三,prompt–parameter 共进化的系统验证:把 ES 更新作为算子插入 EoH 的 m1/m2 变异、与 Trace2Skill 顺序组合,均不改外层脚手架。其四,工程实现:one-sided 扰动加种子重放使训练显存等于推理显存,群体 z-score 归一化提供跨异质奖励的统一接口。

Agentic ESOpt 的详细工作流程
Figure 2: Agentic ESOpt 的详细工作流程

实验结果

四组实验的核心发现。(1) 可控数独(Qwen3.5-4B):随 $H^*$ 增大出现排序反转——$H^*=5$ 时 PPO 90.63% > ESOpt 89.58% > GRPO 85.42%;$H^*=10$ 时 GRPO 67.71% > ESOpt 62.50%;$H^*=15$ 时 ESOpt 53.13% 领先最强 GRPO 12.50 点,PPO 崩溃至 0%。显存仅 8.41GB(比 GRPO 58.88GB 低 85.7%),$H^*=15$ 墙钟 9.4h 约为 GRPO 19.0h 的一半;消融:去掉余弦退火降至 42.71%,$\sigma_T=0$ 过拟合降至 28.13%。(2) ReAct 工具调用(4B):DAPO Mean@4 从 63.0 提至 76.8(GRPO 68.8)、AIME 2026 从 55.8 提至 70.8(GRPO 58.3)、DocVQA 从 40.3 提至 52.5,平均超基线 13.7、超 GRPO 8.3 点,各 Pass@K 全面占优(AIME Pass@4 96.7%)。(3) WebArena-Lite(27B 全参数):No Skill 29.47%→36.16%(+6.69),超 GPT-5.4 的 34.14%;+Trace2Skill 33.94%→36.36%。(4) 自动启发式设计(LLaMA-3.1-8B):36 组对照 28 组提升,EoH+ESOpt 构造式 12 项全胜(TSP gap 降 7.83%,ASP +29.18%)。群体敏感性:4B 的 $G$ 从 8 翻到 16,最终成功率 +677%,9B 则为 0%,暗示越强骨干所需扰动方向越少。

Agentic Sudoku 按最小成功 horizon H* 分组的最终评估成功率与 GPU 显存需求
Table 1: Agentic Sudoku 按最小成功 horizon H* 分组的最终评估成功率与 GPU 显存需求
Agentic Sudoku 上的训练计算量与墙钟时间
Table 2: Agentic Sudoku 上的训练计算量与墙钟时间
No Skill 与 Trace2Skill 上下文下的数学推理与 DocVQA 结果
Table 3: No Skill 与 Trace2Skill 上下文下的数学推理与 DocVQA 结果
WebArena-Lite 成功率(%)
Table 4: WebArena-Lite 成功率(%)
总评估预算 T∈{1000, 2000} 下的构造式启发式设计结果
Table 5: 总评估预算 T∈{1000, 2000} 下的构造式启发式设计结果
15 轮数独上 Vanilla-ES 的群体规模敏感性
Table 6: 15 轮数独上 Vanilla-ES 的群体规模敏感性
Qwen3.5-27B WebArena 上 Agentic ESOpt 后参数更新幅度的分布(σt=1.5×10⁻³)
Table 7: Qwen3.5-27B WebArena 上 Agentic ESOpt 后参数更新幅度的分布(σt=1.5×10⁻³)
跨设置的 Agentic ESOpt 配置汇总
Table 20: 跨设置的 Agentic ESOpt 配置汇总
Agentic Sudoku 按最小成功 horizon H* 分组的性能
Figure 3: Agentic Sudoku 按最小成功 horizon H* 分组的性能
群体规模扩展的直觉示意
Figure 4: 群体规模扩展的直觉示意
数独任务(H*∈{5,10,15})中 Qwen3.5-4B 检查点周围的二维高斯平滑奖励景观
Figure 5: 数独任务(H*∈{5,10,15})中 Qwen3.5-4B 检查点周围的二维高斯平滑奖励景观
长程数独的 turn 级诊断
Figure 6: 长程数独的 turn 级诊断
DAPO、AIME 2026、DocVQA ANLS 与 DocVQA 准确率的重复采样曲线
Figure 7: DAPO、AIME 2026、DocVQA ANLS 与 DocVQA 准确率的重复采样曲线
No Skill Qwen3.5-27B Agentic ESOpt 运行在 WebArena-Lite 全集上的评估成功率
Figure 9: No Skill Qwen3.5-27B Agentic ESOpt 运行在 WebArena-Lite 全集上的评估成功率
查看结构化数据
任务指标本文基线提升
长程多轮数独($H^*=15$,Qwen3.5-4B) 任务成功率(3 次评估均值±标准差) 53.13% ± 2.55 最强 Agentic GRPO 40.63% ± 2.55;PPO 0.00%;基座模型 10.42% +12.50 个百分点
ReAct 数学推理 DAPO(Qwen3.5-4B) Mean@4 准确率(%) 76.8(+Trace2Skill 77.3) No Skill 63.0;Agentic GRPO 68.8 较基线 +13.8、较 GRPO +8.0 个百分点
AIME 2026 分布外数学(Qwen3.5-4B) Mean@4 / Pass@4 准确率(%) 70.8 / 96.7 No Skill 55.8 / 86.7;Agentic GRPO 58.3 / 76.7;Qwen3.5-27B 76.7 / 93.3 较基线 +15.0、较 GRPO +12.5 个百分点,Pass@4 超过 27B
DocVQA 文档工具调用(Qwen3.5-4B) Mean@4 准确率(%)/ ANLS 52.5 / 0.5043 No Skill 40.3 / 0.3875;Agentic GRPO 48.0 / 0.4627 准确率 +12.3 个百分点,ANLS +0.1168
WebArena-Lite 网页智能体(Qwen3.5-27B 全参数微调) 165 任务成功率(3 次均值,%) 36.16 ± 0.70(+Trace2Skill 36.36 ± 0.86) No Skill 29.47 ± 1.14;Trace2Skill 33.94 ± 3.37;GPT-5.4 34.14 ± 0.76 +6.69 / +2.42 个百分点,并超过 GPT-5.4
自动启发式设计(构造式 TSP/KP/ASP + ACO 式 TSP/CVRP/BPP,LLaMA-3.1-8B) 匹配评估预算下的对照获胜数 36 组对照中 28 组提升(构造式 21/24) Sample / EoH(相同评估预算 T=1000/2000) ESOpt+EoH 构造式 12 项全胜;TSP N=20 归一化 gap 降 7.83%~22.96%,ASP 最高 +29.18%

局限与改进

作者承认的局限有三:一是引入新超参 σ 及其调度,最优值依赖模型、奖励分布和环境,尽管 5 个实验共用 $\sigma_0\approx10^{-3}$、$\alpha\approx5\times10^{-4}$ 的通用配置,自动调度仍是开放问题;二是以更多独立环境评估换取省下的反传算力,当环境评估本身极贵(真实浏览器、工业 API)时 rollout 成本会主导总预算;三是 ES 更新严格上是稠密的、含与目标无关的随机游走成分,对持续学习的影响未明——尽管 96.26% 的更新幅度不超过 σ、99.42% 小于 $2\times10^{-3}$(Table 7)。我的补充观察:可控实验只到 $H^*=15$(预算 45 轮),离真正超长程尚远且数独偏合成;RL 基线只有 8-rollout GRPO 和一个崩溃的 Turn-PPO,缺少更强的 turn-level credit 变体或课程学习对照,交叉结论的普适性待检验;WebArena 的 Reddit 类任务反降 1.58 点、AHD 中 ESOpt+Sample 有 2 例回归,增益并非处处成立;理论依赖「奖励与单步 score 弱相关」等近似假设,作者也声明这并非断言 ES 总方差与 $H$ 无关。

独立分析的弱点

独立分析出四个弱点。其一,环境评估成本:ES 把计算从反传挪到 rollout,$G=32$ 对 GRPO 的 8 条轨迹,在真实网页环境中一次评估可能耗时数分钟,总成本可能反超 RL;改进方向是引入轨迹回放/重要性采样复用旧评估,或对扰动方向做低维子空间参数化以减少所需群体。其二,弱骨干的群体敏感:4B 模型在 $G=8$ 时几乎学不动(最佳仅 5.10%),说明小模型上 ES 需要大群体,直接推高成本;可结合结构化噪声先验(按层/模块采样扰动、利用梯度方向缓存)提升单位方向的信息量。其三,稠密更新不利于持续学习:ES 每步全参数移动,多任务顺序训练可能灾难性遗忘,论文只测了单任务内适应;可对更新做 top-k 稀疏化(只保留幅度最大的坐标)或加 EWC 式约束,Table 7 显示 83.68% 的更新已在 $10^{-3}$ 以内,稀疏化空间很大。其四,标量奖励浪费结构信息:ES 完全忽略环境可提供的每步合法性、中间反馈等信号,而这些恰是 RL 擅长利用的;可以设计混合目标——ES 负责长程全局参数搜索,叠加轻量的 turn 级辅助信号,兼顾长程归因与局部信用,避免 PPO 式 critic 的预热问题。

未来方向

作者提出的方向包括:建立群体大小 $G$ 与模型能力的 scaling law,并把 Agentic ESOpt 推向前沿级 LLM 与在线适应场景(专有工具、API、复杂工作流);开发量化友好的 ES 基础设施,包括 scale-aware 噪声生成与数值稳定的种子重放,把全参数 ES 微调推进到量化模型;以及更紧耦合的技能–参数共进化,让外部上下文 $c_t$ 与参数 $\theta_t$ 以相近时间尺度相互塑造、持续重定义彼此看到的数据分布。基于本文成果还可延伸:一是 ES+RL 混合范式——用 ES 做长程全局参数搜索、对关键决策步叠加局部优势估计,取长补短;二是把「强骨干需要更少扰动方向」的初步发现(Table 6)发展成可预测的样本效率理论,指导何时选 ES 何时选 RL;三是把 AHD 中「参数随测试时搜索在线进化」的模式推广到更多测试时计算形式(树搜索、reflection 循环),实现真正的推理期自改进;四是研究自动 σ 调度与自适应群体大小,并在昂贵评估的真实环境中用模拟器或代理模型验证实用边界。

复现评估

复现条件较好。代码已开源(https://github.com/zz1358m/Agentic-ESOpt);数据公开或易重建:数独每档 $H^*$ 仅 32 训练 + 32 评估实例,Math 用 400 道 DAPO 训练、100 道 held-out + 30 道 AIME 2026,DocVQA 50 训练/100 评估,WebArena-Lite 为官方 165 任务,AHD 用标准组合优化问题。算力明确:数独与 Math 用 4×H100 80GB(ESOpt 只需推理级显存,27B 全参数也在 4×H100 内完成),AHD 仅需 8×RTX 3090 24GB。超参跨任务高度一致($\sigma_0\approx10^{-3}$、$\alpha\approx5\times10^{-4}$,附录 D.6 的 Table 20 一站式汇总),附录提供全部提示词与技能。难点:ES rollout 吞吐大(数独每代 32 方向 × 32 任务 × 100 代),多轮环境采样是瓶颈;WebArena 环境搭建繁琐;闭源 GPT-5.4 参照无法严格复现。总体属中低难度、主要吃采样算力的复现。