Agent-G²:面向智能体强化学习的高斯引导框架 Agent-G^2: Gaussian Guidance for Agentic Reinforcement Learning
把提示深度从单一标量改为在线估计的高斯分布,零额外采样实现每任务自适应引导
前置知识
GRPO(组相对策略优化)
GRPO 是 DeepSeekMath 提出的在线强化学习算法:对每个任务(prompt)采样一组 $R$ 条 rollout(本文 $R=8$),用组内奖励的均值和方差把每条 rollout 的二元奖励归一化为相对优势,从而省去价值网络。本文以 GRPO 作为主干策略优化器,所有 hint 基线也共享同一 GRPO 骨干,以便把'前缀深度分配'隔离为唯一变量。
本文的调度参数完全从 GRPO 已采集的 rollout 统计量(成功率 $\hat{p}_i$、组内方差 $V_k$)在线估计,主结果和消融也都以 GRPO 为对照;不懂 GRPO 就无法理解'零额外成本'到底省在哪里。
奖励稀疏与优势坍缩
长视野智能体任务(如 ALFWorld 家务、WebShop 购物)往往需要十几到几十步交互,却只在回合终止时给出 0/1 奖励。当策略从初始状态几乎无法完成任务时,一组 rollout 的奖励全为 0,组内没有对比,GRPO 的组归一化优势失去梯度——这就是优势坍缩(advantage collapse),是从零探索训练智能体的核心障碍。
hint-based RL 正是为解决这一问题而生:注入专家轨迹前缀让 rollout 更容易成功、恢复组内对比度。本文的全部动机都建立在这个痛点之上。
Hint-based RL 与引导深度(guidance depth)
在每次 rollout 前先执行专家轨迹 $\tau^\star$ 的前 $n$ 步,让策略从更接近成功的状态开始探索。引导深度 $d$(或比例 $r = n/L$)决定保留多少前缀:$d$ 太小则 rollout 仍然几乎全失败(欠引导,$p_i(d)<0.4$);$d$ 太大则任务被专家'做完',奖励饱和、没有学习对比(过引导,$p_i(d)>0.6$)。本文深度以比例表示,前缀长度为 $n_i=\min(\lceil r_i L_i\rceil, L_i-1)$。
深度如何选择正是本文的研究对象:Schedule-based 与 Probe-based 两类方法的分歧、以及本文的高斯化改造,全都围绕这一个量展开。
最近发展区与 in-band 目标
源自 Florensa et al. 2018 的自动课程思想:训练信号在成功率处于中间地带(本文取 $[0.4, 0.6]$)时最大——任务既非必败也非必成。Bernoulli 方差 $p(1-p)$ 在 $p=0.5$ 处取峰值、在 $p=0$ 或 $1$ 处为 0,是'训练信息量'的自然代理。本文把 $p_{target}=0.5$ 作为全局基线的移动方向、把 $[0.4,0.6]$ 定义为 in-range 带,并据此诊断各调度器把多少任务分配到了带外。
理解为什么 $0.4$–$0.6$ 是'最值得训练'的区间、以及为什么覆盖整个带比命中单点更好,是读懂第 2 节诊断和全部方法设计的钥匙。
研究动机
用 RL 端到端训练 LLM 智能体时,长视野任务(ALFWorld 的家务操作、WebShop 的网页购物往往需要十几到几十步交互)只在终止时给一个二元奖励,从初始状态探索几乎不可能撞出成功轨迹,GRPO 式训练会因组内奖励全同而出现优势坍缩。Hint-based RL 通过在 rollout 前执行专家轨迹的一段前缀来缓解,但效果对'引导深度'极其敏感:太浅则 rollout 仍然全错,太深则奖励饱和失去对比。现有两类方法都不理想:(1) Schedule-based 方法(Linear/Cosine/Step decay、Target-acc)从训练步数或 batch 反馈算出一个标量深度、全批共享。作者在 Qwen2.5-1.5B/ALFWorld 第 50 步的诊断显示,三个步数式调度器只有 15%–23% 的任务组落在 in-range 带 $[0.4,0.6]$ 内,最好的 Target-acc 也有 38% 错配,且该结构性错配在 5 个检查点上持续存在(平均错配率 39.8%–65.3%);(2) Per-sample probing 方法(Binary Search/Enumeration)为每个任务额外采样定位深度,Binary Search 在 $M_{probe}=2$ 时仍留 75% 错配,Enumeration 要做到近零错配需要 $M_{probe}=32$、即 20 倍于 GRPO 的 rollout 预算。此外这些方法几乎都在结构均匀的数学推理任务上开发,而智能体任务同一 batch 内难度差异巨大(两步的 Pick vs 二十步的 Pick Two),共享标量更水土不服。
本文的目标是本文的目标是把引导深度从'寻找一个点'改为'覆盖一个邻域'。作者先通过诊断实验确立问题的新结构:把每个任务的成功率轮廓按相对深度 $\Delta d = d - d^\star_i$ 对齐后,训练信息量(以 Bernoulli 方差 $p_i(d)(1-p_i(d))$ 度量)呈单峰、近似对称的带状分布,高斯拟合给出 $\sigma=0.22$、$R^2=0.92$,且该拟合在训练早中晚三个窗口都稳定($R^2\in[0.89,0.94]$)——即有用的深度不是孤立最优点 $d^\star_i$,而是围绕它的一段区间。基于此,方法目标是:为每个任务维护一个深度分布并从中采样,使采样以高概率落进该任务的 in-range 带;分布参数必须完全由已为策略优化采集的 rollout 统计量在线估计,不引入任何探针 rollout、辅助网络或学习型深度预测器;最终在 ALFWorld/WebShop 两个长视野智能体基准、1.5B/7B 两个模型规模上,以远低于探针方法的成本超过全部 hint-based、hint-free 与 Aux-RL 基线。
与已有工作不同的是,本文的独特切入在于对问题结构的重新刻画,而非在'怎么选标量'上继续内卷。已有工作(无论调度式还是探针式)共享同一个隐含假设——每个任务存在一个最优深度,区别只是用便宜但粗糙的方式估计它,还是用昂贵但精确的方式定位它;本文证明这个假设本身错位:信息量轮廓是带状而非尖峰,正确做法是以分布形式覆盖整个邻域。在此认识上,作者提出用两参数高斯 $\mathcal{N}(\mu_i, \sigma_i^2)$ 刻画每任务深度分布,其两个矩恰好与 batch rollout 天然产出的两个统计量对齐——全局基线 $\mu_{global}$ 追踪策略整体进度、簇级统计 $A_k/V_k$ 修正难度差异并控制带宽,从而实现'训练即校准'的闭环:同一批为 GRPO 采集的 rollout 既更新策略又刷新分布,每任务深度差异化零额外成本。这同时绕开了两类已有方法的根本缺陷:共享标量抹平批内异质性、逐样本探针付出 $O(\log n)$ 到 20 倍预算的代价。
核心方法
直觉上,Agent-G² 把'给每个任务挑一个最优提示深度'改写为'给每个任务一个深度概率分布并从中抽样':训练初期策略很弱,几乎所有任务都需要接近完整的专家前缀;随着策略成长,简单任务需要的深度迅速变浅,难任务仍依赖深提示,且此时任务间差异最大,因此分布应当按任务难度各自移动中心、并保持足够宽度以覆盖'刚好可学'的深度带;训练后期任务基本都能独立完成,深度收缩到 0。技术路线分四步:(1) 离线按专家轨迹长度把训练集分成 $K=3$ 个难度簇(ALFWorld 上对应 Short: Pick/Look、Medium: Clean/Heat/Cool、Long: Pick2);(2) 在线维护全局基线 $\mu_{global}$ 和每簇 EMA 统计量 $A_k$(簇均成功率)与 $V_k$(簇内方差);(3) 每个任务计算 $\mu_i=\mathrm{clip}(\mu_{global}+\lambda(p_{target}-A_k),0,1)$、$\sigma_i=\max(\gamma V_k,\sigma_{min})$,从中采一个深度比例并转成前缀长度,执行专家前缀后从该状态跑 $R=8$ 条 rollout;(4) 用 GRPO 损失加前缀 teacher-forcing 辅助损失更新策略,再用同一批 rollout 的成功率反向刷新 $\mu_{global}, A_k, V_k$,形成闭环。
核心创新是'深度分布化 + 免费在线矩估计'。与 Schedule-based 方法的本质区别:后者输出一个全批共享的确定性标量 $d_t$,把两步任务和二十步任务强行拉到同一深度,诊断显示其超过一半分配落在信息带外;Agent-G² 为每个任务独立采样 $z_i\sim\mathcal{N}(\mu_i,\sigma_i^2)$,同簇任务共享分布参数但独立采样产生任务级差异。与 Probe-based 方法的本质区别:后者为了定位单个深度而额外支付探针 rollout(Binary Search 每样本 $O(\log n)$ 条、Enumeration 近零错配需 20 倍预算);Agent-G² 的高斯两矩与 rollout 统计量天然对齐——$\mu_i$ 由 $\mu_{global}$ 加簇级修正构成,其中 $\mu_{global}$ 按 batch 成功率 $acc_B$ 朝 $p_{target}=0.5$ 方向以步长 $\Delta=0.1$ 更新(成功率低则加深引导、高则减浅),$\sigma_i$ 取簇内成功方差 $V_k$ 的线性缩放,这些量在每次 GRPO 更新后免费得到,无需任何学习型深度预测器。消融进一步证明关键不是高斯形状本身而是随机覆盖:换成方差匹配的均匀分布掉 7.0 点,把采样关掉($\sigma_i=0$)掉 5.5 点,说明'覆盖带'才是本质。
方法步骤详情
每个训练 batch 的完整流程(Algorithm 1)如下。第一步,难度分簇(离线一次性):按专家轨迹长度分位数把任务划入 $K=3$ 个簇,$k(i)$ 记任务 $i$ 所属簇。第二步,计算每任务分布:$\mu_{global}$ 初始化 0.8(偏深),$A_k,V_k$ 初始化 0,仅决定首批调度;对 batch $B$ 先算全局平均成功率 $acc_B=\frac{1}{|B|}\sum_i \hat{p}_i$,按 $\mu_{global}\leftarrow\mathrm{clip}(\mu_{global}+\mathrm{sign}(p_{target}-acc_B)\cdot\Delta,0,1)$ 更新($\Delta=0.1$);再对每个出现的簇 $B_k$ 计算簇内均值 $\bar{p}_{B_k}$ 与方差 $v_{B_k}$,用 EMA($\alpha=0.2$)折入 $A_k,V_k$。第三步,每任务采样与 rollout:任务 $i$ 取 $\mu_i=\mathrm{clip}(\mu_{global}+\lambda(p_{target}-A_k),0,1)$、$\sigma_i=\max(\gamma V_k,\sigma_{min})$($\sigma_{min}=0.1$),采 $z_i\sim\mathcal{N}(\mu_i,\sigma_i^2)$、$r_i=\mathrm{clip}(z_i,0,1)$,前缀长度 $n_i=\min(\lceil r_i L_i\rceil,L_i-1)$,在环境中执行专家前 $n_i$ 步到达状态 $s_i$,从 $s_i$ 独立 rollout $R=8$ 条并记录二元奖励 $y_{i,j}$。第四步,策略更新:$\mathcal{L}(B)=\mathcal{L}_{GRPO}(B)+\eta\,\mathcal{L}_{aux}(B)$,其中 $\mathcal{L}_{aux}=-\sum_i\sum_t \log\pi_\theta(a^\star_{i,t}\mid s_{i,t},q_i)$ 是对采样前缀的 teacher-forcing 模仿损失($\eta=0.5$)。第五步,调度反馈:用同一批奖励算 $\hat{p}_i$,回到第二步刷新全局与簇统计量,进入下一 batch。全程无探针 rollout、无辅助网络。
技术新颖性
技术新颖性体现在四个层面。其一,问题重定义有实证支撑:作者不是假设带状结构,而是用每 (task, depth) 32 rollouts 的枚举式诊断把它测出来——in-range 带 $[0.4,0.6]$ 横跨多个相邻深度,Bernoulli 方差沿 $\Delta d$ 对齐后单峰对称,高斯拟合 $\sigma=0.22$、$R^2=0.92$,并在训练早中晚三窗口($R^2\in[0.89,0.94]$,$\sigma$ 从 0.198 漂移到 0.231)和五个检查点的错配率上交叉验证,方法论自洽。其二,global-local 分解的参数化设计:两参数高斯之所以够用,是因为其均值/方差分别对应 batch 天然产出的簇级统计,而 Student-t 等重尾族还需要额外形状参数、无法从 rollout 聚合量直接读出;截断高斯采样在 $r\in[0,1]$ 上闭式且数值稳定。其三,调度与优化共用同一批数据的闭环架构,使每任务差异化的边际成本为零,这是效率优势(88s/step vs 探针法 285–425s)的直接来源。其四,调度行为完全可解释:训练动态显示深度分布在 $t=5$ 饱和($\mu\approx 1$)、$t=30$ 簇分离(0.19/0.35/0.68)、$t=75$ 方差峰值($\sigma$ 最高 0.23)、$t=200$ 收敛到 0,与'课程从深到浅、带宽先宽后窄'的直觉一致,而非黑箱。
实验结果
主结果(Table 1):ALFWorld 上 Agent-G² 达到 95.3%(Qwen2.5-1.5B)与 98.4%(7B)总体成功率。1.5B 时比最强 hint-based 基线 Target-acc(93.8%)高 1.5 点、比最强 hint-free 基线 BEACON(91.4%)高 3.9 点、比最强 Aux-RL 基线 RLVMR(87.9%)高 7.4 点、比最强探针基线 Enumeration(86.0%)高 9.3 点;7B 时以 2.3 点优势超过 Enumeration(96.1%),六个子任务中五个达到 100%。WebShop 上取得 92.3 reward score 与 78.9%/84.4%(1.5B/7B)购买成功率,是两个规模上最强的非探针方法。跨规模看,1.5B 的 Agent-G²(95.3%)已超过所有 7B 非探针基线,说明调度设计能部分替代骨干扩缩。效率(Table 2、Figure 6a):每步墙钟 88s,比调度式基线(57–80s)略高但远低于 Binary Search(285s,3.24×)与 Enumeration(425s,4.83×),且收敛到调度基线最终精度只需约一半梯度步。Beyond imitation(Figure 5a):Full SFT 56.3%、Sampled-Prefix SFT 26.6%,与 95.3% 相差的 68.4 点隔离出前缀后状态上 RL 的贡献。消融(Table 3):关闭采样($\sigma_i=0$)降到 89.8%(↓5.5)、换均匀分布 88.3%(↓7.0)、去自适应中心 91.4%(↓3.9)、去自适应散度 93.8% 且 Long 任务 94.7→78.3、$K=1$ 时 89.1% 且 Long 掉 29.3 点、去 $\mathcal{L}_{aux}$ 86.7%(↓8.6)、去 $\mathcal{L}_{GRPO}$ 崩至 26.6%(↓68.7)。聚类设计(Table 8):$K=3$ 得 95.3±2.3、$K=5$ 得 96.5±1.9、$K=10$ 崩至 86.2、随机分组 89.4,证明增益来自难度对齐而非分组本身。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ALFWorld 总体成功率(Qwen2.5-1.5B-Instruct) | 成功率 % | 95.3 | Target-acc 93.8(最强 hint-based)/ BEACON 91.4(最强 hint-free)/ RLVMR 87.9(最强 Aux-RL)/ Enumeration 86.0(最强探针) | +1.5 / +3.9 / +7.4 / +9.3 点 |
| ALFWorld 总体成功率(Qwen2.5-7B-Instruct) | 成功率 % | 98.4 | Enumeration 96.1(最强 hint-based)/ BEACON 94.5(最强 hint-free) | +2.3 / +3.9 点 |
| WebShop(1.5B / 7B) | Reward Score / 购买成功率 % | 92.3 / 78.9(1.5B),92.3 / 84.4(7B) | 1.5B 最强探针 Enumeration 90.1/78.1;7B Enumeration 96.0/89.8 | 1.5B 非探针最强(+2.2 score);7B 上被探针式 Enumeration 反超(−3.7 score),优势限于成本约束下 |
| ALFWorld 训练效率(1.5B) | 每梯度步墙钟时间(秒) | 88(1.00×) | Step decay 57(0.65×)/ Binary Search 285(3.24×)/ Enumeration 425(4.83×) | 比探针方法快 3.2–4.8 倍,且收敛步数约为调度基线一半 |
| ALFWorld 组件消融(1.5B) | 总体成功率 % | 95.3(完整方法) | 去采样 89.8 / 均匀分布 88.3 / K=1 89.1 / 去 L_aux 86.7 / 去 L_GRPO 26.6 | 各组件贡献 1.5–68.7 点 |
局限与改进
作者承认三点:其一,框架依赖每个训练任务都有一条专家轨迹,当轨迹不可得或获取昂贵时无法直接应用;其二,高斯参数化来自两个基准上的经验拟合,对深度轮廓多峰或严重偏斜的任务可能需要更丰富的分布族(尽管均匀分布消融暗示形状不如覆盖重要);其三,难度簇由专家轨迹长度离线定义,策略进步导致任务相对难度漂移时不会自适应。我的补充观察:(1) 验证面较窄——高斯拟合与诊断协议只在 ALFWorld/1.5B 上完成(附录 Table 6 无 WebShop 数据),两个环境都是文本交互加二元奖励,对连续奖励或部分奖励环境,$p_{target}=0.5$ 与 $[0.4,0.6]$ 带的定义需要重构;(2) WebShop 7B 上探针式 Enumeration(96.0 score/89.8% succ)明显高于 Agent-G²(92.3/84.4%),说明在动作空间更复杂的环境里'准确但昂贵'的探针仍占上风,本文优势叙事应限定在 rollout 成本约束下;(3) $K=10$ 时每簇每 batch 不足 2 个任务导致 EMA 不稳、成绩掉 9.1 点,暴露调度质量对 batch 大小与簇大小的耦合敏感;(4) 引导只沿'保留多少前缀'一维变化,未利用专家轨迹内部结构做更细粒度引导(如关键子目标跳转)。
独立分析的弱点
第一,专家轨迹依赖是最实际的门槛:真实业务里专家演示昂贵且常常次优,改进方向是让 Agent-G² 消化自生成成功轨迹(自我改进式回放)或语言提示形式的弱监督,作者也把'次优演示'列为开放方向。第二,离线长度聚类过于粗糙:长度只是难度的代理,且训练中相对难度漂移后固定分区失效,可用滚动成功率在线重聚类,或用历史 $\hat{p}_i$ 的滑动均值等轻量难度信号替代静态分区;Table 8 显示 $K=5$ 还能到 96.5,且 $K=1$ 到 $K=3$ 差 6.2 点是更好难度信号收益的上界。第三,单峰高斯在多峰深度轮廓(任务存在两条截然不同的解题路径、各自对应不同深度带)下会系统性漏采样,可换成每簇两分量的高斯混合并用 EM 风格在线更新。第四,全局基线用固定步长 $\Delta=0.1$ 的符号式更新,未利用 $|p_{target}-acc_B|$ 的幅度信息,训练后期可能振荡,可改为比例控制或带置信度加权。第五,与探针的结合空间明确:WebShop 7B 落后 Enumeration 3.7 score,可设计混合调度——以 Agent-G² 的分布为先验,仅对采样后成功率仍接近 0 或 1 的少数任务追加 1–2 条探针 rollout,以可控成本修复尾部错配。第六,评估只用 5 seeds,且 ALFWorld 7B 五个子任务已 100% 饱和,天花板效应使部分对比的统计功效有限。
未来方向
作者明确提出三个方向:把框架扩展到更弱监督形式(次优演示、语言提示),使专家轨迹不再是硬前提;引入在线难度估计替代静态长度聚类;为多峰/偏斜深度轮廓探索更丰富的分布族。基于本文成果还可延伸:(1) 与更丰富的 RL 算法栈组合——调度层与优化层正交,可叠加到 PPO、GiGPO 的层级分组或过程奖励模型上,检验分布化引导的普适性;(2) 跨环境迁移调度先验:$\mu_{global}$ 的四阶段轨迹(饱和-分离-峰值-收敛)若在不同任务族间稳定,可作为新任务的元知识热启动;(3) 把'深度'从单一标量推广到结构化提示,例如随机采样'跳过哪些子目标'的组合,覆盖比前缀长度更丰富的引导空间;(4) 理论上把 in-band 采样与 GRPO 的梯度方差联系起来,给出收敛速率或样本复杂度分析;(5) 在多峰场景验证混合密度调度;(6) 把本文的诊断协议(32-rollout 枚举 + $\Delta d$ 对齐拟合)沉淀为新环境接入 hint-based RL 前的标准化前置分析工具,这一协议本身就有独立价值。
复现评估
复现条件较好。开源方面:作者承诺论文发表后以 MIT 协议放出代码与训练脚本;实现基于公开的 verl 框架与 GiGPO 代码库,共享超参继承其训练配方;专家轨迹与 RLVMR/ETO 使用同一公开池,不存在数据优势,各训练基线大多使用作者公开实现与默认超参。数据方面:ALFWorld、WebShop 均为公开基准,训练/验证/测试切分沿用 GiGPO。超参完全透明(Table 5):$\Delta=0.1$、$\alpha=0.2$、$\lambda=\gamma=1.0$、$\sigma_{min}=0.1$、$\eta=0.5$、$p_{target}=0.5$、$\mu_{global}(0)=0.8$、$K=3$、$|B|=16$、$R=8$、学习率 $1\times10^{-5}$(cosine、10% warmup)、GRPO clip 0.2、KL 系数 0.01、bfloat16,且两个基准共用一套超参不做单独调整。算力方面:单节点 8×H800,Qwen2.5-1.5B 在 ALFWorld 训 200 步约 10 小时,7B 预计为同等量级到数倍,中小实验室可负担。诊断协议(每 (task, depth) 32 rollouts、$\Delta d$ 按 0.1 分箱最小二乘拟合)在附录 A 有完整公式。总体复现难度中低:方法超参少且消融显示对取值相对鲁棒,主要工程量在环境搭建与 verl 使用;风险点是 5-seed 方差(如 $K=3$ 的 ±2.3)可能吞掉与相近基线间的小差距。
论文图表
三栏示意图对比三代引导深度分配范式随训练步 $t_0\to t_1\to t_2$ 的演化:(a) Schedule-based 方法由训练步数决定一个全批共享的深度 $d_t$(如 Step decay、Cosine decay 曲线);(b) Probe-based 方法为每个样本单独做二分/枚举探针,需要 $O(\log n)$ 条额外 rollout 才得到 $d_i^\star$;(c) Agent-G² 为每个任务维护高斯分布 $d_i\sim\mathcal{N}(\mu_t,\sigma_t^2)$,参数从已有 rollout 在线估计,无需额外探针。
一张图讲清全文定位:本文改进的不是 RL 算法本身,而是'深度怎么分配'这一层,且亮点在于零额外成本的每任务分布化。
(a) 堆叠柱状图显示 Fix-step/Linear/Step-decay/Target-acc 四种共享深度调度器中 under-/in-range/over-guided 任务组的占比:三个步数式调度器只有 15%–23% 落在 in-range 带,最好的 Target-acc 也只有 62% in-range(38% 错配);(b) 错配率 $\rho$ 随探针预算(0.5×–20× GRPO rollout 预算)的变化:$M_{probe}=2$ 的二分搜索仍错配 75%,Enumeration 需 20× 预算才接近零错配,Agent-G² 在 1× 成本处错配约 15%。
用定量证据钉死两类已有方法的失败模式,是第 2 节诊断的核心,也是'为什么需要分布化'的直接依据。
(a) 单个任务的成功率 $p_i(d)$ 随注入深度的变化曲线,$[0.4,0.6]$ 的 in-range 区域横跨多个相邻深度而非单点;(b) 把所有任务-深度对按相对深度 $\Delta d = d - d_i^\star$ 对齐后的 Bernoulli 方差 $p(1-p)$ 信息量轮廓:单峰、近似对称,高斯拟合给出 $\sigma=0.22$、$R^2=0.92$,为采样器提供中心 $\mu$ 与宽度 $\sigma$ 两个参数。
这是全文的核心经验发现:'有用深度是带不是点'。没有这张图,高斯建模就成了无根据的假设。