← 返回 2026-09-09

环境作为脚手架:用增强反馈自举长程任务中的自进化智能体 Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks

Hongbang Yuan, Zhuoran Jin, Yixin Cao 📅 2026-09-08 👍 24 2026-09-12 18:30
LLM智能体 奖励稀疏 强化学习 环境设计 长程任务

把适应从智能体侧转向环境侧,用分阶段增强反馈破解长程RL奖励稀疏

前置知识

POMDP(部分可观测马尔可夫决策过程)

用五元组 $(\mathcal{S}, \mathcal{A}, \mathcal{O}, \mathcal{T}, r)$ 描述的决策模型:真实状态 $s$ 对智能体隐藏,它只能看到观测 $o$,动作经转移函数 $\mathcal{T}$ 改变状态并获得奖励 $r$。SciWorld、BFCL 这类智能体交互环境天然是 POMDP,因为环境不会主动汇报隐藏状态。

本文把反馈增强环境 FEE 定义为对观测空间的干预 $o_t^+ = \mathcal{E}(o_t, h_t)$,观测增强的动机正是补偿部分可观测性;不熟悉 POMDP 就无法理解论文的形式化框架。

奖励稀疏与梯度消失

指奖励信号在时间轴上极少出现:长程任务通常只在整条轨迹结束时给一个二值成败信号,中间几十步全是零。当组内所有轨迹回报相同时组相对优势为零、策略梯度消失,智能体完全没有学习信号,这是长程 RL 训练的头号障碍。

FEE 的全部设计都围绕缓解稀疏奖励导致的零奖励轨迹展开,理解它是读懂论文动机的前提。

组相对策略优化(GRPO/DAPO/GSPO)

GRPO 不训练 critic,而是对同一任务并行采样 $N$ 条轨迹,用组内回报的相对统计计算优势 $A(\tau_k)$,再均匀分配到轨迹中的智能体 token(环境生成的 token 全部被 mask)。DAPO 在此基础上加 clip-higher 与动态采样,GSPO 改用序列级重要性比率,三者是当前主流的 agentic RL 算法。

主实验在三种算法上验证 FEE 的通用性,且论文的组内反馈一致性发现直接源于组相对优势估计机制。

策略熵与熵坍缩

策略熵衡量输出动作分布的随机性:熵高说明策略仍在多样探索,熵趋零说明策略退化为确定性输出、丧失探索能力,训练往往随之停滞甚至崩溃。长程 RL 中过早熵坍缩是训练不稳定的典型症状。

论文用 300 步训练的策略熵曲线证明 FEE 是独立于熵正则的训练稳定器,这是其四大分析发现之首。

SFT 预热(冷启动)

在 RL 之前用专家轨迹对模型做监督微调,抬高初始成功率、保证 RL 早期采样能碰到正奖励。代价是:真值轨迹收集昂贵且难以规模化;过度拟合 SFT 目标会把行为约束过死,压缩后续 RL 所需的探索空间。

它是智能体侧路线的代表,论文提出的范式转移正是针对 SFT 预热两大瓶颈给出的环境侧替代方案。

研究动机

用强化学习训练 LLM 智能体执行长程任务时,奖励极度稀疏:SciWorld 这类交互环境只在轨迹末尾给出二值成败信号,而完成一次科学实验往往需要几十步交互。缺乏引导的智能体极易陷入零奖励轨迹——例如在测金属勺导电性的任务里,它会在教室里盲目翻找材料而不是走进实验室——组内所有轨迹回报相同导致优势为零、梯度消失,没有任何学习信号。常规补救是先用专家轨迹做 SFT 预热,但这有双重瓶颈:真值轨迹的收集昂贵且难以规模化,而过度优化 SFT 目标又会把策略约束得过死,反而压缩 RL 所需的探索空间。基线数据很能说明问题的严重性:Qwen3-4B 未训练时在 SciWorld 上成功率仅 3.90%、BFCL 多轮四子任务平均仅 23.58%,Qwen3-8B 平均也只有 27.18%,与 GPT-5.4 的 52.07% 差距悬殊。

本文的目标是本文目标是把缓解奖励稀疏的着力点从智能体侧系统地转移到环境侧:不再追求更好的初始化或更强的 RL 算法,而是在训练过程中主动改造环境反馈本身。具体要回答两个设计问题——给什么信息(动作引导 AG:直接提示下一步有效动作以剪枝搜索空间;观测增强 OE:补充隐藏状态语义,如实时任务进度清单)与什么时候给(回合内交互的早/晚阶段,训练生命周期的前 100 步/后 100 步),总结出一套经过实验验证的反馈设计策略,据此构建反馈增强环境 FEE,使得无论用 GRPO、DAPO 还是 GSPO、无论 4B 还是 8B 模型,RL 训练都能更稳定高效,并进一步剖析 FEE 对训练动力学、状态空间探索、知识内化和组内采样一致性四个维度的影响。

与已有工作不同的是,此前的工作几乎都聚焦智能体侧:SFT 冷启动、改进优势估计与裁剪策略的 RL 算法(GRPO/DAPO/GSPO)、用语言提示调节任务难度等。而在从规模化解题数据转向规模化交互环境的时代,如何系统地重构多轮动态环境来辅助智能体进化,仍是一片空白。本文的独特切入是把环境当成可设计的脚手架而非固定黑盒:通过干预观测空间 $o_t^+ = \mathcal{E}(o_t, h_t)$ 重塑动作分布、隐式调节任务难度,并提出反馈类型必须与环境所处阶段匹配的分阶段策略——早期用动作引导自举探索、后期用观测增强精炼策略。这一环境侧框架与一切智能体侧优化正交,可直接叠加在任意 RL 算法之上使用。

核心方法

直觉上,这像教学生做题:与其只琢磨怎么让学生更聪明,不如让题目学会因材施教——入门阶段给详细解题步骤,上手后改为只补充关键信息、逼学生自己推理。形式化上,环境是目标条件 POMDP $\mathcal{E}_\phi = (\mathcal{G}, \mathcal{S}, \mathcal{A}, \mathcal{O}, \mathcal{T}, r)$,智能体按 $a_t \sim \pi_\theta(a_t \mid g, o_t, h_t)$ 产出动作,FEE 通过 $o_t^+ = \mathcal{E}(o_t, h_t)$ 干预观测,得到增强环境 $\mathcal{E}_\phi^+$。技术路线分两步:先在 SciWorld 上做试点实验,网格组合反馈类型(AG/OE)与交付时机(回合内步 1–3 或 6–10;训练前/后 100 步),确定 AG-Early & OE-Late 最优;再在 SciWorld 与 BFCL v3 多轮任务上,用 Qwen3-4B/8B 配 GRPO/DAPO/GSPO 三种算法大规模验证该策略。

核心创新是反馈的阶段化匹配:动作引导应早期使用、观测增强应后期引入,且这一规律在回合内探索与训练间演化两个时间尺度上同时成立。机理解释清晰:AG 直接给出有效下一步动作(如进入实验室、抓住金属勺),剪枝巨大的组合搜索空间,快速自举早期学习,但基础动作掌握后即变冗余;OE 暴露隐状态语义(如阴极尚未通电、[1/4 已完成] 的进度清单),认知负荷更高,需要策略先具备解读能力,因此初期低效、后期却能驱动精细的策略修正。与 SFT 预热的本质区别有二:其一,探针实验证明环境引导最终被内化进策略权重,而非停留在推理期提示;其二,增强虽以 0.5 概率随机施加,但同一 rollout 组内必须保持反馈一致——组内随机化会扭曲组相对优势 $A(\tau_k)$ 的估计,引入有害噪声导致训练剧烈震荡。

方法步骤详情

第一步,构建增强环境:SciWorld 中 AG 注入具体有效动作提示(如抓住金属勺),OE 注入实时任务进度([Pass]/[Pending] 子目标清单);BFCL 中 AG 把建议动作附加到用户查询,OE 扩展工具返回内容(如返回绝对路径)。第二步,试点实验:Qwen3-4B-Thinking-2507 用 GRPO 训练 200 步,每步 16 个并行环境、rollout 长度 15、学习率 $1\times10^{-6}$,增强以 0.5 概率随机施加,AG-Early/OE-Early 在步 1–3、AG-Late/OE-Late 在步 6–10 生效,每 5 步在不相交任务上评估标准环境成功率;结果显示 AG 全程优于 OE,AG-Early & OE-Late(第 100 步切换)超过所有单一设置。第三步,主实验:按该策略训练 Qwen3-4B/8B,组相对优势 $A(\tau_k) = \text{GroupComputation}[(r_{\tau_k})_{k=1}^N]$ 均匀分配到智能体 token、环境 token 全部 mask,每 5 步评估并记录峰值。

技术新颖性

新颖性有四层。范式层面:首次旗帜鲜明地提出环境侧适应与智能体侧预热之争,把环境反馈当作长期被忽视的课程信号,且与任意 agent 中心的算法改进正交、可叠加。方法层面:不是简单堆提示,而是系统化刻画给什么(AG vs OE)与何时给(回合内/训练间、早/晚)的二维设计空间,并给出经实验验证的分阶段切换策略,把环境改造变成有原则的工程。分析层面:用策略熵曲线证明 FEE 是独立于熵正则的稳定器;用按难度分层的 400 个 BFCL 环境证明探索能力被内化且可迁移回标准环境;用输出概率探针(8 种文件操作、预测工具输出)证明反馈被写入权重而非充当推理期先验。边界层面:发现组内反馈一致性是稳定优化的前提条件,这是对组相对类 RL rollout 采样实践的一个此前未知的约束,对社区具有普适参考价值。

Illustration of the Feedback-Enriched Environments (FEEs).
Figure 1: Illustration of the Feedback-Enriched Environments (FEEs).
RL training dynamics under various feedback enrichment strategies. Task success rate is evaluated on the standard environment. Curves are smoothed for visual clarity, and shaded regions denote variance.
Figure 2: RL training dynamics under various feedback enrichment strategies. Task success rate is evaluated on the standard environment. Curves are smoothed for visual clarity, and shaded regions denote variance.

实验结果

主实验显示 FEE 在全部六组模型×算法设置上一致占优,跨设置平均提升 2.82 个百分点,如 4B DAPO 43.88→47.81(+3.93)、8B GSPO 41.78→46.39(+4.61)。亮点:4B GRPO 在 BFCL Base 上 58→68(+10.00),8B GSPO 在 SciWorld 上 53.91→60.94(+7.03)。RL 后 4B/8B 峰值达 47.81/48.11,反超 Qwen3-235B-Thinking(35.09)、逼近 GPT-5.4(52.07)。分析:其一,无熵正则时标准环境约 250 步熵坍缩至零而 FEE 全程 300 步稳定;其二,FEE 模型在 hard 档(N=235 环境)成功率 10.9 对 6.5(+4.3),探索能力内化且可迁移;其三,探针实验中 FEE 模型对增强输出的概率持续上升,反馈被写入策略权重;其四,组内一致反馈平稳上升,随机反馈剧烈震荡。副作用:Miss Param 上 4B DAPO 41.00→34.00、Miss Func 上 8B GRPO 52→48,过度服从引导弱化质疑能力。

Main evaluation results on two selected benchmarks. Color blocks group identical RL algorithms to show the impact of training environments. Performance scores are reported as percentages (%). Values in parentheses indicate the absolute percentage point improvement (↑) or degradation (↓) of FEE training over the standard baseline.
Table 1: Main evaluation results on two selected benchmarks. Color blocks group identical RL algorithms to show the impact of training environments. Performance scores are reported as percentages (%). Values in parentheses indicate the absolute percentage point improvement (↑) or degradation (↓) of FEE training over the standard baseline.
Policy entropy curves of Qwen3-4B over 300 training steps in standard SciWorld environments and FEEs, with and without entropy regularization.
Figure 3: Policy entropy curves of Qwen3-4B over 300 training steps in standard SciWorld environments and FEEs, with and without entropy regularization.
Left & Middle: Exploration dynamics of Qwen3-4B on BFCL under standard environments and FEEs. The x-axis denotes training steps and the y-axis denotes environment indices ordered by difficulty (bottom: easy, top: hard). Each point represents the avg@8 success rate of a sampled environment, while the blue curve shows the global average avg@8. Right: Validation success rates of models trained in standard environments and FEEs, evaluated on standard environments partitioned into hard, medium, and easy difficulty tiers.
Figure 4: Left & Middle: Exploration dynamics of Qwen3-4B on BFCL under standard environments and FEEs. The x-axis denotes training steps and the y-axis denotes environment indices ordered by difficulty (bottom: easy, top: hard). Each point represents the avg@8 success rate of a sampled environment, while the blue curve shows the global average avg@8. Right: Validation success rates of models trained in standard environments and FEEs, evaluated on standard environments partitioned into hard, medium, and easy difficulty tiers.
Probability difference between the original and enriched feedback options across training steps.
Figure 5: Probability difference between the original and enriched feedback options across training steps.
Validation success rates of Qwen3-4B in standard SciWorld environments during GRPO training under different feedback consistency settings.
Figure 6: Validation success rates of Qwen3-4B in standard SciWorld environments during GRPO training under different feedback consistency settings.
查看结构化数据
任务指标本文基线提升
五项平均(Qwen3-4B + GRPO) BFCL 四子任务 + SciWorld 平均成功率 (%) 44.27(FEE 训练) 40.98(标准环境训练) +3.29
五项平均(Qwen3-4B + DAPO) BFCL 四子任务 + SciWorld 平均成功率 (%) 47.81(FEE 训练) 43.88(标准环境训练) +3.93
五项平均(Qwen3-4B + GSPO) BFCL 四子任务 + SciWorld 平均成功率 (%) 38.57(FEE 训练) 36.48(标准环境训练) +2.09
五项平均(Qwen3-8B + GRPO) BFCL 四子任务 + SciWorld 平均成功率 (%) 47.44(FEE 训练) 46.75(标准环境训练) +0.69
五项平均(Qwen3-8B + DAPO) BFCL 四子任务 + SciWorld 平均成功率 (%) 48.11(FEE 训练) 45.80(标准环境训练) +2.31
五项平均(Qwen3-8B + GSPO) BFCL 四子任务 + SciWorld 平均成功率 (%) 46.39(FEE 训练) 41.78(标准环境训练) +4.61
SciWorld(Qwen3-8B + GSPO) 任务成功率 (%) 60.94(FEE 训练) 53.91(标准环境训练) +7.03
BFCL V3 Multi-Turn Base(Qwen3-4B + GRPO) 任务成功率 (%) 68.00(FEE 训练) 58.00(标准环境训练) +10.00
BFCL 难度分层验证 hard 档(Qwen3-4B,N=235 个环境) 标准环境验证成功率 (%) 10.9(FEE 训练) 6.5(标准环境训练) +4.3
与专有模型对比(Qwen3-4B + DAPO + FEE) 五项平均成功率 (%) 47.81 Qwen3-235B-Thinking 35.09;GPT-5.4 52.07 反超 235B 模型,逼近 GPT-5.4

局限与改进

作者承认三点局限:一是 FEE 构建需要环境特定的设计与超参,早/晚阶段的边界(回合内步 1–3 与 6–10、训练第 100 步的切换点)均手工指定,其敏感性与最优配置未系统研究;二是只在 SciWorld 与 BFCL 两个基准上验证,泛化能力不足;三是在更难的 AppWorld 上,即使引入增强反馈,Qwen3-4B/8B 的训练仍困于零奖励轨迹,说明 FEE 并非万能。我自己的观察补充:其一,BFCL 上多个子任务出现退化(4B GRPO Long Context 降 6.00、8B GRPO Miss Func 降 4.00),且 AG 的建议动作与 OE 的进度清单本质是特权信息,真实部署中往往不存在现成的 ground truth 可注入;其二,主表记录的是每 5 步评估的峰值性能而非最终性能,存在挑选最优检查点的风险;其三,增强模板依赖人工编写(进度清单格式、工具输出扩展规则),扩展到开放网页/终端环境的成本未讨论;其四,熵稳定性与内化分析只在 Qwen3-4B 上展示,缺少跨规模的稳健性验证。

独立分析的弱点

独立分析出四个弱点。第一,特权信息依赖:SciWorld 的任务进度清单与 BFCL 的当前绝对路径都来自模拟器内部状态,真实环境中往往没有此类 ground truth,改进方向是用世界模型或 LLM 模拟器生成近似反馈,并系统研究带噪反馈下的鲁棒性。第二,过度服从:Miss Param/Miss Func 的退化表明 FEE 让智能体倾向盲目执行而非质疑输入(4B DAPO 41.00→34.00),改进方向是在反馈流中显式混入信息不足或无法完成的样本、对澄清类行为做奖励塑形,并在训练后期逐步撤走反馈。第三,阶段切换超参敏感且手工:第 100 步切换、0.5 增强概率、步 1–3 与 6–10 的窗口都是拍定的,改进方向是用 bandit 或元梯度自动学习反馈调度策略,消除人工调参。第四,组内一致性约束与真实环境的天然随机性冲突:真实环境观测自带噪声,同一 rollout 组内保持反馈完全一致可能不可行,改进方向是按反馈类型分层计算组内基线(条件化优势估计),从算法层面消除该约束而非依赖环境实现。

未来方向

作者在 Limitations 中提出三个方向:系统研究阶段划分与超参数的敏感性;在更广泛的智能体基准上验证泛化能力;为极稀疏的长程设置(如 AppWorld 完全零奖励)设计更丰富的环境适应策略。基于本文成果还可延伸:其一,可学习的反馈课程——用强化学习或 bandit 在训练中自动决定每个状态给 AG 还是 OE、何时撤除,把手工调度变成可优化策略;其二,反馈退火——训练末期逐步把增强信号衰减到零,检验能否同时保住性能与无辅助部署能力,并缓解 Miss Param 类退化;其三,把 FEE 思想迁移到真实网页/终端智能体,用轨迹摘要、错误原因解释等替代特权信息作为 OE;其四,理论化:组内一致性发现提示增强反馈会改变组相对优势估计的方差结构,值得给出偏差—方差分析;其五,与过程奖励模型结合,用学习到的中间奖励信号替代启发式进度清单,摆脱人工模板。

复现评估

复现条件较好。代码开源在 github.com/HongbangYuan/EnvAsScaffold,基准(SciWorld、BFCL v3)与底座模型(Qwen3-4B/8B、Qwen3-4B-Thinking-2507)均公开可得。关键超参齐全:学习率 $1\times10^{-6}$、每步 16 个并行环境、rollout 长度 15、训练 200 步(稳定性分析 300 步)、每 5 步评估、增强概率 0.5、GRPO/DAPO/GSPO 三算法配置。算力需求中等:4B/8B 模型加 16 路 rollout,单机多卡(8×A100 量级)即可承担。主要复现难点在于增强模板的工程实现:SciWorld 的进度清单格式与 BFCL 的工具输出扩展规则、探针问题设计分别在附录 B 与附录 C,若描述不够细需要自行补齐并与原文逐项对齐;另外主表记录峰值性能,评估频率会造成 1–2 个点的复现波动。总体难度中等,熟悉 agentic RL 训练框架的团队一至两周可跑通主干实验。