← 返回 2026-08-21

EnvHarness:唤醒静态环境的智能体学习定制层 EnvHarness: Awakening Static Worlds for Agent Learning

Chengsong Huang, Zifeng Wang, Rujun Han, Jun Yan, Yanfei Chen, Zoey CuiZhu, Ke Jiang, Peng Xia, Han Yu, Yufan Zhuang, Yifei Ming, Jiaqi Pan, Bhavana Dalvi Mishra, Jiaxin Huang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee 📅 2026-08-20 👍 263 2026-08-26 18:30
LLM智能体 强化学习 智能体学习 环境定制 自动化课程

用可插拔组件包裹静态环境,按策略弱点自动定制训练环境,显著提升智能体学习

前置知识

LLM 智能体与环境交互循环

LLM 智能体是「冻结的大模型 + 外部脚手架」构成的系统:模型接收环境返回的观测(网页截图、代码报错、房间文本描述),生成动作(点击、执行命令、移动物体),环境状态随之改变并返回新观测,如此往复直到任务完成或失败。环境负责出题、维护状态、响应动作和判定成功,是智能体获取学习信号的地方。

本文的全部操作都发生在智能体-环境循环的标准接口(reset/step/obs)上,理解这个循环才能明白 EnvHarness 为什么能不改环境本身而改变其行为。

马尔可夫决策过程(MDP)

强化学习中描述序贯决策的标准形式化:元组 $(\mathcal{S}, \mathcal{A}, \mathcal{O}, T, R, s_0)$ 分别表示状态空间、动作空间、观测空间、转移函数 $T:\mathcal{S}\times\mathcal{A}\to\mathcal{S}$、由验证器诱导的奖励 $R$ 和初始状态 $s_0$。智能体从 $s_0$ 出发,每步选动作,$T$ 决定状态演化,$R$ 决定最终评价。

论文用 MDP 元组精确定义 EnvHarness:每个组件 $w$ 都是保持元组结构、只改写部分分量的变换 $E'=w(E)$,这是理解 Stage/Contract/Chain 三类组件数学定义的基础。

Agent Harness(智能体脚手架)

指包裹 LLM 使其成为可用智能体的软件层:执行循环、工具注册表、上下文与记忆管理等。它不修改模型权重,而是通过外挂工具、记忆、技能让同一个 LLM 处理远超纯文本生成的复杂任务,即 Agent = Model + Harness,典型如各类 agent 框架与编码助手。

本文的核心类比:既然 harness 能把冻结 LLM 变成自主智能体,那么同样可以用一层可插拔组件把静态环境变成可定制环境,EnvHarness 的命名与设计哲学直接源于此。

环境生成与环境扩展

为解决人工环境稀缺,用 LLM 自动生成训练环境或任务实例的研究方向:GenEnv 用 LLM 模拟环境与反馈,SWE-smith 在现有基准内合成新任务实例,VeriEnv 生成带验证器的可执行环境。共同问题是管线领域绑定(为网页设计的无法迁移到编程),且生成环境与验证器的正确性难以保证,只能过量生成加过滤。

EnvHarness 是这些方法的对照面——不生成新环境而是改造已有环境。理解它们的局限才能体会论文「包裹而非创作」的动机,以及实验中 GenEnv/VeriEnv/SWE-smith 基线的含义。

技能式学习与经验记忆(ReasoningBank)

一种不改模型权重的智能体改进范式:从历史执行轨迹中蒸馏出可复用的技能条目(原则描述加可执行步骤),存入技能库,遇到相似任务时检索并注入上下文。ReasoningBank 是该范式的代表方法,本文直接借用它从环境轨迹中提取技能供策略使用。

EnvHarness 的技能学习实验正是用 ReasoningBank 式管线从不同环境来源提取技能库,再在留出集上评测带技能的策略,这是理解表 2、表 3 实验协议的前提。

GRPO(组相对策略优化)

在线强化学习算法:对同一提示采样一组轨迹,用组内相对优势(去掉基线的奖励比较)更新策略,无需独立价值网络,训练稳定、实现简单,因 DeepSeek-R1 等工作广为人知。特别适合有程序化验证器提供可验证奖励的环境。

论文第 5 节用 Qwen3-8B-base + GRPO 验证 EnvHarness 定制环境可作为在线 RL 的独立训练信号,看懂表 4 的强化学习实验需要知道这一设置。

研究动机

LLM 智能体的能力来源正从静态文本数据转向交互环境,但环境几乎全靠人工搭建:需要硬编码交互逻辑与验证器,工程成本高昂,且建成后是完全静态的——无论面对哪个智能体、它已进步多少,环境行为都一模一样。这带来两个根本缺陷:一是无法针对特定智能体的弱点给出矫正信号,例如 ALFWorld 的「放干净杯子」任务对所有策略都呈现相同的初始状态和交互规则;二是一旦策略学会现有任务,环境便再无可教。近年出现的自动环境生成方法(如 GenEnv、VeriEnv、SWE-smith)虽能扩大规模,却有两大硬伤:其一,生成管线高度领域绑定,为网页导航设计的流水线无法迁移到编程或办公自动化,一个领域一套系统;其二,环境与验证器都由 LLM 生成,正确性验证既昂贵又不可靠,只能靠过量生成加过滤兜底,仍无法完全保证质量。

本文的目标是本文的目标是:在不修改环境内部实现、不放弃原始人工验证器的前提下,把任意静态环境改造成「因材施教」的动态训练环境——能够隔离特定技能(如空间搜索)、拉长任务跨度(把多个任务串成复合 episode)、校准难度(让智能体挣扎但最终可解),并通过全自动循环针对目标策略与具体任务完成定制。作者希望该框架在技能式学习(SL)与强化学习(RL)两种范式下都产生更强策略:技能学习在五个基准的留出实例上最多提升 9.0 分、执行步数减少 9.8%;RL 下最多提升 6.5 分;且随环境预算从 0 扩到 300 时性能持续上升,而真实环境与生成环境都会趋于平缓,最终实现策略与环境的持续共同进化。

与已有工作不同的是,本文的独特切入:不做「从零生成新环境」,而是「包裹已有环境」。作者把 agent harness 的类比搬到交互的另一侧——既然执行循环、工具注册、上下文管理能在不改动权重的条件下把冻结 LLM 变成自主智能体,那么也可以用一个可编程层在不改动环境的条件下把静态环境变成可定制环境(Customized Env = Static Env + EnvHarness)。所有干预只发生在标准 reset/step 接口的信息流上,因此一份实现即可跨文本具身、网页、软件工程、办公自动化四个领域复用,且每个新环境天然继承人类构建的可信验证器,绕开了「生成验证器不可靠」的死结。再配合 EnvRigger 把策略当黑盒、从真实轨迹诊断弱点并写组件验证,形成以学习者当前能力为中心的环境定制,这与无差别扩充任务数量的生成式方法形成本质分野。

核心方法

直觉上,EnvHarness 像给环境「套壳装插件」:底层环境完全冻结,外壳决定 episode 从哪里开始、允许什么动作与观测、如何衔接多个环境。形式化上,环境建模为元组 $E=(\mathcal{S}, \mathcal{A}, \mathcal{O}, T, R, s_0)$,EnvHarness 组件是环境无关的变换 $w$,满足 $E'=w(E)$,仅在接口层面重塑初始状态、过滤暴露空间、更新转移机制,原始验证器 $R$ 仍可为 episode 打分。三类具体组件:Stage 用状态操作序列 $\delta=(a_1,\dots,a_k)$ 改写起点,$s_0'=T(\cdots T(T(s_0,a_1),a_2)\cdots,a_k)$,如先把杯子藏进抽屉逼智能体先搜索;Contract 用三元映射 $r=(f_A,f_T,f_O)$ 分别改写动作空间、转移动力学与观测空间,如截断房间描述制造部分可观测、未持杯时封锁 clean 动作;Chain 用 $\ell=(E_{\text{ext}},g)$ 按组合逻辑 $g$ 拼接另一环境形成复合任务。组件可任意嵌套 $E'=w_{\text{chain},\ell}(w_{\text{contract},r}(w_{\text{stage},\delta}(E)))$,复合不可交换,嵌套顺序决定约束在初始化还是交互阶段生效。

核心创新有三层。第一,把环境构建从「创作」重构为「包裹」(wrapping 而非 authoring):一切改动都发生在标准接口之上,一份实现通用五基准,并完整保留人工验证器,从根本上回避了生成式方法「环境与验证器正确性无法保证」的难题。第二,任务-策略条件化映射 $H(E,t;\pi)=(w_k\circ w_{k-1}\circ\cdots\circ w_1)(E)$:单个组件是策略无关的纯环境变换,但组件的选择与参数化取决于对策略 $\pi$ 在任务 $t$ 上行为的黑盒诊断,从而把课程学习的思想从 RL 专用搬到通用智能体学习,且无需访问模型内部权重。第三,EnvRigger 的写-验证闭环(write-and-validate)只接受被全新 rollout 证实「既暴露弱点又可解」的候选组件,失败者被拒绝或修订,保证训练信号始终落在策略的能力边界上——这正是静态环境永远做不到的。

方法步骤详情

EnvRigger 按四阶段循环运行。Observe:在当前环境(已包裹已接受组件 $w_1,\dots,w_k$)上对基础任务 $t$ 跑一批 rollout,失败轨迹暴露弱点,成功轨迹划定缺陷边界。Diagnose:分析轨迹找系统性根因(重复动作循环、长观测解析失败、误读工具约束),并决定方向——成功率低则搭脚手架简化;完美则说明环境太宽松,转而注入更难场景把潜在缺陷逼出来,输出文本诊断。Write:依据诊断合成一个或多个组件(如 Stage 改初始状态 + Contract 过滤交互)作为候选,如发现策略靠捷径绕过学习,就写 Contract 在特定条件下封锁该动作。Validate:用候选实例化 $E'$ 跑全新 rollout,依成功率与失败分布决定接受、拒绝(不可解或无挑战)或修订,修订则回到 Write,循环直至接受或预算耗尽。学习侧:技能学习范式用 ReasoningBank 从定制环境轨迹提取技能后在留出集评估;RL 范式用 Qwen3-8B-base 加 GRPO 直接训练。自动化管线排除 Chain(难以观测拼接环境内部状态),单独评估;Stage 依赖确定性 reset。

技术新颖性

与相关工作的本质区别:环境生成(GenEnv、VeriEnv、SWE-smith 等)领域绑定、依赖 LLM 生成的验证器、产物仍是静态环境集合;课程学习与奖励整形(PLR、ACCEL 一类)多为 RL 专用且需手工设计;自进化智能体改的是提示词、技能库、记忆或权重,环境保持固定。EnvHarness 反其道而行:用领域无关的接口级变换 $w(E)$ 重塑冻结环境,保留真值验证器,定制过程由被训策略的行为数据自动驱动。组件化设计与函数复合语义($w_1\circ w_2 \neq w_2 \circ w_1$,顺序敏感)让「隔离技能、拉长视野、校准难度」成为可编程原语,把环境供应问题从一次性工程变成可持续的优化循环,这是对「环境即数据」范式的实质性推进,也解释了它为何能在没有生成基线的办公自动化领域直接应用。

Agent harness 与 EnvHarness 的类比示意
Figure 2: Agent harness 与 EnvHarness 的类比示意
Overview of EnvHarness components wrapping the standard environment interface
Figure 3: Overview of EnvHarness components wrapping the standard environment interface
EnvRigger generating EnvHarness components for a target policy based on given task
Figure 4: EnvRigger generating EnvHarness components for a target policy based on given task

实验结果

技能学习(表 2、3)覆盖五基准,全部超越原始环境技能源。ALFWorld 平均 68.3 对 62.4(+5.9),OOD 提升 9.0 分(70.4 对 61.4),超生成器 GenEnv 平均 5.7 分、OOD 8.5 分;WebArena 平均 41.6 对 38.5(+3.1),Shop Admin +6.2(50.8 对 44.6),整体超 VeriEnv 的 39.6;SWE-bench Verified 成功率 52.58 对 49.88(+2.70),超 SWE-smith 的 50.12(+2.46),平均步数从 55.01 降至 49.61(少 9.8%),静态环境技能反而把步数拉长到 55.01;OfficeQA EM 56.20 对 54.40(+1.80)、F1 57.73 对 55.77;SpreadsheetBench Pass@1 49.15 对 45.88(+3.27),且静态环境技能 45.88 低于无技能基线 46.44。RL(表 4):Qwen3-8B-base + GRPO 下 ALFWorld 分布内 87.9 对 81.4(+6.5),WebShop 分数 79.2 对 75.6、成功率 67.4 对 66.0。长程任务(表 5):Chain-only 把步数从 53.58 砍到 41.96,Stage/Contract 与 Chain 组合取得最佳 54.30 与 43.12 步。扩展(图 5):300 环境下从 47.67 升至 54.79(+7.12)未饱和,原始环境 52.13、SWE-smith 50.37 趋平。跨模型(图 6):四个骨干全部有效,较原始环境高 2.7–3.7 绝对分(相对 +8.7%/+7.6%/+5.4%/+4.6%),最弱两模型相对无技能提升 +9.3/+11.1 分。

Analogy between Agent Harness and EnvHarness
Table 1: Analogy between Agent Harness and EnvHarness
Performance of agents equipped with skills extracted from different environment sources on ALFWorld and WebArena
Table 2: Performance of agents equipped with skills extracted from different environment sources on ALFWorld and WebArena
Performance of agents equipped with skills extracted from different environment sources on SWE-bench Verified, OfficeQA, and SpreadsheetBench
Table 3: Performance of agents equipped with skills extracted from different environment sources on SWE-bench Verified, OfficeQA, and SpreadsheetBench
Reinforcement learning on ALFWorld and WebShop
Table 4: Reinforcement learning on ALFWorld and WebShop
Performance on long-horizon environments
Table 5: Performance on long-horizon environments
Overall performance
Figure 1: Overall performance
Environment scaling on SWE-bench Verified
Figure 5: Environment scaling on SWE-bench Verified
Cross-model results on SWE-bench Verified
Figure 6: Cross-model results on SWE-bench Verified
查看结构化数据
任务指标本文基线提升
ALFWorld(文本具身) 成功率(分布内/OOD/平均) 66.2 / 70.4 / 68.3 原始环境 63.3 / 61.4 / 62.4;GenEnv 平均 62.6 平均 +5.9,OOD +9.0;超 GenEnv 平均 +5.7、OOD +8.5
WebArena(网页交互) 成功率(四站点平均) 41.6(Reddit 40.6 / Shopping 37.4 / Shop Admin 50.8 / GitLab 37.7) 原始环境 38.5;VeriEnv 39.6 +3.1(Shop Admin +6.2)
SWE-bench Verified(软件工程) 成功率 SR 52.58 原始环境 49.88;SWE-smith 50.12 +2.70(超 SWE-smith +2.46)
SWE-bench Verified(软件工程) 平均执行步数(越低越好) 49.61 原始环境 55.01;SWE-smith 54.72 较原始环境少 9.8%(少 5.11 步)
OfficeQA(办公自动化) EM / F1 56.20 / 57.73 原始环境 54.40 / 55.77 +1.80 / +1.96
SpreadsheetBench(表格) Pass@1 49.15 原始环境 45.88;无技能 46.44 +3.27(原始环境技能反而低于无技能)
ALFWorld / WebShop(RL,Qwen3-8B-base + GRPO) 分布内成功率 / 环境分数 ALFWorld 87.9;WebShop 分数 79.2、成功率 67.4 原始环境训练:ALFWorld 81.4;WebShop 75.6 / 66.0 ALFWorld +6.5;WebShop 分数 +3.6
SWE-bench Verified(环境扩展,300 个环境) 解决率 54.79(从 47.67 持续上升) 原始环境 52.13;SWE-smith 生成 50.37(均趋平) 净增 +7.12 分且未饱和
SWE-bench Verified(长程任务) SR / 平均步数 组合技能 54.30 / 43.12;Chain-only 49.63 / 41.96 无技能 47.67 / 53.58;原始环境 49.88 / 55.01 组合技能 SR +4.42,步数减 10.46

局限与改进

作者承认的限制:自动化 EnvRigger 管线排除了 Chain,因为难以观测被拼接环境的内部状态,Chain 只能以随机配对方式单独评估;Stage 的初始状态改写依赖环境的确定性 reset 才能可靠复现;实验中 EnvRigger 与策略共用同一骨干模型以排除蒸馏效应,这本身也构成设定约束。我的补充观察:其一,五个基准全部带有可靠的程序化验证器(文本游戏、网页、代码测试、表格),对缺乏自动验证器的开放任务该方法无从保证学习信号正确;其二,每个任务需要 Observe 加多轮 Write/Validate 的真实 rollout,LLM 调用与环境执行成本可观,论文未报告定制开销与成本收益比;其三,诊断与写组件依赖较强模型,弱模型可能写不出有效组件(图 6 显示弱模型获益更大,但 EnvRigger 本身也用同一弱模型,两者如何抵消未深入分析);其四,部分基准增益较小(OfficeQA +1.80、WebArena GitLab +2.3),每个评估实例仅尝试一次、指标为三次运行均值,未报告统计显著性。

独立分析的弱点

独立弱点分析:1) 验证器依赖——EnvHarness 的正确性完全继承自原始验证器,若原验证器存在假阳性/假阴性(SWE-bench 类基准已知存在测试覆盖不足问题),定制组件会系统性放大错误信号;改进方向是在 Validate 阶段加入验证器一致性抽查或对抗样本检测。2) Chain 无法自动化——当前只能随机配对环境,无法按诊断结果智能拼接;改进方向是设计仅依赖接口观测的拼接验收准则,例如用子目标完成率与首段任务保持率作代理信号。3) Rollout 成本——每个任务的诊断与多轮验证都需要真实执行,在慢环境(编译、真实浏览器)上代价高;改进方向是轨迹缓存、廉价代理环境预筛与已验证组件的复用库。4) 组件表达能力受限——Stage/Contract/Chain 三类原语无法修改奖励本身,也不能注入新工具;改进方向是扩展观测增强、工具注入等组件类型,论文自己也说「expect more to follow」。5) 评估口径——每实例一次尝试、部分增益在 2 分以内,跨更多随机种子的显著性检验会更有说服力;Chain 的评估是随机配对而非按弱点定制,可能低估其上限。

未来方向

作者提出的方向:论文明确表示预计会出现更多组件类型;把 Chain 纳入自动化循环(当前因内部状态不可观测而被排除);深化用户显式约束——目前已支持两类:量化目标(目标成功率或平均步数)与自然语言描述的弱点(如「提交补丁前没跑失败测试」,EnvRigger 据此生成拦截未跑测试提交的 githook 风格 Contract,并从轨迹蒸馏出「验证驱动开发」技能)。基于成果可延伸的方向:一是把 EnvRigger 循环与在线 RL 级联成策略-环境持续共同进化系统,扩展实验已显示每 50 个环境产出一个技能库、两者交替进化的雏形(47.67 到 54.79);二是把定制环境用作智能体评测的对抗性压力测试集,量化鲁棒性;三是研究组件与技能的跨任务、跨策略迁移以摊薄定制成本;四是从理论上刻画组件复合对任务可解性与难度的影响边界。

复现评估

复现条件:论文给出 github.com/google-research/envharness 与 www.envharness.com,为 Google Research 项目;组件接口与类架构的实现说明在附录 C,EnvRigger 的系统提示与验收标准在附录 A,训练/评测划分在附录 E.1。模型依赖是最大门槛:策略与 EnvRigger 在 ALFWorld/WebArena 用 Gemini-3.1-Flash-Lite、其余基准用 Gemini-3.5-Flash(闭源 API,有版本漂移风险),RL 实验用开源的 Qwen3-8B-base 加 GRPO,需多卡训练算力。六个基准(ALFWorld、WebArena、SWE-bench Verified、OfficeQA、SpreadsheetBench、WebShop)全部公开可得。主要成本:EnvRigger 每任务多轮真实 rollout 的 API 费用、ReasoningBank 风格技能提取的提示对齐。总体评估:中等偏难——数据与协议透明、跨模型实验有助于验证稳健性,但闭源模型依赖与大量 rollout 开销意味着从零复现到论文数字需要可观预算。