EnvACE:通过世界预演将环境动态内化的智能体强化学习方法 EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
让单一策略同时扮演行动者与环境,内化世界模型以摆脱外部环境依赖。
前置知识
POMDP(部分可观察马尔可夫决策过程)
一种决策过程建模框架,状态空间 $S$ 对智能体不可直接观测,智能体只能通过观测 $O$ 间接感知环境。本文把工具交互任务形式化为 $M=(S,A,O,P,R)$,其中 $A$ 包含结构化工具调用与最终答案,$P$ 决定状态转移以及动作后返回的观测,$R$ 评估整条轨迹的任务完成度。
理解本文为何要把"生成观测"也交给策略,必须先理解传统 POMDP 里"策略只产动作、环境产观测"这一分工边界,EnvACE 改写的正是这条边界。
GRPO(Group Relative Policy Optimization)
DeepSeek-R1 提出的 RL 算法。对同一个 instruction 采样一组 $K$ 条 rollout,用组内奖励归一化来估计优势 $A$,无需单独训练 critic,再用 clipped 目标更新策略。本文的 role-wise GRPO 在此基础上为 ACT/REHEARSE 两个角色分别计算基线。
GRPO 是本文的核心优化器,role-wise 改造是关键创新点;不懂 GRPO 的组内归一化,就无法理解为什么要按角色分组算优势。
World Model(世界模型)
学习环境动态的模型,能预测动作导致的下一状态或观测,常用于 lookahead 和规划。传统做法是单独训练一个世界模型供智能体查询调用;EnvACE 则把世界建模能力吸收进策略参数本身,形成所谓 agent world model。
整篇论文的立意就是把"外部世界模型"变成"内化在策略里的世界模型",这是理解 world rehearsal 概念的钥匙。
Agentic RL(智能体强化学习)
把 LLM 训练成能多轮调用工具、与用户和环境交互的智能体的强化学习方法,典型轨迹是 reasoning-action-observation 交替的长 horizon 序列,用任务成功的可验证奖励(RLVR)做优化,涉及信用分配、训练稳定性等挑战。
本文所属的训练范式;理解其长 horizon 与环境构建成本两大痛点,才能理解 EnvACE 想解决的核心矛盾。
Tool Use / Function Calling(工具调用)
LLM 通过结构化 JSON 调用外部 API/函数来查询或改变环境状态,每次工具调用后环境返回一个观测(结果或错误)。BFCL、$\tau^2$-Bench 等基准专门评估这种能力,涉及单轮、多轮、有状态、不可逆写操作等子任务。
EnvACE 的 rehearsal 角色本质上就是在"模拟工具调用的返回结果",理解工具调用机制才能理解 rehearsal 到底在生成什么。
研究动机
训练用于长 horizon 工具使用的 LLM 智能体,传统上依赖与真实或合成可执行环境的交互,或者外部 LLM 模拟器,两条路都有硬伤。真实/合成可执行环境的构建流水线昂贵且复杂,随复杂度增长其正确性越来越难验证;而基于 LLM 的模拟器(如 Simulator-8B)虽然更便宜灵活、能直接生成工具输出和用户反馈,但其响应可能不准确或不一致,grounding 仍需要真实环境的监督。具体到 BFCL-v4、$\tau^2$-Bench 这类多轮有状态任务,环境必须能正确追踪订单状态、用户身份和业务规则(例如 basic_economy 机票不允许改签、订单号必须以 # 开头),任何一个响应错误都会让策略学到错误的因果关系。更根本的问题是,如图 1 所示,无论是真实环境 rollout 还是外部模拟器 rollout,策略都只是"消费"外部提供的观测,环境建模能力始终游离在执行策略之外,导致策略的可扩展性和学习质量被外部响应提供者卡住脖子。
本文的目标是本文要让一个单一策略既能"行动"又能"预演环境响应",从而在训练阶段完全摆脱对外部环境的依赖。可量化的目标包括:第一,在 BFCL-v4、$\tau^2$-Bench、VitaBench、FinMCP-Bench 四个异构基准上的 Overall 分数超过依赖环境扩展的强基线;第二,让策略把动作与响应的因果关系吸收进自身参数,形成可泛化的 agent world model;第三,在不同模型规模(1.7B 到 8B)上保持有效,且规模越大收益越大;第四,在测试阶段复用这个内化世界模型做"私有预演",在不增加任何外部交互的前提下进一步提升最终执行表现,并证明收益来自内化知识而非单纯增加推理算力。
与已有工作不同的是,已有工作的共同盲点在于:无论是合成可执行环境、LLM 模拟器,还是把"预测下一观测"当作辅助损失的方法,环境动态始终被放在策略外部或仅作为辅助信号。EnvACE 抓住的被忽视的角度是——把"生成环境响应"本身变成策略的一个显式角色(rehearsal role),与 acting 角色共享同一套参数,并直接用任务成功奖励端到端联合优化。这相当于把传统 POMDP 中"策略产动作、环境产观测"的分工边界改写为"策略同时产动作和观测"。这一视角源自 learned world model 的成功,但本质区别在于:它不是单独训练一个世界模型供智能体查询,而是让世界建模与行动在统一过程中展开,使策略在 acting 的同时就在学习"我的动作会引发什么响应"。
核心方法
直觉上,可以把 EnvACE 想象成一位演员在排练室里自导自演:他先抛出一个动作(比如查订单),然后立刻切换角色扮演导演/环境,自己说出这个动作会得到的反馈("订单号格式不对,缺少 # 号"),再根据这个自己给的反馈决定下一步。整条轨迹从头到尾都是这位演员一个人走完的,不需要真正的舞台(外部环境)。技术路线是:在 POMDP $M=(S,A,O,P,R)$ 框架下,给共享策略 $\pi_\theta$ 赋予两个角色 ACT 和 REHEARSE。每一步先用 ACT 角色生成动作 $a_t \sim \pi_\theta(\cdot | h_t, \text{ACT})$,再用 REHEARSE 角色生成对应的环境响应 $\hat{o}_t \sim \pi_\theta(\cdot | h_t, a_t, \text{REHEARSE})$,把 $\hat{o}_t$ 拼进历史 $h_{t+1} = h_t \oplus (a_t, \hat{o}_t)$,交替进行直到终止。整条轨迹 $\tau=(x, a_1, \hat{o}_1, \ldots, a_T, \hat{o}_T)$ 完全由策略自己展开,不需要查询任何外部环境。
核心创新点是"双角色 + 参数共享 + 联合优化"三位一体。与已有方法的本质区别有三层。第一,已有方法(合成环境、LLM 模拟器)把世界建模放在策略外部,EnvACE 把它吸收进策略参数本身。第二,已有的"预测下一观测"类辅助损失只是把观测预测当作正则信号,EnvACE 则把 rehearsed 响应直接作为 on-policy 轨迹的一部分参与决策,后续动作真的基于这个自己生成的观测来选。第三,role-wise GRPO 为两个角色分别计算基线 $\mu_{x,r} = \frac{1}{|G_{x,r}|}\sum R_j$,优势 $A_{i,m} = R_i - \mu_{x,r_{i,m}}$,让 acting 和 rehearsal 各自相对同角色输出来估计优势,避免一个角色的噪声淹没另一个,但两个角色的梯度又共同更新同一套参数 $\theta$。参数共享是让 rehearsal 学到的环境知识能直接服务于 acting 决策的关键——消融显示共享相比分离策略在 $\tau^2$-Bench 上有 1.2% 的提升,证明环境动态确实被内化进了行动策略。
方法步骤详情
完整流程分训练和测试两阶段。训练阶段:(1) 对每个 instruction $x$ 采样一组 $K$ 条 rollout;(2) 每条 rollout 中策略交替扮演 ACT 与 REHEARSE——先产 tool call,再自己产环境响应,拼入历史,循环直到轨迹终止(最多 30 轮);(3) 轨迹终止后由可验证评估器或 checklist-based LLM judge(训练时用 Qwen3-30B-A3B)给出轨迹级奖励 $R_i$;(4) 按 role-wise GRPO,先按角色 $r$ 收集所有输出 $G_{x,r}$,分别算基线 $\mu_{x,r}$ 和优势 $A_{i,m}$;(5) 用 clipped 目标 $\max_\theta \mathbb{E}[\min(\rho A, \text{clip}(\rho, 1-\epsilon, 1+\epsilon)A)]$ 联合更新 $\theta$。附录给出了 rehearsal 角色的提示词,它会校验 tool call 的格式、白名单、JSON schema,通过后才生成符合 schema 的执行结果。测试阶段(test-time scaling):给定新指令 $x$,策略做 $N$ 次私有预演尝试,每次产生想象轨迹 $\tilde{\tau}^{(n)}$ 并自我评估得到反馈 $f^{(n)}$;并行模式下各次独立 $\tilde{\tau}^{(n)} \sim \Pi_\theta(\cdot|x)$,顺序模式下每次能看到之前轨迹与反馈 $\tilde{\tau}^{(n)} \sim \Pi_\theta(\cdot|x, \{(\tilde{\tau}^{(j)}, f^{(j)})\}_{j<n})$;最后把所有轨迹和自评汇总成紧凑的 rehearsal memory $m_x$,ACT 角色基于 $m_x$ 在真实环境里执行唯一一次提交,预演过程本身不改变外部环境。
技术新颖性
技术新颖性体现在三个层面。算法层面,role-wise GRPO 是对标准 GRPO 的角色化改造——把同一条轨迹里属于不同角色的 token 输出分组、分别归一化优势,目的是让"生成观测"和"生成动作"这两种本质不同分布的任务各自学到合适的相对优势,而不是被同一个基线稀释。范式层面,world rehearsal 区别于所有"外部世界模型"工作:它不查询、不调用外部模拟器,而是让策略 inline 地自己生成下一步观测并据此继续决策,整条训练轨迹无需任何外部环境交互。与 CoMap、Policy and world modeling co-training 这类把世界模型和策略分开(哪怕是协同训练)的方法相比,EnvACE 强调的是单一策略、单一过程。测试层面,把内化世界模型当作 test-time scaling 的计算载体也是新颖的——不需要额外环境交互,仅靠策略自己的想象就能多采几条候选、择优提交,并且作者通过用 base 模型做对照实验,证明增益确实来自内化知识而非单纯多算。
实验结果
主结果(Table 1)显示 EnvACE-8B 在 BFCL-v4、$\tau^2$-Bench、VitaBench 三基准 Overall 达 32.91%,在有完整结果的环境扩展基线中最高,分别超过 EnvScaler-8B(31.92%)0.99%、AWM-14B(32.54%)0.37%。分基准看:BFCL-v4 Avg. 46.04%,比 Qwen3-8B(44.04%)高 2.00%、比 AWM-8B(44.29%)高 1.75%,距 EnvScaler-8B(47.07%)仅差 1.03%;$\tau^2$-Bench Avg. 36.7%(列第二),分别超 EnvScaler-8B(32.9%)、AWM-8B(31.2%)、AWM-14B(30.7%)3.8%、5.5%、6.0%,在有状态多轮交互上优势尤其明显,说明联合学习预演能更好预判交互动态;VitaBench Avg. 16.0%,是所有 7B–8B 方法里最高,超 EnvScaler-8B(15.8%)、ScaleEnv-8B(15.0%)0.2% 和 1.0%。金融基准 FinMCP-Bench(Table 2)上 EnvACE-8B 拿到最高 TF1 46.78%,超 EnvScaler-8B(43.68%)3.10%、AWM-8B(42.50%)4.28%,工具精度 TP 54.04% 也是最高,虽然召回 TR 41.23% 不是最高但 F1 平衡最好。消融(Figure 3)证明 world rehearsal 在 $\tau^2$-Bench 上把标准 GRPO 的 31.2% 提到 36.7%(+5.5%),参数共享比分离的 Per-role Policy(35.5%)再高 1.2%。规模实验(Figure 4)显示从 1.7B 到 8B,BFCL-v4 从 31.81% 升到 46.04%(+14.23%),$\tau^2$-Bench 从 15.3% 升到 36.7%(+21.4%),且 EnvACE 在两个规模上均胜过标准 GRPO,规模越大增益越显著。测试时扩展(Table 3)在 $N=2$ 时并行预演 Overall 40.9%,比 Non-TTS(36.7%)高 4.2%,$\tau^2$-Bench 31.4%→38.0%、BFCL Multi-Turn 41.9%→43.9%;用 EnvACE 做预演显著优于用 base 模型(后者并行仅 36.8%、顺序 34.9% 甚至低于 Non-TTS),证明收益来自内化的世界知识而非单纯多算。训练动态(Figure 5)显示离线评估分从 step 50 的 30.0% 上升到 step 470 的 36.7%,整体向上但中途有波动。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 三基准 Overall(BFCL-v4 + τ²-Bench + VitaBench) | Overall 平均分 | 32.91% | EnvScaler-8B 31.92% / AWM-14B 32.54% | 比 EnvScaler-8B +0.99%,比 AWM-14B +0.37%,在有完整结果的环境扩展基线中最高 |
| τ²-Bench 多轮有状态工具交互 | 平均分 | 36.7% | EnvScaler-8B 32.9% / AWM-8B 31.2% | 比 EnvScaler-8B +3.8%、比 AWM-8B +5.5%、比 AWM-14B +6.0%;比标准 GRPO +5.5%(消融) |
| FinMCP-Bench 金融工具调用 | TF1 | 46.78% | EnvScaler-8B 43.68% / AWM-8B 42.50% | TF1 +3.10% / +4.28%,工具精度 TP 54.04% 列最高 |
| Test-time scaling(N=2 并行预演) | Overall(τ² + BFCL Multi-Turn) | 40.9% | Non-TTS 36.7% | +4.2%;用 base 模型做预演仅 36.8%,证明增益来自内化知识 |
| 模型规模扩展(1.7B → 8B) | BFCL-v4 / τ²-Bench Avg. | 31.81% → 46.04% / 15.3% → 36.7% | 1.7B 起点 | BFCL-v4 +14.23%、τ²-Bench +21.4%,world rehearsal 随规模放大收益更大 |
局限与改进
作者承认的局限有两条:一是算力限制只做到 8B 规模,更大模型(如 70B)上的效果待验证;二是当前评估主要集中在工具交互任务,向更广智能体场景(如 Web/GUI 导航、软件工程)的扩展留作未来工作。我自己的观察补充几点:第一,rehearsal 角色本质是让策略"想象"环境响应,对于有严格确定语义的工具(真实数据库查询、金融计算),策略想象出的响应可能与真实环境存在系统性偏差,而论文未给出 rehearsal 响应与真实环境响应的一致性量化指标;第二,Table 3 与 Figure 6 显示 $N=3$ 时性能反而下降,作者归因于上下文变长逼近有效范围,说明 test-time scaling 的上限受 context length 限制;第三,在 BFCL-v4 上 EnvACE 并非最优(EnvScaler-8B 47.07% 更高),说明在某些任务上精心合成的外部真实环境仍有不可替代的优势,world rehearsal 并非全面碾压;第四,TTS 实验因算力只跑单次(非 Avg@4),方差未经多次验证。
独立分析的弱点
弱点一:rehearsal 的"幻觉风险"未充分量化。在金融计算、库存查询这类对状态一致性要求极高的场景,策略自生成的观测若与真实环境不符,会训练出错误因果。改进方向是引入真实环境锚定的稀疏校验——例如每隔 $K$ 步用真实环境抽查 rehearsal 响应并给予一致性奖励,形成以自预演为主、偶尔查证为辅的混合训练。弱点二:test-time scaling 的增益受 context 限制($N=3$ 退化)。改进方向是把 rehearsal memory $m_x$ 做成层次化摘要或外部记忆检索,而非线性拼接进上下文,从而支持更大的 $N$。弱点三:role-wise GRPO 的基线估计在高方差场景下可能不稳,尤其当一个角色在某条轨迹里输出很少时基线估计噪声大。改进方向是引入 GAE 风格的时序优势或跨 instruction 的基线平滑来降低方差。弱点四:只在 8B 验证,scaling law 不明朗,未给 70B 量级的趋势预测,难以判断该范式在大模型上是增益放大还是饱和;建议补一条更大规模的 scaling 曲线。
未来方向
作者明确提出的方向是扩展到更大模型和更广智能体场景。基于成果可延伸的方向:第一,把 world rehearsal 从工具调用推广到 Web/GUI 导航和代码执行等需要长 horizon、强状态依赖的领域,验证内化世界模型的跨域迁移性;第二,探索 rehearsal 角色与 acting 角色的非对称设计——例如让 rehearsal 用更小或更大的 LoRA 分支,平衡参数共享带来的收益与角色干扰;第三,把 test-time 的并行/顺序预演与树搜索(如 MCTS)结合,构建更结构化的"想象空间",而不只是线性多次尝试;第四,引入主动学习机制,让策略在 rehearsal 不确定时主动请求少量真实环境交互,从而在摆脱外部环境依赖与保证响应正确性之间取得动态平衡。
复现评估
复现门槛中等偏高。开源情况良好:代码已公开在 https://github.com/Within-yao/EnvACE ,附录还提供了 world rehearsal prompt、self-evaluation prompt、summarization prompt 三个关键提示词的全文,能复现核心的"双角色预演"机制。训练数据用的是 CM2 数据集(arXiv:2602.12268),公开可获取。训练超参交代清楚:Qwen3-8B 主干、470 步、学习率 $1\times10^{-6}$、batch size 16、每 prompt 4 条 rollout、KL 系数 $1\times10^{-4}$、entropy 系数 0.0、每步采样 64 实例、输入 12k/响应 8k token、每条轨迹最多 30 轮、judge 用 Qwen3-30B-A3B,基于 verl 框架、16 张 NVIDIA H20 GPU。主要难点在于:16 张 H20 的算力门槛不低;role-wise GRPO 的实现需要对 verl 做定制改造,按角色分组算基线不是现成功能;TTS 实验因算力只跑单次,方差难以独立验证;另外 rehearsal prompt 里依赖 few-shot 真实工具调用作为参考,这部分 few-shot 数据的来源与质量对效果影响较大但披露有限。
论文图表
对比三种 rollout 范式:真实环境 rollout、外部 LLM 模拟器 rollout、以及 EnvACE 的 world rehearsal。前两者从外部获取环境响应,而 EnvACE 把环境响应内化在策略自身内部。
这张图一图道破本文的立意——它清晰地画出 EnvACE 与已有两种范式在"环境响应从哪来"上的本质区别,是理解整个动机的最佳入口。