← 返回 2026-08-07

EnvACE:通过世界预演将环境动态内化的智能体强化学习方法 EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang Huang, Yan Xu, Yasheng Wang, Weinan Zhang, Xingshan Zeng, Weiwen Liu 📅 2026-08-06 👍 40 2026-08-11 18:30
LLM Agent Test-time Scaling 世界模型 工具调用 强化学习 智能体

让单一策略同时扮演行动者与环境,内化世界模型以摆脱外部环境依赖。

前置知识

POMDP(部分可观察马尔可夫决策过程)

一种决策过程建模框架,状态空间 $S$ 对智能体不可直接观测,智能体只能通过观测 $O$ 间接感知环境。本文把工具交互任务形式化为 $M=(S,A,O,P,R)$,其中 $A$ 包含结构化工具调用与最终答案,$P$ 决定状态转移以及动作后返回的观测,$R$ 评估整条轨迹的任务完成度。

理解本文为何要把"生成观测"也交给策略,必须先理解传统 POMDP 里"策略只产动作、环境产观测"这一分工边界,EnvACE 改写的正是这条边界。

GRPO(Group Relative Policy Optimization)

DeepSeek-R1 提出的 RL 算法。对同一个 instruction 采样一组 $K$ 条 rollout,用组内奖励归一化来估计优势 $A$,无需单独训练 critic,再用 clipped 目标更新策略。本文的 role-wise GRPO 在此基础上为 ACT/REHEARSE 两个角色分别计算基线。

GRPO 是本文的核心优化器,role-wise 改造是关键创新点;不懂 GRPO 的组内归一化,就无法理解为什么要按角色分组算优势。

World Model(世界模型)

学习环境动态的模型,能预测动作导致的下一状态或观测,常用于 lookahead 和规划。传统做法是单独训练一个世界模型供智能体查询调用;EnvACE 则把世界建模能力吸收进策略参数本身,形成所谓 agent world model。

整篇论文的立意就是把"外部世界模型"变成"内化在策略里的世界模型",这是理解 world rehearsal 概念的钥匙。

Agentic RL(智能体强化学习)

把 LLM 训练成能多轮调用工具、与用户和环境交互的智能体的强化学习方法,典型轨迹是 reasoning-action-observation 交替的长 horizon 序列,用任务成功的可验证奖励(RLVR)做优化,涉及信用分配、训练稳定性等挑战。

本文所属的训练范式;理解其长 horizon 与环境构建成本两大痛点,才能理解 EnvACE 想解决的核心矛盾。

Tool Use / Function Calling(工具调用)

LLM 通过结构化 JSON 调用外部 API/函数来查询或改变环境状态,每次工具调用后环境返回一个观测(结果或错误)。BFCL、$\tau^2$-Bench 等基准专门评估这种能力,涉及单轮、多轮、有状态、不可逆写操作等子任务。

EnvACE 的 rehearsal 角色本质上就是在"模拟工具调用的返回结果",理解工具调用机制才能理解 rehearsal 到底在生成什么。

研究动机

训练用于长 horizon 工具使用的 LLM 智能体,传统上依赖与真实或合成可执行环境的交互,或者外部 LLM 模拟器,两条路都有硬伤。真实/合成可执行环境的构建流水线昂贵且复杂,随复杂度增长其正确性越来越难验证;而基于 LLM 的模拟器(如 Simulator-8B)虽然更便宜灵活、能直接生成工具输出和用户反馈,但其响应可能不准确或不一致,grounding 仍需要真实环境的监督。具体到 BFCL-v4、$\tau^2$-Bench 这类多轮有状态任务,环境必须能正确追踪订单状态、用户身份和业务规则(例如 basic_economy 机票不允许改签、订单号必须以 # 开头),任何一个响应错误都会让策略学到错误的因果关系。更根本的问题是,如图 1 所示,无论是真实环境 rollout 还是外部模拟器 rollout,策略都只是"消费"外部提供的观测,环境建模能力始终游离在执行策略之外,导致策略的可扩展性和学习质量被外部响应提供者卡住脖子。

本文的目标是本文要让一个单一策略既能"行动"又能"预演环境响应",从而在训练阶段完全摆脱对外部环境的依赖。可量化的目标包括:第一,在 BFCL-v4、$\tau^2$-Bench、VitaBench、FinMCP-Bench 四个异构基准上的 Overall 分数超过依赖环境扩展的强基线;第二,让策略把动作与响应的因果关系吸收进自身参数,形成可泛化的 agent world model;第三,在不同模型规模(1.7B 到 8B)上保持有效,且规模越大收益越大;第四,在测试阶段复用这个内化世界模型做"私有预演",在不增加任何外部交互的前提下进一步提升最终执行表现,并证明收益来自内化知识而非单纯增加推理算力。

与已有工作不同的是,已有工作的共同盲点在于:无论是合成可执行环境、LLM 模拟器,还是把"预测下一观测"当作辅助损失的方法,环境动态始终被放在策略外部或仅作为辅助信号。EnvACE 抓住的被忽视的角度是——把"生成环境响应"本身变成策略的一个显式角色(rehearsal role),与 acting 角色共享同一套参数,并直接用任务成功奖励端到端联合优化。这相当于把传统 POMDP 中"策略产动作、环境产观测"的分工边界改写为"策略同时产动作和观测"。这一视角源自 learned world model 的成功,但本质区别在于:它不是单独训练一个世界模型供智能体查询,而是让世界建模与行动在统一过程中展开,使策略在 acting 的同时就在学习"我的动作会引发什么响应"。

核心方法

直觉上,可以把 EnvACE 想象成一位演员在排练室里自导自演:他先抛出一个动作(比如查订单),然后立刻切换角色扮演导演/环境,自己说出这个动作会得到的反馈("订单号格式不对,缺少 # 号"),再根据这个自己给的反馈决定下一步。整条轨迹从头到尾都是这位演员一个人走完的,不需要真正的舞台(外部环境)。技术路线是:在 POMDP $M=(S,A,O,P,R)$ 框架下,给共享策略 $\pi_\theta$ 赋予两个角色 ACT 和 REHEARSE。每一步先用 ACT 角色生成动作 $a_t \sim \pi_\theta(\cdot | h_t, \text{ACT})$,再用 REHEARSE 角色生成对应的环境响应 $\hat{o}_t \sim \pi_\theta(\cdot | h_t, a_t, \text{REHEARSE})$,把 $\hat{o}_t$ 拼进历史 $h_{t+1} = h_t \oplus (a_t, \hat{o}_t)$,交替进行直到终止。整条轨迹 $\tau=(x, a_1, \hat{o}_1, \ldots, a_T, \hat{o}_T)$ 完全由策略自己展开,不需要查询任何外部环境。

核心创新点是"双角色 + 参数共享 + 联合优化"三位一体。与已有方法的本质区别有三层。第一,已有方法(合成环境、LLM 模拟器)把世界建模放在策略外部,EnvACE 把它吸收进策略参数本身。第二,已有的"预测下一观测"类辅助损失只是把观测预测当作正则信号,EnvACE 则把 rehearsed 响应直接作为 on-policy 轨迹的一部分参与决策,后续动作真的基于这个自己生成的观测来选。第三,role-wise GRPO 为两个角色分别计算基线 $\mu_{x,r} = \frac{1}{|G_{x,r}|}\sum R_j$,优势 $A_{i,m} = R_i - \mu_{x,r_{i,m}}$,让 acting 和 rehearsal 各自相对同角色输出来估计优势,避免一个角色的噪声淹没另一个,但两个角色的梯度又共同更新同一套参数 $\theta$。参数共享是让 rehearsal 学到的环境知识能直接服务于 acting 决策的关键——消融显示共享相比分离策略在 $\tau^2$-Bench 上有 1.2% 的提升,证明环境动态确实被内化进了行动策略。

方法步骤详情

完整流程分训练和测试两阶段。训练阶段:(1) 对每个 instruction $x$ 采样一组 $K$ 条 rollout;(2) 每条 rollout 中策略交替扮演 ACT 与 REHEARSE——先产 tool call,再自己产环境响应,拼入历史,循环直到轨迹终止(最多 30 轮);(3) 轨迹终止后由可验证评估器或 checklist-based LLM judge(训练时用 Qwen3-30B-A3B)给出轨迹级奖励 $R_i$;(4) 按 role-wise GRPO,先按角色 $r$ 收集所有输出 $G_{x,r}$,分别算基线 $\mu_{x,r}$ 和优势 $A_{i,m}$;(5) 用 clipped 目标 $\max_\theta \mathbb{E}[\min(\rho A, \text{clip}(\rho, 1-\epsilon, 1+\epsilon)A)]$ 联合更新 $\theta$。附录给出了 rehearsal 角色的提示词,它会校验 tool call 的格式、白名单、JSON schema,通过后才生成符合 schema 的执行结果。测试阶段(test-time scaling):给定新指令 $x$,策略做 $N$ 次私有预演尝试,每次产生想象轨迹 $\tilde{\tau}^{(n)}$ 并自我评估得到反馈 $f^{(n)}$;并行模式下各次独立 $\tilde{\tau}^{(n)} \sim \Pi_\theta(\cdot|x)$,顺序模式下每次能看到之前轨迹与反馈 $\tilde{\tau}^{(n)} \sim \Pi_\theta(\cdot|x, \{(\tilde{\tau}^{(j)}, f^{(j)})\}_{j<n})$;最后把所有轨迹和自评汇总成紧凑的 rehearsal memory $m_x$,ACT 角色基于 $m_x$ 在真实环境里执行唯一一次提交,预演过程本身不改变外部环境。

技术新颖性

技术新颖性体现在三个层面。算法层面,role-wise GRPO 是对标准 GRPO 的角色化改造——把同一条轨迹里属于不同角色的 token 输出分组、分别归一化优势,目的是让"生成观测"和"生成动作"这两种本质不同分布的任务各自学到合适的相对优势,而不是被同一个基线稀释。范式层面,world rehearsal 区别于所有"外部世界模型"工作:它不查询、不调用外部模拟器,而是让策略 inline 地自己生成下一步观测并据此继续决策,整条训练轨迹无需任何外部环境交互。与 CoMap、Policy and world modeling co-training 这类把世界模型和策略分开(哪怕是协同训练)的方法相比,EnvACE 强调的是单一策略、单一过程。测试层面,把内化世界模型当作 test-time scaling 的计算载体也是新颖的——不需要额外环境交互,仅靠策略自己的想象就能多采几条候选、择优提交,并且作者通过用 base 模型做对照实验,证明增益确实来自内化知识而非单纯多算。

Overview of EnvACE and world rehearsal.
Figure 2: Overview of EnvACE and world rehearsal.
Case study of EnvACE compared with EnvScaler8B and Vanilla agents (Case A).
Figure 7: Case study of EnvACE compared with EnvScaler8B and Vanilla agents (Case A).

实验结果

主结果(Table 1)显示 EnvACE-8B 在 BFCL-v4、$\tau^2$-Bench、VitaBench 三基准 Overall 达 32.91%,在有完整结果的环境扩展基线中最高,分别超过 EnvScaler-8B(31.92%)0.99%、AWM-14B(32.54%)0.37%。分基准看:BFCL-v4 Avg. 46.04%,比 Qwen3-8B(44.04%)高 2.00%、比 AWM-8B(44.29%)高 1.75%,距 EnvScaler-8B(47.07%)仅差 1.03%;$\tau^2$-Bench Avg. 36.7%(列第二),分别超 EnvScaler-8B(32.9%)、AWM-8B(31.2%)、AWM-14B(30.7%)3.8%、5.5%、6.0%,在有状态多轮交互上优势尤其明显,说明联合学习预演能更好预判交互动态;VitaBench Avg. 16.0%,是所有 7B–8B 方法里最高,超 EnvScaler-8B(15.8%)、ScaleEnv-8B(15.0%)0.2% 和 1.0%。金融基准 FinMCP-Bench(Table 2)上 EnvACE-8B 拿到最高 TF1 46.78%,超 EnvScaler-8B(43.68%)3.10%、AWM-8B(42.50%)4.28%,工具精度 TP 54.04% 也是最高,虽然召回 TR 41.23% 不是最高但 F1 平衡最好。消融(Figure 3)证明 world rehearsal 在 $\tau^2$-Bench 上把标准 GRPO 的 31.2% 提到 36.7%(+5.5%),参数共享比分离的 Per-role Policy(35.5%)再高 1.2%。规模实验(Figure 4)显示从 1.7B 到 8B,BFCL-v4 从 31.81% 升到 46.04%(+14.23%),$\tau^2$-Bench 从 15.3% 升到 36.7%(+21.4%),且 EnvACE 在两个规模上均胜过标准 GRPO,规模越大增益越显著。测试时扩展(Table 3)在 $N=2$ 时并行预演 Overall 40.9%,比 Non-TTS(36.7%)高 4.2%,$\tau^2$-Bench 31.4%→38.0%、BFCL Multi-Turn 41.9%→43.9%;用 EnvACE 做预演显著优于用 base 模型(后者并行仅 36.8%、顺序 34.9% 甚至低于 Non-TTS),证明收益来自内化的世界知识而非单纯多算。训练动态(Figure 5)显示离线评估分从 step 50 的 30.0% 上升到 step 470 的 36.7%,整体向上但中途有波动。

Benchmark results across BFCL V4, τ²-Bench, and VitaBench.
Table 1: Benchmark results across BFCL V4, τ²-Bench, and VitaBench.
Performance comparison on FinMCP-Bench using TR, TP, and TF1 metrics.
Table 2: Performance comparison on FinMCP-Bench using TR, TP, and TF1 metrics.
Test-time scaling with N=2 on τ² and BFCL multi-turn.
Table 3: Test-time scaling with N=2 on τ² and BFCL multi-turn.
Ablation results on τ²-Bench.
Figure 3: Ablation results on τ²-Bench.
EnvACE performance across model scales.
Figure 4: EnvACE performance across model scales.
TTS scaling performance on BFCL Multi-Turn.
Figure 6: TTS scaling performance on BFCL Multi-Turn.
查看结构化数据
任务指标本文基线提升
三基准 Overall(BFCL-v4 + τ²-Bench + VitaBench) Overall 平均分 32.91% EnvScaler-8B 31.92% / AWM-14B 32.54% 比 EnvScaler-8B +0.99%,比 AWM-14B +0.37%,在有完整结果的环境扩展基线中最高
τ²-Bench 多轮有状态工具交互 平均分 36.7% EnvScaler-8B 32.9% / AWM-8B 31.2% 比 EnvScaler-8B +3.8%、比 AWM-8B +5.5%、比 AWM-14B +6.0%;比标准 GRPO +5.5%(消融)
FinMCP-Bench 金融工具调用 TF1 46.78% EnvScaler-8B 43.68% / AWM-8B 42.50% TF1 +3.10% / +4.28%,工具精度 TP 54.04% 列最高
Test-time scaling(N=2 并行预演) Overall(τ² + BFCL Multi-Turn) 40.9% Non-TTS 36.7% +4.2%;用 base 模型做预演仅 36.8%,证明增益来自内化知识
模型规模扩展(1.7B → 8B) BFCL-v4 / τ²-Bench Avg. 31.81% → 46.04% / 15.3% → 36.7% 1.7B 起点 BFCL-v4 +14.23%、τ²-Bench +21.4%,world rehearsal 随规模放大收益更大

局限与改进

作者承认的局限有两条:一是算力限制只做到 8B 规模,更大模型(如 70B)上的效果待验证;二是当前评估主要集中在工具交互任务,向更广智能体场景(如 Web/GUI 导航、软件工程)的扩展留作未来工作。我自己的观察补充几点:第一,rehearsal 角色本质是让策略"想象"环境响应,对于有严格确定语义的工具(真实数据库查询、金融计算),策略想象出的响应可能与真实环境存在系统性偏差,而论文未给出 rehearsal 响应与真实环境响应的一致性量化指标;第二,Table 3 与 Figure 6 显示 $N=3$ 时性能反而下降,作者归因于上下文变长逼近有效范围,说明 test-time scaling 的上限受 context length 限制;第三,在 BFCL-v4 上 EnvACE 并非最优(EnvScaler-8B 47.07% 更高),说明在某些任务上精心合成的外部真实环境仍有不可替代的优势,world rehearsal 并非全面碾压;第四,TTS 实验因算力只跑单次(非 Avg@4),方差未经多次验证。

独立分析的弱点

弱点一:rehearsal 的"幻觉风险"未充分量化。在金融计算、库存查询这类对状态一致性要求极高的场景,策略自生成的观测若与真实环境不符,会训练出错误因果。改进方向是引入真实环境锚定的稀疏校验——例如每隔 $K$ 步用真实环境抽查 rehearsal 响应并给予一致性奖励,形成以自预演为主、偶尔查证为辅的混合训练。弱点二:test-time scaling 的增益受 context 限制($N=3$ 退化)。改进方向是把 rehearsal memory $m_x$ 做成层次化摘要或外部记忆检索,而非线性拼接进上下文,从而支持更大的 $N$。弱点三:role-wise GRPO 的基线估计在高方差场景下可能不稳,尤其当一个角色在某条轨迹里输出很少时基线估计噪声大。改进方向是引入 GAE 风格的时序优势或跨 instruction 的基线平滑来降低方差。弱点四:只在 8B 验证,scaling law 不明朗,未给 70B 量级的趋势预测,难以判断该范式在大模型上是增益放大还是饱和;建议补一条更大规模的 scaling 曲线。

未来方向

作者明确提出的方向是扩展到更大模型和更广智能体场景。基于成果可延伸的方向:第一,把 world rehearsal 从工具调用推广到 Web/GUI 导航和代码执行等需要长 horizon、强状态依赖的领域,验证内化世界模型的跨域迁移性;第二,探索 rehearsal 角色与 acting 角色的非对称设计——例如让 rehearsal 用更小或更大的 LoRA 分支,平衡参数共享带来的收益与角色干扰;第三,把 test-time 的并行/顺序预演与树搜索(如 MCTS)结合,构建更结构化的"想象空间",而不只是线性多次尝试;第四,引入主动学习机制,让策略在 rehearsal 不确定时主动请求少量真实环境交互,从而在摆脱外部环境依赖与保证响应正确性之间取得动态平衡。

复现评估

复现门槛中等偏高。开源情况良好:代码已公开在 https://github.com/Within-yao/EnvACE ,附录还提供了 world rehearsal prompt、self-evaluation prompt、summarization prompt 三个关键提示词的全文,能复现核心的"双角色预演"机制。训练数据用的是 CM2 数据集(arXiv:2602.12268),公开可获取。训练超参交代清楚:Qwen3-8B 主干、470 步、学习率 $1\times10^{-6}$、batch size 16、每 prompt 4 条 rollout、KL 系数 $1\times10^{-4}$、entropy 系数 0.0、每步采样 64 实例、输入 12k/响应 8k token、每条轨迹最多 30 轮、judge 用 Qwen3-30B-A3B,基于 verl 框架、16 张 NVIDIA H20 GPU。主要难点在于:16 张 H20 的算力门槛不低;role-wise GRPO 的实现需要对 verl 做定制改造,按角色分组算基线不是现成功能;TTS 实验因算力只跑单次,方差难以独立验证;另外 rehearsal prompt 里依赖 few-shot 真实工具调用作为参考,这部分 few-shot 数据的来源与质量对效果影响较大但披露有限。