AgentMercury:智能体可大规模合成可验证的业务场景环境 AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale
提出PLANET角色从业务场景合成可执行可验证环境,训练出的策略在域内外基准均显著提升。
前置知识
策略模型(Policy)
强化学习中决定智能体行为的组件:在每一步根据交互历史 $h_t$ 输出动作分布 $a_t \sim \pi(\cdot \mid h_t)$。本文中被训练的策略就是一个 LLM 智能体,它通过调用工具与可执行环境交互,但不决定这个世界由什么实体、服务和规则构成。
论文的主实验就是用 GRPO/SAO 在合成环境中优化策略,再评估其在企业工作流和域外基准上的迁移能力,策略与环境构建的分离是全文框架的起点。
世界模型(World Model)
学习预测环境如何随动作演化的模型 $W(s_{t+1} \mid h_t, a_t)$,可用于预测、规划或模拟(如 Dreamer、MuZero)。它作用于已经存在的环境,只近似其转移动态 $T$,而不能定义什么世界存在。
理解 PLANET 角色的定位需要先明白传统分工:策略学『怎么做』,世界模型学『世界如何响应』,而『决定什么世界存在』长期处在学习回路之外——这正是本文要填补的空缺。
可执行环境与世界级不变量
可执行环境是能真实运行的业务软件模拟,含持久化数据库状态、多个服务、工具和确定性转移函数 $T$。世界级不变量 $R$ 是世界应满足的跨服务约束(如上游事件后下游须有对应记录),环境不自动执行它们,而是渲染成可执行验证条件供事后确定性评分;同一不变量还有可见(世界内文档)与隐藏(评分用)两种视图。
不变量的『可执行验证』是本文奖励信号可靠、轨迹可复现的关键,也是环境创作实验中 12 个结构验证器的基础,不懂它就看不懂评分与创作实验。
GRPO
Group Relative Policy Optimization,DeepSeekMath 提出的强化学习算法:对同一 prompt 采样一组回答(本文 8 个),用组内相对奖励构造优势信号,配合解耦 PPO 裁剪更新策略;本文采用 Dr.GRPO 非对称裁剪 0.2/0.28,并过滤零方差组。
主实验用 GRPO 训练 Qwen3.5-4B 与 35B-A3B,并与单 rollout 异步优化 SAO 对比,以证明环境提供的学习信号不绑定特定 RL 算法。
MCP 工具调用
Model Context Protocol,智能体通过标准化接口调用外部软件服务(搜索记录、发邮件、更新工单等)的协议。本文每个环境以本地 MCP 工具服务器形式运行,智能体每回合最多 20 次工具调用,通过工具读写底层数据库状态。
合成环境的可执行性完全建立在 MCP 工具之上,EnterpriseOps-GYM 等评测同样使用 MCP 服务,它是交互与验证的共同载体。
τ-bench 式交互评测
一类要求智能体在多轮对话与工具调用中完成状态变更任务的基准(τ-bench/τ²/τ³ 系列),评分通常读回数据库状态并结合断言判断(有时辅以 LLM judge),比单轮问答更贴近真实业务工作流。
论文用 τ³(Airline/Retail/Telecom)和 EnterpriseOps-GYM 评估迁移效果,理解其『多轮交互+状态读回』的评分方式,才能正确解读结果表中均值与方差变化的意义。
研究动机
现有智能体环境的构建几乎都是『任务中心』的:要么围绕特定领域人工搭建实体、工具与转移逻辑(如 ALFWorld、WebArena、OSWorld、WorkArena),要么从任务描述或评测规格反向合成环境(如 Agent-World、EnvScaler 等)。这种范式把世界和任务捆绑在一起,环境被优化成『让某个任务可执行、可度量』,而不是承载更广业务场景的持续世界。后果是:增加任务数量并不等于增加底层世界的多样性,扩大基准覆盖也无法直接得到更大规模、更富状态的交互环境空间。以真实企业工作流为例(SWE-Bench Pro、τ 风格域),任务不是孤立目标,而是从用户意图、持久状态、多个软件系统的交互中涌现的;手工构建这类世界成本极高,Figure 1 的对比也显示既有环境(AppWorld、MCPMark、τ-bench、AWM)要么规模有限、要么多服务深度不足,无法提供既大规模又跨服务的可验证训练基底。
本文的目标是本文要把环境构建从『围绕任务』转向『围绕场景』:给定一段高层业务场景描述 $\sigma$,自动合成一个完整可执行的世界 $w$——包含公司身份、服务图、状态模式、种子初始状态 $s_0$ 和世界级不变量 $R$——再从同一个世界中实例化出多样的任务与交互轨迹。具体量化目标有三:(1) 构建覆盖 14 个行业、50 个国家的 4,783 个可执行环境(约 1398 万行状态数据),每个环境含多服务、持久状态与可跨服务验证的约束;(2) 证明这些与评测基准无关的环境可作为 RL 训练基底,提升策略在 EnterpriseOps-GYM 及推理、编码、科学计算、工具使用等域外基准上的表现;(3) 证明环境构建过程本身可学习:用构建轨迹微调模型,使其能从未见过的业务简报创作出通过 12 项结构验证的可执行世界。
与已有工作不同的是,独特的切入角度是把『构建世界』确立为智能体系统中与策略 $\pi$、世界模型 $W$ 并列的第三个一等角色——PLANET,它决定『什么世界存在』。技术上,本文不像以往工作那样把世界规则硬编码进转移函数,而是把跨服务不变量渲染为可执行的验证条件:执行时环境照常转移状态,评分时用确定性检查事后评估,且同一不变量集有『可见视图』(世界内文档,需智能体交互中发现)与『隐藏视图』(评分用)两个投影。此外,世界构建、任务实例化、交互与评分被彻底解耦:$\sigma \xrightarrow{\text{PLANET}} w \xrightarrow{\text{TASK}} (u,\rho) \xrightarrow{\pi} \tau \xrightarrow{\text{GRADE}} r$,一个世界可派生多个任务,环境分布本身成为可扩展对象。最后,作者把构建过程显式记录为轨迹(实体、服务、状态、验证条件的修改历史)作为监督数据,证明『造世界』可被微调成模型能力,这是此前环境合成工作未触及的方向。
核心方法
直觉上,AgentMercury 认为『任务只是世界的切片』:与其为每个任务定制环境,不如先造出一个富饶的世界,让任务自然涌现。技术路线是四段流水线:给定业务场景 $\sigma$,PLANET 先合成可执行世界 $w = \langle S, A, \Omega, T, O, s_0, R \rangle$;任务生成器从世界中实例化 $(\Delta s_0, u, \rho)$,即任务状态种子、自然语言指令与评分规则;策略 $\pi$ 经 MCP 工具与世界交互产生轨迹 $\tau$;确定性评分器按 $r(\tau) = \text{GRADE}(s_H, \tau; \rho, R_{hid})$ 依据任务 rubric 与隐藏不变量打分。世界合成分解为公司身份、服务图、状态模式、种子状态与不变量的条件概率链,整个库最终含 4,783 个环境、43,300 个任务,被直接用作 GRPO/SAO 强化学习的训练基底。
核心创新是『场景接地』(scenario-grounded)的世界合成范式与『不变量即验证器』的设计。与任务中心合成的本质区别在依赖方向:不是从任务造世界,而是从世界派生任务——同一世界可通过不同种子状态、用户意图和 rubric 支撑多个任务,任务数量与结构多样性因此可同时扩展。第二个关键设计是把跨服务不变量(例如『上游业务事件发生后,下游系统必须存在对应记录』)从转移机制中剥离:环境不会替智能体自动创建下游记录,而是把它作为可执行验证条件留给智能体满足,这迫使策略学会跨系统状态一致性维护,而非依赖模拟器兜底。第三个创新是把构建过程显式记录为轨迹(简报到世界生成、中间阶段补全、验证器引导的损坏修复、意图到 diff 四类监督共 29,823 条样本),证明创作可执行世界的能力可被微调习得——成功率从 3.3% 跃升至 83.3%,环境构建由此从外部工程流程变成智能体的可学习接口。
方法步骤详情
第一步,PLANET 世界合成:从场景 $\sigma$ 依次生成公司身份、服务图、状态模式、种子状态与不变量集;每环境暴露 10–26 个工具(均值 16.1),状态存 SQL 表,全库约 1398 万行;不变量分为可见(世界内文档)与隐藏(验证条件)两种视图。第二步,任务实例化:$(\Delta s_0, u, \rho) \sim \text{TASK}(\cdot \mid s_0, R)$,每环境采 10 个种子,平均触及 2.9 个服务、含 5.4 条断言(存在性、等值、不等值);25,991/43,300 个任务标记为跨系统操作风险。第三步,交互:智能体经 MCP 工具交互,每回合最多 20 次调用,转移由确定性 $T$ 执行。第四步,评分:$\text{GRADE}(s_H, \tau; \rho, R_{hid})$ 基于最终数据库状态断言,可重放『golden reasoning trace』复核。第五步,RL:GRPO 每 prompt 采 8 样本、batch 128、lr $1\times10^{-6}$,200 步内 3,200 个任务获得梯度。
技术新颖性
新颖性体现在四个层面。概念上,首次把环境构建提升为与策略、世界模型并列的 PLANET 角色,把『该有什么世界』纳入学习系统的设计空间,区别于把环境当作预置工件的惯例。机制上,不变量的『可见/隐藏双视图』与『验证而非强制』设计是新的:可见视图通过世界内文档提供需要探索的信息,隐藏视图提供确定性奖励,两者是同一不变量集 $R$ 的投影,兼顾了信息发现与奖励可复核。系统上,构建—任务—交互—评分的解耦使同一世界可跨任务、跨训练配置复用,扩展的对象从『任务实例数』变为『世界的多样性、结构与真实性』。学习上,论文不仅发布环境,还发布构建轨迹作为监督数据,并揭示一个反直觉现象:基座模型加 recipe 提示可从 3.3% 升到 20.0%,但微调后的模型加同一 recipe 反而从 83.3% 跌到 10.0%(27/30 败在跨服务验证)——说明『提示注入的程序知识』与『参数内化的程序知识』存在质的差异,这为程序性技能的学习方式提供了新证据。
实验结果
企业工作流上,Qwen3.5-4B 经 GRPO 在 EnterpriseOps-GYM 从 12.3 升至 15.7(+27.6%),Drive/Email 各 +9.4;35B-A3B 上 GRPO 24.8→28.1、SAO 28.3,八域全升。域外迁移上,4B 的 AIME26 45.9→56.0、HMMT 28.5→35.4、LiveCodeBench 36.6→44.0、SciCode 22.6→25.7、GPQA 76.5→77.5,τ³-Airline 48.8→58.7,Telecom 持平说明并非均匀漂移;35B 的 BFCL 31.1→42.1 涨幅最大,τ³-Telecom 方差从 ±49.8 收窄至 ±20.5。提升随训练渐进出现,动态健康(截断率趋零、退化率近零)。环境创作上,API 模型零样本通过 12 验证器约 66.7%–86.7%,GPT-5.4 有 10/30 例错置跨服务约束;基座 35B-A3B 仅 3.3%,经 29,823 条构建轨迹微调后达 83.3%(通过 11.5/12,$p = 1.2\times10^{-10}$)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 企业工作流(EnterpriseOps-GYM,8 个域) | pass@1 平均分(3 次运行均值) | Qwen3.5-4B+GRPO 15.7;35B-A3B+GRPO 28.1、+SAO 28.3 | 基座模型:4B 12.3;35B-A3B 24.8(参考:GPT-5 为 30.9) | 4B +3.4(+27.6%);35B +3.3~3.5(+13.3%~14.1%),8 域全升 |
| 数学推理 AIME26 | avg@10 准确率(每题 10 次采样) | 4B 56.0;35B 92.2(SAO) | 4B 45.9;35B 91.0 | 4B +10.1;35B +1.2(接近饱和) |
| 数学推理 HMMT February 2026 | avg@4 精确匹配准确率 | 4B 35.4;35B 83.3(SAO) | 4B 28.5;35B 77.0 | 4B +6.9;35B +6.3 |
| 竞赛编码 LiveCodeBench v5–v6 | pass@1(隐藏测试执行判定) | 4B 44.0;35B 79.0(GRPO) | 4B 36.6;35B 74.3 | 4B +7.4;35B +4.7 |
| 科学计算 SciCode | 主问题通过率(代码执行) | 4B 25.7 | 4B 22.6 | +3.1 |
| 结构化工具调用 BFCL | AST/可执行调用准确率 | 4B 31.7;35B 42.1(SAO) | 4B 30.3;35B 31.1 | 35B +11.0,为该规模最大单项收益 |
| 交互式工具使用 τ³(Airline/Retail/Telecom) | pass1 奖励(4 trials) | 4B Airline 58.7;35B Telecom 68.9±20.5(GRPO) | 4B Airline 48.8;35B Telecom 49.1±49.8 | 4B Airline +9.9;35B 均值提升且方差大幅收窄、稳定性显著改善 |
| 研究生级知识 GPQA-Diamond | avg@5 多选准确率 | 4B 77.5;35B 85.0(GRPO) | 4B 76.5;35B 82.8 | 4B +1.0;35B +2.2(收益最小,符合知识型任务预期) |
| 可执行世界创作(30 个 held-out 业务简报) | 12 项结构验证器全通过率 | 微调后 Qwen3.5-35B-A3B 83.3%(平均通过 11.5/12) | 微调前 3.3%;最强 API 模型 83.3% | +80 个百分点,Fisher 检验 $p = 1.2 \times 10^{-10}$ |
局限与改进
作者承认的局限:系统尚未形成环境生成与策略学习的闭环——合成过程没用习得的世界模型预测候选世界行为,生成器无法按策略失败模式定向补世界;SAO 在 4B 上信号不足(4B+SAO 被排除出主表),单 rollout 优化对小策略不稳定。我的补充观察:CSM 域在 4B 上从 9.2 退化到 5.6,提示业务域间负迁移但缺乏分析;断言仅三种形式、每任务 2–10 条,只能度量终态而难以评估过程质量与长程规划,τ³ 评分仍依赖 LLM judge(DeepSeek-V4-Flash);语料同质化风险真实——最近邻 TF-IDF 相似度中位数 0.83,8.3% 任务有 >0.99 的近孪生,工具数仅 {10,14,18,22,26} 五档;创作评测仅 30 个简报,微调后 Wilson 95% 区间仍宽达 [66.4, 92.7];此外所有环境均为单公司业务调查类任务,未覆盖多组织协作或对话式用户模拟。
独立分析的弱点
第一,任务多样性存在结构性天花板:Figure 6 显示文本聚类与元数据脱钩,任务形状由『10 个核心工具 + 每个附加资源 4 个工具』的离散格点决定,服务组合仅 148 种,继续扩张可能先撞上同质化墙;改进方向是引入可变服务拓扑(更深调用链、异步事件、跨公司交互)打破该格点结构。第二,奖励只看数据库终态,无法评估操作路径的效率、安全性与副作用——例如误删数据但终态正确仍可能得分;可加入过程级不变量与成本敏感奖励。第三,跨域迁移机制未被解释:业务工具使用为何能把 AIME26 抬高约 10 分?论文缺少消融(如任务量减半、去除跨服务不变量、去除可见文档视图),无法排除『多轮长上下文 RL 格式效应』这类平凡解释,建议补充分离『世界多样性』与『交互格式』的对照实验。第四,训练配方对规模和领域敏感:4B 下 SAO 失效、CSM 负迁移,可按域平衡采样或引入域感知课程。第五,构建管线依赖强闭源 API 模型(zero-shot 已约 80% 通过),微调模型的独立价值需要在成本与离线可用性维度上进一步论证,而非仅追平 API 模型。
未来方向
作者提出的方向:(1) 闭环环境—智能体循环——智能体监测自身失败与不确定性,提出针对能力缺口的高层场景,由 PLANET 编译为可执行世界并回流 RL,形成自适应课程,让策略决定接下来生成什么世界;(2) 用习得世界模型(如 Qwen-AgentWorld)在完整实例化前预测候选环境的行为,加速环境空间搜索;(3) 探索 GRPO 与 SAO 的互补性——GRPO 为小模型提供更强相对信号,SAO 的单 rollout 特性适合大规模环境覆盖的知识注入。基于其成果可延伸的:把不变量系统从终态断言扩展到时序/过程约束(『必须在 X 之前完成 Y』)与软性业务指标(成本、满意度),获得更细粒度的奖励塑造;构建多智能体、多组织世界(供应链、审批链)以研究协作与谈判行为;将环境创作能力与策略训练结合(如多任务学习),检验『会造世界』是否促进对世界结构的系统性理解;在更多 RL 步数与更大模型上刻画 7.4% 任务覆盖率与收益的关系,建立环境规模—性能的 scaling law。
复现评估
开源情况良好:论文声明释放全部合成环境与任务、业务场景与任务指令、构建代码 diff 及训练后的策略模型。算力方面,4B RL 用单机 8 卡(2 卡 actor + 6 卡 rollout,张量并行 2,SGLang 推理,slime 框架,异步训练 staleness 上限 4);35B-A3B 评测需 4 路张量并行与 128K 上下文。关键超参在附录 Table 6–11 完整给出(GRPO 8 样本/prompt、batch 128、lr $1\times10^{-6}$ 恒定、每回合 20 次 MCP 调用、冷启动保留截断样本等)。评测大多程序化(AIME/HMMT 精确匹配、LCB/SciCode 代码执行、BFCL AST 匹配、EnterpriseOps-GYM oracle),仅 τ³ 用 LLM judge,可直接复跑。难点有二:环境构建管线依赖强闭源模型,从零重造 4,783 个环境成本不低,但直接用发布环境训练可绕过;创作评测集仅 30 简报,统计功效有限。总体属中上等易复现:数据与模型齐全,主要门槛是异步 RL 基础设施的工程细节。
论文图表
三联图。(a) 环境库的行业分布直方图:制造业 924、金融 886、零售 569、能源 517、建筑 341 等,共 4,783 个环境、覆盖 50 国。(b) 与 AppWorld、MCPMark、τ-bench、AWM 等既有智能体环境在『环境规模 × 多服务深度』平面上的对比,本文占据既大规模又多服务的区域。(c) 单环境的富状态结构:约 65 个工具、31 个服务、15 张表,全球合计约 1398 万行数据,并配确定性 SQL 验证器实施跨服务约束。
一张图概括资源规模、行业覆盖与相对既有工作的定位,是理解『场景接地合成可以规模化』这一核心主张的证据基础。
四条训练曲线:原始奖励随训练稳步上升;响应长度先升(学会更复杂的多步任务)后降;截断响应比例大幅下降;退化响应比例全程接近于零。
排除『奖励上升但输出崩坏』的投机优化可能,说明奖励改善来自对可执行任务完成的渐进优化,是 RL 训练健康度的必备证据。