用于大规模训练计算机使用智能体的深度演化环境(Echoverse) Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale
构建深度可演化合成环境与协同进化循环,让9B计算机使用智能体逼近前沿模型
前置知识
计算机使用智能体(Computer-Use Agent)
指通过浏览器或图形界面操作应用程序来完成任务的智能体——点击控件、填写表单、提交订单等。它只能从动作产生真实后果的场景中学习:一次点击改变了已保存的状态、一条消息送达真人。截图只能显示界面长什么样,只有运行中的应用才能显示一个动作造成了什么后果。这类智能体与只读式问答助手不同,它的成功是一次状态改变而非一个字符串。
整篇论文围绕如何为这类智能体构造可训练、可打分、可重置的环境展开,理解智能体从'动作后果'中学习这一前提,是读懂为何登录门控、有状态的应用如此关键的基础。
世界(World):环境 + 任务 + 验证器
论文把一个可训练单元称为'世界' $W=(E,\mathcal{T},V)$:环境 $E=(S,A,T,O,D_0)$ 是应用本身(状态空间 $S$ 取为应用数据库而非像素、动作空间 $A$、转移 $T$、观测 $O$、种子库 $D_0$);任务语料库 $\mathcal{T}$ 中每个任务 $\tau=(g,r,\kappa)$ 含目标、参考结果与类型 $\kappa\in\{\text{READ,WRITE,READ\_WRITE}\}$;验证器 $V$ 依据数据库给结果打分。三个组件都由协同进化循环共同修复。
把状态定义为数据库(而非像素)是全文推理的基石——它使奖励可接地、重置可精确、任务可由构造保证为真。理解'世界'的三元组结构是理解协同进化为何要同时修复三者的前提。
数据库接地的打分(Grounded Grading)
判定成败时不看截图、不评整条轨迹,而是把智能体的输出与一条从数据库读出的参考做闭合比较。WRITE 任务看原始库 $D_0$ 与终止库 $D_T$ 的 sqldiff 是否包含参考状态改变;READ 任务把回答与生成时从库读出的参考答案做语义等价比较;READ_WRITE 取两者最小值。最终比较可由大模型(如 GPT-4.1)完成,但它只看到观测结果与参考,看不到轨迹或截图。
这是论文与真实网络基准(用多模态判官看截图判成败)的本质区别,也是奖励可信、难以被'谎报成功'钻空子的根源。理解它才能明白为何同一套世界既能做基准又能做 RL 训练环境。
蒸馏与拒绝微调(Rejection Fine-Tuning / STaR)
监督阶段让前沿教师模型(GPT-5.4)在活动环境中解每个任务,用接地验证器只保留通过的轨迹作为微调语料。这是一种验证器过滤的拒绝采样蒸馏,继承了教师的能力上限——干净的演示从不展示如何从错误中恢复或何时该停,这正是模仿的'天花板'。
论文用此构造 21,009 条监督轨迹,并明确指出其天花板由强化学习来突破。理解蒸馏的局限是理解为何需要 RL、以及 RL 为何能学到策略自身特有错误的前提。
组相对策略梯度(Group-Relative Policy Gradient)
一种 RL 算法,对一个 prompt 采样一组 $G$ 条 rollout,用组内奖励的均值作基线计算优势 $A=R-\text{mean}(R_{group})$,无需训练价值网络,适合长多模态浏览器轨迹。论文采用未归一化的优势(不除组标准差,沿用 Liu et al. 2025),并把组扩展为'共享同一 prompt 的所有 rollout 的所有步骤行',使过程信用分配与结果信用分配统一在同一尺度下。
这是论文 RL 部分采用的核心算法,理解其组内基线与逐行信用分配机制,才能看懂作者如何把接地轨迹奖励与稠密逐步奖励两项放在同一个优势里联合优化。
研究动机
计算机使用智能体只能从其动作产生真实后果的场景中学习——一次点击改变了已保存的状态、一条消息送达真人、一个拒绝响应的页面告诉它上一步无效。但最值得训练的应用都是登录门控且有状态的(邮件、聊天、银行、健康档案、云与机器学习控制台),无法直接训练:每次尝试都写入真实账户、尝试之间无法重置、真实状态隐藏在屏幕之后。最近的流水线(Zhou 2026、Zhang et al. 2026 等)批量生成合成环境,把瓶颈从'有多少个'转移到了'每个里面装了什么'。而真实网络基准(WebVoyager、Mind2Web)受限于未登录的公开面,以只读的信息检索为主,且只能由多模态大模型依据截图判定成败——这意味着智能体可以自信地声称已完成某个从未真正落地的动作却被宽容判官接受,这种信号既不能作为训练奖励也无法保证可重复。浅表的合成克隆虽然快速搭建、外观可信,却在跨用户状态一致性与工作流依赖上失效,宽容判官还会把判官自身的盲点教给策略。
本文的目标是本文的目标是构建一类'深度、可演化的合成环境':将规格说明编译成有状态的真实应用(自带数据库、后端、前端),任务依据应用自身数据库的状态来打分,并引入一个协同进化循环——把每一次被评分的 rollout 同时读作两份信号:对模型失败的训练信号,以及对环境、任务和验证器的修复信号。作者想用三个杠杆(深度、能力定向、协同进化)证明:决定收益的不是合成环境数量而是内部质量。进一步目标是让同一套世界在监督训练之外,不经修改即可满足强化学习对精确重置、并行吞吐和可信奖励的要求,并训练一个 9B 参数的计算机使用智能体,使其在十四个评测切分上逼近远大得多的前沿模型,同时公开发布四个世界作为基准。
与已有工作不同的是,本文的独特切入角度在于:它把环境数量固定、专门变化环境'内部质量',并明确指出低于某个深度阈值时,增加环境只是在加入噪声而非信号——这是对'堆砌规模'思路的直接反驳。与开放式/无监督环境设计(在固定且正确的模拟器内搜索任务分布)和自我博弈不同,Echoverse 协同进化的是环境的实现本身、任务语料库与验证器,因为在自动生成的软件中这三者一开始都是有缺陷的,任何一者的缺陷都会暗中污染对其他两者的度量。此外,作者给出了'深度'的可操作定义——以目标工作流集合为参照的完备性,而非功能计数,并在构建时用机器可检验的断言来'证明'一个世界支持这些工作流。配合'修复先于训练'的顺序与'绝不削弱目标以抬高通过率'的纪律,这让世界与模型作为一个耦合系统共同进步,而非两个独立阶段。
核心方法
Echoverse 是一条单一流水线,产出两类世界:保留真实工作流深度与结构的'全域世界'(如 ECHOSTAY 住宿预订、ECHOBANK 银行),以及隔离并变化某个被诊断出的交互弱点的'能力世界'(如日期选择器、嵌套筛选)。两者都依赖底层自有的数据库,使成功成为应用状态的属性而非对截图的解读。流水线分两个阶段:阶段一构建并验证世界本体——把手写种子扩展为结构化规格与一组可检验断言,据此生成完整应用(FastAPI 与 SQLite 后端、React 前端),再用验证智能体对照运行中的环境逐条检查断言,修复智能体修复数据库/后端/前端直到至少 95% 断言通过;阶段二在该环境上生长接地任务语料库——把种子对照活动数据库重新接地以生成任务,用一组验证器检查实体真实性、目标合理性、难度与可行性,失败被分流归类并由分层修复智能体修复,直到至少 95% 任务通过。两个阶段实为一个循环,且不会在世界发布时停止:被训练模型在该世界上的失败本身就是关于这个世界的新证据。
核心创新由三个相互支撑的理念构成。第一,'深度'的可操作定义:一个世界'深'意味着它的环境端到端支持其任务语料库所要求的每一条工作流,并在状态中留下精确可检的痕迹;作者将其分解为五个属性(行为保真度、状态一致性、工作流深度、权威验证、领域价值),并在构建时用机器可检验的断言来证明。第二,'一次 rollout 两份信号':每次被评分的运行都被读两次——一次作为模型训练数据,一次作为对环境、任务与验证器的修复;并采用'修复先于训练'的顺序(由世界缺陷导致的失败是噪声而非学习目标)与'绝不削弱目标'的纪律(若修复让任务索取的更少则视为回归而非修复)。第三,同一套世界不经修改即可作为强化学习环境:自有数据库带来精确重置(按任务快照)、并行吞吐(自包含应用可复制并行)、可信奖励(接地验证器)、平稳性与破坏安全性。这与在固定正确模拟器内搜索任务分布的开放式环境设计有本质区别。
方法步骤详情
阶段一(构建环境):少量手写种子(场景、任务、能力)扩展为结构化规格与关于路由、状态、行为的机器可检验断言,据此生成完整应用(FastAPI+SQLite+React)。验证智能体用 Playwright 驱动界面、读源码、查库逐条检查断言;修复智能体按层定位修复,回归则回滚,直到 ≥95% 断言通过。阶段二(生长语料):生成对照活动数据库接地的任务,验证面板白盒检查实体真实、合理、难度与可行性。失败按必改层打标,分流智能体按共同成因归并,分层修复智能体修复并复检,循环直到 ≥95% 通过。协同进化:失败 rollout 回到同一套验证与分流,区分世界与模型缺陷,世界先被修复。再用 GPT-5.4 解任务,接地验证器只留通过轨迹(21,009 条)做 SFT。强化学习以 πSFT 为起点用组相对策略梯度;每 rollout 两项奖励——接地轨迹奖励 + 稠密逐步判官奖励,逐行奖励 $R_{row}=R_{traj}+\lambda R_{step}$($\lambda=1$),优势 $A_{row}=R_{row}-\text{mean}(R_{group})$,不除组标准差。
技术新颖性
技术新颖性体现在多方面。首先是'深度'的可操作定义——以目标工作流集合为参照的完备性,并在构建时用机器可检验断言来证明,使'深'是被展示的属性而非被声明的。其次是分工明确的智能体工作力(构建者/验证者/分流者/修复者):验证与构造分离,没有任何智能体是自身输出的唯一裁判;分流介于验证与修复之间,使修复在整批失败上规划而非逐任务,从而一次修复能清掉许多任务(如 ECHOFORUM 一个前端修复把 37 个失败从 0 解决提升到 36)。第三是'一次 rollout 两份信号'配以'修复先于训练'与'绝不削弱目标'的纪律。第四是负面结论:浅表世界比不训练更糟。第五是同一套世界不经修改即满足 RL 的重置/吞吐/奖励要求,因为重置原语就是阶段二的按任务数据库隔离、奖励就是监督阶段过滤轨迹的接地验证器。第六是双项奖励(接地的结果项 + 判定的过程项)配合多个耦合让接地项始终主导(错误结局时末步稠密奖励强制归零、错误终止有显式惩罚、稠密项仅用于训练 rollout 使验证只看接地轨迹奖励)。
实验结果
核心发现可逐条归纳。其一,深世界迁移、浅世界倒退:浅世界训练让 Allrecipes 从基线 80.0 跌到 75.0、HuggingFace 停在 48.0,而深世界把两者分别提升到 85.0 与 65.0。其二,πSFT 在十四个切分几乎翻倍,36.5→67.1,距前沿 GPT-5.4(80.7)约十四个点;六个最弱切分提升三到九倍,在 ECHOBANK(94.6 vs 92.8)、ECHOMAIL(81.1 vs 74.5)及两个嵌套筛选切分上追平或反超 GPT-5.4。其三,能力世界精准:留出日期选择器 34.0→57.3、留出筛选面板 62.8→84.8,+Both 把 Online-Mind2Web 提到 34.3。其四,开放网络迁移:WebVoyager hosted 66.5→71.5、datacentre 50.9→55.6。其五,两缩放轴相反:固定世界加轨迹让真实迁移饱和,加环境则持续上升。其六,协同进化显效:ECHOSTAY 修复客人数量控件后可完成预订 48%→78%,模型在其语料上 16.2%→38.5%。其七,强化学习把留出判分 58.8%→68.0%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 14 个评测切分的平均任务成功率 | 任务成功率(%,数据库接地验证器) | πSFT 67.1% | 基线 πbase 36.5% | 几乎翻倍(+30.6 个点),距前沿 GPT-5.4(80.7%)约 14 个点 |
| ECHOBANK 银行转账/账单类任务 | 任务成功率(%) | 94.6% | 基线 76.6% / GPT-5.4 92.8% | 9B 模型反超前沿 GPT-5.4,较基线 +18 个点 |
| 深世界 vs 浅世界(Allrecipes 实时准确率) | 实时站点任务成功率(%) | 深世界 85.0 | 基线 80.0 / 浅世界 75.0 | 深世界 +5 点、浅世界 -5 点(浅比不训练更糟) |
| 能力世界留出控件迁移(held-out 日期选择器) | 任务成功率(%) | +Both 模型 57.3 | 基线 34.0 | +23.3 个点,说明学到的是技能而非单一布局 |
| 开放网络迁移(WebVoyager, hosted 浏览器) | 任务成功率(%) | 71.5 | 基线 66.5 | +5 个点(无任何真实网络训练数据,纯迁移) |
| 协同进化效果(ECHOSTAY 上训练的模型) | 任务成功率(%) | v2 世界 38.5% | v1 世界 16.2% | 翻倍以上,约三分之二逼近 GPT-5.4(50.4%) |
| 强化学习(5 个世界留出集判分) | 接地验证器判分(%) | πRL 68.0%(约两个 epoch,step 50) | πSFT 初始 58.8% | +9.2 个点,超越监督初始化 |
局限与改进
局限来自几方面。首先,监督阶段存在'模仿天花板':9B 模型复制的是 GPT-5.4 做对的轨迹,无法学到自己特有的错误恢复方式,作者虽用 RL 部分缓解但增益有限(58.8→68.0)。其次,RL 的稠密逐步奖励由 GPT-4.1 视觉判官给出,恰恰重新引入了论文在别处批判的'判定式信号',作者用多个耦合尽量让接地项主导,但本质上仍依赖判官的可靠性。第三,部分切分与前沿差距巨大,例如留出日期选择器 πSFT 仅 52.0 而 GPT-5.4 达 94.7。第四,'深 vs 浅'的关键结论只用两个域、每域几十个任务,作者自己也承认这只是'证据'而非对深度价值的估计。第五,最终结果比较仍部分依赖 GPT-4.1 判官(虽是比对照而非评估整条轨迹)。第六,整套工厂依赖前沿模型当教师与判官、并有人类 QA 层,复现成本与劳动强度高。第七,仅发布四个世界作为基准,其余八个及其 21,009 条轨迹未公开。第八,任务可行性由前沿模型判定,可能使语料向该模型强项倾斜。
独立分析的弱点
独立分析,第一个弱点是关键'深 vs 浅'结论样本过小(两域、数十任务),说服力有限——改进方向是覆盖更多域与任务规模,量化'深度'阈值而非定性叙述。第二个弱点是 RL 的稠密逐步判官与论文的接地哲学相矛盾——改进方向是设计能从接地信号(如数据库差分)派生逐步信号的方法,或用更弱但可校准的判官。第三个弱点是留出日期选择器远落后前沿(52.0 vs 94.7),说明能力世界对极多样控件仍欠覆盖——改进方向是扩展控件家族与场景数。第四个弱点是严重依赖前沿模型(GPT-5.4 教师、GPT-4.1 判官与视觉判官),复现与成本受限——改进方向是用开源模型或自训练判官替换,并消融判官强度。第五个弱点是工厂自动化程度受限于智能体工作力与人类 QA 的可扩展性——改进方向是减少人工介入、提升修复智能体的自主验证。第六个弱点是 RL 增益有限且仅五世界——改进方向是更多世界与更长训练、加入自适应课程。第七个弱点是任务可行性由单一前沿模型决定,语料可能偏向其强项——改进方向是用多模型可行性投票或纯程序化可解性检验。
未来方向
作者明确提出的未来方向包括:为公开基准触及不到的封闭域构建更多深世界、为模型持续失败的交互构建更多能力世界,以及在接地世界上做更多强化学习——三者相互促进(更广的世界允许更长训练,每轮暴露下一个要建的能力)。基于本成果可延伸的方向有:把当前的'一次性 pass@4 过滤'升级为随训练动态调整的持续课程学习;用接地信号派生逐步奖励以移除对视觉判官的依赖;研究如何把世界修复能力迁移到真实网络(论文指出真实网络中'动作落空后只能靠智能体自己察觉并改道',是世界要教的最后一课,也是模仿最弱处);探索更系统的自动课程与环境设计,减少人类 QA;把协同进化从模型评测扩展到模型部署的持续数据飞轮;将接地验证理念推广到更多模态与桌面操作系统智能体。
复现评估
复现性中等偏上。作者在 https://aka.ms/echoverse 开源了四个世界(全域 ECHOSTAY、ECHOFORGE 及两个能力世界,含其应用、种子数据库与每个任务的接地验证器),且只发布评测任务以避免污染。但完整的 21,009 条监督轨迹语料未公开(不作为训练数据发布),八个训练世界也未全部发布。强化学习配置非常吃资源:32 块 GPU、组大小 8(每步 128 条轨迹)、vLLM 服务策略、温度 0.7、50 轮上限,配置细节见 Table 8/9 较完整。工厂本身实现为 GitHub Copilot SDK 智能体,并依赖 GPT-5.4(教师)、GPT-4.1(判官与视觉判官)等前沿闭源模型,因此完整复现训练流水线成本高昂且依赖专有模型;但仅复现基准评测相对可行。总体而言,基准评测可复现性好,完整训练复现难度与成本高。
论文图表