Qwen-UI-Agent:面向真实世界的通用基础 GUI 智能体技术报告 Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
面向真实设备的统一 GUI+CLI 基础智能体,在移动端全面 SOTA。
前置知识
GUI Agent(图形界面智能体)
一类能够通过感知屏幕截图、理解界面语义、并发出鼠标/键盘/触控等操作指令来自动完成数字任务的多模态大模型系统。它把用户的高层意图翻译成一连串底层界面动作(如点击坐标 $(x,y)$、输入文本、滑动等),无需应用暴露专用 API 即可操作现有软件生态。
本文的核心研究对象就是 GUI Agent,理解它的输入(截图、历史)、输出(动作序列)、评价指标(成功率、步数)是读懂全部实验和消融的前提。
Sim-to-Real Gap(仿真到真实鸿沟)
模型在可控沙箱(重置状态的 Android 模拟器、虚拟机)里表现优异,但部署到真实设备时由于弹窗、CAPTCHA、权限请求、动态刷新内容、账户状态变化等不可控因素而大幅失效。这是移动智能体最棘手的工程难题。
本文的核心动机就是弥合这道鸿沟,作者专门构建了 100+ 台物理手机、150+ 应用的真实设备运行时来训练和评测。
GRPO(Group Relative Policy Optimization,组相对策略优化)
一种基于采样的强化学习算法:对同一任务采样 $K$ 条轨迹,用可执行验证器给出二值奖励 $r_i \in \{0,1\}$,然后计算组内相对优势 $\hat{A}_i = (r_i - \bar{r}_x)/(\mathrm{Std}(r_1,\ldots,r_K)+\epsilon)$ 来更新策略。它免去了显式 critic 网络,适合稀疏奖励的长程任务。
本文的 Online RL 阶段就是用 GRPO 变体优化端到端任务成功率,是模型长程决策能力跃升的关键算法。
Hybrid GUI+CLI 动作空间
在同一条轨迹中同时允许视觉化的 GUI 操作(点击、拖拽、输入)和程序化的 CLI 命令(`cli_command` 执行 bash),以及 API 调用(`api_call`)和用户交互(`ask_user`)。模型自主选择最合适的执行通道,并能批量发出动作。
这是本文最重要的设计创新之一,使得结构化任务(文件处理、批量计算)可以用 CLI 高效完成,而视觉任务用 GUI 完成。
Batched Actions(批量动作)
在一次模型决策步内发出有序动作序列 $a_t = (a_t^{(1)}, \ldots, a_t^{(K_t)})$,当多个操作无需新的环境反馈即可顺序完成时跳过中间的观察-推理循环。平均批量大小约 3.1 个原语动作。
在 OSWorld 上超过 40% 的动作为批量形式,显著缩短了轨迹长度并降低了每步推理开销,是效率优势的关键来源。
Agent-Driven Data Flywheel(智能体驱动数据飞轮)
一种 AutoResearch 风格的闭环流程:用强基础模型自动生成任务和环境状态、合成状态验证器、收集轨迹、用 VLM-as-Judge 评估、归因失败原因、再针对性生成下一轮数据。人工仅做高层监督和定点修订。
这是支撑 Qwen-UI-Agent 能在移动/桌面/网页/DeepSearch 多域大规模扩展数据的关键工程范式,理解它才能看懂 SFT 和 Online RL 的数据从何而来。
研究动机
现有 GUI 智能体几乎都是针对模拟沙箱基准优化出来的,与真实可用之间存在巨大鸿沟。具体表现在六个方面:(1) 仿真到真实鸿沟严重,模型在 MobileWorld 沙箱里动辄 70%+ 成功率,但放到真实中文移动生态(密集界面、超级 App、频繁弹窗、CAPTCHA)就频繁失效——作者分析 Qwen 3.7 Plus 在真机上的失败中 52.0% 源于 UI 误读、弹窗干扰、物理控件控制等真实场景挑战。(2) 现有方法把移动、网页、桌面分开训练,无法完成跨平台工作流。(3) 多数模型只输出纯 GUI 动作,把本可一行命令完成的结构化操作拖成长串点击。(4) 模型只能完成短程任务,缺乏长程规划、状态跟踪、中间验证与错误恢复。(5) 训练流水线高度依赖人工构造任务、采数据、分析失败,难以规模化。(6) 智能体只能被动等待用户指令,而真实手机上其实已存在大量可操作的信号(如航班取消通知)。
本文的目标是构建一个面向真实世界的基础 GUI 智能体 Qwen-UI-Agent,同时跨越移动、桌面、网页、DeepSearch 四种环境,达到六个核心目标:在真实物理设备上可靠执行、支持跨域跨平台工作流、统一 GUI+CLI+批量动作空间、可靠完成长程(100+ 步)任务、用 Agent 驱动数据飞轮大幅降低人工成本、并能基于手机通知主动发起有用服务。作者希望最终在一系列真实设备与公开基准上全面超越 Opus 4.8、GPT-5.6 Sol、Gemini 3.1 Pro、Seed 2.1 Pro 等前沿闭源模型。
与已有工作不同的是,本文的独特切入角度在于把 GUI 智能体当作一个'系统'而非单个模型来设计:把环境基础设施(100+ 真实手机 + 10000 并发沙箱)、统一动作空间(GUI/CLI/API 批量)、自动化数据飞轮(VLM-as-Judge 步级监督 + 可执行验证器)、三段式训练(SFT→Action RL→Online RL)、以及一层轻量 Harness(主动服务 + 跨平台执行)协同设计。与只堆数据或只换 RL 算法的工作不同,作者专门针对'真机经验稀缺'这个被忽视的根因,构建了带健康感知调度器、虚拟屏、用户接管机制的真机运行时,并用同一套数据流水线闭环驱动能力获取。
核心方法
整体思路是先把 GUI 智能体任务形式化为 $\tau=(I, E_\tau)$,其中 $I$ 是用户指令、$E_\tau$ 是可用环境集合;在每一步模型接收多通道观察 $o_t=(o_t^{GUI}, o_t^{CLI}, o_t^{API})$(截图 + 命令输出 + API 响应),并输出推理 $r_t$ 和批量动作 $a_t=(a_t^{(1)},\ldots,a_t^{(K_t)})$。围绕这一形式化,系统由四大组件构成:(1) 环境基础设施——可扩展沙箱(基于 redroid 容器化的 Android、OSWorld VM、Playwright 浏览器、Serper+Jina 的 DeepSearch)+ 真机移动运行时;(2) Agent 驱动的数据飞轮,自动完成任务/环境/验证器合成与失败归因;(3) 统一训练框架 SFT + Action RL + Online RL;(4) Harness 层,连接用户上下文,支持主动服务和跨平台执行。直觉上:让模型在尽可能真实的环境里学习,用飞轮自动获取能力,再用分层 RL 先修局部错误再优化长程成功,最后用 Harness 把孤立的执行变成日常助手。
最本质的创新有三点。第一,统一的多通道动作空间与批量执行:不同于以往纯 GUI 或纯代码方案,模型在一条轨迹内自由混用 GUI、CLI、API,并用 `ask_user` 在敏感操作前请求确认,单步可批量发出多个无需新观察的动作(平均 3.1 个/批),从根本上改变了执行效率与覆盖度。第二,把 Agent 驱动的数据飞轮作为闭环引擎:用强模型生成任务-环境-验证器三元组,用步级 VLM-as-Judge 从失败轨迹里抢救出'最长连续正确步''首次反思步''错误恢复段'三类监督信号,使 SFT 数据质量可媲美甚至超过完整轨迹筛选。第三,分层 RL:Action RL 用动作感知奖励(公式 $r_t = F_t[w_{type}C_t + w_{arg}C_tQ_t - \lambda_{sens}S_t - \lambda_{rep}L_t]$)针对六大类复发动作错误做局部修正;Online RL 用 GRPO 在 100+ 步轨迹上优化端到端成功,并配以模型自适应课程(活跃池+监控池)让'当前可学'的任务拿到全部 rollout 预算。
方法步骤详情
完整流程如下:**阶段一:领域能力 Bootstrapping**——用强基础模型分析各域所需知识与能力,构建层级化功能树和能力画像,编译成可复用的'任务合成技能',自动生成初始任务池与环境上下文;按 MAI-UI 范式做拒绝采样、聚合得到统一 SFT 语料。**阶段一·SFT 细节**——为每个域训练专家模型(域条件专家训练,含跨域数据混合防过拟合),再做模型合并得到单一 checkpoint;为保留通用能力,混合'起始模型自己能解对'的 in-distribution 数据(数学、代码、问答、工具使用),实验证明这种比喂难题更有效;用滑动窗口训练(窗口 $n=5$,步长 $n-1=4$,一步重叠)压缩长轨迹 SFT 的重复上下文成本。**阶段二:Action RL**——挖掘 6 类复发错误(易混淆元素定位、排序、数量完备性、过早完成、重复循环、长尾动作选择失败),结合历史轨迹挖掘 + 主动环境探索构造针对性数据,按上述动作感知奖励训练,并用熵正则与推理长度上下界防止策略坍缩。**阶段三:Online RL**——用统一环境基础设施在阿里云上部署最多 10000 并发 rollout;通过环境状态合成→任务合成→验证器合成三步自动产出约 10000 个已验证任务-验证器对;对每任务采样 $K$ 条轨迹,验证器评估最终状态得二值奖励,按 GRPO 相对优势更新;模型自适应课程把'中等成功率'任务放活跃池、'太难'任务放监控池小预算监测,一旦开始出现成功就升级到活跃池。**阶段四:Harness 层**——基于通知流的事件感知→关联持久化 affair(事件/事务/任务三层抽象)→affair 级推理生成决策就绪的任务卡→低风险准备性动作先行、敏感动作(支付/预订)需用户确认→从用户反馈持续演化画像记忆。跨平台执行用 OpenClaw 式分层规划器,移动子任务在虚拟屏上并行不阻塞用户。
技术新颖性
技术新颖性体现在多个维度。**环境侧**:首次系统化构建真实中文移动生态的真机运行时(100+ 设备、150+ App、健康感知调度器、动态黑名单、虚拟屏 1 机多显、VLM 判官区分模型失败与环境失败),并用同一接口统一异构环境生命周期(acquire/reset/step/evaluate/tear_down/release)。**动作侧**:把 cli_command 直接嵌入 OSWorld VM 内的非交互 shell(而非打开终端 App 操作),CLI 输出作为结构化观察与截图一起返回;批量动作在 GUI 与 CLI 间自由组合,超过 40% 动作为批量。**数据侧**:步级 VLM-as-Judge 从成功和失败轨迹中抢救三种监督信号,作者发现其 SFT 效果'相当或优于'用可执行验证器筛选完整轨迹——这是对'高质量 outcome 标注稀缺'这一痛点的重要回应。**训练侧**:Action RL 专门针对 6 类复发动作错误做局部修正,Online RL 用 100+ 步轨迹和模型自适应课程优化长程决策,并观察到'Bash 作手、GUI 作眼'的跨模态协作模式自发涌现(执行-验证转移从 40.2%→52.4%)。**系统侧**:Harness 层把通知流转化为 affair 级推理,是'从被动执行到主动服务'这一新维度的早期探索。
实验结果
**移动端**(核心战场):在 MobileWorld GUI-only 子集(117 任务,50 步预算)上 Qwen-UI-Agent-27B 拿到 82.1% 的新 SOTA,分别比 GPT-5.6 Sol、Opus 4.8、Seed 2.1 Pro 高 12.0、14.6、8.9 个百分点,比最强专用 GUI 基线 GUI-Owl-1.5-32B(43.9%)高 38.2 个百分点;步预算放宽到 100 时进一步提升到 85.5%。在自建真机基准 MobileWorld-Real(409 任务、104 App)上拿到 92.2%,超过 Seed 2.1 Pro(88.7%)、Gemini 3.1 Pro(86.2%)、GPT-5.6 Sol(85.4%)、Opus 4.8(84.7%)等所有闭源基线 3.5–7.5 个百分点;在 AndroidDaily 上达 97.5% 排名第一。**桌面端**:OSWorld-Verified 上 79.5% 排名第二,仅次于 Opus 4.8(83.4%),超越 Seed 2.1 Pro、GPT-5.5、Gemini 3.5/3.1;OSWorld-v2 上 partial 40.0%、binary 13.9%,比开源最强基线 MiniMax M3 在 partial/binary 上分别高 17.7/9.3 个点,且平均步数仅 135.8,比 MiniMax M3(326.7)和 Qwen 3.7 Plus(173.5)分别少 58.4% 和 21.7% 步。**浏览器与 DeepSearch**:WebArena 上 73.6%(所有比较模型中最高,比 Opus 4.8 71.9% 高 1.7 个点,距人类 78.2% 还差 4.6 个点);BrowseComp 64.1%、BrowseComp-ZH 75.0%(中文第二)。**GUI 定位**:ScreenSpot-Pro no-zoom 76.6%、zoom-in 81.5% 均为第一,ScreenSpot-V2 97.5%、MMBench-GUI L2 92.6%、OSWorld-G-Refined 78.5%、UI-Vision 70.0%。**通用能力保留**:相对 Qwen3.5-27B 基座,在 MMMU-Pro/MMLU-Pro 等通用基准上几乎无损(72.4 vs 73.5、86.5 vs 86.0),在 agentic 基准上反而提升(Terminal-Bench 2.0 50.1 vs 41.1、Claw-Eval 73.5 vs 66.9),并大幅超越 UI-Venus、GUI-Owl 等专用 GUI 模型。**消融**:Action RL 让总体 SR 提升 7%+,推理 token 降 21.3%、交互步数升 8.4%;在 5 类错误模式专用测试集上系统性纠错(如重复循环 72.9%→82.4%);长尾动作训练占比被主动提升到约 40%、奖励提升 6.4%。Online RL 让含验证动作的轨迹比例 +14.7%、误停率 −11.2%、GUI/Bash 混用轨迹 +10.6%、约束满足率在 OSWorld +8.6%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| MobileWorld(GUI-only,模拟沙箱,长程跨应用) | Success Rate (%) | 82.1(27B),100 步预算下 85.5 | Seed 2.1 Pro 73.2;GPT-5.6 Sol 70.1;Opus 4.8 67.5;GUI-Owl-1.5-32B 43.9 | 比 GPT-5.6 Sol +12.0、比 Opus 4.8 +14.6、比 Seed 2.1 Pro +8.9;比最强专用 GUI 基线 +38.2 |
| MobileWorld-Real(真机,中文移动生态,409 任务/104 App) | Success Rate (%) | 92.2(27B) | Seed 2.1 Pro 88.7;Gemini 3.1 Pro 86.2;GPT-5.6 Sol 85.4;Opus 4.8 84.7 | 比 Seed 2.1 Pro +3.5、Gemini 3.1 Pro +6.0、GPT-5.6 Sol +6.8、Opus 4.8 +7.5 个百分点 |
| AndroidDaily(真机高频日常场景) | Success Rate (%) | 97.5(27B) | Seed 2.1 Pro 95.2;Gemini 3.1 Pro 93.8 | 排名第一,比 Seed 2.1 Pro +2.3 个百分点 |
| OSWorld-Verified(桌面,partial progress,361 任务) | Success Rate (%) | 79.5(27B) | Opus 4.8 83.4;Seed 2.1 Pro 78.8;GPT-5.5 78.7;Gemini 3.5 Flash 78.4 | 总榜第二,仅次 Opus 4.8;超越所有其他闭源与开源模型 |
| OSWorld-v2(长程桌面工作流) | Partial / Binary (%) | 40.0 / 13.9(27B),平均 135.8 步/任务 | Opus 4.8 54.8/20.6;GPT-5.5 49.5/13.0;MiniMax M3 22.3/4.6(326.7 步) | binary 比 GPT-5.5 +0.9;比 MiniMax M3 在 partial/binary 上 +17.7/+9.3,步数少 58.4% |
| WebArena(功能性网站多步浏览器交互) | Success Rate (%) | 73.6(27B) | Opus 4.8 71.9;GPT-5.5 69.5;Gemini 3.1 Pro 65.3;人类 78.2 | 所有比较模型中最高,比 Opus 4.8 +1.7、比 GPT-5.5 +4.1 个点 |
| BrowseComp / BrowseComp-ZH(持久信息检索) | Success Rate (%) | 64.1 / 75.0(27B) | GPT-5.5 90.1(BC);Apodex-1.0-mini 71.5/80.6;UI-TARS-2 29.6/50.5 | BC-ZH 第二;超越 Qwen3.5-27B、Tongyi-DR-30B、UI-TARS-2 |
| ScreenSpot-Pro(高分辨率专业软件定位) | Accuracy (%) | 76.6 no-zoom / 81.5 zoom-in(27B) | GUI-Owl-1.5-32B 72.9/80.3;Seed 2.1 Pro 65.3/80.7;UI-Venus-1.5-30B-A3B 69.6/74.8 | no-zoom 与 zoom-in 均第一 |
| 通用 & agentic(13 个基准均值代表) | Terminal-Bench 2.0 / Claw-Eval / Tau2-Bench | 50.1 / 73.5 / 89.9(27B) | Qwen3.5-27B 基座 41.1 / 66.9 / 89.2;GUI-Owl-1.5-32B 0.0 / 29.6 / 6.1 | agentic 任务显著超越基座,通用推理基本无损;远超专用 GUI 模型 |
局限与改进
作者明确承认四点:(1) 真机评测用 AutoJudge(VLM 多数投票)而非确定性验证器或人工专家裁定,因为第三方 App 不暴露内部状态、全人工裁定 11 个系统也不现实——在 666 条专家标注上 AutoJudge 仅 92.8% 精确匹配,残留误差会给真机结果带来轻微不确定性。(2) 35B-A3B 规模的 CUA 和 DeepSearch 训练报告发布时尚未完成,相关结果缺失。(3) 已构建更高保真的合成环境但尚未纳入当前模型训练,故未在报告中呈现。(4) 全自动 GUI 能力开发尝试表明当前基础模型尚不能可靠自管整个流程,流水线仍是 agent 驱动而非完全自主,仍需大量人工监督。**我自己的观察**:WebArena 与人类(78.2%)仍有 4.6 个点差距;OSWorld-v2 partial 与 Opus 4.8 差 14.8 个点、binary 差 6.7 个点,长程桌面任务的绝对完成度仍偏低(13.9%);DeepSearch 在英文 BrowseComp 上(64.1%)距 GPT-5.5(90.1%)差距巨大,27B 规模在重度研究任务上力有不逮;报告主要给出成功率与步数,对延迟、token 成本、单任务美元成本等部署关键指标缺乏系统披露;自动生成的验证器和 VLM 判官本身可能有系统性偏差,会以同样方式同时影响本文模型和基线,难以暴露真实差距。
独立分析的弱点
**弱点一:执行延迟与每步成本未解决。** GUI 智能体每一步都要'观察-推理-动作'循环,长程任务延迟累积严重,文中恐龙游戏案例就揭示了单步模型推理无法跟上实时游戏,必须靠 CLI 写本地控制器绕开。改进方向:自适应观察(仅在状态显著变化时截图)、异步执行、推测解码、把高频小决策蒸馏成轻量策略。**弱点二:长程任务的绝对完成度仍低。** OSWorld-v2 binary 仅 13.9%,说明大多数复杂桌面工作流仍做不完。改进方向:把 Harness 的上下文压缩、任务分解、记忆管理、进度跟踪做成显式机制,作为模型能力之外的补充支撑(作者自己也列为未来方向)。**弱点三:评测依赖 VLM 判官。** AutoJudge 的 92.8% 精度意味着约 7% 真机结果可能被误判,且判官与被评模型可能共享偏见。改进方向:构建可在真实 App 上注入和读取状态的更高保真合成环境(作者提到已建未用),配合确定性验证器;公开 AutoJudge 的提示与 disagreed 案例供社区审计。**弱点四:主动服务的安全性与个性化尚浅。** Harness 会基于通知发起预订、改签等敏感操作,目前靠 ask_user 兜底,但缺少系统的安全训练目标、可解释性约束与用户可控的画像记忆审计。改进方向:安全导向的 RL 目标、行为可解释性方法、让用户能查看/删除/纠偏画像。**弱点五:35B-A3B 与 CUA/DeepSearch 的训练未完成。** 当前开源友好版(35B-A3B)的能力图谱不完整,影响部署选型。改进方向:尽快补齐并开源权重与数据合成方法。
未来方向
作者明确提出的方向:(1) **高效 GUI 执行**——通过更快推理、自适应观察、异步执行、减少交互轮次来降低每步延迟,这是走向实用的最大障碍。(2) **Harness 辅助的长程工作流**——在模型之外用 Harness 做上下文压缩、任务分解、记忆管理、进度跟踪、结构化工具调用。(3) **大规模跨域 Online RL**——开发更高效稳定的训练策略应对慢且变长的 rollout 与稀疏延迟奖励,并在浏览器/移动/桌面环境上联合训练以提升数据效率和跨域泛化。(4) **高保真环境的可扩展合成**——真机昂贵难重置难验证,合成高保真环境是缩小 sim-to-real 鸿沟的互补路径,作者承诺开源环境合成方法。(5) **安全、用户控制与个性化**——更系统的安全评测与训练目标、可解释性约束;构建可靠的用户记忆与画像、并让用户可控。**基于成果可延伸**:可探索把 Harness 的 affair 抽象推广到桌面通知/IoT 事件流形成全设备主动助理;可研究 Action RL 的奖励 shaping 与 Online RL 的课程学习联合优化;可把 GUI-CLI 跨模态'Bash 作手、GUI 作眼'模式显式建模为分层策略以加速收敛;可在 4B 小模型上验证该方法能否下沉到端侧部署。
复现评估
**复现难度高,属于工业级系统工程。** 关键阻碍:(1) 真机运行时需要 100+ 物理手机、150+ App、健康感知调度器、虚拟屏、用户接管机制——这是普通学术组无法负担的硬件与工程投入。(2) Online RL 依赖阿里云上 10000 并发沙箱环境,rollout 吞吐量本身是工程壁垒。(3) 数据飞轮依赖强基础模型生成任务/环境/验证器,约 10000 个验证任务-验证器对、约 10000 并发环境,数据生成代码与验证器细节未公开。(4) 论文提供了模型规模(27B/35B-A3B/4B)、关键公式(动作感知奖励、GRPO 相对优势)、训练超参(窗口 $n=5$、entropy 正则、推理长度界)、评测协议(AutoJudge 三分类、5 个 VLM 投票、环境错误单独报告)等关键信息,但 SFT 数据配比、课程学习阈值、各 RL 阶段的具体步数/学习率均未给出。(5) 报告发布时模型权重、代码、MobileWorld-Real 数据集、AutoJudge 协议均未明确开源计划(仅项目页 tongyi-mai.github.io/Qwen-UI-Agent)。AutoJudge 在 666 条人工标注上 92.8% 精度为真机评测提供了可审计基础,是少数可被外部部分验证的组件。整体上,独立复现完整系统近乎不可行,复现单一基准上的小规模结果也需要相当工程能力。
论文图表
展示 409 个端到端任务、104 个 App、7 大领域(内容/生活/生产力/电商/系统/金融/社交)的分布与长尾特征;列举典型复杂任务(如多平台比价、深度入口导航、条件指令+弹窗干扰);同模型对比下 MobileWorld-Real 比 AndroidDaily 成功率更低、轨迹更长,凸显真机挑战。
这是本文新提出的关键评测基准,理解其任务分布与难度画像才能正确解读 92.2% 这一数字的分量。
六类失败案例配关键帧与模型思维摘录:执行能力限制类(探索失败、错误动作循环、丢失执行状态);真实场景挑战类(UI 误读、弹窗干扰、物理控件控制)。紫色标注关键谬误。
这是支撑'真机训练必要性'论点的核心定性证据,每类失败都直接对应作者后续设计的应对机制。