← 返回 2026-07-31

Qwen-UI-Agent:面向真实世界的通用基础 GUI 智能体技术报告 Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

Hanzhang Zhou, Panrong Tong, Xu Zhang, Quyu Kong, Chenglin Cai, Tianyu Xia, Gongjie Zhang, Jianan Zhang, Long Li, Long Chen, Lei Wang, Gaole Dai, Pengxiang Li, Liangyu Chen, Yue Wang, Steven Hoi 📅 2026-07-30 👍 300 2026-08-05 19:06
GUI Agent Sim-to-Real 在线强化学习 多模态大模型 强化学习 数据飞轮 智能体 移动端自动化

面向真实设备的统一 GUI+CLI 基础智能体,在移动端全面 SOTA。

前置知识

GUI Agent(图形界面智能体)

一类能够通过感知屏幕截图、理解界面语义、并发出鼠标/键盘/触控等操作指令来自动完成数字任务的多模态大模型系统。它把用户的高层意图翻译成一连串底层界面动作(如点击坐标 $(x,y)$、输入文本、滑动等),无需应用暴露专用 API 即可操作现有软件生态。

本文的核心研究对象就是 GUI Agent,理解它的输入(截图、历史)、输出(动作序列)、评价指标(成功率、步数)是读懂全部实验和消融的前提。

Sim-to-Real Gap(仿真到真实鸿沟)

模型在可控沙箱(重置状态的 Android 模拟器、虚拟机)里表现优异,但部署到真实设备时由于弹窗、CAPTCHA、权限请求、动态刷新内容、账户状态变化等不可控因素而大幅失效。这是移动智能体最棘手的工程难题。

本文的核心动机就是弥合这道鸿沟,作者专门构建了 100+ 台物理手机、150+ 应用的真实设备运行时来训练和评测。

GRPO(Group Relative Policy Optimization,组相对策略优化)

一种基于采样的强化学习算法:对同一任务采样 $K$ 条轨迹,用可执行验证器给出二值奖励 $r_i \in \{0,1\}$,然后计算组内相对优势 $\hat{A}_i = (r_i - \bar{r}_x)/(\mathrm{Std}(r_1,\ldots,r_K)+\epsilon)$ 来更新策略。它免去了显式 critic 网络,适合稀疏奖励的长程任务。

本文的 Online RL 阶段就是用 GRPO 变体优化端到端任务成功率,是模型长程决策能力跃升的关键算法。

Hybrid GUI+CLI 动作空间

在同一条轨迹中同时允许视觉化的 GUI 操作(点击、拖拽、输入)和程序化的 CLI 命令(`cli_command` 执行 bash),以及 API 调用(`api_call`)和用户交互(`ask_user`)。模型自主选择最合适的执行通道,并能批量发出动作。

这是本文最重要的设计创新之一,使得结构化任务(文件处理、批量计算)可以用 CLI 高效完成,而视觉任务用 GUI 完成。

Batched Actions(批量动作)

在一次模型决策步内发出有序动作序列 $a_t = (a_t^{(1)}, \ldots, a_t^{(K_t)})$,当多个操作无需新的环境反馈即可顺序完成时跳过中间的观察-推理循环。平均批量大小约 3.1 个原语动作。

在 OSWorld 上超过 40% 的动作为批量形式,显著缩短了轨迹长度并降低了每步推理开销,是效率优势的关键来源。

Agent-Driven Data Flywheel(智能体驱动数据飞轮)

一种 AutoResearch 风格的闭环流程:用强基础模型自动生成任务和环境状态、合成状态验证器、收集轨迹、用 VLM-as-Judge 评估、归因失败原因、再针对性生成下一轮数据。人工仅做高层监督和定点修订。

这是支撑 Qwen-UI-Agent 能在移动/桌面/网页/DeepSearch 多域大规模扩展数据的关键工程范式,理解它才能看懂 SFT 和 Online RL 的数据从何而来。

研究动机

现有 GUI 智能体几乎都是针对模拟沙箱基准优化出来的,与真实可用之间存在巨大鸿沟。具体表现在六个方面:(1) 仿真到真实鸿沟严重,模型在 MobileWorld 沙箱里动辄 70%+ 成功率,但放到真实中文移动生态(密集界面、超级 App、频繁弹窗、CAPTCHA)就频繁失效——作者分析 Qwen 3.7 Plus 在真机上的失败中 52.0% 源于 UI 误读、弹窗干扰、物理控件控制等真实场景挑战。(2) 现有方法把移动、网页、桌面分开训练,无法完成跨平台工作流。(3) 多数模型只输出纯 GUI 动作,把本可一行命令完成的结构化操作拖成长串点击。(4) 模型只能完成短程任务,缺乏长程规划、状态跟踪、中间验证与错误恢复。(5) 训练流水线高度依赖人工构造任务、采数据、分析失败,难以规模化。(6) 智能体只能被动等待用户指令,而真实手机上其实已存在大量可操作的信号(如航班取消通知)。

本文的目标是构建一个面向真实世界的基础 GUI 智能体 Qwen-UI-Agent,同时跨越移动、桌面、网页、DeepSearch 四种环境,达到六个核心目标:在真实物理设备上可靠执行、支持跨域跨平台工作流、统一 GUI+CLI+批量动作空间、可靠完成长程(100+ 步)任务、用 Agent 驱动数据飞轮大幅降低人工成本、并能基于手机通知主动发起有用服务。作者希望最终在一系列真实设备与公开基准上全面超越 Opus 4.8、GPT-5.6 Sol、Gemini 3.1 Pro、Seed 2.1 Pro 等前沿闭源模型。

与已有工作不同的是,本文的独特切入角度在于把 GUI 智能体当作一个'系统'而非单个模型来设计:把环境基础设施(100+ 真实手机 + 10000 并发沙箱)、统一动作空间(GUI/CLI/API 批量)、自动化数据飞轮(VLM-as-Judge 步级监督 + 可执行验证器)、三段式训练(SFT→Action RL→Online RL)、以及一层轻量 Harness(主动服务 + 跨平台执行)协同设计。与只堆数据或只换 RL 算法的工作不同,作者专门针对'真机经验稀缺'这个被忽视的根因,构建了带健康感知调度器、虚拟屏、用户接管机制的真机运行时,并用同一套数据流水线闭环驱动能力获取。

核心方法

整体思路是先把 GUI 智能体任务形式化为 $\tau=(I, E_\tau)$,其中 $I$ 是用户指令、$E_\tau$ 是可用环境集合;在每一步模型接收多通道观察 $o_t=(o_t^{GUI}, o_t^{CLI}, o_t^{API})$(截图 + 命令输出 + API 响应),并输出推理 $r_t$ 和批量动作 $a_t=(a_t^{(1)},\ldots,a_t^{(K_t)})$。围绕这一形式化,系统由四大组件构成:(1) 环境基础设施——可扩展沙箱(基于 redroid 容器化的 Android、OSWorld VM、Playwright 浏览器、Serper+Jina 的 DeepSearch)+ 真机移动运行时;(2) Agent 驱动的数据飞轮,自动完成任务/环境/验证器合成与失败归因;(3) 统一训练框架 SFT + Action RL + Online RL;(4) Harness 层,连接用户上下文,支持主动服务和跨平台执行。直觉上:让模型在尽可能真实的环境里学习,用飞轮自动获取能力,再用分层 RL 先修局部错误再优化长程成功,最后用 Harness 把孤立的执行变成日常助手。

最本质的创新有三点。第一,统一的多通道动作空间与批量执行:不同于以往纯 GUI 或纯代码方案,模型在一条轨迹内自由混用 GUI、CLI、API,并用 `ask_user` 在敏感操作前请求确认,单步可批量发出多个无需新观察的动作(平均 3.1 个/批),从根本上改变了执行效率与覆盖度。第二,把 Agent 驱动的数据飞轮作为闭环引擎:用强模型生成任务-环境-验证器三元组,用步级 VLM-as-Judge 从失败轨迹里抢救出'最长连续正确步''首次反思步''错误恢复段'三类监督信号,使 SFT 数据质量可媲美甚至超过完整轨迹筛选。第三,分层 RL:Action RL 用动作感知奖励(公式 $r_t = F_t[w_{type}C_t + w_{arg}C_tQ_t - \lambda_{sens}S_t - \lambda_{rep}L_t]$)针对六大类复发动作错误做局部修正;Online RL 用 GRPO 在 100+ 步轨迹上优化端到端成功,并配以模型自适应课程(活跃池+监控池)让'当前可学'的任务拿到全部 rollout 预算。

方法步骤详情

完整流程如下:**阶段一:领域能力 Bootstrapping**——用强基础模型分析各域所需知识与能力,构建层级化功能树和能力画像,编译成可复用的'任务合成技能',自动生成初始任务池与环境上下文;按 MAI-UI 范式做拒绝采样、聚合得到统一 SFT 语料。**阶段一·SFT 细节**——为每个域训练专家模型(域条件专家训练,含跨域数据混合防过拟合),再做模型合并得到单一 checkpoint;为保留通用能力,混合'起始模型自己能解对'的 in-distribution 数据(数学、代码、问答、工具使用),实验证明这种比喂难题更有效;用滑动窗口训练(窗口 $n=5$,步长 $n-1=4$,一步重叠)压缩长轨迹 SFT 的重复上下文成本。**阶段二:Action RL**——挖掘 6 类复发错误(易混淆元素定位、排序、数量完备性、过早完成、重复循环、长尾动作选择失败),结合历史轨迹挖掘 + 主动环境探索构造针对性数据,按上述动作感知奖励训练,并用熵正则与推理长度上下界防止策略坍缩。**阶段三:Online RL**——用统一环境基础设施在阿里云上部署最多 10000 并发 rollout;通过环境状态合成→任务合成→验证器合成三步自动产出约 10000 个已验证任务-验证器对;对每任务采样 $K$ 条轨迹,验证器评估最终状态得二值奖励,按 GRPO 相对优势更新;模型自适应课程把'中等成功率'任务放活跃池、'太难'任务放监控池小预算监测,一旦开始出现成功就升级到活跃池。**阶段四:Harness 层**——基于通知流的事件感知→关联持久化 affair(事件/事务/任务三层抽象)→affair 级推理生成决策就绪的任务卡→低风险准备性动作先行、敏感动作(支付/预订)需用户确认→从用户反馈持续演化画像记忆。跨平台执行用 OpenClaw 式分层规划器,移动子任务在虚拟屏上并行不阻塞用户。

技术新颖性

技术新颖性体现在多个维度。**环境侧**:首次系统化构建真实中文移动生态的真机运行时(100+ 设备、150+ App、健康感知调度器、动态黑名单、虚拟屏 1 机多显、VLM 判官区分模型失败与环境失败),并用同一接口统一异构环境生命周期(acquire/reset/step/evaluate/tear_down/release)。**动作侧**:把 cli_command 直接嵌入 OSWorld VM 内的非交互 shell(而非打开终端 App 操作),CLI 输出作为结构化观察与截图一起返回;批量动作在 GUI 与 CLI 间自由组合,超过 40% 动作为批量。**数据侧**:步级 VLM-as-Judge 从成功和失败轨迹中抢救三种监督信号,作者发现其 SFT 效果'相当或优于'用可执行验证器筛选完整轨迹——这是对'高质量 outcome 标注稀缺'这一痛点的重要回应。**训练侧**:Action RL 专门针对 6 类复发动作错误做局部修正,Online RL 用 100+ 步轨迹和模型自适应课程优化长程决策,并观察到'Bash 作手、GUI 作眼'的跨模态协作模式自发涌现(执行-验证转移从 40.2%→52.4%)。**系统侧**:Harness 层把通知流转化为 affair 级推理,是'从被动执行到主动服务'这一新维度的早期探索。

Qwen-UI-Agent 主动式跨平台任务执行的示例轨迹
Figure 2: Qwen-UI-Agent 主动式跨平台任务执行的示例轨迹
Qwen-UI-Agent 的环境基础设施
Figure 3: Qwen-UI-Agent 的环境基础设施
带闭环环境治理的真机移动运行时
Figure 4: 带闭环环境治理的真机移动运行时
Qwen-UI-Agent 的数据飞轮
Figure 5: Qwen-UI-Agent 的数据飞轮
主动服务与跨平台执行的 Harness 概览
Figure 6: 主动服务与跨平台执行的 Harness 概览
代表性 GUI 交互模式
Figure 14: 代表性 GUI 交互模式
代表性 CLI 交互模式
Figure 15: 代表性 CLI 交互模式
代表性批量动作模式
Figure 16: 代表性批量动作模式

实验结果

**移动端**(核心战场):在 MobileWorld GUI-only 子集(117 任务,50 步预算)上 Qwen-UI-Agent-27B 拿到 82.1% 的新 SOTA,分别比 GPT-5.6 Sol、Opus 4.8、Seed 2.1 Pro 高 12.0、14.6、8.9 个百分点,比最强专用 GUI 基线 GUI-Owl-1.5-32B(43.9%)高 38.2 个百分点;步预算放宽到 100 时进一步提升到 85.5%。在自建真机基准 MobileWorld-Real(409 任务、104 App)上拿到 92.2%,超过 Seed 2.1 Pro(88.7%)、Gemini 3.1 Pro(86.2%)、GPT-5.6 Sol(85.4%)、Opus 4.8(84.7%)等所有闭源基线 3.5–7.5 个百分点;在 AndroidDaily 上达 97.5% 排名第一。**桌面端**:OSWorld-Verified 上 79.5% 排名第二,仅次于 Opus 4.8(83.4%),超越 Seed 2.1 Pro、GPT-5.5、Gemini 3.5/3.1;OSWorld-v2 上 partial 40.0%、binary 13.9%,比开源最强基线 MiniMax M3 在 partial/binary 上分别高 17.7/9.3 个点,且平均步数仅 135.8,比 MiniMax M3(326.7)和 Qwen 3.7 Plus(173.5)分别少 58.4% 和 21.7% 步。**浏览器与 DeepSearch**:WebArena 上 73.6%(所有比较模型中最高,比 Opus 4.8 71.9% 高 1.7 个点,距人类 78.2% 还差 4.6 个点);BrowseComp 64.1%、BrowseComp-ZH 75.0%(中文第二)。**GUI 定位**:ScreenSpot-Pro no-zoom 76.6%、zoom-in 81.5% 均为第一,ScreenSpot-V2 97.5%、MMBench-GUI L2 92.6%、OSWorld-G-Refined 78.5%、UI-Vision 70.0%。**通用能力保留**:相对 Qwen3.5-27B 基座,在 MMMU-Pro/MMLU-Pro 等通用基准上几乎无损(72.4 vs 73.5、86.5 vs 86.0),在 agentic 基准上反而提升(Terminal-Bench 2.0 50.1 vs 41.1、Claw-Eval 73.5 vs 66.9),并大幅超越 UI-Venus、GUI-Owl 等专用 GUI 模型。**消融**:Action RL 让总体 SR 提升 7%+,推理 token 降 21.3%、交互步数升 8.4%;在 5 类错误模式专用测试集上系统性纠错(如重复循环 72.9%→82.4%);长尾动作训练占比被主动提升到约 40%、奖励提升 6.4%。Online RL 让含验证动作的轨迹比例 +14.7%、误停率 −11.2%、GUI/Bash 混用轨迹 +10.6%、约束满足率在 OSWorld +8.6%。

Qwen-UI-Agent 的动作空间
Table 1: Qwen-UI-Agent 的动作空间
MobileWorld GUI-only 子集(117 任务)性能对比
Table 2: MobileWorld GUI-only 子集(117 任务)性能对比
真机移动基准对比(MobileWorld-Real & AndroidDaily)
Table 3: 真机移动基准对比(MobileWorld-Real & AndroidDaily)
OSWorld-Verified 性能对比
Table 4: OSWorld-Verified 性能对比
OSWorld-v2 性能对比(partial/binary/步数/动作模式)
Table 5: OSWorld-v2 性能对比(partial/binary/步数/动作模式)
WebArena 性能对比
Table 6: WebArena 性能对比
DeepSearch 基准(BrowseComp / BrowseComp-ZH)
Table 7: DeepSearch 基准(BrowseComp / BrowseComp-ZH)
GUI 定位基准对比
Table 8: GUI 定位基准对比
通用与 agentic 能力对比
Table 9: 通用与 agentic 能力对比
Qwen 3.7 Plus 真机失败模式分布
Table 10: Qwen 3.7 Plus 真机失败模式分布
OSWorld-Verified/v2 上 GUI+CLI 与批量执行统计
Table 11: OSWorld-Verified/v2 上 GUI+CLI 与批量执行统计
Action RL 前后在 5 类错误模式专用测试集上的性能
Table 12: Action RL 前后在 5 类错误模式专用测试集上的性能
高频 vs 长尾动作对比
Table 13: 高频 vs 长尾动作对比
AutoJudge 与人工标注的一致性
Table 14: AutoJudge 与人工标注的一致性
Qwen-UI-Agent 在多种 GUI 设置下展现领先或有竞争力的性能
Figure 1: Qwen-UI-Agent 在多种 GUI 设置下展现领先或有竞争力的性能
真机移动 GUI 执行演示
Figure 8: 真机移动 GUI 执行演示
桌面任务中的混合 GUI+CLI 执行演示
Figure 9: 桌面任务中的混合 GUI+CLI 执行演示
DeepSearch 辅助的 GUI 执行演示
Figure 10: DeepSearch 辅助的 GUI 执行演示
基于手机通知的主动服务演示
Figure 11: 基于手机通知的主动服务演示
跨平台任务执行演示
Figure 12: 跨平台任务执行演示
动态任务中紧耦合 GUI-CLI 协作案例(恐龙游戏)
Figure 17: 动态任务中紧耦合 GUI-CLI 协作案例(恐龙游戏)
Action RL 案例研究(Mastodon 邀请链接)
Figure 18: Action RL 案例研究(Mastodon 邀请链接)
Online RL 激发验证与自我修正(Excel 图表任务)
Figure 19: Online RL 激发验证与自我修正(Excel 图表任务)
Online RL 涌现跨模态协作(记账任务)
Figure 20: Online RL 涌现跨模态协作(记账任务)
Online RL 改善长程搜索与约束保持(BrowseComp-ZH)
Figure 21: Online RL 改善长程搜索与约束保持(BrowseComp-ZH)
查看结构化数据
任务指标本文基线提升
MobileWorld(GUI-only,模拟沙箱,长程跨应用) Success Rate (%) 82.1(27B),100 步预算下 85.5 Seed 2.1 Pro 73.2;GPT-5.6 Sol 70.1;Opus 4.8 67.5;GUI-Owl-1.5-32B 43.9 比 GPT-5.6 Sol +12.0、比 Opus 4.8 +14.6、比 Seed 2.1 Pro +8.9;比最强专用 GUI 基线 +38.2
MobileWorld-Real(真机,中文移动生态,409 任务/104 App) Success Rate (%) 92.2(27B) Seed 2.1 Pro 88.7;Gemini 3.1 Pro 86.2;GPT-5.6 Sol 85.4;Opus 4.8 84.7 比 Seed 2.1 Pro +3.5、Gemini 3.1 Pro +6.0、GPT-5.6 Sol +6.8、Opus 4.8 +7.5 个百分点
AndroidDaily(真机高频日常场景) Success Rate (%) 97.5(27B) Seed 2.1 Pro 95.2;Gemini 3.1 Pro 93.8 排名第一,比 Seed 2.1 Pro +2.3 个百分点
OSWorld-Verified(桌面,partial progress,361 任务) Success Rate (%) 79.5(27B) Opus 4.8 83.4;Seed 2.1 Pro 78.8;GPT-5.5 78.7;Gemini 3.5 Flash 78.4 总榜第二,仅次 Opus 4.8;超越所有其他闭源与开源模型
OSWorld-v2(长程桌面工作流) Partial / Binary (%) 40.0 / 13.9(27B),平均 135.8 步/任务 Opus 4.8 54.8/20.6;GPT-5.5 49.5/13.0;MiniMax M3 22.3/4.6(326.7 步) binary 比 GPT-5.5 +0.9;比 MiniMax M3 在 partial/binary 上 +17.7/+9.3,步数少 58.4%
WebArena(功能性网站多步浏览器交互) Success Rate (%) 73.6(27B) Opus 4.8 71.9;GPT-5.5 69.5;Gemini 3.1 Pro 65.3;人类 78.2 所有比较模型中最高,比 Opus 4.8 +1.7、比 GPT-5.5 +4.1 个点
BrowseComp / BrowseComp-ZH(持久信息检索) Success Rate (%) 64.1 / 75.0(27B) GPT-5.5 90.1(BC);Apodex-1.0-mini 71.5/80.6;UI-TARS-2 29.6/50.5 BC-ZH 第二;超越 Qwen3.5-27B、Tongyi-DR-30B、UI-TARS-2
ScreenSpot-Pro(高分辨率专业软件定位) Accuracy (%) 76.6 no-zoom / 81.5 zoom-in(27B) GUI-Owl-1.5-32B 72.9/80.3;Seed 2.1 Pro 65.3/80.7;UI-Venus-1.5-30B-A3B 69.6/74.8 no-zoom 与 zoom-in 均第一
通用 & agentic(13 个基准均值代表) Terminal-Bench 2.0 / Claw-Eval / Tau2-Bench 50.1 / 73.5 / 89.9(27B) Qwen3.5-27B 基座 41.1 / 66.9 / 89.2;GUI-Owl-1.5-32B 0.0 / 29.6 / 6.1 agentic 任务显著超越基座,通用推理基本无损;远超专用 GUI 模型

局限与改进

作者明确承认四点:(1) 真机评测用 AutoJudge(VLM 多数投票)而非确定性验证器或人工专家裁定,因为第三方 App 不暴露内部状态、全人工裁定 11 个系统也不现实——在 666 条专家标注上 AutoJudge 仅 92.8% 精确匹配,残留误差会给真机结果带来轻微不确定性。(2) 35B-A3B 规模的 CUA 和 DeepSearch 训练报告发布时尚未完成,相关结果缺失。(3) 已构建更高保真的合成环境但尚未纳入当前模型训练,故未在报告中呈现。(4) 全自动 GUI 能力开发尝试表明当前基础模型尚不能可靠自管整个流程,流水线仍是 agent 驱动而非完全自主,仍需大量人工监督。**我自己的观察**:WebArena 与人类(78.2%)仍有 4.6 个点差距;OSWorld-v2 partial 与 Opus 4.8 差 14.8 个点、binary 差 6.7 个点,长程桌面任务的绝对完成度仍偏低(13.9%);DeepSearch 在英文 BrowseComp 上(64.1%)距 GPT-5.5(90.1%)差距巨大,27B 规模在重度研究任务上力有不逮;报告主要给出成功率与步数,对延迟、token 成本、单任务美元成本等部署关键指标缺乏系统披露;自动生成的验证器和 VLM 判官本身可能有系统性偏差,会以同样方式同时影响本文模型和基线,难以暴露真实差距。

独立分析的弱点

**弱点一:执行延迟与每步成本未解决。** GUI 智能体每一步都要'观察-推理-动作'循环,长程任务延迟累积严重,文中恐龙游戏案例就揭示了单步模型推理无法跟上实时游戏,必须靠 CLI 写本地控制器绕开。改进方向:自适应观察(仅在状态显著变化时截图)、异步执行、推测解码、把高频小决策蒸馏成轻量策略。**弱点二:长程任务的绝对完成度仍低。** OSWorld-v2 binary 仅 13.9%,说明大多数复杂桌面工作流仍做不完。改进方向:把 Harness 的上下文压缩、任务分解、记忆管理、进度跟踪做成显式机制,作为模型能力之外的补充支撑(作者自己也列为未来方向)。**弱点三:评测依赖 VLM 判官。** AutoJudge 的 92.8% 精度意味着约 7% 真机结果可能被误判,且判官与被评模型可能共享偏见。改进方向:构建可在真实 App 上注入和读取状态的更高保真合成环境(作者提到已建未用),配合确定性验证器;公开 AutoJudge 的提示与 disagreed 案例供社区审计。**弱点四:主动服务的安全性与个性化尚浅。** Harness 会基于通知发起预订、改签等敏感操作,目前靠 ask_user 兜底,但缺少系统的安全训练目标、可解释性约束与用户可控的画像记忆审计。改进方向:安全导向的 RL 目标、行为可解释性方法、让用户能查看/删除/纠偏画像。**弱点五:35B-A3B 与 CUA/DeepSearch 的训练未完成。** 当前开源友好版(35B-A3B)的能力图谱不完整,影响部署选型。改进方向:尽快补齐并开源权重与数据合成方法。

未来方向

作者明确提出的方向:(1) **高效 GUI 执行**——通过更快推理、自适应观察、异步执行、减少交互轮次来降低每步延迟,这是走向实用的最大障碍。(2) **Harness 辅助的长程工作流**——在模型之外用 Harness 做上下文压缩、任务分解、记忆管理、进度跟踪、结构化工具调用。(3) **大规模跨域 Online RL**——开发更高效稳定的训练策略应对慢且变长的 rollout 与稀疏延迟奖励,并在浏览器/移动/桌面环境上联合训练以提升数据效率和跨域泛化。(4) **高保真环境的可扩展合成**——真机昂贵难重置难验证,合成高保真环境是缩小 sim-to-real 鸿沟的互补路径,作者承诺开源环境合成方法。(5) **安全、用户控制与个性化**——更系统的安全评测与训练目标、可解释性约束;构建可靠的用户记忆与画像、并让用户可控。**基于成果可延伸**:可探索把 Harness 的 affair 抽象推广到桌面通知/IoT 事件流形成全设备主动助理;可研究 Action RL 的奖励 shaping 与 Online RL 的课程学习联合优化;可把 GUI-CLI 跨模态'Bash 作手、GUI 作眼'模式显式建模为分层策略以加速收敛;可在 4B 小模型上验证该方法能否下沉到端侧部署。

复现评估

**复现难度高,属于工业级系统工程。** 关键阻碍:(1) 真机运行时需要 100+ 物理手机、150+ App、健康感知调度器、虚拟屏、用户接管机制——这是普通学术组无法负担的硬件与工程投入。(2) Online RL 依赖阿里云上 10000 并发沙箱环境,rollout 吞吐量本身是工程壁垒。(3) 数据飞轮依赖强基础模型生成任务/环境/验证器,约 10000 个验证任务-验证器对、约 10000 并发环境,数据生成代码与验证器细节未公开。(4) 论文提供了模型规模(27B/35B-A3B/4B)、关键公式(动作感知奖励、GRPO 相对优势)、训练超参(窗口 $n=5$、entropy 正则、推理长度界)、评测协议(AutoJudge 三分类、5 个 VLM 投票、环境错误单独报告)等关键信息,但 SFT 数据配比、课程学习阈值、各 RL 阶段的具体步数/学习率均未给出。(5) 报告发布时模型权重、代码、MobileWorld-Real 数据集、AutoJudge 协议均未明确开源计划(仅项目页 tongyi-mai.github.io/Qwen-UI-Agent)。AutoJudge 在 666 条人工标注上 92.8% 精度为真机评测提供了可审计基础,是少数可被外部部分验证的组件。整体上,独立复现完整系统近乎不可行,复现单一基准上的小规模结果也需要相当工程能力。