UI-Mate:借助上下文示范推进开源权重基础GUI智能体 UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations
开源27B GUI智能体:环境闭环数据训练+子任务级示范引导,登顶开源计算机操作基准
前置知识
计算机操作智能体(CUA, Computer-Use Agent)
直接在真实操作系统桌面上完成任务的视觉-语言智能体:每一步接收屏幕截图作为观测 $o_t$,输出推理与鼠标键盘动作(点击、输入、滚动等),循环往复直至发出终止动作或耗尽步数预算。与传统API调用型助手不同,CUA像人一样通过图形界面与应用交互,不依赖应用暴露接口或脚本入口。
本文的模型、数据管线、RL环境、评测基准与桌面App全部围绕CUA的任务形态构建;理解这一设定才能理解为什么数据必须绑定可执行、可验证的环境,以及演示为何不能直接当作可回放脚本。
决策轮(Decision Turn)
论文的基本交互与度量单位:一次「观测→模型响应」循环。一个响应 $y_t=(r_t,a_t)$ 含推理和一串动作 $a_t=(a_t^{(1)},\dots,a_t^{(K_t)})$,这 $K_t$ 个动作连续执行、期间不接收新观测,因此计为一轮而非 $K_t$ 轮。交互预算以决策轮数计(如OSWorkerBench为200轮)。
RL阶段的决策轮中心化校正、OSWorkerBench的轨迹长度分析(Kimi-K2.6中位68轮、UI-Mate-27B中位71轮)都以决策轮为度量,混同于原子UI操作数会误读结论。
GRPO(群组相对策略优化)
一种无需价值网络的在线RL算法:对同一任务用同一策略快照 $\bar\theta$ 并行采样 $N$ 条轨迹组成组 $G$,可执行验证器给出二元结果 $R_i\in\{0,1\}$,用组内相对比较估计优势(成功者为正、失败者为负)。全组同结果的组不提供相对信号而被跳过。
UI-Mate的RL阶段以GRPO为骨架,并针对GUI长轨迹的特点叠加了决策轮中心化、token级归一化、异步更新与失配过滤等改造,是读懂第4节的必要前置。
RLVR 与执行不变式
可验证奖励强化学习(RL from Verifiable Rewards)要求每次rollout终结于可验证信号。论文用任务包 $(x,\mathcal{E}_0,\mathcal{E}^\star,R)$ 形式化:$\mathcal{E}_0$ 为初始状态、$\mathcal{E}^\star$ 为参考完成状态,必须满足不变式 $R(\mathcal{E}_0)=0,\ R(\mathcal{E}^\star)=1$,即初始状态不得得分、参考完成必须得分。
这是数据管线合成RL语料的硬性数据契约,也是评估器精炼阶段硬负例/替代正例双探针审计的设计依据——不变式只保证内部自洽,不保证奖励忠实于指令。
过程信用分配(PCM, Process Credit Model)
轨迹级结果奖励无法指出哪些决策步是成败关键。PCM由教师模型从已验证成功轨迹提取可观察里程碑并合并等价分支,为失败轨迹的每个里程碑标注 completed / attempted_failed / not_attempted / skipped_by_branch,转化为非负重要性权重 $w_{i,t}=\mathrm{clip}(b+\phi(e_{i,t})\,\mathrm{sgn}(A^{base}_{i,t}),0,w_{max})$,只在决策步之间重分配学习信号、不改变最终任务奖励 $R_i$。
PCM与决策轮中心化、token归一化共同构成论文「轨迹到token信用分配」方案,是把结果奖励落实到具体决策的机制,也是其训练效率(少一半更新达到同等性能)的来源之一。
上下文示范学习(In-Context Demonstration Learning)
不更新参数,把任务示例放进提示上下文让模型参照执行。本文的变体:人类或智能体的屏幕录制被离线转化为子任务级工作流 $d=(s_1,\dots,s_N)$,每个子任务 $s_n=(\ell_n,v_n,u_n)$ 含自然语言目标、可验证完成判据和无坐标的动作描述,执行时由harness逐步注入当前子任务与进度清单。
DemoCUA是论文第二大贡献:其训练数据三阶段流水线、系统提示中的 subtask_complete 控制动作、以及「演示是先验不是目标」的设计原则都源于这一表示。
研究动机
现有一流CUA(UI-TARS、Qwen-UI-Agent等)虽在基准上进步显著,但真实部署受制于两个互补瓶颈。其一是训练瓶颈:GUI学习数据与生成它的环境不可分离——一条轨迹只有在初始状态可实例化、动作可执行、结果可验证时才有学习价值;而规模化数据生产天然偏向「便宜可实例化」的任务,短小、单应用任务大量堆积,长时程工作流、跨应用信息迁移与执行错误恢复的数据保持稀疏,在这种偏斜分布上训练会固化狭窄的执行模式。作者审计还发现,即使通过了执行不变式 $R(\mathcal{E}_0)=0,\ R(\mathcal{E}^\star)=1$ 一致性校验的RL评估器,仍有约18%与指令语义错位,主要模式为过严匹配(40%)、语义空洞断言(23%)和检查对象错误(19%)。其二是交互瓶颈:日常办公流程由用户的工具、文件组织、模板与命名惯例塑造,指令通常只说清结果而省略过程——把每个细节写进提示的工作量与手动完成任务相当,于是隐含细节在每次运行中被不同地解析,导致「成功过一次的智能体在下一次看似相同的请求上失败」。平均成功率完全掩盖这种差别:偶发正确与持续正确可以产生相同的均值,但对用户而言只有后者才构成可托付的可靠性。
本文的目标是本文目标是构建开源权重的基础GUI智能体UI-Mate,同时打通训练与交互两侧瓶颈,具体分解为四个目标:(1) 建立环境接地的闭环数据引擎,自动完成任务指令策展、环境构造、rollout采集与过滤、层级能力树诊断与数据再平衡,同时产出SFT所需的已验证轨迹和在线RL所需的任务-验证器束(task–verifier bundle);(2) 设计两阶段训练配方(SFT+在线agentic RL),使UI-Mate-27B在OSWorld-Verified达到77.0%、WindowsAgentArena达到66.2%,确立开源权重最优水平;(3) 提出DemoCUA上下文示范机制,把人类或智能体的多模态演示转化为子任务级工作流,以提升欠规范任务上的执行一致性——在33任务自演示子集上把严格成功率从17.2%提升到35.4%、进度从67.9%提升到81.1%;(4) 构建OSWorkerBench基准(100个长时程办公任务、41个应用),以配对协议把「演示有无」隔离为唯一变量来量化其价值,并通过UI-Mate App把示范录制与引导执行落到用户自己的桌面上。
与已有工作不同的是,与已有工作的关键差异在于切入角度。数据侧,先前工作(EvoCUA、ScaleCUA等)以「合成经验的规模」为主线,UI-Mate则把数据问题重新表述为「诊断语料缺什么」:用应用→粗能力→细粒度操作的三级能力树追踪覆盖密度、rollout成功率与过滤拒绝率,按能力覆盖率而非轨迹数量分配生成预算。合成可验证任务时,先前做法多依赖生成期自洽校验,UI-Mate把「奖励是否忠实于指令」当作独立问题,用生成器/验证器解耦加硬负例与替代正例双探针独立审计(结果发现18%错位率并进入有界修复)。交互侧,RPA回放固定操作序列、ShowUI-Aloha把录像转为语义动作轨迹引导执行,本质上仍是复用演示的路径;UI-Mate把演示提升为带完成判据的「先验而非目标」——工作流视图 $g_t$ 只含检查清单与当前子任务,实时截图对演示保留否决权,允许跟随、跳过或重规划。评测侧,OSWorld与WindowsAgentArena均为纯指令协议,OSWorkerBench首次把同一目标的演示有无作为受控变量,用相同指令、环境、预算与验证器的配对比较隔离演示的净价值。
核心方法
直觉上,UI-Mate要同时做到「见多识广」与「善于领会意图」:前者靠在大量真实、多样、可验证的桌面环境中训练,后者靠教会模型从演示中读出程序性意图而非死记操作序列。技术路线由五个组件构成。其一,数据管线:四来源策展指令(开源数据集转换、失败rollout分解原子能力、真实文档与静态网站grounding、能力树驱动生成),LLM生成setup代码构造可执行环境并以随机化增广、优先检索真实文件;云VM并行rollout覆盖Ubuntu/Windows/macOS;双阶段过滤(任务/环境有效性+步级交付物证据);按能力树再平衡;人工标注修复补充。其二,训练栈:先SFT学习交互协议、视觉grounding与应用工作流,再在线RL——以GRPO为基础,叠加决策轮中心化、token级归一化、可选过程信用模型PCM、IcePop/SeqClip失配过滤的异步更新与自适应课程采样。其三,DemoCUA:离线把录像经VLM四轴标注(屏幕状态、意图、动作、视觉定位)并切分为带完成判据的子任务工作流,在线每步只注入当前子任务与进度清单,模型发出subtask_complete推进指针。其四,OSWorkerBench提供100个长时程办公任务的配对评测与self-demo/variant-demo两种演示设置。其五,统一harness与UI-Mate App负责部署、演示录制与执行可视化。
核心创新是把演示从「可回放的脚本」重构为「带完成判据的子任务级先验」。形式化地,演示 $d=(s_1,\dots,s_N)$,$s_n=(\ell_n,v_n,u_n)$:$\ell_n$ 是子任务目标,$v_n$ 是可检验的完成判据,$u_n$ 是带视觉线索但无像素坐标的动作描述(建议性而非可执行)。执行时指针 $n_t$ 追踪当前子任务,策略条件于工作流视图 $g_t=\Phi(d,n_t)$——全部子任务目标加完成/当前/未来完成标记,加上仅当前子任务的详细步骤;动作空间扩展一个控制动作 subtask_complete:当截图满足 $v_{n_t}$ 时发出,指针推进 $n_{t+1}=\min(n_t+1,N)$,即进度由观测屏幕状态而非固定步数计数器驱动。两个设计保证演示不被盲从:其一,$g_t$ 是先验不是目标,$u_n$ 可能省略低层操作、引用界面上不存在的元素或与当前状态错位,正确的动作是观测 $o_t$ 所要求的,观测对演示保留否决权;其二,目标函数不变,验证器仍只检查环境终态 $R(\tau)\in\{0,1\}$。与RPA/轨迹回放及ShowUI-Aloha的本质区别在于:训练数据刻意覆盖全对齐、部分错位与无关三类演示-屏幕关系,且训练时只给关键动作、推理时才给完整序列,强制模型学会「里程碑由演示给、路径靠截图找」。
方法步骤详情
完整流程分六步。第一步数据生产:四源指令经环境构造(LLM写setup代码建文件装应用,优先检索真实文件)、云VM并行rollout、双阶段过滤(任务/环境有效性+步级交付物证据追踪)与能力树配平,辅以人工标注的修复与rollout对齐重标注,产出SFT轨迹。第二步RL任务合成:生成器构造 $(x,\mathcal{E}_0,\mathcal{E}^\star)$ 并满足 $R(\mathcal{E}_0)=0,\ R(\mathcal{E}^\star)=1$,验证器仅凭任务说明与状态判分;再经硬负例探针(貌似合理的错误完成应被拒绝)与替代正例探针(另一种合法完成应被接受)独立审计,问题任务进入有界修复而非丢弃。第三步SFT:以决策轮为单位最小化 $\mathcal{L}_{SFT}=-\mathbb{E}\sum_k\log\pi_\theta(y_{t,k}\mid y_{t,<k},c_t)$。第四步在线RL:GRPO组内优势经决策轮中心化 $A^{base}_{i,t}=R_i-\mu_{turn}$、$\mu_{turn}=\sum_i T_iR_i/\sum_i T_i$ 校正轮数偏差,token级归一化校正响应长度偏差,PCM用教师里程碑标注重加权,异步更新配IcePop/SeqClip过滤陈旧token,课程采样把预算转向弱域。第五步DemoCUA数据:在扰动AgentNet上跑Rollout→Score→Filter & Repair三阶段流水线,S1–S4打分(VLM整体/子任务完成+规则遵循度)、R1–R4修复。第六步推理:harness首轮注入工作流快照并每步原位重写,主动折叠管理长上下文。
技术新颖性
技术新颖性体现在五处。其一,演示表示层面:先前的示范引导方法(RPA脚本、CUA-Skill参数化技能图、ShowUI-Aloha语义动作轨迹)都倾向复用演示的操作序列,UI-Mate首次把多模态演示蒸馏为「目标+可验证完成判据+无坐标里程碑」的子任务结构,并用专门的 subtask_complete 控制动作让智能体自行判断何时推进,进度锚定在实时像素而非演示计数上。其二,训练-推理不对称:训练时刻意隐去中间动作(焦点点击、滚动、弹窗关闭)并混入部分错位/无关演示防止抄近路,推理时提供完整动作序列,这种刻意错配在示范学习文献中少见,且实测更优。其三,奖励工程层面:把「生成期收敛」与「语义忠实」分离,用独立于生成路径的硬负例/替代正例探针审计评估器,发现18%错位率并以有界修复代替丢弃,保留最易被误判的困难环境任务。其四,RL信用分配:决策轮中心化(按轮数 $T_i$ 加权的组基线)与全批量token归一化分别消除轮数与响应长度两种系统性偏差,配合异步GRPO适配GUI任务时长高度不均的现实。其五,诊断工具:三级能力树把「应用级统计看不见的长尾缺口」变成可执行的生成预算,能力感知采样使Multi-App性能相对提升15.5个百分点。
实验结果
通用能力:UI-Mate-27B在OSWorld-Verified达77.0%,超Kimi-K2.6(73.1%)与Qwen3.7-Plus(73.3%),距GPT-5.5(78.7%)仅1.7pp,远超专用智能体ScaleCUA(68.7%)、EvoCUA-32B(56.7%)、UI-TARS-1.5(25.4%);9B达66.2%,超大10倍的EvoCUA-32B。WindowsAgentArena上27B达66.2%,超1T参数的Kimi-K2.6(63.3%)2.9pp;9B较基座Qwen3.5-9B(37.5%)提升24.2pp。OSWorkerBench上27B取得41.0%严格成功与76.86%进度,较基座+17.67/+24.51pp,略超Kimi-K2.6(40.67%/72.42%);Multi-App子集28.57%对基座7.48%,Long-Memory 32.84%对12.94%。DemoCUA配对实验:OSWorld-30从40.27%升至65.75%(+25.48pp,18升/8平/4降,四个零分任务被满分解决);OSWorker-33进度67.85%→81.14%、严格成功17.17%→35.35%(28/33任务改善,满分任务1→5个);GameDev 76.76%→81.15%且平均轨迹缩短16.6%(303.6→253.1步),Kimi-K2.6同设置+5.00pp,证明收益跨模型泛化。决策轮分析:UI-Mate-27B中位71轮、38%任务超100轮(GPT-5.6-Sol中位42.5但每轮3.83个动作属批量执行)。训练洞见:真实资源比合成资源约大6倍、轨迹58.4对38.5步(+51.7%);能力感知采样带来Multi-App +15.5pp;PCM与自适应课程把收敛所需更新减半但不提升终值;历史推理在推理期+3.43/+2.27pp、并入SFT再+2.85pp,但进入RL训练引发熵坍缩。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| OSWorld-Verified(通用桌面任务) | 平均任务成功率 | UI-Mate-27B 77.0%(UI-Mate-9B 66.2%) | 开源最强 Kimi-K2.6 73.1%;闭源最强 Claude Opus 4.8 83.4% | 超最强开源基线 +3.9pp,距最强闭源 -6.4pp |
| WindowsAgentArena(Windows跨平台) | 任务成功率 | UI-Mate-27B 66.2%(UI-Mate-9B 61.7%) | Kimi-K2.6 63.3%;GPT-5.5 70.4%;基座Qwen3.6-27B 47.1% | 超Kimi-K2.6 +2.9pp;9B较基座 +24.2pp,9B还超EvoCUA-32B +5.2pp |
| OSWorkerBench(100任务,指令-only) | 严格二元成功率 | UI-Mate-27B 41.00%(UI-Mate-9B 34.00%) | Kimi-K2.6 40.67%;基座Qwen3.6-27B 23.33%;GPT-5.6-Sol 71.00% | 较基座 +17.67pp,略超Kimi-K2.6 +0.33pp |
| OSWorkerBench | 检查点加权进度分 $S_{partial}$ | UI-Mate-27B 76.86%(UI-Mate-9B 66.55%) | Kimi-K2.6 72.42%;基座 52.35% | 较基座 +24.51pp,超Kimi-K2.6 +4.44pp |
| OSWorld-Subset30(自演示配对) | 平均任务分(5次运行) | 65.75% | 无演示 40.27% | +25.48pp(18升/8平/4降,4个零分任务满分解决) |
| OSWorkerBench-Subset33(自演示配对) | 进度分 / 严格成功(3次运行) | 81.14% / 35.35% | 无演示 67.85% / 17.17% | +13.29pp / +18.18pp,28/33任务改善 |
| GameDev(10任务超长时程) | 平均任务分(5次运行) | UI-Mate-27B 81.15%;Kimi K2.6 88.46% | 无演示分别 76.76% / 83.46% | +4.39pp / +5.00pp,且UI-Mate平均轨迹缩短16.6% |
局限与改进
作者明确承认的局限:其一,进度与严格成功之间存在35.86pp差距(76.86%对41.0%),轨迹分析指向「晚期遗漏」(漏写一个字段、漏发最后通知)是主要残余失败模式;其二,所有定量DemoCUA结果都基于self-demo设置(演示即同一任务的成功rollout),不能证明跨任务变体的程序迁移——45任务变体演示只做了10任务试点,需要「把演示段复制到目标实体数量」才净正向,性能尚不稳定,不足以支撑主基准结论;其三,OSWorld子集上有4个任务出现负迁移(如multi-03从100%跌至0%),演示过程被误用或与当前界面冲突时会伤害性能;其四,工作流置于上下文开头,每步原位重写使共享前缀失效、无法复用KV缓存,长episode推理成本被放大。我自己的观察:UI-Mate-27B在Professional类任务上仍落后Kimi-K2.6(75.5%对81.6%),说明专业软件覆盖不足;OSWorkerBench每模型仅1–5次rollout、100个任务,41.0%对40.67%这样的差距在统计噪声范围内;9B模型对评估器正确性更敏感(不完整的成功判据更容易强化错误行为),暗示小规模复现该配方更难;PCM与课程采样不提升最终性能,作者也承认进一步增益受限于数据覆盖与质量而非优化技巧。
独立分析的弱点
第一,演示获取成本高:self-demo依赖更强智能体在同一任务上的成功rollout,variant-demo需要人工录制,冷启动场景(新用户、无演示库的内部工具)无解——改进方向是从教学视频、产品文档自动挖掘演示,或让强智能体在相关任务上自举生成并筛选。第二,上下文效率:工作流在每一步被原位重写,破坏前缀KV缓存,长episode(中位71决策轮、38%任务超100轮)下推理成本被系统性放大——作者已提出把工作流移到上下文末尾使其append-only,这是明确的工程改进点。第三,负迁移不可检测:4个OSWorld任务因演示与界面冲突而变差,模型缺乏「演示可能失效」的元认知——可在训练中增加显式冲突标注或不确定性估计,让模型在检测到错位时自动降权演示。第四,基准统计功效有限:100任务、部分设置仅3次运行,跨模型1个点内的差距无法区分真优劣,Long-Memory与Multi-App是重叠人群而非匹配变体,不能做因果归因。第五,部署延迟:中位每步3030ms(模型调用2108ms、其中prefill约1597ms占76%),经QuaRot W8A8量化与DFlash投机解码压至2–3秒,端侧9B(6-bit约7GB)仍需10–20秒/步,交互式使用仍有距离。第六,能力树维护与评估器审计依赖LLM加人工带宽,数据引擎本身的可扩展性受标注产能约束,且RL阶段历史推理引发熵坍缩的问题尚无解法。
未来方向
作者提出的方向:(1) 变体演示设置的系统性评测——训练智能体提取部分匹配演示中的可迁移结构并识别其未覆盖之处,而非逐步重放;(2) 演示的离线规模化获取——从书籍、策划文档与教学视频中收割演示,而非每任务录制一条;(3) 演示检索——用实时界面状态查询演示库,使覆盖率随语料而非标注努力增长;(4) 验证器接地的进度信用——把PCM的里程碑结构升级为任务条件化的进度奖励模型,奖励里程碑完成与错误恢复、惩罚回退,同时保持终局残差使总过程奖励等于可执行结果;(5) 解决历史推理与RL探索的矛盾,在保留长时程状态跟踪优势的同时避免熵坍缩;(6) 把工作流移到上下文末尾实现append-only的KV缓存复用。基于其成果可延伸的方向:把能力树诊断机制推广到浏览器、机器人等其他agentic领域的数据预算;self-demo实际上给出一条「用强模型演示教弱模型」的蒸馏路径,可与模型级联部署结合降低成本;DemoCUA与UI-Mate App结合暗示「用户录一次、智能体终身执行」的个人自动化产品方向,值得在组织内部工具(无公开训练数据覆盖)场景验证;GameDev式的长时程创作型基准(8个Godot任务构成完整2D游戏开发链、平均超200步人工操作)也值得扩展为独立评测套件。
复现评估
开源情况:UI-Mate-9B/27B权重开源(分别基于Qwen3.5-9B与Qwen3.6-27B基座),项目页为 ui-mate.github.io;作者承诺发布OSWorkerBench的任务规格、33个self-demo与45个variant-demo配对、分类元数据和全部评估器;附录C公开了GameDev全部10个任务的逐字指令与评分rubric(每任务7–30项等权检查),附录B给出DemoCUA数据的完整打分规则(S1–S4)与修复规则(R1–R4),附录E/F给出逐任务结果,透明度较高。数据与算力方面则难以完全复现:数据引擎依赖内部云VM后端(跨三系统高并发rollout)、人工标注团队与真实文件索引,RL训练算力规模未披露;推理侧参考明确——单台8卡GPU机以bf16跑27B每步3–5秒,QuaRot式W8A8量化加DFlash训练的投机解码后2–3秒,Mac端侧6-bit 9B(约7GB)每步10–20秒。综合评估:复现DemoCUA推理(提示格式、上下文管理参数如折叠阈值、每截图1800 token成本估算等均已给出)属于中等难度;完整复现训练栈(数据引擎+大规模在线RL+人工标注)属于高难度,更适合视为工业级配方参考;评测复现依赖官方OSWorld/WAA协议与Docker/AWS provider,属于中等难度。
论文图表
以Godot「定时器与子弹发射」任务(演示含323个动作、切分7个子任务、episode共289步)为例,(a)展示运行时第105步的完整上下文窗口:系统提示含工作流契约,前64步被折叠为摘要,一条用户轮承载三块演示内容(workflow_progress检查清单、current_subtask目标与完成判据、current_subtask_action_list关键步骤),其余轮次为普通智能体历史(仅保留最近5张截图);(b)完整展示这三块内容:done/current/todo标记由harness运行时维护,子任务文本来自演示,该子任务含72个里程碑(节选展示)。
最详细地展示「演示在上下文中的确切形态」,是理解推理时信息注入方式与上下文管理策略的关键,也是复现提示格式的直接依据。