← 返回 2026-08-18

UI-Mate:借助上下文示范推进开源权重基础GUI智能体 UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

Zihan Ding, Longxu Dou, Qi Gao, Xiangwu Guo, Shengchao Hu, Zilong Huang, Zihang Jiang, Lei Ke, Mengcheng Lan, Weixian Lei, Hanxuan Li, Honglin Li, Xiyun Li, Zaitang Li, Leowei Liang, Xin Luo, Haozhe Ma, Jiayi Mao, Zhoujie Pan, Can Qin, Tianyuan Qu, Weiqi Wang, Wenkai Wang, Yonglin Wang, Yuxin Wang, Chenxu Wu, Yingchen Yu, Chenyu Zhang, Yuhao Zheng 📅 2026-08-16 👍 46 2026-08-23 18:30
GUI智能体 上下文示范学习 基准评测 强化学习 数据引擎 计算机操作

开源27B GUI智能体:环境闭环数据训练+子任务级示范引导,登顶开源计算机操作基准

前置知识

计算机操作智能体(CUA, Computer-Use Agent)

直接在真实操作系统桌面上完成任务的视觉-语言智能体:每一步接收屏幕截图作为观测 $o_t$,输出推理与鼠标键盘动作(点击、输入、滚动等),循环往复直至发出终止动作或耗尽步数预算。与传统API调用型助手不同,CUA像人一样通过图形界面与应用交互,不依赖应用暴露接口或脚本入口。

本文的模型、数据管线、RL环境、评测基准与桌面App全部围绕CUA的任务形态构建;理解这一设定才能理解为什么数据必须绑定可执行、可验证的环境,以及演示为何不能直接当作可回放脚本。

决策轮(Decision Turn)

论文的基本交互与度量单位:一次「观测→模型响应」循环。一个响应 $y_t=(r_t,a_t)$ 含推理和一串动作 $a_t=(a_t^{(1)},\dots,a_t^{(K_t)})$,这 $K_t$ 个动作连续执行、期间不接收新观测,因此计为一轮而非 $K_t$ 轮。交互预算以决策轮数计(如OSWorkerBench为200轮)。

RL阶段的决策轮中心化校正、OSWorkerBench的轨迹长度分析(Kimi-K2.6中位68轮、UI-Mate-27B中位71轮)都以决策轮为度量,混同于原子UI操作数会误读结论。

GRPO(群组相对策略优化)

一种无需价值网络的在线RL算法:对同一任务用同一策略快照 $\bar\theta$ 并行采样 $N$ 条轨迹组成组 $G$,可执行验证器给出二元结果 $R_i\in\{0,1\}$,用组内相对比较估计优势(成功者为正、失败者为负)。全组同结果的组不提供相对信号而被跳过。

UI-Mate的RL阶段以GRPO为骨架,并针对GUI长轨迹的特点叠加了决策轮中心化、token级归一化、异步更新与失配过滤等改造,是读懂第4节的必要前置。

RLVR 与执行不变式

可验证奖励强化学习(RL from Verifiable Rewards)要求每次rollout终结于可验证信号。论文用任务包 $(x,\mathcal{E}_0,\mathcal{E}^\star,R)$ 形式化:$\mathcal{E}_0$ 为初始状态、$\mathcal{E}^\star$ 为参考完成状态,必须满足不变式 $R(\mathcal{E}_0)=0,\ R(\mathcal{E}^\star)=1$,即初始状态不得得分、参考完成必须得分。

这是数据管线合成RL语料的硬性数据契约,也是评估器精炼阶段硬负例/替代正例双探针审计的设计依据——不变式只保证内部自洽,不保证奖励忠实于指令。

过程信用分配(PCM, Process Credit Model)

轨迹级结果奖励无法指出哪些决策步是成败关键。PCM由教师模型从已验证成功轨迹提取可观察里程碑并合并等价分支,为失败轨迹的每个里程碑标注 completed / attempted_failed / not_attempted / skipped_by_branch,转化为非负重要性权重 $w_{i,t}=\mathrm{clip}(b+\phi(e_{i,t})\,\mathrm{sgn}(A^{base}_{i,t}),0,w_{max})$,只在决策步之间重分配学习信号、不改变最终任务奖励 $R_i$。

PCM与决策轮中心化、token归一化共同构成论文「轨迹到token信用分配」方案,是把结果奖励落实到具体决策的机制,也是其训练效率(少一半更新达到同等性能)的来源之一。

上下文示范学习(In-Context Demonstration Learning)

不更新参数,把任务示例放进提示上下文让模型参照执行。本文的变体:人类或智能体的屏幕录制被离线转化为子任务级工作流 $d=(s_1,\dots,s_N)$,每个子任务 $s_n=(\ell_n,v_n,u_n)$ 含自然语言目标、可验证完成判据和无坐标的动作描述,执行时由harness逐步注入当前子任务与进度清单。

DemoCUA是论文第二大贡献:其训练数据三阶段流水线、系统提示中的 subtask_complete 控制动作、以及「演示是先验不是目标」的设计原则都源于这一表示。

研究动机

现有一流CUA(UI-TARS、Qwen-UI-Agent等)虽在基准上进步显著,但真实部署受制于两个互补瓶颈。其一是训练瓶颈:GUI学习数据与生成它的环境不可分离——一条轨迹只有在初始状态可实例化、动作可执行、结果可验证时才有学习价值;而规模化数据生产天然偏向「便宜可实例化」的任务,短小、单应用任务大量堆积,长时程工作流、跨应用信息迁移与执行错误恢复的数据保持稀疏,在这种偏斜分布上训练会固化狭窄的执行模式。作者审计还发现,即使通过了执行不变式 $R(\mathcal{E}_0)=0,\ R(\mathcal{E}^\star)=1$ 一致性校验的RL评估器,仍有约18%与指令语义错位,主要模式为过严匹配(40%)、语义空洞断言(23%)和检查对象错误(19%)。其二是交互瓶颈:日常办公流程由用户的工具、文件组织、模板与命名惯例塑造,指令通常只说清结果而省略过程——把每个细节写进提示的工作量与手动完成任务相当,于是隐含细节在每次运行中被不同地解析,导致「成功过一次的智能体在下一次看似相同的请求上失败」。平均成功率完全掩盖这种差别:偶发正确与持续正确可以产生相同的均值,但对用户而言只有后者才构成可托付的可靠性。

本文的目标是本文目标是构建开源权重的基础GUI智能体UI-Mate,同时打通训练与交互两侧瓶颈,具体分解为四个目标:(1) 建立环境接地的闭环数据引擎,自动完成任务指令策展、环境构造、rollout采集与过滤、层级能力树诊断与数据再平衡,同时产出SFT所需的已验证轨迹和在线RL所需的任务-验证器束(task–verifier bundle);(2) 设计两阶段训练配方(SFT+在线agentic RL),使UI-Mate-27B在OSWorld-Verified达到77.0%、WindowsAgentArena达到66.2%,确立开源权重最优水平;(3) 提出DemoCUA上下文示范机制,把人类或智能体的多模态演示转化为子任务级工作流,以提升欠规范任务上的执行一致性——在33任务自演示子集上把严格成功率从17.2%提升到35.4%、进度从67.9%提升到81.1%;(4) 构建OSWorkerBench基准(100个长时程办公任务、41个应用),以配对协议把「演示有无」隔离为唯一变量来量化其价值,并通过UI-Mate App把示范录制与引导执行落到用户自己的桌面上。

与已有工作不同的是,与已有工作的关键差异在于切入角度。数据侧,先前工作(EvoCUA、ScaleCUA等)以「合成经验的规模」为主线,UI-Mate则把数据问题重新表述为「诊断语料缺什么」:用应用→粗能力→细粒度操作的三级能力树追踪覆盖密度、rollout成功率与过滤拒绝率,按能力覆盖率而非轨迹数量分配生成预算。合成可验证任务时,先前做法多依赖生成期自洽校验,UI-Mate把「奖励是否忠实于指令」当作独立问题,用生成器/验证器解耦加硬负例与替代正例双探针独立审计(结果发现18%错位率并进入有界修复)。交互侧,RPA回放固定操作序列、ShowUI-Aloha把录像转为语义动作轨迹引导执行,本质上仍是复用演示的路径;UI-Mate把演示提升为带完成判据的「先验而非目标」——工作流视图 $g_t$ 只含检查清单与当前子任务,实时截图对演示保留否决权,允许跟随、跳过或重规划。评测侧,OSWorld与WindowsAgentArena均为纯指令协议,OSWorkerBench首次把同一目标的演示有无作为受控变量,用相同指令、环境、预算与验证器的配对比较隔离演示的净价值。

核心方法

直觉上,UI-Mate要同时做到「见多识广」与「善于领会意图」:前者靠在大量真实、多样、可验证的桌面环境中训练,后者靠教会模型从演示中读出程序性意图而非死记操作序列。技术路线由五个组件构成。其一,数据管线:四来源策展指令(开源数据集转换、失败rollout分解原子能力、真实文档与静态网站grounding、能力树驱动生成),LLM生成setup代码构造可执行环境并以随机化增广、优先检索真实文件;云VM并行rollout覆盖Ubuntu/Windows/macOS;双阶段过滤(任务/环境有效性+步级交付物证据);按能力树再平衡;人工标注修复补充。其二,训练栈:先SFT学习交互协议、视觉grounding与应用工作流,再在线RL——以GRPO为基础,叠加决策轮中心化、token级归一化、可选过程信用模型PCM、IcePop/SeqClip失配过滤的异步更新与自适应课程采样。其三,DemoCUA:离线把录像经VLM四轴标注(屏幕状态、意图、动作、视觉定位)并切分为带完成判据的子任务工作流,在线每步只注入当前子任务与进度清单,模型发出subtask_complete推进指针。其四,OSWorkerBench提供100个长时程办公任务的配对评测与self-demo/variant-demo两种演示设置。其五,统一harness与UI-Mate App负责部署、演示录制与执行可视化。

核心创新是把演示从「可回放的脚本」重构为「带完成判据的子任务级先验」。形式化地,演示 $d=(s_1,\dots,s_N)$,$s_n=(\ell_n,v_n,u_n)$:$\ell_n$ 是子任务目标,$v_n$ 是可检验的完成判据,$u_n$ 是带视觉线索但无像素坐标的动作描述(建议性而非可执行)。执行时指针 $n_t$ 追踪当前子任务,策略条件于工作流视图 $g_t=\Phi(d,n_t)$——全部子任务目标加完成/当前/未来完成标记,加上仅当前子任务的详细步骤;动作空间扩展一个控制动作 subtask_complete:当截图满足 $v_{n_t}$ 时发出,指针推进 $n_{t+1}=\min(n_t+1,N)$,即进度由观测屏幕状态而非固定步数计数器驱动。两个设计保证演示不被盲从:其一,$g_t$ 是先验不是目标,$u_n$ 可能省略低层操作、引用界面上不存在的元素或与当前状态错位,正确的动作是观测 $o_t$ 所要求的,观测对演示保留否决权;其二,目标函数不变,验证器仍只检查环境终态 $R(\tau)\in\{0,1\}$。与RPA/轨迹回放及ShowUI-Aloha的本质区别在于:训练数据刻意覆盖全对齐、部分错位与无关三类演示-屏幕关系,且训练时只给关键动作、推理时才给完整序列,强制模型学会「里程碑由演示给、路径靠截图找」。

方法步骤详情

完整流程分六步。第一步数据生产:四源指令经环境构造(LLM写setup代码建文件装应用,优先检索真实文件)、云VM并行rollout、双阶段过滤(任务/环境有效性+步级交付物证据追踪)与能力树配平,辅以人工标注的修复与rollout对齐重标注,产出SFT轨迹。第二步RL任务合成:生成器构造 $(x,\mathcal{E}_0,\mathcal{E}^\star)$ 并满足 $R(\mathcal{E}_0)=0,\ R(\mathcal{E}^\star)=1$,验证器仅凭任务说明与状态判分;再经硬负例探针(貌似合理的错误完成应被拒绝)与替代正例探针(另一种合法完成应被接受)独立审计,问题任务进入有界修复而非丢弃。第三步SFT:以决策轮为单位最小化 $\mathcal{L}_{SFT}=-\mathbb{E}\sum_k\log\pi_\theta(y_{t,k}\mid y_{t,<k},c_t)$。第四步在线RL:GRPO组内优势经决策轮中心化 $A^{base}_{i,t}=R_i-\mu_{turn}$、$\mu_{turn}=\sum_i T_iR_i/\sum_i T_i$ 校正轮数偏差,token级归一化校正响应长度偏差,PCM用教师里程碑标注重加权,异步更新配IcePop/SeqClip过滤陈旧token,课程采样把预算转向弱域。第五步DemoCUA数据:在扰动AgentNet上跑Rollout→Score→Filter & Repair三阶段流水线,S1–S4打分(VLM整体/子任务完成+规则遵循度)、R1–R4修复。第六步推理:harness首轮注入工作流快照并每步原位重写,主动折叠管理长上下文。

技术新颖性

技术新颖性体现在五处。其一,演示表示层面:先前的示范引导方法(RPA脚本、CUA-Skill参数化技能图、ShowUI-Aloha语义动作轨迹)都倾向复用演示的操作序列,UI-Mate首次把多模态演示蒸馏为「目标+可验证完成判据+无坐标里程碑」的子任务结构,并用专门的 subtask_complete 控制动作让智能体自行判断何时推进,进度锚定在实时像素而非演示计数上。其二,训练-推理不对称:训练时刻意隐去中间动作(焦点点击、滚动、弹窗关闭)并混入部分错位/无关演示防止抄近路,推理时提供完整动作序列,这种刻意错配在示范学习文献中少见,且实测更优。其三,奖励工程层面:把「生成期收敛」与「语义忠实」分离,用独立于生成路径的硬负例/替代正例探针审计评估器,发现18%错位率并以有界修复代替丢弃,保留最易被误判的困难环境任务。其四,RL信用分配:决策轮中心化(按轮数 $T_i$ 加权的组基线)与全批量token归一化分别消除轮数与响应长度两种系统性偏差,配合异步GRPO适配GUI任务时长高度不均的现实。其五,诊断工具:三级能力树把「应用级统计看不见的长尾缺口」变成可执行的生成预算,能力感知采样使Multi-App性能相对提升15.5个百分点。

UI-Mate combines strong general computer-use capabilities with demonstration-guided execution.
Figure 1: UI-Mate combines strong general computer-use capabilities with demonstration-guided execution.
Overview of the UI-Mate data flywheel.
Figure 2: Overview of the UI-Mate data flywheel.
Representative subset of the collected GUI capability tree.
Figure 3: Representative subset of the collected GUI capability tree.
Agentic RL system of UI-Mate.
Figure 4: Agentic RL system of UI-Mate.
Demonstration representation.
Figure 5: Demonstration representation.
DemoCUA SFT Format: the demonstration is pinned to the first user turn as a snapshot of the workflow state.
Figure 7: DemoCUA SFT Format: the demonstration is pinned to the first user turn as a snapshot of the workflow state.
OSWorkerBench benchmark construction pipeline.
Figure 8: OSWorkerBench benchmark construction pipeline.
OSWorkerBench dataset overview.
Figure 9: OSWorkerBench dataset overview.
UI-Mate App's four-layer architecture.
Figure 13: UI-Mate App's four-layer architecture.

实验结果

通用能力:UI-Mate-27B在OSWorld-Verified达77.0%,超Kimi-K2.6(73.1%)与Qwen3.7-Plus(73.3%),距GPT-5.5(78.7%)仅1.7pp,远超专用智能体ScaleCUA(68.7%)、EvoCUA-32B(56.7%)、UI-TARS-1.5(25.4%);9B达66.2%,超大10倍的EvoCUA-32B。WindowsAgentArena上27B达66.2%,超1T参数的Kimi-K2.6(63.3%)2.9pp;9B较基座Qwen3.5-9B(37.5%)提升24.2pp。OSWorkerBench上27B取得41.0%严格成功与76.86%进度,较基座+17.67/+24.51pp,略超Kimi-K2.6(40.67%/72.42%);Multi-App子集28.57%对基座7.48%,Long-Memory 32.84%对12.94%。DemoCUA配对实验:OSWorld-30从40.27%升至65.75%(+25.48pp,18升/8平/4降,四个零分任务被满分解决);OSWorker-33进度67.85%→81.14%、严格成功17.17%→35.35%(28/33任务改善,满分任务1→5个);GameDev 76.76%→81.15%且平均轨迹缩短16.6%(303.6→253.1步),Kimi-K2.6同设置+5.00pp,证明收益跨模型泛化。决策轮分析:UI-Mate-27B中位71轮、38%任务超100轮(GPT-5.6-Sol中位42.5但每轮3.83个动作属批量执行)。训练洞见:真实资源比合成资源约大6倍、轨迹58.4对38.5步(+51.7%);能力感知采样带来Multi-App +15.5pp;PCM与自适应课程把收敛所需更新减半但不提升终值;历史推理在推理期+3.43/+2.27pp、并入SFT再+2.85pp,但进入RL训练引发熵坍缩。

Overall average scores (%) on OSWorld-Verified.
Table 1: Overall average scores (%) on OSWorld-Verified.
Main results on OSWorkerBench under the instruction-only protocol.
Table 2: Main results on OSWorkerBench under the instruction-only protocol.
Agent success rates on WindowsAgentArena.
Table 3: Agent success rates on WindowsAgentArena.
GameDev performance with and without demonstrations on UI-Mate-27B.
Table 4: GameDev performance with and without demonstrations on UI-Mate-27B.
Paired self-demo performance on the OSWorld-Subset30 and OSWorkerBench-Subset33 with UI-Mate-27B.
Table 5: Paired self-demo performance on the OSWorld-Subset30 and OSWorkerBench-Subset33 with UI-Mate-27B.
Trajectory lengths and task scores on GameDev on UI-Mate-27B.
Table 6: Trajectory lengths and task scores on GameDev on UI-Mate-27B.
Serving arrangements and approximate step times on our devices.
Table 7: Serving arrangements and approximate step times on our devices.
Scoring rules used to evaluate each rollout.
Table 8: Scoring rules used to evaluate each rollout.
Repair rules applied to rollouts.
Table 9: Repair rules applied to rollouts.
Kimi K2.6 performance on GameDev without and with demonstrations.
Table 12: Kimi K2.6 performance on GameDev without and with demonstrations.
Trajectory lengths and task scores for UI-Mate-27B on the 33-task OSWorkerBench self-demo subset.
Table 16: Trajectory lengths and task scores for UI-Mate-27B on the 33-task OSWorkerBench self-demo subset.
Decision-turn distributions for GPT-5.6-Sol, Kimi-K2.6, and UI-Mate-27B on the same 100 OSWorkerBench tasks.
Figure 10: Decision-turn distributions for GPT-5.6-Sol, Kimi-K2.6, and UI-Mate-27B on the same 100 OSWorkerBench tasks.
Demonstrations help the agent modify the correct underlying object.
Figure 11: Demonstrations help the agent modify the correct underlying object.
Demonstrations teach reliable viewport control for document-grounded reasoning.
Figure 12: Demonstrations teach reliable viewport control for document-grounded reasoning.
UI-Mate interface and runtime latency.
Figure 14: UI-Mate interface and runtime latency.
查看结构化数据
任务指标本文基线提升
OSWorld-Verified(通用桌面任务) 平均任务成功率 UI-Mate-27B 77.0%(UI-Mate-9B 66.2%) 开源最强 Kimi-K2.6 73.1%;闭源最强 Claude Opus 4.8 83.4% 超最强开源基线 +3.9pp,距最强闭源 -6.4pp
WindowsAgentArena(Windows跨平台) 任务成功率 UI-Mate-27B 66.2%(UI-Mate-9B 61.7%) Kimi-K2.6 63.3%;GPT-5.5 70.4%;基座Qwen3.6-27B 47.1% 超Kimi-K2.6 +2.9pp;9B较基座 +24.2pp,9B还超EvoCUA-32B +5.2pp
OSWorkerBench(100任务,指令-only) 严格二元成功率 UI-Mate-27B 41.00%(UI-Mate-9B 34.00%) Kimi-K2.6 40.67%;基座Qwen3.6-27B 23.33%;GPT-5.6-Sol 71.00% 较基座 +17.67pp,略超Kimi-K2.6 +0.33pp
OSWorkerBench 检查点加权进度分 $S_{partial}$ UI-Mate-27B 76.86%(UI-Mate-9B 66.55%) Kimi-K2.6 72.42%;基座 52.35% 较基座 +24.51pp,超Kimi-K2.6 +4.44pp
OSWorld-Subset30(自演示配对) 平均任务分(5次运行) 65.75% 无演示 40.27% +25.48pp(18升/8平/4降,4个零分任务满分解决)
OSWorkerBench-Subset33(自演示配对) 进度分 / 严格成功(3次运行) 81.14% / 35.35% 无演示 67.85% / 17.17% +13.29pp / +18.18pp,28/33任务改善
GameDev(10任务超长时程) 平均任务分(5次运行) UI-Mate-27B 81.15%;Kimi K2.6 88.46% 无演示分别 76.76% / 83.46% +4.39pp / +5.00pp,且UI-Mate平均轨迹缩短16.6%

局限与改进

作者明确承认的局限:其一,进度与严格成功之间存在35.86pp差距(76.86%对41.0%),轨迹分析指向「晚期遗漏」(漏写一个字段、漏发最后通知)是主要残余失败模式;其二,所有定量DemoCUA结果都基于self-demo设置(演示即同一任务的成功rollout),不能证明跨任务变体的程序迁移——45任务变体演示只做了10任务试点,需要「把演示段复制到目标实体数量」才净正向,性能尚不稳定,不足以支撑主基准结论;其三,OSWorld子集上有4个任务出现负迁移(如multi-03从100%跌至0%),演示过程被误用或与当前界面冲突时会伤害性能;其四,工作流置于上下文开头,每步原位重写使共享前缀失效、无法复用KV缓存,长episode推理成本被放大。我自己的观察:UI-Mate-27B在Professional类任务上仍落后Kimi-K2.6(75.5%对81.6%),说明专业软件覆盖不足;OSWorkerBench每模型仅1–5次rollout、100个任务,41.0%对40.67%这样的差距在统计噪声范围内;9B模型对评估器正确性更敏感(不完整的成功判据更容易强化错误行为),暗示小规模复现该配方更难;PCM与课程采样不提升最终性能,作者也承认进一步增益受限于数据覆盖与质量而非优化技巧。

独立分析的弱点

第一,演示获取成本高:self-demo依赖更强智能体在同一任务上的成功rollout,variant-demo需要人工录制,冷启动场景(新用户、无演示库的内部工具)无解——改进方向是从教学视频、产品文档自动挖掘演示,或让强智能体在相关任务上自举生成并筛选。第二,上下文效率:工作流在每一步被原位重写,破坏前缀KV缓存,长episode(中位71决策轮、38%任务超100轮)下推理成本被系统性放大——作者已提出把工作流移到上下文末尾使其append-only,这是明确的工程改进点。第三,负迁移不可检测:4个OSWorld任务因演示与界面冲突而变差,模型缺乏「演示可能失效」的元认知——可在训练中增加显式冲突标注或不确定性估计,让模型在检测到错位时自动降权演示。第四,基准统计功效有限:100任务、部分设置仅3次运行,跨模型1个点内的差距无法区分真优劣,Long-Memory与Multi-App是重叠人群而非匹配变体,不能做因果归因。第五,部署延迟:中位每步3030ms(模型调用2108ms、其中prefill约1597ms占76%),经QuaRot W8A8量化与DFlash投机解码压至2–3秒,端侧9B(6-bit约7GB)仍需10–20秒/步,交互式使用仍有距离。第六,能力树维护与评估器审计依赖LLM加人工带宽,数据引擎本身的可扩展性受标注产能约束,且RL阶段历史推理引发熵坍缩的问题尚无解法。

未来方向

作者提出的方向:(1) 变体演示设置的系统性评测——训练智能体提取部分匹配演示中的可迁移结构并识别其未覆盖之处,而非逐步重放;(2) 演示的离线规模化获取——从书籍、策划文档与教学视频中收割演示,而非每任务录制一条;(3) 演示检索——用实时界面状态查询演示库,使覆盖率随语料而非标注努力增长;(4) 验证器接地的进度信用——把PCM的里程碑结构升级为任务条件化的进度奖励模型,奖励里程碑完成与错误恢复、惩罚回退,同时保持终局残差使总过程奖励等于可执行结果;(5) 解决历史推理与RL探索的矛盾,在保留长时程状态跟踪优势的同时避免熵坍缩;(6) 把工作流移到上下文末尾实现append-only的KV缓存复用。基于其成果可延伸的方向:把能力树诊断机制推广到浏览器、机器人等其他agentic领域的数据预算;self-demo实际上给出一条「用强模型演示教弱模型」的蒸馏路径,可与模型级联部署结合降低成本;DemoCUA与UI-Mate App结合暗示「用户录一次、智能体终身执行」的个人自动化产品方向,值得在组织内部工具(无公开训练数据覆盖)场景验证;GameDev式的长时程创作型基准(8个Godot任务构成完整2D游戏开发链、平均超200步人工操作)也值得扩展为独立评测套件。

复现评估

开源情况:UI-Mate-9B/27B权重开源(分别基于Qwen3.5-9B与Qwen3.6-27B基座),项目页为 ui-mate.github.io;作者承诺发布OSWorkerBench的任务规格、33个self-demo与45个variant-demo配对、分类元数据和全部评估器;附录C公开了GameDev全部10个任务的逐字指令与评分rubric(每任务7–30项等权检查),附录B给出DemoCUA数据的完整打分规则(S1–S4)与修复规则(R1–R4),附录E/F给出逐任务结果,透明度较高。数据与算力方面则难以完全复现:数据引擎依赖内部云VM后端(跨三系统高并发rollout)、人工标注团队与真实文件索引,RL训练算力规模未披露;推理侧参考明确——单台8卡GPU机以bf16跑27B每步3–5秒,QuaRot式W8A8量化加DFlash训练的投机解码后2–3秒,Mac端侧6-bit 9B(约7GB)每步10–20秒。综合评估:复现DemoCUA推理(提示格式、上下文管理参数如折叠阈值、每截图1800 token成本估算等均已给出)属于中等难度;完整复现训练栈(数据引擎+大规模在线RL+人工标注)属于高难度,更适合视为工业级配方参考;评测复现依赖官方OSWorld/WAA协议与Docker/AWS provider,属于中等难度。