OSReward:为跨平台计算机使用智能体奖励模型建立标准化评测 OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
跨平台 CUA 轨迹评测基准揭示 VLM 判官普遍的宽容偏差,并开源低成本奖励模型弥合成本鸿沟。
前置知识
计算机使用智能体 (CUA, Computer-Using Agent)
由视觉语言模型驱动、能感知真实数字环境(网页、移动 App、桌面软件)并执行点击、键入、命令行等操作以完成用户任务的智能体。它的核心产物是轨迹(trajectory):一段由状态(截图)、思考(thought)与动作(action)交织而成的长序列记录。
整篇论文都是围绕「如何判断一段 CUA 轨迹是否真正完成了任务」展开,不理解 CUA 及其轨迹结构,就无法理解评测的对象。
VLM-as-a-Judge(视觉语言模型作为判官)
用一个 VLM 读取轨迹的截图与文本,输出成功/失败的裁决。它常被当作奖励模型用于数据筛选、拒绝采样和强化学习,也可作为 autorater 打分。本文要回答的核心问题就是:这些判官到底可不可靠。
VLM 判官是本文的评测对象,也是 OS-Shepherd 要训练成的目标;理解它的工作方式才能理解后续所有的宽容偏差、去偏与成本分析。
奖励模型 (Reward Model)
给定(轨迹,任务)返回一个标量奖励的模型,用于强化学习过程中引导策略优化。对 CUA 而言,它本质就是一个二值(成功/失败)或细粒度的轨迹裁决器。本文训练的 OS-Shepherd 就是开放权重的奖励模型。
论文最终落点是「造一个能跑在训练规模上的奖励模型」,奖励模型的概念贯穿动机、方法与成本分析。
宽容偏差 (Leniency Bias)
判官倾向于把实际失败(尤其是智能体口头声称成功但环境未达成的「假成功」)误判为成功,导致失败召回率(fRec)偏低。论文量化发现这是所有判官家族共有的首要错误模式,占全部错误约三分之二。
这是全文最关键的发现,也是 OS-Shepherd RL 阶段专门针对的去偏目标,不掌握它就读不懂整个评测结论和训练动机。
GRPO (Group Relative Policy Optimization)
一种基于组的相对策略优化算法,用同一问题的一组采样回报做相对基线来估计优势,免去额外的价值网络,常用于大模型的强化学习阶段。本文用它做 OS-Shepherd 的第二阶段训练。
OS-Shepherd 的两阶段训练(SFT + GRPO)是方法核心,理解 GRPO 才能看懂 RL 阶段如何针对假成功进行优化。
平衡准确率与召回率分解
二值准确率(Acc)会受类别比例影响,因此论文把成功召回率 sRec 与失败召回率 fRec 分开报告,并以二者均值 BalAcc 作为不可被 43/57 类别比例注水的主指标。在失败占 70% 的 Hard 集上,恒判失败也能拿 70% Acc,故必须看召回分解。
论文几乎所有结论都建立在 sRec/fRec/BalAcc 这组指标上,读懂表格和图都依赖这套度量。
研究动机
计算机使用智能体(CUA)的评估、数据筛选和强化学习都依赖一个前置环节:判断一段轨迹是否真正完成了任务指令。但这个判官供给严重不足。人工编写的规则验证器只能覆盖少数精心策划的任务,对静态语料和已采集的轨迹完全失效;人工标注又跟不上规模。于是社区越来越依赖 VLM 充当判官(既作奖励模型也作 autorater),这几乎成了事实标准。然而这个判官到底可不可靠,长期没人系统检验。作者的初步研究发现:最好的 VLM 判官在桌面端裁决上与现有基准自带验证器有约四分之一的分歧——一个潜伏的系统性错误。更糟的是,已有研究要么只看单一平台、要么复用其他基准现成的轨迹,而复用的轨迹本身携带质量混杂(继承 rollout 设置、标签来自不完美验证器、指令甚至无法判定),让「判官错」与「轨迹错」无法区分。
本文的目标是本文要系统地回答「VLM 判官能不能被信任」,并把发现转化为可用的工具。具体目标有三:第一,从零搭建一个跨平台、基于真实环境、带有人工金标签的 CUA 轨迹基准 OSReward,用来评测判官本身;第二,开展迄今最全面的 VLM 判官评测,定位它们在哪些场景可靠、以何种方式失败;第三,针对暴露出的核心问题,构建开放数据语料 OS-Shepherd-100K 并训练开放权重的奖励模型 OS-Shepherd(9B 与 35B),让可靠奖励信号的成本降到学术预算可承受、能跑在训练规模的程度。
与已有工作不同的是,本文的独特切入在于「评测判官本身」而非评测智能体,并从底层基础设施重做以避免复用轨迹带来的归因混淆。它跨越 Web、Windows、Ubuntu、Mobile 四大平台(覆盖纯 GUI 与 GUI+CLI 工作流),用人工编写并交叉验证的指令驱动四个模型家族执行,再用三轮标注+元评审得到金标签;并刻意构造失败密集的 OSReward-Hard 暴露假成功这类隐蔽错误。更关键的是,它把评测发现直接反向写入训练语料的标注策略(无需新的人工标注),实现「评测驱动训练」的闭环,这是以往单平台、复用轨迹的工作做不到的。
核心方法
整体思路是「先诊断、再开药」。诊断端:作者自建跨平台数据基础设施(真实装好日常应用、预置用户配置与真实文件、预置干扰内容的 Web/Windows/Ubuntu/Mobile 环境),让标注员在环境上写接地的指令,交由多模型家族的智能体执行,产生真实成败轨迹;每条轨迹经三轮独立标注,分歧送元评审,最终得到 1019 条金标签轨迹,再衍生出全量集、Hard 难例集和带对齐/效率细粒度标签的 Multi 集。用这套干净数据评测 27 个 VLM 判官,找出共性失败模式。开药端:基于诊断揭示的「假成功」问题,用多判官集成+一致性筛选自动标注 321K 判官实例、蒸馏成 96.6K 样本的 OS-Shepherd-100K,再以 SFT+GRPO 两阶段训练出开放奖励模型。
核心创新是「用一致性筛选代替投票来构造训练标签」。分析发现判官高度趋同(顶部判官两两 Cohen's $\kappa\approx 0.71$)且共同趋同于同一批难轨迹,因此多数投票只会复制同样的错误,无法锐化裁决。但语料构建有权直接丢弃轨迹,所以作者改用「多个强判官在不同截图设置下独立达成一致」才保留该轨迹,丢掉模糊的中间地带——不强行做多数决。这一选择让标签既便宜(全自动)又可靠,并让每个样本带判官的推理过程(因为研究发现裁决主要活在文本里),形成首个大规模、带推理标注的 CUA 判官语料。这与「单判官蒸馏会传播自身偏差」「投票无法去偏」形成本质区别。
方法步骤详情
数据侧:标注员探索环境→写指令→同伴交叉审核(约 1500 候选→约 800 存活)→智能体执行→自动预过滤掉被反爬/网络/冻结的坏轨迹→三轮独立标注,一致则定,分歧则两位资深评审元评审定夺(非多数决),全程约 800 人工小时,得 1019 金轨迹。训练语料侧:约 100K 自采指令→88.7K 过滤→78.6K 轨迹过滤→并入 OpenCUA/ScaleCUA/OS-Genesis 等开源轨迹共 82K→用约 4 个强判官打分得 321K 判官实例→一致性筛选(保留约 85%)+质量过滤→96.6K 样本,按成功/失败均衡。训练侧:第一阶段 SFT,在 96.6K 样本上微调 Qwen3.5 基座学习判官能力;第二阶段 GRPO,从 SFT 模型重复采样中挖出仍判错的假成功难例,针对性 RL 优化。评测协议固定:判官读最后 $N$ 个状态(默认 $N=5$)及每步思考与动作文本,输出二值裁决,无任务专用脚手架、无工具、无逐步监督。
技术新颖性
新颖性体现在三处相互咬合的设计。一是首次跨平台、基于全新金轨迹而非复用数据,系统度量 VLM 判官可靠性,并量化出「宽容偏差/假成功」这一跨家族共性的首要错误。二是诊断驱动的标注策略:语料不再依赖新人工标注,而是把评测结论(保留全文文本、丢掉红色点击标记、保留判官推理)直接编码进训练数据的构造规则,实现评测与训练的闭环。三是去偏的训练配方:SFT 修正基座近乎全宽容的倾向,GRPO 再专攻 SFT 残留的假成功,配合一致性筛选,使 9B 小模型能在成本-精度前沿逼近商用判官,并把去偏泛化到从未训练过的 OSWorld/WebArena/AndroidWorld。
实验结果
评测 27 个 VLM 判官得到几条硬结论。第一,精度天花板不乐观:训练级奖励通常要约 90% 二值准确率,但在全量集只有前沿模型接近——Claude-Opus-4-8 最高 89.7%,GPT-5.5 89.5%,Claude-Opus-4-6 89.5%;开放权重模型普遍落后,最大者 Kimi-K2.5、Qwen3.5-397B-A17B 也只追到与领先者约 4 个百分点以内。第二,难例集上整体崩塌:OSReward-Hard(30/70 成败比)让每个判官掉 20–43 个百分点,最好的 Claude-Opus-4-8 跌到 69.7%(与恒判失败的 70% 持平),均值判官跌到 52%。第三,宽容偏差是首要错误:误判中「把未完成任务当成成功」约占三分之二,是每一个判官家族各自的首要错误(不低于其错误数的 48%),跨判官汇总过度接受与过度拒绝约为 3:1。第四,文本主导裁决:删掉逐步思考与动作文本平均掉 7.2 个百分点、翻转 22.7% 裁决,而换最后 3 帧、删红色点击标记等视觉扰动只动 0.5 个百分点以内——判官主要读智能体的自述而非屏幕,这正是假成功得以骗过判官的机制。第五,平台与失败类型差异显著:Hard 集上 Mobile 最好(58.3%)、Windows 最难(42.4%);依赖读屏的感知类失败(41.6%)与动作类(43.5%)最难抓,远难于读文本即可辨的规划类(49.0%)。第六,可靠判官太贵:Opus-4-8 在 Hard 集 69.7% 要花约 100 美元判一遍全集,GPT-5.5 67.3% 要 45 美元。OS-Shepherd-9B 以 86.1%(全量)/60.2%(Hard,失败召回 57.6%)逼近,判全集仅 1.36 美元;35B 在 Hard 平衡准确率再涨到 64.3%。规模收益很小:四倍参数只换 2.4 个百分点。在 OSWorld/WebArena/AndroidWorld 三个外部基准上,OS-Shepherd 是最佳开放判官,去偏跨基准迁移:9B 抓住的真失败远多于任何通用 Qwen 判官,而后者 30B–397B 各规模都保持宽容。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 全量集二值裁决(OSReward) | 二值准确率 Acc | OS-Shepherd-9B 86.1%,OS-Shepherd-35B-A3B 85.6% | 最佳商用 Claude-Opus-4-8 89.7%,基座 Qwen3.5-9B 仅 76.7% | 9B 相对基座 +9.4 个百分点,进入商用梯队,落后最强判官约 3.6 个百分点但成本低约 30–60 倍 |
| 难例集裁决(OSReward-Hard) | 平衡准确率 BalAcc(恒判失败基线 50%) | OS-Shepherd-9B 61.9%,OS-Shepherd-35B-A3B 64.3%,失败召回分别 57.6%/60.1% | 均值判官约 52%,最佳 Claude-Opus-4-8 69.7% | 9B 把基座的 Hard 平衡准确率从 55.9% 提到 61.9,并守住对角线平衡,是同价位(<2 美元)唯一能做到的判官 |
| 训练规模成本(单轮在线 RL,51200 次判官调用) | 总判官成本(美元) | OS-Shepherd-9B 约 68 美元 | Claude-Opus-4-8 约 4000 美元,GPT-5.5 约 2300 美元 | 相对前沿判官降低 30–60 倍成本,且自托管时边际成本仅是实验室自有 GPU 时间 |
| 跨基准迁移(OSWorld/WebArena/AndroidWorld 平均二值准确率) | 对各自人工验证器的二值准确率 | OS-Shepherd-9B 平均 79%,OS-Shepherd-35B-A3B 80% | 通用 Qwen3.5-397B(约 44 倍 9B 规模)平均 72% | 在三个独立基准上均为最佳开放判官,去偏能力从训练习得而非来自规模 |
局限与改进
作者承认若干局限。其一,可靠判官仍限于前沿商用模型,开放权重整体落后,OS-Shepherd 虽缩小差距但未达前沿精度。其二,对齐/效率的细粒度打分是短板:即便最佳判官也从二值的约 90% 跌到低 60 分区间,判官能排序(AUC 尚可)却定不准阈值(macro-recall 差),尤其对齐维度几乎一律给满分,OS-Shepherd 9B 也接近常数水平基线。其三,七节对已有基准的比较是与各基准自带验证器的一致性而非绝对真值,验证器本身不完美,故判官真实准确率可能略高于图示。从我自己的观察补充:基准规模 1019、Hard 集 284 偏小,平台分布不均(Windows 在 Hard 仅 29 条、Mobile 63 条),难例子集统计方差较大;训练语料靠合成指令(桌面约占 25%),其与真人任务的差距未被单独量化;移动端在语料中占比仅 10%,迁移到移动端是否同样稳健仍待更大规模验证。
独立分析的弱点
弱点一:细粒度质量评分能力薄弱,尤其对齐轴判官系统性给最高分。改进方向是引入带校准的细粒度标注与阈值学习,或设计显式对齐验证子任务。弱点二:判官主要读文本而非屏幕(删文本掉 7.2 个百分点),导致对「屏幕上达成但叙述含糊」或「叙述声称但屏幕未达成」的两类相反情形都可能误判;可改进判官对环境终态的显式核验流程(论文自己也指出显式核验提示可能比集成更有效,留作未来工作)。弱点三:判官高度趋同($\kappa\approx 0.71$)且采样噪声大($T=0.7$ 翻转 6–9% 裁决),意味着单条标签对奖励建模有噪声底;可改进为软标签、置信度加权奖励建模而非硬投票。弱点四:成本与规模的张力未完全解决,35B 相对 9B 收益甚微说明配方而非规模是关键,但 9B 在外部基准仍未追上前沿;可改进为更大数据+更强去偏目标,或显式校准判官在不同失败基率下的工作点。弱点五:平台覆盖失衡、移动端语料少,可针对性扩采移动与 Windows 难例。
未来方向
作者明确指出的方向包括:用「显式完成核验提示」替代或补充集成判官来抑制假成功;用软标签、置信度加权的奖励建模替代硬投票,因为判官群体虽趋同但合集几乎总含正确裁决(oracle 达 99%)。基于本成果可延伸的方向:把去偏配方推广到更多平台(macOS 已部分覆盖)与更长时程、GUI+CLI 混合交互;研究细粒度对齐/效率奖励的校准机制,补齐当前 Multi 轴的短板;用 OS-Shepherd 作为可自托管奖励信号驱动 CUA 的在线 RL 自演化;进一步把「评测驱动训练」范式扩展到错误类型标签,让奖励模型不仅判成败还能归因失败类别,辅助策略针对性改进。
复现评估
复现性整体较强且对社区友好。论文明确开放代码、基准、数据集 OS-Shepherd-100K 与 OS-Shepherd-9B/35B 模型权重(见 OSReward Homepage)。基准构建细节(每平台环境、应用清单、动作空间、统计)放在附录 A,标注漏斗与一致率在 §B,判官协议与完整 prompt 在 §C,训练细节在 §D,均给出。训练用主流 Qwen3.5 基座+GRPO,学术预算可承受(9B 判全集约 1.36 美元)。挑战主要在数据采集侧:自建跨平台真实环境(含约 20 类真实文件、登录态、反爬规避)与约 800 人工小时的三轮标注+元评审成本较高,他人重制金标签门槛不低;语料中约 25% 桌面指令来自反向任务合成,合成质量与真人的差异需自行评估。整体而言,使用其开源产物做下游训练与评测复现容易,而从零复现整个数据基础设施较难。
论文图表
左图(a)给出 27 个判官在全量集与 Hard 集上的二值准确率:前沿 Claude-Opus-4-8/GPT-5.5 在全量集约 89%,但在 Hard 集分别跌到约 70%/67%,开放小模型(Qwen3-VL-30B)仅 31%,逼近抛硬币。右图(b)在(失败召回,成功召回)平面上展示宽容-严格偏差:大部分判官落在宽容一侧(低失败召回),共享同一偏置。
这是全文结论的浓缩:既呈现精度天花板,又揭示跨家族共享的宽容偏差,是理解整篇论文动机与发现的核心图。