← 返回 2026-07-30

OmegaUse-OfficeVal:面向经济锚定长周期办公套件任务的LLM智能体基准 OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao, Kaiqi Guo, Muxin Guo, Mingxuan Li, Xinjiang Lu, Yanru Ma, Yixiong Xiao, Zenghui Zhang, Le Zhang, Hua Wu 📅 2026-07-29 👍 12 2026-08-04 18:30
LLM智能体 交付物质量评测 代码化验证 办公套件自动化 经济价值评估 长周期任务基准

首个为长周期办公套件任务提供任务级经济标注的LLM智能体评测基准

前置知识

LLM 智能体 (LLM Agent)

以大语言模型为大脑、能调用工具、读写文件、多步规划并最终产出工作成果的自主系统。本文关注的不是单轮问答,而是接管一段办公工作流、读取多模态输入文件并交付成品的智能体。

全文都在评测这类智能体完成办公套件任务的能力,不理解智能体的工具调用与多步执行就无法理解任务难度与零分率含义。

长周期任务 (Long-horizon task)

需要持续多步执行、跨越较长人工耗时才能完成的任务。本文平均人工耗时 2.32 小时、中位 2.03 小时、最长 8.35 小时,与几步即可完成的短周期交互相对。

本文刻意只选长周期任务来探测前沿能力,且实验显示任务越长智能体得分越低,这是理解结果曲线的关键。

任务级经济锚定 (Task-level economic grounding)

为每个具体任务标注经济信号(本文为人类劳动时间 human labor time 与任务价格代理 task price proxy),而非只在职业或数据集聚合层面挂经济价值,从而能在任务粒度直接比较人类成本与 LLM 推理成本。

这是本文区别于 GDPVal/RLI/ALE 的核心创新,也是价值加权评测与质量-成本-时间权衡分析的前提。

评分细则与代码化验证 (Rubric & code-based verification)

把任务要求拆成细粒度、可客观判定的检查项 rubric,再转译为可执行代码自动打分,取代人工评分或 LLM-as-judge。本文共有 219 条可用性检查项与 2009 条任务完成项,平均每任务 20.09 条。

评分公式(可用性门一票否决 + 正负加权 + 零下限截断)是读懂所有结果数字的基础。

价值加权评测 (Value-weighted evaluation)

用人类劳动时间或价格代理对任务得分加权汇总,衡量模型捕获了多少「经济重要性高」的任务,而非只看平均分。

本文关键发现之一就是平均分冠军 GLM-5.2 在价值加权上输给 Qwen3.7-Plus,不懂此概念会误读排名。

研究动机

现有评测基准在回答「智能体能否以合理成本完成办公套件工作流」这一最关键的实际问题时存在系统性缺口。通用生产力基准 GDPVal、Remote Labor Index (RLI) 和 Agents' Last Exam (ALE) 虽然把任务锚定在真实专业工作流上,但只公开任务子集或限制参考答案访问,且其经济价值通常挂在宽泛的职业类别上而非单个任务。办公自动化类基准如 OfficeBench、OdysseyBench、SpreadsheetBench、PPT-Eval 多聚焦于有界的单步操作、合成工作流或标准化熟练度测试,既不是长周期任务,也不提供经济标注。GUI 智能体基准(含较新的 OSWorld 2.0,108 个任务、人类中位耗时约 1.6 小时)则以短周期交互为主、按是否到达预定环境状态来评判,关注操作轨迹而非最终交付物的可用性。结果是当前基准难以支持实践者最关心的问题:给定一个长周期办公任务,智能体能否交付正确且可用的成品,这一成品又对应多少人工或市场价值。

本文的目标是本文目标是构建一个专门面向长周期办公套件任务、且带任务级经济锚定的开放评测基准 OmegaUse-OfficeVal。具体而言,作者希望:(1) 用从真实从业者办公需求出发、经隐私化改造得到的 100 个任务来刻画真实办公场景,平均人工耗时 2.32 小时;(2) 为每个任务同时标注两类互补的经济信号——人类劳动时间与任务价格代理,使人类成本与 LLM 推理成本可在任务粒度上直接对比,并支持按价值加权的评测;(3) 用细粒度评分细则转译为可执行代码的验证器,取代人工评分和 LLM-as-judge,保证评测随模型演进而保持稳定可复现;(4) 把任务指令、输入文件、评分细则、验证代码、经济标注全部开放,让社区能持续追踪「智能体能否可靠地完成 vibe working」。

与已有工作不同的是,本文的独特切入角度有三点。第一是粒度:与 GDPVal/RLI/ALE 把经济价值绑在职业类别或聚合层面不同,本文坚持任务级经济标注,因此可以做价值加权分析,发现「平均分最高的模型未必是捕获经济价值最多的模型」。第二是评测对象:与 OSWorld 2.0 等 GUI 基准评判「是否到达预期环境状态」不同,本文直接评判最终办公交付物本身的正确性与可用性,不规定执行轨迹,允许 GUI、脚本或混合策略殊途同归。第三是开放性:与只公开子集或封闭参考答案的同类基准不同,本文完整释放指令、输入文件、rubric、验证代码与经济标注。三者结合填补了「长周期办公套件 + 任务级经济锚定 + 完全开放 + 交付物质量」这一组合维度的空白。

核心方法

整体思路是「先建任务、再标价值、最后写验证器」的三阶段流水线。直觉上,评测智能体办公能力最难的不是出题,而是出既真实又可复现判分的题——所以作者从真实从业者需求出发,用漏斗式筛选拿到 100 个高质量长周期任务,再为每个任务钉上两个经济信号,最后把人类专家的判分意图固化成可执行代码。技术路线上,任务构建用 1715→595→282→100 的多轮专家筛选加隐私化改造;价值估计把约 20% 的高置信显式价格与一致性聚合的三专家估计混合;验证则用 LLM 辅助生成 rubric、再生成代码、再做人工-代码分歧消解,迭代到代码打分与专家判断对齐为止。最终每个任务的得分由两阶段流程给出:先过全部可用性检查,再按加权正负项计算归一化完成度。

核心创新点是为每个长周期办公任务同时配备「双经济信号 + 双层 rubric 验证」,并刻意用确定性代码取代人类/LLM 评分。与已有方法的本质区别在于:rubric 不只奖励完成的需求项,还显式惩罚「增加用户返工负担的无意改动」,用 $w_c>0$ 标记必要组件、$w_c<0$ 标记可避免的损坏;评分公式先用可用性乘法门 $U_t=\prod_{u\in U_t} I_u$ 一票否决,再用 $\text{Score}(t)=U_t\cdot \max(0,\sum_{c\in C_t} w_c I_c)/\sum_{c\in C_t:\, w_c>0} w_c$ 在零下限处截断。这种设计模拟了「用户收到文件后还要不要返工」的真实视角,把交付物的可用性与完成度统一到一个标量;而价格代理的混合策略(当 $A/B\geq 2$ 或 $B/A\geq 2$ 时剔除离群极值,其中 $A=\max-\text{mid}$、$B=\text{mid}-\min$)则保证了经济信号既有真实锚点又有全覆盖。

方法步骤详情

完整步骤如下。第一步任务收集:招募从业者提出真实办公需求与样例材料,从 1715 条初筛到 595 条(看真实性与交付物清晰度),再由三位资深专家独立判定是否足够长周期且可行,至少两人认可才保留得 282 条,最终策展为 100 条。第二步隐私化改造:重写指令去敏感信息但保留原意与口语风格,剔除无法客观评测的主观要求;输入文件用 LLM 辅助重建后人工修订,图片/视频单独复刻并检查版式不漂浮不重叠,三专家一致通过才入选。第三步标注经济信号:招募 20 名标注员,每任务至少 2 人独立完成、差异大时加第 3 人,人类劳动时间取「两个最短有效完成时间」的均值;价格代理对约 20% 显式价格直接采用,其余由三专家基于职业类别/复杂度/报酬独立估值,按 $A=\max-\text{mid}$、$B=\text{mid}-\min$ 的规则(比值达 2 剔极值,否则取均值)聚合。第四步构建验证器:LLM 辅助生成 rubric 并经专家修订(含可用性与任务完成两维),用 coding agent 转成可执行码,经专家检视、LLM 反思、逐 rubric 项的人工-代码分歧消解迭代至对齐。第五步打分:输出文件先过全部 219 条可用性检查(否则 0 分),再按 2009 条加权完成项算归一化得分。

技术新颖性

技术新颖性集中在四处。其一是任务级双经济信号:同时标注人类劳动时间与价格代理,并设计质量门控激励与一致性聚合算法,使经济锚点既真实又可跨任务比较。其二是评分模型把「可用性一票否决 + 正负加权 + 零下限截断」统一到一个公式,正面项可枚举而负面失败模式不可穷尽,所以用 $\max(0,\cdot)$ 截断避免负分污染。其三是用确定性代码验证器取代 LLM-as-judge,规避了「判官模型随前沿演进而失效、历史分数不可比」的问题,并通过人工-代码分歧消解保证与专家判断对齐。其四是评测对象是最终交付物而非执行轨迹,不预设 GUI/脚本路径,允许同一交付物存在多种合法工作流。这四点共同把「长周期办公套件」从过程级评测推进到交付物级、经济可解释的评测。

Task distribution by domain and operation intent in OmegaUse-OfficeVal.
Figure 3: Task distribution by domain and operation intent in OmegaUse-OfficeVal.
Distribution of task-level economically grounded annotations in OmegaUse-OfficeVal.
Figure 4: Distribution of task-level economically grounded annotations in OmegaUse-OfficeVal.
Task Construction Pipeline for OmegaUse-OfficeVal.
Figure 5: Task Construction Pipeline for OmegaUse-OfficeVal.

实验结果

核心发现可从表 3 与图 6-8 分析。第一,人类基线得分 27.79 远超所有 LLM:最好的 GLM-5.2 仅 17.91,其后 Qwen3.7-Plus 17.51、Kimi K2.6 17.00、DeepSeek-V4-Pro 14.48、MiniMax M3 13.82;但人类也远非满分,说明基准本身难度高。第二,价值加权排名与平均分排名不一致:Qwen3.7-Plus 平均分略低于 GLM-5.2,但其时间加权分 34.73 与价格加权分 106.50 均为模型最高(GLM-5.2 为 30.13、93.51),印证「最高平均分不等于捕获最多经济价值」。第三,效率上 LLM 全面占优:人类每任务 2.324 小时、成本 6.856 美元,而 Qwen3.7-Plus 仅 0.193 小时、0.2152 美元,DeepSeek-V4-Pro 最快达 0.184 小时。第四,图 7 显示人类 21% 任务得分大于 50、零分率仅 29%,GLM-5.2 高分率 14%,Qwen3.7-Plus 零分率最低 38%,DeepSeek-V4-Pro 与 MiniMax M3 零分率高达 50%/51%。第五,图 8 显示人类劳动时间与得分负相关,任务越长得分越低,LLM 下降更陡,表明当前智能体难以在长流程中维持任务状态与交付物质量。

Distribution of input files and output artifacts.
Table 1: Distribution of input files and output artifacts.
Statistics of rubric check items.
Table 2: Statistics of rubric check items.
Overall performance and efficiency on OmegaUse-OfficeVal.
Table 3: Overall performance and efficiency on OmegaUse-OfficeVal.
Score, runtime, and monetary cost across human annotators and LLM agents.
Figure 6: Score, runtime, and monetary cost across human annotators and LLM agents.
Distribution of task scores across human and LLMs.
Figure 7: Distribution of task scores across human and LLMs.
Task scores by human labor-time bucket.
Figure 8: Task scores by human labor-time bucket.
查看结构化数据
任务指标本文基线提升
OmegaUse-OfficeVal 总体完成度 Score (归一化, 满分约100) GLM-5.2 = 17.91(最佳 LLM) Human = 27.79 最佳 LLM 仍落后人类约 35.6%
单位任务推理成本 Cost/Task (USD) Qwen3.7-Plus = $0.2152(最低) Human = $6.8560 成本降至人类的约 3.1%
单位任务耗时 Time/Task (hours) DeepSeek-V4-Pro = 0.184h(最快) Human = 2.324h 耗时降至人类的约 7.9%
价格加权完成度 Price-Weighted Score Qwen3.7-Plus = 106.50(模型最高) Human = 144.61 模型捕获经济价值仍落后人类约 26.4%
彻底失败率 Zero-score 任务占比 Qwen3.7-Plus = 38%(LLM 最低) Human = 29% LLM 零分率仍比人类高约 9 个百分点

局限与改进

作者承认的局限与本文观察如下。作者层面:人类基线得分 27.79 也远非满分,说明任务本身极难、且代码验证器的负面项扣分可能偏严;评测完全依赖确定性代码,无法覆盖开放性/审美/创意等主观质量维度。进一步观察:任务与定价高度中国本土化(CNY 计价、中文办公场景、本土模型为主,未评测 GPT/Claude/Gemini 等国际前沿模型),泛化到其他语言/地区存疑;样本仅 100 个且分布非均衡(反映采集期办公请求分布),对某些长尾领域覆盖可能偏稀;所有 LLM 在同一 agent scaffold 下评测,得分对脚手架实现高度敏感;价格代理中约 80% 靠专家估计,仍带主观性;零分任务占比过高(38%-51%)可能掩盖了部分完成的细微差异,因为可用性门会一票否决。

独立分析的弱点

独立分析的弱点及改进方向如下。弱点一:代码验证器无法度量主观/审美质量,改进方向是引入轻量、可复现的「审美-可用性」混合验证层或对比学习型判分。弱点二:单脚手架评测使排名可能随脚手架变化而翻转,改进方向是固定并开源脚手架、同时报告多脚手架方差。弱点三:任务与定价的本土化限制了国际可比性,改进方向是增加英文任务与多币种定价,并补测 GPT/Claude/Gemini。弱点四:可用性门一票否决使近半任务得 0 分、分辨率不足,改进方向是报告「部分完成分」或采用软可用性门。弱点五:价格代理 80% 依赖专家估计,改进方向是扩大真实外包交易数据的采集比例。弱点六:任务数 100 偏少,长尾领域覆盖薄,改进方向是分阶段扩容并按操作意图/领域分层均衡。

未来方向

作者提出的方向:把 OmegaUse-OfficeVal 作为持续追踪「vibe working」进展的测试床,扩展模型与脚手架评测。基于成果可延伸的方向:一是将双经济信号扩展为多维度价值函数(时间、价格、质量、返工成本),构建帕累托前沿分析;二是研究长流程任务的状态保持与错误累积机制(图 8 的陡降提示这是关键瓶颈);三是把代码验证器泛化为可迁移的「办公交付物自动评测器」,跨任务复用;四是探索多智能体/人在回路的混合办公工作流,量化人机协作的经济收益;五是结合人在回路标注建立主观质量基准,补足代码验证的盲区;六是随着模型迭代持续重跑,绘制能力增长曲线。

复现评估

复现性总体很高。作者把代码与数据集完全开源,并在项目网站 https://omegause-officeval.github.io 释放任务指令、输入文件、评分细则、验证代码与经济标注,这对同类基准(GDPVal/RLI/ALE 仅开放子集或封闭参考答案)是显著优势。验证器为确定性代码,避免了 LLM-as-judge 的判官漂移,可跨时间复现。评分细则统计透明(219 条可用性、2009 条完成项、平均每任务 20.09 条)。需要注意的复现成本与风险:人类基线依赖 20 名标注员与质量门控激励协议,复现人类分数需重招标注员;agent scaffold 与执行环境/推理配置细节放在附录 E,复现 LLM 分数需严格对齐脚手架;被测模型为 GLM-5.2、Kimi K2.6、DeepSeek-V4-Pro、MiniMax M3、Qwen3.7-Plus 等带未来权重的模型,具体版本获取可能影响复现;长任务算力成本中等(人类基线每任务 2.32 小时,LLM 最快 0.184 小时)。总体难度中等偏低,适合社区跟进。