← 返回 2026-08-19

StartupBench:基于市场验证端到端工作流的通用智能体评测基准 StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

Liya Zhu, Xin Ma, Tao Liu, Haodong Wang, Ge Zhang, Jingzhe Ding, Qingshui Gu, Yongjie Zhong, Jinxiang Meng, Yuan Gao, Yunqiu Zhou, Hao Zhu, Jifeng He, Yongzhi Liao, Xinyi Zhang, Chaoxin Li, Yi Zhu, Xi Lin, Duju Zeng, Xiang Gao, Wen Zhang, Yunyang Wang, Duo Wang, Huan Zhou, Zuo Wang, Jin Chen, Kaiyuan Zhang, Chuqian Yu, Tianhao Yu, Longxiang Liu, Jianbo Xue, Huimin Che, Jiahao Wang, Yujia Qin, Jiaheng Liu, Shen Yan, Xiaolong Chang, Wenhao Huang 📅 2026-08-18 👍 9 2026-08-24 18:30
Agent-as-a-Judge 基准构建 智能体评测 真实用户需求 端到端工作流

从市场验证的AI创业产品工作流构建97任务基准,最强模型严格完成率仅约30%

前置知识

Agent-as-a-Judge(智能体评审)

传统 LLM-as-a-Judge 让一个 LLM 直接给另一个模型的输出打分,适合评短答案;但报告、表格、幻灯片这类复杂交付物需要打开文件、检索证据、核对状态才能评。Agent-as-a-Judge 在此基础上给评审模型配备工具和环境交互能力,使其能像人类评审一样检查最终工件。StartupBench 用它对 DOCX、XLSX、PPTX、PDF 等异构交付物逐条评分,评审 agent 本身也运行在统一的 Nanobot harness 上。

本文整套评测协议都建立在 Agent-as-a-Judge 之上,不理解它就无法理解论文中分数是怎么产生的。

细粒度评估量表(Rubric)

把一个任务的成功标准拆解为多条可独立判定的评分点,每条描述交付物必须满足的一项具体要求(如「包含指定工作表」「公式计算结果正确」),并赋予权重。本文每个任务平均 25.3 条 rubric,按 6 个能力维度和 3 个重要性等级(Core/Important/Auxiliary,权重 5/3/1)组织,任务得分是各条二元判定结果的加权通过率。

论文的评分公式、成功率定义(score ≥ 90)以及按维度、按重要性分级的失败分析全部依赖 rubric 体系。

通用智能体与垂直(专用)智能体

通用智能体用统一的 agent 框架(harness,如 Nanobot、Claude Code、Hermes)配合基础模型执行任意任务,不做领域定制;垂直智能体则针对特定工作流做了领域模型选型、专用提示、工具编排和流程设计(如本文来源的医疗、金融创业产品)。两者代表「一个模型打天下」与「为场景深度定制」两条产品路线。

论文的两组关键实验(换 harness 影响多大、通用与专用智能体差多少)都围绕这对概念展开。

端到端(E2E)交付物评测

不评中间步骤或单点能力,而是要求智能体从原始输入出发,自主完成理解、检索、分析、生成全流程,最终产出用户可直接使用的完整交付物(报表、备忘录、治疗方案等),再按功能、结构、格式、领域合规等多重标准验收。相比工具调用或问答基准,它更接近「把活干完」的真实职业标准。

StartupBench 的定位就是 E2E 交付物评测,这是它与 GAIA、OSWorld 等已有基准对比时的核心坐标。

研究动机

现有智能体基准存在两个系统性缺陷。其一是任务来源失真:GAIA、OSWorld 等主流基准的任务主要由研究者自行设计或改编,缺少真实需求验证,无法回答「用户是否真的愿意把这类工作交给 AI」。其二是评测协议与交付物本身严重不匹配:真实工作产品通常包含大量功能、结构、格式和领域合规要求,而许多基准只做整体式判断(如 GDPval 依赖人工评分、OneMillionBench 用单一 LLM-judge),既无法逐项核查,也难以复现。结果是,即使模型在 AgentBench、GAIA 这类基准上分数很高,业界仍然不知道它能否把能力转化为「可以直接交付给客户的专业工作产品」。例如一份财务尽调报告可能图表精美、结构完整,却因折现假设与来源数据不一致而完全不可用——这种整体式评分捕捉不到的失败,恰恰是专业场景中的常态。

本文的目标是本文要构建一个以「市场已验证的真实需求」为任务来源的端到端智能体基准,并量化当前模型与之的差距。具体目标包括:一,建立一套可操作的任务发现方法——用融资超过 100 万美元且有付费用户或规模采纳证据等市场信号筛选 AI 原生创业产品,通过深度用户访谈恢复真实工作流;二,把这些工作流转化为可复现、可评测、有区分度的完整交付物任务,覆盖医疗、金融、法律、商业管理、STEM 与计算机、教育人文六大领域;三,配套一套与专家判断高度一致的自动化评测框架;四,用统一 harness 系统评测代表性模型,明确回答「当前最强通用智能体离可靠完成真实工作还有多远」。最终得到的答案是:即便是榜首模型,严格完成率也不到三分之一。

与已有工作不同的是,本文最独特的视角是把「商业市场验证」本身作为任务发现的信号源。已有工作的任务要么由研究者手工设计(可控但脱离真实需求),要么直接从产品演示中抽取(真实但缺少上下文、成功标准和可复现规格)。本文指出这两条路都不充分,转而走第三条路:先用融资规模(>100 万美元)加真实采纳证据(付费使用或显著用户规模)锁定 20 多家被市场验证的 AI 创业公司,再访谈 30 多位深度企业用户还原使用场景、任务目标和交付物预期,最后由 57 位领域专家把经过验证的场景标准化为可复现的评测实例。换句话说,任务不是「研究者认为 AI 应该会做的」,而是「用户已经在付钱让 AI 做的」。这个需求驱动的锚点,配合逐条 rubric 的交付物级评测,构成了它与所有已有基准的本质区别。

核心方法

直觉上,这篇论文的做法是:与其猜测 AI 能做什么,不如去看用户已经在为什么付钱。整个基准构建像做市场调研加出版流程。第一步(Startup Agent Selection)按融资超过 100 万美元且有真实采纳证据筛选出 20 多家 AI 原生创业公司及其 agent 产品;第二步(Interview & Task Scoping)访谈 30 多位深度用户,提取使用场景、输入信息、预期交付物、成功标准和常见约束,形成场景规格和演示案例;第三步(Data Production)招募 57 位领域专家(中位从业 5 年,24.6% 从业 10 年以上),把验证过的场景重构为保留原始工作流目标与约束、但可复现的基准任务,共产出 150 多个候选任务;第四步(Quality Control & Difficulty Calibration)做专家交叉验证(任务真实性、工作流保真度、rubric 有效性、参考答案一致性四个方面),并用 GPT-5.5、Seed-2.1-Pro、GLM-5.1 等前沿模型试跑校准难度,淘汰区分度不足或题目本身有缺陷的任务,最终保留 97 个任务。

核心创新有两点。第一,任务三元组表示:每个任务形式化为 $\mathcal{T} = (q, E, \mathcal{R})$,其中 $q$ 是自然语言用户请求,$E$ 是自包含的工作区,$\mathcal{R} = \{(p_i, w_i)\}_{i=1}^{n}$ 是带权重的 rubric 集合——让真实工作流既保留完整性又变得可判定。第二,逐 rubric 独立评审:先从交付物 $\mathcal{D}$ 构建证据视图 $V(\mathcal{D})$(提取文本加渲染页面图),每条 rubric 单独开一个轻量 AgentJudge 会话,输出二元判定 $y_i \in \{0,1\}$ 和文字依据,最后按 $\text{score}(\mathcal{D},\mathcal{T}) = \frac{\sum_{i=1}^{n} w_i y_i}{\sum_{i=1}^{n} w_i}$ 加权聚合。与「全部交付物和 rubric 一次性交给一个评审」的本质区别在于分解与专注:消融显示整体式评审与专家一致性掉到 83%,且因需同时做长上下文推理、跨标准保持一致并输出结构化分数,格式错误频发、平均要跑两次以上才能得到有效结果;逐条评审一致性达 92.78% 且运行稳定。

方法步骤详情

完整流程分四个阶段。阶段一,创业 agent 筛选:按「融资 > 100 万美元 + 付费使用或显著用户规模」双条件过滤市场调研结果,输出 20 多家合格创业公司及其工作流清单。阶段二,用户访谈:对每款产品访谈不同领域的深度用户,提取使用情境、任务目标、输入、预期交付物、成功标准和约束,每个候选 agent 至少一个演示案例,输出场景规格说明。阶段三,专家任务构建:57 位专家以访谈规格和种子场景为参照,把真实用户请求标准化为三元组 $(q, E, \mathcal{R})$——请求反映真实意图(含隐含约束),工作区自包含全部多模态输入,rubric 每条含评分点 $p_i$ 和正权重 $w_i$;全部 2453 条 rubric 分为 6 个维度(计算精度 38.89%、结构完整性 27.31%、领域合规 15.49%、信息整合 9.46%、工程格式 6.20%、输出呈现 2.65%)和 3 个重要性等级(Core/Important/Auxiliary 权重 5/3/1,占总权重 59.10%/34.33%/6.57%),产出 150 多个候选任务。阶段四,质量控制与难度校准:每任务至少一名额外专家独立复核四项标准;再用前沿模型试跑,高通过率任务因无区分度被剔除,因指令模糊或工作区缺陷导致的失败则修订后重验,最终保留 97 个任务,平均每任务 25.3 条 rubric。

技术新颖性

与已有工作逐项对比(Table 1):GAIA 是手工设计文本任务、规则评分;OSWorld 评环境状态;DAComp 和 Workspace-Bench 虽评工作区但任务来源含人工或模拟成分,且不支持过程逻辑校验;GDPval 用人工构建工作产品却依赖人工评分,不可扩展;Agents' Last Exam 覆盖职业任务但只部分支持逐条判分和过程校验。StartupBench 是对比表中唯一同时满足「市场验证任务来源 + 端到端工作区 + 逐条判分 + 过程逻辑 + 开放式输出 + Agent-as-Judge 评测」全部六项的基准。技术上的新颖性不在单个算法,而在评测协议设计:每条 rubric 独立会话的 AgentJudge 配合证据视图,兼顾了评审深度(每条都有专属推理与工具调用)、执行稳定性(避免长上下文一次性输出全部分数导致的格式失败)和可扩展性(全自动、无需人工),92.78% 的专家一致性验证了这条路的可行性。

StartupBench data construction pipeline: select market-validated startup agents, collect real user workflows, construct task artifacts and instances, and calibrate quality and difficulty through multi-stage review.
Figure 2: StartupBench data construction pipeline: select market-validated startup agents, collect real user workflows, construct task artifacts and instances, and calibrate quality and difficulty through multi-stage review.
A representative example of a rubric of a task spanning 3 levels.
Figure 7: A representative example of a rubric of a task spanning 3 levels.

实验结果

在统一 Nanobot harness、每任务最多 200 步、每模型 3 次独立运行、1 万次 bootstrap 置信区间、judge 底座为 GPT-5.5 的设定下评测 9 个模型。榜首之争:Kimi-K3 平均分最高(73.67),GPT-5.6-sol 成功率最高(31.27%,平均分 73.61),GPT-5.5 紧随(72.79 / 26.80%),但没有任何模型严格完成(score ≥ 90)三分之一的任务;Gemini-3.1-Pro 垫底(49.73 / 6.53%)。平均分与成功率系统性背离,说明瓶颈不在「完成大部分流程」,而在「稳定达到可直接专业使用的标准」。领域差异显著:商业管理最容易(所有模型平均分超过 60,Kimi-K3 达 83.90、成功率 52.63%),金融最难(九模型平均仅 54.48%),反映模型更擅长结构化、标准化任务,而非需要持续定量推理、跨文档一致性和多步验证的工作流;同时领域专长分化明显,平均分上 Kimi-K3 领先医疗、商业、金融、教育,GPT-5.6-sol 领先法律和 STEM,没有模型全面占优。评测框架有效性:与专家在 rubric 级一致 92.78%、成功判定级一致 92.84%,消融为整体式单次评审则降至 83%。失败结构上,领域合规是最难维度、计算精度同样偏弱;按重要性分级,满足率从 Auxiliary 68.67% 递减到 Important 65.89%、Core 63.45%(9 个模型中 8 个同趋势)——普遍满足边缘要求却漏掉决定成败的核心要求。此外,56 个有明确输出格式要求的任务上没有模型完全合规(最好 97.6%,最差 86.3%),典型错误包括用 .md/.txt 代替要求的 .pdf,或只交付要求的两个文件之一。

Statistics of StartupBench: 97 real-world workflow tasks across six top-level domains and diverse deliverable formats.
Table 2: Statistics of StartupBench: 97 real-world workflow tasks across six top-level domains and diverse deliverable formats.
Model performance of StartupBench, averaged over three independent runs (top: average score; bottom: success rate ≥90).
Table 3: Model performance of StartupBench, averaged over three independent runs (top: average score; bottom: success rate ≥90).
Task-normalized rubric satisfaction rates (%) across different importance levels (Auxiliary / Important / Core).
Table 4: Task-normalized rubric satisfaction rates (%) across different importance levels (Auxiliary / Important / Core).
Output-format compliance on the 56 StartupBench tasks with explicit output-file requirement rubrics.
Table 5: Output-format compliance on the 56 StartupBench tasks with explicit output-file requirement rubrics.
Performance under different general-purpose agent frameworks (Hermes / Claude Code / Nanobot).
Table 6: Performance under different general-purpose agent frameworks (Hermes / Claude Code / Nanobot).
General-purpose versus specialized agent systems (Oracle General = best of all trials per model-task).
Table 7: General-purpose versus specialized agent systems (Oracle General = best of all trials per model-task).
Summary of domain expert backgrounds.
Table 8: Summary of domain expert backgrounds.
Distribution of rubric categories in StartupBench.
Table 9: Distribution of rubric categories in StartupBench.
Leaderboard of StartupBench.
Figure 3: Leaderboard of StartupBench.
Performance across rubric dimensions: importance-weighted pass rates (%) of different models on the six rubric dimensions in StartupBench.
Figure 4: Performance across rubric dimensions: importance-weighted pass rates (%) of different models on the six rubric dimensions in StartupBench.
A representative case of models failing on core rubrics though passing auxiliary rubrics on StartupBench.
Figure 5: A representative case of models failing on core rubrics though passing auxiliary rubrics on StartupBench.
A representative case of complex instruction following failure (HR payroll workbook).
Figure 6: A representative case of complex instruction following failure (HR payroll workbook).
A representative example of self-verification hallucination.
Figure 8: A representative example of self-verification hallucination.
A representative example of failure caused by insufficient domain-specific clinical actionability.
Figure 9: A representative example of failure caused by insufficient domain-specific clinical actionability.
查看结构化数据
任务指标本文基线提升
端到端工作流完成(97 任务整体) 重要性加权平均分(0–100) Kimi-K3 73.67(全场最高),GPT-5.6-sol 73.61 次之 Gemini-3.1-Pro 49.73 为最低;此前无同类型市场验证来源基准 首个以市场验证工作流为来源的 E2E 基准,揭示最强模型仍未饱和
严格成功判定(score ≥ 90) 成功率(%,3 次运行池化) GPT-5.6-sol 31.27%(最高) Gemini-3.1-Pro 6.53%(最低) 首尾差 24.74 个百分点,但无任何模型超过 1/3
金融领域工作流(最难领域) 平均分 Kimi-K3 62.38、GPT-5.6-sol 61.66 九模型领域均值仅 54.48,为六领域最低 比最容易的商业管理域(Kimi-K3 83.90)低约 21.5 分
自动评测器与领域专家的一致性 rubric 级一致率 92.78%(逐 rubric 独立评审),成功判定级一致 92.84% 83%(整体式单次评审消融) +9.78 个百分点,且执行更稳定(无需平均 2 次以上重试)
通用 vs 专用智能体 平均分 / 成功率 专用 startup agent 83.50 / 39.18% 通用智能体全部运行平均 64.26 / 19.74%;取 3 次最优的 oracle 也仅 71.75 / 28.06% 专用智能体仍领先 oracle 设置 11.75 分 / 11.12 个百分点

局限与改进

作者承认的局限:难度校准用 GPT-5.5、Seed-2.1-Pro、GLM-5.1 试跑,目的是构造有挑战性的基准而非估计自然任务分布,因此报告的分数可能低估模型在自然难度分布下的表现;成功阈值 90 的设定带有一定任意性。我的补充观察:其一,97 个任务规模偏小且领域不均衡(教育人文仅 7 个),每个领域内的统计功效有限,模型间几个点的差异可能落在置信区间内;其二,judge 底座固定为 GPT-5.5,可能对同家族模型存在潜在偏好,论文未报告跨家族 judge 的敏感性分析;其三,任务全部来自已被 AI 产品化的工作流,天然偏向「适合 AI 做、已被产品验证」的任务类型,对尚未被产品化但同样真实的专题工作覆盖不足;其四,市场验证信号(融资 + 付费)是粗代理,融资规模反映的是资本市场预期而非任务质量本身;其五,与专用 agent 的对比中,专用系统是在其自身来源的工作流上被评测的,存在一定「主场」成分,差距可能被略微放大。

独立分析的弱点

独立分析四点弱点。一,规模与均衡性:教育人文域仅 7 个任务,单任务波动即可改变领域排名,改进方向是按域扩样至每域 30 个以上并报告每域置信区间。二,评测器单点依赖:judge 固定用 GPT-5.5,若未来参赛模型与其同源,可能出现自我偏好;改进方向是多 judge 集成(跨模型家族取多数或平均)并公开 judge 一致性随参赛模型更新的监控数据。三,数据污染风险:任务源自公开的创业产品与真实工作流,模型若在训练中见过类似产品文档或模板,分数可能虚高;改进方向是建立不公开的保留测试集并定期轮换任务。四,成本维度缺失:基准只报质量分,未报告完成任务消耗的 token 数、时间和费用,而「专业可用」在现实中隐含成本约束;改进方向是补充质量-成本帕累托曲线,让 73 分模型与 60 分模型的性价比可比。这些弱点都有明确可行的修复路径,不动摇基准的框架价值。

未来方向

作者指出的方向:当前通用模型短板集中在复杂指令遵循、领域专业知识、专业惯例和长时程工作流执行,随这些能力提升,通用 agent 有望在不依赖领域定制 harness 的情况下完成有价值的端到端专业任务。基于成果可延伸的方向:其一,把 rubric 级判定作为可验证奖励用于强化学习,直接优化「交付物达标率」而非过程模仿——Core rubric 权重 5 倍于 Auxiliary 的设计天然适合做奖励加权;其二,按域模型路由,本文显示 Kimi-K3 与 GPT-5.6-sol 各自在不同领域领先,产品层可以用轻量领域分类器在两者间切换取长;其三,把「自验证幻觉」的发现产品化:在 agent 收尾阶段强制引入交付物级工件检查(重开文件、核对缓存值、抽查关键单元格),成本远低于整体重跑;其四,基准动态化,随 AI 创业生态演化定期纳入新产品工作流,保持任务分布与市场需求同步;其五,扩展到多轮人机协作场景,评测 agent 根据用户反馈修订交付物的能力。

复现评估

复现分两个层次看。评测复现(用该基准测自己的模型)可行性较高:评测协议完全自动化——统一 Nanobot harness、固定工具配置、200 步上限、judge 用 GPT-5.5、3 次运行加 1 万次 bootstrap 置信区间,项目页 startupbench.github.io 提供入口;主要成本是 API 费用,9 模型 × 97 任务 × 3 次运行、每次最多 200 步的长时程交互,外加平均 25.3 条 rubric 的逐条评审,全量评测对推理预算要求不低,但单模型评测应在中小团队可负担范围内。数据复现(重建基准本身)则很困难:需要融资与采纳数据筛选、30 多场深度用户访谈、57 位领域专家(中位 5 年经验)的人工构建与交叉验证,人力成本是主要门槛,论文也未给出数据集完整开放的细节,建议以项目页实际发布情况为准。总体评估:跑评测中等难度,造数据高难度。