StartupBench:基于市场验证端到端工作流的通用智能体评测基准 StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows
从市场验证的AI创业产品工作流构建97任务基准,最强模型严格完成率仅约30%
前置知识
Agent-as-a-Judge(智能体评审)
传统 LLM-as-a-Judge 让一个 LLM 直接给另一个模型的输出打分,适合评短答案;但报告、表格、幻灯片这类复杂交付物需要打开文件、检索证据、核对状态才能评。Agent-as-a-Judge 在此基础上给评审模型配备工具和环境交互能力,使其能像人类评审一样检查最终工件。StartupBench 用它对 DOCX、XLSX、PPTX、PDF 等异构交付物逐条评分,评审 agent 本身也运行在统一的 Nanobot harness 上。
本文整套评测协议都建立在 Agent-as-a-Judge 之上,不理解它就无法理解论文中分数是怎么产生的。
细粒度评估量表(Rubric)
把一个任务的成功标准拆解为多条可独立判定的评分点,每条描述交付物必须满足的一项具体要求(如「包含指定工作表」「公式计算结果正确」),并赋予权重。本文每个任务平均 25.3 条 rubric,按 6 个能力维度和 3 个重要性等级(Core/Important/Auxiliary,权重 5/3/1)组织,任务得分是各条二元判定结果的加权通过率。
论文的评分公式、成功率定义(score ≥ 90)以及按维度、按重要性分级的失败分析全部依赖 rubric 体系。
通用智能体与垂直(专用)智能体
通用智能体用统一的 agent 框架(harness,如 Nanobot、Claude Code、Hermes)配合基础模型执行任意任务,不做领域定制;垂直智能体则针对特定工作流做了领域模型选型、专用提示、工具编排和流程设计(如本文来源的医疗、金融创业产品)。两者代表「一个模型打天下」与「为场景深度定制」两条产品路线。
论文的两组关键实验(换 harness 影响多大、通用与专用智能体差多少)都围绕这对概念展开。
端到端(E2E)交付物评测
不评中间步骤或单点能力,而是要求智能体从原始输入出发,自主完成理解、检索、分析、生成全流程,最终产出用户可直接使用的完整交付物(报表、备忘录、治疗方案等),再按功能、结构、格式、领域合规等多重标准验收。相比工具调用或问答基准,它更接近「把活干完」的真实职业标准。
StartupBench 的定位就是 E2E 交付物评测,这是它与 GAIA、OSWorld 等已有基准对比时的核心坐标。
研究动机
现有智能体基准存在两个系统性缺陷。其一是任务来源失真:GAIA、OSWorld 等主流基准的任务主要由研究者自行设计或改编,缺少真实需求验证,无法回答「用户是否真的愿意把这类工作交给 AI」。其二是评测协议与交付物本身严重不匹配:真实工作产品通常包含大量功能、结构、格式和领域合规要求,而许多基准只做整体式判断(如 GDPval 依赖人工评分、OneMillionBench 用单一 LLM-judge),既无法逐项核查,也难以复现。结果是,即使模型在 AgentBench、GAIA 这类基准上分数很高,业界仍然不知道它能否把能力转化为「可以直接交付给客户的专业工作产品」。例如一份财务尽调报告可能图表精美、结构完整,却因折现假设与来源数据不一致而完全不可用——这种整体式评分捕捉不到的失败,恰恰是专业场景中的常态。
本文的目标是本文要构建一个以「市场已验证的真实需求」为任务来源的端到端智能体基准,并量化当前模型与之的差距。具体目标包括:一,建立一套可操作的任务发现方法——用融资超过 100 万美元且有付费用户或规模采纳证据等市场信号筛选 AI 原生创业产品,通过深度用户访谈恢复真实工作流;二,把这些工作流转化为可复现、可评测、有区分度的完整交付物任务,覆盖医疗、金融、法律、商业管理、STEM 与计算机、教育人文六大领域;三,配套一套与专家判断高度一致的自动化评测框架;四,用统一 harness 系统评测代表性模型,明确回答「当前最强通用智能体离可靠完成真实工作还有多远」。最终得到的答案是:即便是榜首模型,严格完成率也不到三分之一。
与已有工作不同的是,本文最独特的视角是把「商业市场验证」本身作为任务发现的信号源。已有工作的任务要么由研究者手工设计(可控但脱离真实需求),要么直接从产品演示中抽取(真实但缺少上下文、成功标准和可复现规格)。本文指出这两条路都不充分,转而走第三条路:先用融资规模(>100 万美元)加真实采纳证据(付费使用或显著用户规模)锁定 20 多家被市场验证的 AI 创业公司,再访谈 30 多位深度企业用户还原使用场景、任务目标和交付物预期,最后由 57 位领域专家把经过验证的场景标准化为可复现的评测实例。换句话说,任务不是「研究者认为 AI 应该会做的」,而是「用户已经在付钱让 AI 做的」。这个需求驱动的锚点,配合逐条 rubric 的交付物级评测,构成了它与所有已有基准的本质区别。
核心方法
直觉上,这篇论文的做法是:与其猜测 AI 能做什么,不如去看用户已经在为什么付钱。整个基准构建像做市场调研加出版流程。第一步(Startup Agent Selection)按融资超过 100 万美元且有真实采纳证据筛选出 20 多家 AI 原生创业公司及其 agent 产品;第二步(Interview & Task Scoping)访谈 30 多位深度用户,提取使用场景、输入信息、预期交付物、成功标准和常见约束,形成场景规格和演示案例;第三步(Data Production)招募 57 位领域专家(中位从业 5 年,24.6% 从业 10 年以上),把验证过的场景重构为保留原始工作流目标与约束、但可复现的基准任务,共产出 150 多个候选任务;第四步(Quality Control & Difficulty Calibration)做专家交叉验证(任务真实性、工作流保真度、rubric 有效性、参考答案一致性四个方面),并用 GPT-5.5、Seed-2.1-Pro、GLM-5.1 等前沿模型试跑校准难度,淘汰区分度不足或题目本身有缺陷的任务,最终保留 97 个任务。
核心创新有两点。第一,任务三元组表示:每个任务形式化为 $\mathcal{T} = (q, E, \mathcal{R})$,其中 $q$ 是自然语言用户请求,$E$ 是自包含的工作区,$\mathcal{R} = \{(p_i, w_i)\}_{i=1}^{n}$ 是带权重的 rubric 集合——让真实工作流既保留完整性又变得可判定。第二,逐 rubric 独立评审:先从交付物 $\mathcal{D}$ 构建证据视图 $V(\mathcal{D})$(提取文本加渲染页面图),每条 rubric 单独开一个轻量 AgentJudge 会话,输出二元判定 $y_i \in \{0,1\}$ 和文字依据,最后按 $\text{score}(\mathcal{D},\mathcal{T}) = \frac{\sum_{i=1}^{n} w_i y_i}{\sum_{i=1}^{n} w_i}$ 加权聚合。与「全部交付物和 rubric 一次性交给一个评审」的本质区别在于分解与专注:消融显示整体式评审与专家一致性掉到 83%,且因需同时做长上下文推理、跨标准保持一致并输出结构化分数,格式错误频发、平均要跑两次以上才能得到有效结果;逐条评审一致性达 92.78% 且运行稳定。
方法步骤详情
完整流程分四个阶段。阶段一,创业 agent 筛选:按「融资 > 100 万美元 + 付费使用或显著用户规模」双条件过滤市场调研结果,输出 20 多家合格创业公司及其工作流清单。阶段二,用户访谈:对每款产品访谈不同领域的深度用户,提取使用情境、任务目标、输入、预期交付物、成功标准和约束,每个候选 agent 至少一个演示案例,输出场景规格说明。阶段三,专家任务构建:57 位专家以访谈规格和种子场景为参照,把真实用户请求标准化为三元组 $(q, E, \mathcal{R})$——请求反映真实意图(含隐含约束),工作区自包含全部多模态输入,rubric 每条含评分点 $p_i$ 和正权重 $w_i$;全部 2453 条 rubric 分为 6 个维度(计算精度 38.89%、结构完整性 27.31%、领域合规 15.49%、信息整合 9.46%、工程格式 6.20%、输出呈现 2.65%)和 3 个重要性等级(Core/Important/Auxiliary 权重 5/3/1,占总权重 59.10%/34.33%/6.57%),产出 150 多个候选任务。阶段四,质量控制与难度校准:每任务至少一名额外专家独立复核四项标准;再用前沿模型试跑,高通过率任务因无区分度被剔除,因指令模糊或工作区缺陷导致的失败则修订后重验,最终保留 97 个任务,平均每任务 25.3 条 rubric。
技术新颖性
与已有工作逐项对比(Table 1):GAIA 是手工设计文本任务、规则评分;OSWorld 评环境状态;DAComp 和 Workspace-Bench 虽评工作区但任务来源含人工或模拟成分,且不支持过程逻辑校验;GDPval 用人工构建工作产品却依赖人工评分,不可扩展;Agents' Last Exam 覆盖职业任务但只部分支持逐条判分和过程校验。StartupBench 是对比表中唯一同时满足「市场验证任务来源 + 端到端工作区 + 逐条判分 + 过程逻辑 + 开放式输出 + Agent-as-Judge 评测」全部六项的基准。技术上的新颖性不在单个算法,而在评测协议设计:每条 rubric 独立会话的 AgentJudge 配合证据视图,兼顾了评审深度(每条都有专属推理与工具调用)、执行稳定性(避免长上下文一次性输出全部分数导致的格式失败)和可扩展性(全自动、无需人工),92.78% 的专家一致性验证了这条路的可行性。
实验结果
在统一 Nanobot harness、每任务最多 200 步、每模型 3 次独立运行、1 万次 bootstrap 置信区间、judge 底座为 GPT-5.5 的设定下评测 9 个模型。榜首之争:Kimi-K3 平均分最高(73.67),GPT-5.6-sol 成功率最高(31.27%,平均分 73.61),GPT-5.5 紧随(72.79 / 26.80%),但没有任何模型严格完成(score ≥ 90)三分之一的任务;Gemini-3.1-Pro 垫底(49.73 / 6.53%)。平均分与成功率系统性背离,说明瓶颈不在「完成大部分流程」,而在「稳定达到可直接专业使用的标准」。领域差异显著:商业管理最容易(所有模型平均分超过 60,Kimi-K3 达 83.90、成功率 52.63%),金融最难(九模型平均仅 54.48%),反映模型更擅长结构化、标准化任务,而非需要持续定量推理、跨文档一致性和多步验证的工作流;同时领域专长分化明显,平均分上 Kimi-K3 领先医疗、商业、金融、教育,GPT-5.6-sol 领先法律和 STEM,没有模型全面占优。评测框架有效性:与专家在 rubric 级一致 92.78%、成功判定级一致 92.84%,消融为整体式单次评审则降至 83%。失败结构上,领域合规是最难维度、计算精度同样偏弱;按重要性分级,满足率从 Auxiliary 68.67% 递减到 Important 65.89%、Core 63.45%(9 个模型中 8 个同趋势)——普遍满足边缘要求却漏掉决定成败的核心要求。此外,56 个有明确输出格式要求的任务上没有模型完全合规(最好 97.6%,最差 86.3%),典型错误包括用 .md/.txt 代替要求的 .pdf,或只交付要求的两个文件之一。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 端到端工作流完成(97 任务整体) | 重要性加权平均分(0–100) | Kimi-K3 73.67(全场最高),GPT-5.6-sol 73.61 次之 | Gemini-3.1-Pro 49.73 为最低;此前无同类型市场验证来源基准 | 首个以市场验证工作流为来源的 E2E 基准,揭示最强模型仍未饱和 |
| 严格成功判定(score ≥ 90) | 成功率(%,3 次运行池化) | GPT-5.6-sol 31.27%(最高) | Gemini-3.1-Pro 6.53%(最低) | 首尾差 24.74 个百分点,但无任何模型超过 1/3 |
| 金融领域工作流(最难领域) | 平均分 | Kimi-K3 62.38、GPT-5.6-sol 61.66 | 九模型领域均值仅 54.48,为六领域最低 | 比最容易的商业管理域(Kimi-K3 83.90)低约 21.5 分 |
| 自动评测器与领域专家的一致性 | rubric 级一致率 | 92.78%(逐 rubric 独立评审),成功判定级一致 92.84% | 83%(整体式单次评审消融) | +9.78 个百分点,且执行更稳定(无需平均 2 次以上重试) |
| 通用 vs 专用智能体 | 平均分 / 成功率 | 专用 startup agent 83.50 / 39.18% | 通用智能体全部运行平均 64.26 / 19.74%;取 3 次最优的 oracle 也仅 71.75 / 28.06% | 专用智能体仍领先 oracle 设置 11.75 分 / 11.12 个百分点 |
局限与改进
作者承认的局限:难度校准用 GPT-5.5、Seed-2.1-Pro、GLM-5.1 试跑,目的是构造有挑战性的基准而非估计自然任务分布,因此报告的分数可能低估模型在自然难度分布下的表现;成功阈值 90 的设定带有一定任意性。我的补充观察:其一,97 个任务规模偏小且领域不均衡(教育人文仅 7 个),每个领域内的统计功效有限,模型间几个点的差异可能落在置信区间内;其二,judge 底座固定为 GPT-5.5,可能对同家族模型存在潜在偏好,论文未报告跨家族 judge 的敏感性分析;其三,任务全部来自已被 AI 产品化的工作流,天然偏向「适合 AI 做、已被产品验证」的任务类型,对尚未被产品化但同样真实的专题工作覆盖不足;其四,市场验证信号(融资 + 付费)是粗代理,融资规模反映的是资本市场预期而非任务质量本身;其五,与专用 agent 的对比中,专用系统是在其自身来源的工作流上被评测的,存在一定「主场」成分,差距可能被略微放大。
独立分析的弱点
独立分析四点弱点。一,规模与均衡性:教育人文域仅 7 个任务,单任务波动即可改变领域排名,改进方向是按域扩样至每域 30 个以上并报告每域置信区间。二,评测器单点依赖:judge 固定用 GPT-5.5,若未来参赛模型与其同源,可能出现自我偏好;改进方向是多 judge 集成(跨模型家族取多数或平均)并公开 judge 一致性随参赛模型更新的监控数据。三,数据污染风险:任务源自公开的创业产品与真实工作流,模型若在训练中见过类似产品文档或模板,分数可能虚高;改进方向是建立不公开的保留测试集并定期轮换任务。四,成本维度缺失:基准只报质量分,未报告完成任务消耗的 token 数、时间和费用,而「专业可用」在现实中隐含成本约束;改进方向是补充质量-成本帕累托曲线,让 73 分模型与 60 分模型的性价比可比。这些弱点都有明确可行的修复路径,不动摇基准的框架价值。
未来方向
作者指出的方向:当前通用模型短板集中在复杂指令遵循、领域专业知识、专业惯例和长时程工作流执行,随这些能力提升,通用 agent 有望在不依赖领域定制 harness 的情况下完成有价值的端到端专业任务。基于成果可延伸的方向:其一,把 rubric 级判定作为可验证奖励用于强化学习,直接优化「交付物达标率」而非过程模仿——Core rubric 权重 5 倍于 Auxiliary 的设计天然适合做奖励加权;其二,按域模型路由,本文显示 Kimi-K3 与 GPT-5.6-sol 各自在不同领域领先,产品层可以用轻量领域分类器在两者间切换取长;其三,把「自验证幻觉」的发现产品化:在 agent 收尾阶段强制引入交付物级工件检查(重开文件、核对缓存值、抽查关键单元格),成本远低于整体重跑;其四,基准动态化,随 AI 创业生态演化定期纳入新产品工作流,保持任务分布与市场需求同步;其五,扩展到多轮人机协作场景,评测 agent 根据用户反馈修订交付物的能力。
复现评估
复现分两个层次看。评测复现(用该基准测自己的模型)可行性较高:评测协议完全自动化——统一 Nanobot harness、固定工具配置、200 步上限、judge 用 GPT-5.5、3 次运行加 1 万次 bootstrap 置信区间,项目页 startupbench.github.io 提供入口;主要成本是 API 费用,9 模型 × 97 任务 × 3 次运行、每次最多 200 步的长时程交互,外加平均 25.3 条 rubric 的逐条评审,全量评测对推理预算要求不低,但单模型评测应在中小团队可负担范围内。数据复现(重建基准本身)则很困难:需要融资与采纳数据筛选、30 多场深度用户访谈、57 位领域专家(中位 5 年经验)的人工构建与交叉验证,人力成本是主要门槛,论文也未给出数据集完整开放的细节,建议以项目页实际发布情况为准。总体评估:跑评测中等难度,造数据高难度。
论文图表
全景图:左上以一个生物科技 CMO 起草 FDA 审评董事会备忘录的任务为例(要求论证单臂二期数据不足并提出 MRCT 策略),中间展示智能体「理解分解→检索→分析推理→生成精修」的长时程执行流程,右侧列出六大领域和 DOCX/XLSX/PPTX/PDF/Markdown 等多格式交付物。
一张图讲清基准的全貌:任务从哪来、智能体要做什么、覆盖哪些领域、产出什么形态的交付物,是快速建立整体认知的入口。
与 GAIA、OSWorld、DAComp、GDPval、Workspace-Bench、OneMillionBench、Agents' Last Exam、OfficeQA Pro 逐项对比任务来源、端到端支持、最终输出形态、逐条判分、过程逻辑、开放式输出和评测方法。StartupBench 是唯一在全部维度打勾的基准。
一表定位本文在基准版图中的独特位置,是「为什么需要这个新基准」的最直接论据。