← 返回 2026-08-03

ExtractBench:面向企业文档的模式引导抽取基准 ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo 📅 2026-07-31 👍 23 2026-08-08 18:30
企业文档处理 基准测试 文档信息抽取 模式引导抽取 视觉语言模型

首个联合评测准确率、记录完整性、溯源与成本的文档抽取基准

前置知识

模式引导抽取(Schema-Guided Extraction)

给定一份文档和一个用户自定义的 JSON Schema(声明要抽取的字段名、类型、自然语言描述、可空性与值约束),系统输出符合该 Schema 的结构化数据。一个 Schema 定义一个抽取任务,对同一类型的所有文档通用——例如一张发票 schema 覆盖所有供应商的发票。与“固定本体”抽取(字段在基准里预定义)不同,模式引导允许用户在推理时灵活指定新任务而无需重新训练模型。

这是本文的核心任务定义,理解它才能明白为何不能仅用一个聚合分数评估,以及为何需要按“挑战维度”独立切片来诊断失败。

文档信息抽取 / KIE(Document Information Extraction)

把非结构化文档(PDF、扫描件、表格)转换为结构化记录的过程。经典方法用手工模板填字段(如 MUC 会议的 message understanding 范式),现代方法用视觉语言模型(VLM)或专用抽取 API。关键难点包括长列表的完整性、密集表单的字段定位、扫描噪声与手写体识别、跨页表格的结构延续等。SROIE、DocILE、RealKIE 是这条线上的代表性基准。

本文构建在 KIE 数十年的发展之上,并显式对标这些经典基准(见 Table 1、Table 6),理解这条演进脉络才能定位 ExtractBench 的差异化贡献。

视觉溯源 / Grounding

抽取系统不仅要返回正确的值,还要指明每个值来自文档的哪个位置——通常是源页码和词级别的边界框(bounding box)。溯源让审核者无需翻阅整份文档就能定位并修正错误,是企业级生产系统的关键需求,因为 AI 抽取必然存在失败(如长表格被截断导致基金持仓对账失败时,人需要快速找到漏掉的那段)。

本文是首个在模式引导抽取基准中显式评测 word 级和 page 级溯源 F1 的工作,这也是它揭示“VLM/编码智能体默认不返回证据”这一隐藏问题的依据。

顺序无关的值 F1(Order-Insensitive Value F1)

评测抽取准确率的核心指标。输出先按标量字段和记录子字段拍平为“单元”(cell),每个单元在归一化(如日期转 ISO、空白折叠、大小写)后做精确匹配,无数值容差也无 LLM judge。对重复记录用匈牙利算法(Hungarian algorithm)做全局最优一对一配对以最小化不匹配单元数,因此记录顺序不影响得分。每个文档上做微平均 P/R/F1,slice 与总体再做文档级无权重平均。

理解这个指标才能看懂 Table 2 的结果表,也才能理解为何 precision-recall 差距(如 Gemini 长文档 Δ=57.2)是诊断“截断丢记录”的关键信号。

通用 VLM vs 编码智能体 vs 专用抽取 API

文档抽取的三种范式。VLM(如 GPT-5.4 Nano、Gemini 3.5 Flash)把抽取当作多模态生成,单次调用输出 JSON,简单便宜但容易截断长记录且默认不返回证据。编码智能体(如 Claude Code Opus 4.8、Codex GPT-5.5)用工具迭代循环,可写解析代码、反复校验、修订输出,更鲁棒但贵且慢。专用抽取 API(如 LlamaExtract、Reducto、Extend、Datalab)是托管流水线,集成预处理、解析、schema 引导抽取与溯源,质量与成本介于两者之间。

本文的核心实验就是比较这三类共 14 个系统的“质量-成本前沿”(Figure 4),理解范式差异才能解读结果差异的根源。

研究动机

企业工作流越来越依赖智能体做模式引导抽取:读财报、保险理赔单、采购订单、政府表格,按用户定义的 Schema 把相关值键入业务系统。这类工作高度人工、重复,且错误代价高昂 [5,18]。现有基准都有关键短板(Table 1)。经典 IE 用手工模板填固定字段(MUC 范式 [16]);固定本体 KIE 基准如 SROIE(1000 文档)、DocILE(6680 文档)不处理用户自定义 Schema。更现代的模式引导基准 [4,12] 只覆盖问题的窄维度。最接近的三个基准各覆盖一片:ContextualAI 的 ExtractBench [12] 强调 Schema 复杂度(最多 369 字段),但只评估 5 个共享 schema、不含手写文档、不评测视觉溯源也不计成本;LongArray-Extract [9] 和 LongExtractBench-50 [26] 在长文档与重复记录完整性上施压,但公开测试集只有几十份文档,其合成文档无法体现真实企业数据的视觉多变性与感知挑战;VAREX [4] 每文档一 schema,无法测试一个抽取任务能否跨多样外观迁移。这种碎片化使人们难以全面比较不同系统家族或诊断失败原因。

本文的目标是本文要构建一个面向真实生产需求的、全面的模式引导企业文档抽取基准。具体目标包括:(1) 广覆盖——跨越多业务域和文档类型;(2) 可溯源——显式评测每个值能否指回文档源头(词级与页级);(3) 可计成本——以美分/页为单位度量实际开销,因为在百万页级流水线里每页差 1 美分就意味着 $10{,}000$ 的差距;(4) 可归因——用独立的多轴挑战标签把低分追溯到真实原因。规模目标为 370 份文档、4,869 页、8 个业务域、67 个文档类型,并对任务挑战、感知挑战、表格结构、长度、领域五个独立轴打标签(共 22 个挑战标签),支持逐挑战切片分析,从而让一个聚合分数能被拆解到具体失败模式。

与已有工作不同的是,本文的独特切入在于把“完整输出 + 源溯源 + 鲁棒性 + 规模化成本”这四个生产核心需求同时纳入一个基准,并用五轴独立的挑战标签让聚合分数能被拆解。和已有工作相比,它抓住了几个被忽视的点:(1) 一个聚合分数无法区分“漏掉列表的三分之一”和“读错一个标签”,也无法区分“难任务”和“差扫描”——而独立标签轴让失败可归因;(2) 用单系统输出当 ground truth 会重复其错误并偏向该系统,作者用“独立系统一致 + 裁决”的集成方法避免单点偏差;(3) 合成长列表“数据先行、文档后渲染”的做法让真值在 PDF 生成前就确定,无需人工标注即可任意长;(4) 退化重拍(scan-degraded re-capture)保留真值不变只换捕获方式,从而隔离“捕获退化”的纯效应。

核心方法

整体思路像给文档抽取系统造一台“多轴压力测试仪”——既要像生产那样考核“完整、可溯源、便宜”,又要像体检那样分科室定位病灶。技术路线分三块。其一,任务定义:把抽取严格刻画为函数 $f : (\text{document},\ \text{schema}) \mapsto (\text{structured data},\ \text{evidence})$,schema 是用户写的 JSON Schema(含标量、嵌套对象、记录数组、可空字段、值约束),输出必须是 schema 合法的 JSON 且每个值带源页与词级框。其二,语料与标签:370 份文档跨 8 域 67 类型,沿五个独立轴打标签——任务挑战 T1–T3、感知挑战 P1–P3、表格结构 S1–S5、长度 L1–L3、业务域 D1–D8,共 22 个标签。其三,可扩展的真值流水线:对三类来源(真实文档、合成长列表、扫描表单)分别用最合适的方法造真值,避免逐字段人工标注的不可行性。这种“按来源分流”的设计让大规模高质量真值成为可能。

核心创新是把“挑战可归因 + 真值可扩展 + 多维联合评测”三者打包进一个基准。和已有方法最本质的区别是:第一,标签轴彼此独立而非折算成一个难度分——同一个任务挑战可出现在任意长度,长度本身又带来独立的“截断”失败,所以任务挑战与长度分开标注,让低分能溯源到真实成因(如区分“难任务”与“差扫描”)。第二,真值不靠单系统也不靠全人工,而是“独立模型池一致 + 裁决”用于真实文档、“数据先行的程序化渲染”用于合成长列表、“逐字段人工核验”用于扫描表单三种方式互补,分别用“跨模型一致”“构造即精确”“人验”三种信任背书,避免单点偏差。第三,首次在模式引导抽取里把 word 级和 page 级溯源 F1、order-insensitive 值 F1、以及实测成本放在一起评,揭示“花更多钱不一定更准”“VLM/编码智能体默认不返回证据”这些被隐藏的真相。

方法步骤详情

真值构建按来源分流。真实文档:先从样本文档起草 schema(每字段描述含别名、格式、位置提示、易混项引导),再跑多个不同模型/流水线家族的系统;全部系统一致的值(含缺失字段的 null)成为候选真值;分歧按原因分类——若多种读法都说得通则是 schema 缺陷,收紧描述直到重跑收敛,若只有一种读法合理则是模型错误,由审核员对照页面裁定。合成长列表:先选真实版式(基金明细、债权人名册等),先造全部结构化记录(含 null、总计、层级、归一化规则),再让编码智能体研究版式后写渲染代码生成 PDF,按真实尺寸分页(避免固定行数分页造成的错误源页标签);值在 PDF 生成前就已知,其页号和词框从渲染结果读回,所以真值随列表变长仍精确;机械检查捕获版式/截断问题,再用抽取系统池审计。扫描表单:schema 从空白模板起草并冻结,最多五个系统的集成投票,分歧交给必须先看页面的裁决智能体;一条流水线提议每字段的框,人工逐字段接受/编辑/置 null/重画,得到 169 份人工核验文档(84% 字段带人放框)。评测时把输出拍平为单元,用匈牙利算法对齐记录,归一化后精确匹配,算微平均 P/R/F1 再做文档级无权重平均;溯源只在有人验框的字段上评,词框 $\text{IoU} \geq 0.5$ 才算接地。

技术新颖性

和已有技术的本质区别体现在四个层面。(1) 对比固定本体 KIE 基准(SROIE/DocILE/RealKIE),字段不预设而是用户推理时给 schema。(2) 对比 ContextualAI ExtractBench [12]——两者同名但范围完全不同,前者只 5 个 schema、强调 schema 复杂度且不含手写、不计成本、不评溯源;本文 67 schema 且四维齐评。(3) 对比 LongArray/LongExtract-50,本文不是几十份合成文档,而是 370 份真实+合成混合,跨 8 域并含真实扫描与手写。(4) 真值方法上,用“模型池一致+裁决”替代“单系统输出当真值”避免偏向,用“数据先行渲染”替代“先文档后标注”实现任意长精确真值,用“退化重拍保留真值”隔离捕获效应——这些都是工程上的新颖组合,让大规模、高质量、可归因的评测第一次成为可能。

ExtractBench scores schema-guided extraction on real enterprise documents
Figure 1: ExtractBench scores schema-guided extraction on real enterprise documents
ExtractBench coverage across the five tag axes
Figure 2: ExtractBench coverage across the five tag axes
How ground truth is constructed, one strip per source type
Figure 3: How ground truth is constructed, one strip per source type

实验结果

核心发现分几条。质量-成本前沿(Figure 4):VLM 占据低价区($\leq 1.0$ ¢/page)但都没破 80% F1(GPT-5.4 Nano 74.9%、Gemini 3.5 Flash 79.8%);编码智能体达 87.1%/93.6% 但要 16.2/27.8 ¢/page;专用 API 跨度大,LlamaExtract 三档勾勒前沿——Cost-Effective 86.8%@1.0¢、Agentic 89.5%@3.1¢、Agentic Plus 95.6%@8.1¢。Agentic Plus 在更低成本下击败两个编码智能体(Codex 93.6%@27.8¢、Claude Code 87.1%@16.2¢)。长度效应最触目惊心:Gemini 3.5 Flash 从短文档 87.9% 暴跌到长文档 27.9%,所有商业 VLM 在长文档上跌破 40%;而 Agentic Plus 三档稳定(96.6/93.3/94.4%)。作者归因为上下文限制——一次性 VLM 无法贯穿长文档,没迭代策略就提前停止截断记录,Table 13 的 precision-recall 差距证实这点(Gemini 长 $\Delta=P-R=57.2$、GPT-5.4 Nano 37.5)。任务挑战:T1 长列表完整性 Agentic Plus 96.1%、Reducto 94.8% 领先;T3 密集文档重排排名(Reducto 跌到 87.5%、Datalab 跌到 54.4%),Agentic Plus 95.5%、Codex 95.4% 领先。表格结构里超大表 S4 区分度最强:所有 VLM 低于 10%(Gemma4/Qwen 几乎 0),Datalab 32.7%、Extend 24.8%,而 Agentic Plus 95.9%、Reducto 95.3%、Claude Code 87.8% 顶住。感知挑战暴露系统盲点:Codex 在旋转/纯图 P1 掉到 81.0%,Reducto 在扫描 P2 掉到 81.1%,Qwen 在扫描和手写上反而 $>92\%$。溯源差距(Table 3)是最醒目的发现:所有 VLM 与编码智能体默认不返回证据,两级溯源全 0;即使最好的专用系统,词级 F1 也只有 46.4%(Agentic Plus),页级 84.9%——定位到词远比定位到页难,且 Extend/Datalab 在长文档上词级直接归零。模型家族内标度(Figure 8)也反直觉:GPT 是唯一单调提升的家族(74.9→85.2→88.7),Gemini 跨 tier 基本持平(79.6→79.8→78.2),Claude 甚至非单调(29.9→31.5→30.1)。

Comparison of representative fixed-ontology and schema-guided extraction benchmarks
Table 1: Comparison of representative fixed-ontology and schema-guided extraction benchmarks
Unified value F1 (%) by dimension and system
Table 2: Unified value F1 (%) by dimension and system
Grounding score (%)
Table 3: Grounding score (%)
Overall unified value F1 versus mean document-level cost per page
Figure 4: Overall unified value F1 versus mean document-level cost per page
查看结构化数据
任务指标本文基线提升
整体抽取准确率(370 文档) Unified Value F1(越高越好) LlamaExtract Agentic Plus 95.6%(8.1 ¢/page) Codex GPT-5.5 93.6%(27.8 ¢/page);Gemini 3.5 Flash 79.8%(1.0 ¢/page) 比最强编码智能体高 2.0 分且成本仅约 1/3
长文档抽取(L3,>50 页,20 文档) Unified Value F1 LlamaExtract Agentic Plus 94.4% Gemini 3.5 Flash 27.9%;GPT-5.4 Nano 35.8%;Gemma4 26B 12.2% 比 Gemini 高 66.5 分,揭示 VLM 的长文档截断问题
超大表格完整性(S4,>1000 行,12 文档) Unified Value F1 LlamaExtract Agentic Plus 95.9%;Reducto 95.3% 所有商业 VLM <10%(Gemma4 0.0%);Datalab 32.7%;Extend 24.8% Agentic Plus 比 Datalab 高 63.2 分
词级视觉溯源 Word-level Grounding F1(IoU≥0.5) LlamaExtract Agentic Plus 46.4%(最佳) 所有 VLM 与编码智能体 0.0%(默认不返回证据);Datalab 2.0% 仍是开放问题,最佳系统也仅 46.4%
页级溯源(长文档) Page-level Grounding F1(L3 切片) LlamaExtract Agentic Plus 87.1% Extend Max 0.0%;Datalab 0.0%;Reducto 67.3% Agentic Plus 比 Reducto 高 19.8 分且在长文档上稳定

局限与改进

作者承认的局限:合成长列表虽然精确但“无法捕捉真实企业数据的视觉多变性与感知挑战”(Section 4.1);即便最好的系统,词级溯源 F1 也只有 46.4%,“把每个值可靠地连到其确切证据仍是开放问题”。我观察到的更多局限:领域分布严重不均——房地产仅 6 份(1.6%)、法律 10 份、医疗 15 份,小领域统计噪声大;长文档只有 20 份(5.4%),却占了 37.3% 的页数,少数几份极端合成文档(如 26,725 行未认领财产清单、8,624 条债权人地址块)可能过度影响长文档结论;基准是英文中心的,未覆盖多语言/跨文化版式;T3.d filer-reviewer separation 只有 13 份 W-14,Claude Code 在此得 0 分可能是部署配置(大 schema 拒绝)而非能力问题;所有定价为 2026-07-01 快照,未含批量/企业折扣,可能高估真实部署成本。

独立分析的弱点

弱点一,溯源仍是最大短板——VLM 和编码智能体默认零证据,意味着任何需要审计的工作流都必须叠加独立的证据定位组件,这推高了系统复杂度。改进方向:让结构化输出 API 原生支持“值+词框”联合生成,或训练专门的轻量定位头。弱点二,长文档评测样本太少(20 份)且高度依赖极端合成文档,结论可能脆弱;改进方向:扩充真实长文档(如完整 10-K 年报、跨年基金持仓),并报告置信区间。弱点三,挑战标签虽独立但仍可能混淆——例如 T3 密集文档里混了表单版式、文档分类、审核标注、schema 大小多种难度源,单分数无法分辨;改进方向:把 T3 进一步拆分到子标签级别报告(作者已在 Table 14 部分做到,可更彻底并给出每子标签的样本量)。弱点四,领域覆盖偏金融/能源(D1+D2 占 65.7% 页数),对医疗、法律等高价值但低占比领域的代表性不足;改进方向:定向补充这些领域的真实文档。

未来方向

作者明确指出的方向:词级溯源是最清晰的改进点,需要让抽取系统原生返回证据。基于成果可延伸的方向:(1) 把基准扩展到多语言与跨文化版式(如中文发票、日文报表、阿拉伯文表格),测试 VLM 的跨语言泛化;(2) 引入“增量抽取”评测——当 schema 增删字段时系统是否需要重跑整份文档,这是生产中频繁发生的场景却几乎没被基准化;(3) 研究混合架构,让 VLM 做快速初抽、编码智能体或定位头做补全与溯源,在 Agentic Plus 的质量-成本点上进一步压低成本;(4) 把“挑战标签→失败模式”的映射做成自动诊断工具,帮企业按自身文档分布预测哪个系统最适合;(5) 跟踪模型迭代——本文显示 Gemini 跨 tier 质量基本持平(79.6→79.8→78.2)、Claude 甚至非单调,说明“换更大模型”未必提升抽取,值得系统研究抽取能力与模型规模的标度律。

复现评估

复现性较好。数据集与评测代码已在 HuggingFace 和 GitHub 开源(论文首页标注 Dataset / Evaluation code)。14 个系统的 prompt 与配置在 Appendix C.1 逐字给出——VLM 的系统提示、用户提示、编码智能体的共享任务提示原文都列出,包括“对大表格优先写本地脚本解析”“对表单优先直接抽取”等具体指令;成本核算规则与 2026-07-01 的厂商定价表在 Appendix C.2(Table 10 的 token 价、Table 11 的解析/抽取信用价)。退化重拍的“配方与种子都记录,可字节级复现”,OpenAI 的 2× 输入/1.5× 输出长上下文附加费、Anthropic Opus 4.7+ tokenizer 多发 30% token 等细节也都标注。主要挑战是算力与 API 费用:编码智能体每文档 1200 秒超时、Codex 在长文档上 4.3¢/page 但短文档 35.8¢/page,全量跑 14 系统成本不低;四个自托管 OSS 模型(Lift 9B、NuExtract3、Qwen3.6 35B-A3B、Gemma4 26B)需要 GPU 但无 API 价故未计入成本对比。整体复现难度中等——脚本与数据齐备,主要门槛是商业 API 的预算与厂商版本漂移(模型与价格都标注 as of July 1, 2026)。