← 返回 2026-07-15

SynthDocBench:面向长上下文视觉文档理解的全合成受控基准 SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding

Abhigya Verma, Khyati Mahajan, Amit Kumar Saha, Shruthan Radhakrishna, Sagar Davasam, Vikas Yadav, Sai Rajeswar Mudumba 📅 2026-07-11 👍 69 2026-07-19 18:30
合成数据 图表理解 文档问答 视觉语言模型 长上下文基准

首个全合成长文档视觉理解基准,系统揭示VLM三类失败模式

前置知识

视觉语言模型(Vision Language Model, VLM)

能同时处理图像与文本的多模态大模型,可对页面图像做问答、读图表、跨页推理。本文评估的 Gemini-3.1-Pro、GPT-5.4、Qwen3-VL 等都属此类,它们在单页 DocVQA 上已接近饱和(>95%),但在长多页文档上仍表现不佳。

理解本文的前提是被测对象是 VLM,且需要区分纯视觉输入(页面图像)与 OCR 文本输入两种截然不同的能力。

文档视觉问答(Document VQA / DocVQA)

给定文档图像回答问题的任务,单页基准 DocVQA 已近饱和;多页扩展如 MMLongBench-Doc(最强仅 57%)、LongDocURL、M-LongDoc 则聚焦长 PDF 理解。本文基准平均 51.1 页,处于该谱系的长文档端。

本文正是要诊断'为什么长文档场景下模型远不如单页',需要先理解现有文档 VQA 基准的能力边界与诊断盲区。

跨模态推理(Cross-modal reasoning)

把分布在不同位置的文本与图表证据联合起来作答的能力。本文 cross_modal 子集刻意把支撑图表与佐证文本放在不相邻的远距离章节,测试长程跨模态对齐,结果证明这是所有模型最难的一类任务。

三类失败模式之一即跨模态整合崩塌,理解这一概念才能读懂为何 cross-modal 子集始终最难。

LLM-as-judge 评估

用一个强模型(本文为 GPT-5)对被测模型的作答打分。本文采用 0-10 分细则,阈值 $\tau=6$ 记为正确,并用 Gemini-3.1-Pro、Claude-Sonnet-4.5 作交叉裁判验证一致性(3.5 ACC 点内,$r \geq 0.94$)。

理解裁判协议与置信区间(bootstrap 2000 次)是判断排序是否统计稳健的关键,否则无法判断 0.725 vs 0.655 的差距是否可信。

受控/组合基准设计(Combinatorial controlled benchmark)

源自 bAbI、SCAN、CLEVR 的思想:用程序化生成让每个困难因素独立变化,从而把失败归因到具体原因。本文把文档长度、页面深度、模态构成、问题类型设为四个正交轴,配合 6 种版面原型与 24 种图表类型,并用 40% 随机版面覆盖防伪相关。

这是本文区别于真实数据基准的根本方法论,决定了它为何能'受控归因'三类失败模式。

研究动机

现有视觉语言模型(VLM)在文档理解基准上表现亮眼——前沿模型在 DocVQA 上已突破 95%、在 ChartQA 上达到 89%。然而真实文档同时交织了多个困难因素:文档长度、版面复杂度、模态构成(文本/表格/图表)以及问题难度,这些因素共同变化,使得当模型在一份真实文档上失败时几乎无法把失败归因到具体原因。更关键的是,现有长上下文基准(如 MMLongBench-Doc 最强模型仅 57%、LongDocURL、M-LongDoc)都基于真实文档、追求覆盖广度而非受控诊断:答案深度、呈现模态、版面密度、跨页证据整合等困难来源相互混杂、无法解耦。而 ChartQA、ChartQAPro、ChartMuseum 等图表基准虽暴露了 30 个百分点以上的退化,却都把图表从其天然所在的多页语境中剥离出来孤立评估。诊断盲区由此产生。

本文的目标是本文目标是构建一个完全合成、可受控的基准 SYNTHDOCBENCH,对长上下文视觉文档理解中的 VLM 失败模式做首次系统性分解。核心做法是把文档长度、页面深度、模态构成、问题类型作为四个相互独立的轴加以变化,通过组合设计让每个因素单独改变,从而实现受控分析。基准拆成三个任务子集:chart 阅读子集覆盖 24 种 D3.js 图表类型(含 dumbbell、lollipop、slope、sparkline 等视觉歧义形式)要求精确读数;cross_modal 子集把支撑图表与佐证文本放在不相邻的远距离章节测试长程跨模态对齐;complex 子集则要求组合 2-4 个证据单元,难度从 L1(直接查值)到 L5(跨章节综合)。整个流程用 LLM 端到端生成,并通过双层文档设计让答案由构造决定(deterministic by construction),消除真实文档基准的标注瓶颈。

与已有工作不同的是,本文独特切入角度在于把'合成控制'这一源自 bAbI、SCAN、CLEVR、RAVEN、PuzzleVQA 的诊断思想,首次系统迁移到长上下文视觉文档理解这个'混杂因素最严重'的场景。合成控制用生态效度换取可解释性,从而能把失败归因到具体原因而非一团不可拆解的混杂变量。与所有现有基准相比,SYNTHDOCBENCH 的本质区别在于:它是唯一把长度、深度、模态、问题类型同时作为独立轴受控、并把图表作为首要推理目标(其解读需要与任意远距离上下文证据交互)的诊断仪器。它平均 51.1 页、约 20568 词,页数上与 LongDocURL 相当但文本密度远超 MMLongBench,处于长度与密度双轴的前沿区域,填补了图表评估与长文档评估两者交集的空白。

核心方法

方法整体思路遵循'先直觉后技术'。直觉是:与其从真实文档里艰难拆解混杂因素,不如用一个可控的合成管线'长出来'文档,让每个困难维度可独立拨动。技术路线是三阶段耦合管线。第一阶段文档生成:把主题种子 $\tau$ 映射成一份带样式、视觉丰富的报告 $D$ 和一个文档级 QA 清单 $M$。第二阶段 QA 生成:把清单 $M$ 转换成难度可控的问答对。第三阶段 vision-only 评估:模型只能看到渲染出的页面图像,永远接触不到 HTML 源码、嵌入元数据或 $M$。整个流程的关键是'双层文档设计'——每个可视化同时以两种对齐形式存在:一种是人眼可见、出现在文档里的 D3.js 渲染图,另一种是记录图表语义(坐标轴、数据点、派生洞察)的结构化元数据对象 $V_k$,后者只用于推导真值、绝不喂给被测模型。这样真值由构造保证,无需事后解析图表或人工标注。共生成 200 份报告、1788 道题。

核心创新点是'双层对齐 + 组合受控'的组合拳,与已有方法的本质区别有三层。其一,双层文档设计使每个图表既是可见渲染又是隐藏的结构化元数据块,真值直接从生成文档时所用的同一套结构化产物派生,从根本上消除真实文档基准的标注瓶颈与解析噪声。其二,组合设计把长度、深度、模态、问题类型设为正交轴,每个因素独立变化,配合 6 种版面原型(dashboard、magazine、editorial、infographic、academic、brutalist)与 24 种图表类型,且每个版面原型以概率 0.6 从主题条件分布采样、0.4 均匀随机采样,专门防止模型利用主题与版面之间的伪相关。其三,难度被显式标定为 L1-L5,每题带结构化证据溯源,便于按维度切片分析失败。这种'由构造确定性'(deterministic by construction)的特性是区别于 ChartQAPro、MMLongBench-Doc 等真实数据基准的根本所在。

方法步骤详情

输入为主题种子 $\tau$,经六步流水线产出对齐对 $(D, M)$ 与问答。(1)内容生成:检索主题证据构建语义骨架,重组为暴露章节边界与数据区段的结构化中间表示。(2)设计:版面原型 $a$ 以概率 0.6 从主题条件分布采样、0.4 均匀随机采样,决定页面语法与图表放置。(3)接地可视化合成:每个可视化同时生成可见 D3.js 渲染与隐藏元数据 $V_k$。(4)验证组装:对图表/表格数值从结构化数据重算校正聚合进 $M$,HTML 经 Playwright 渲染为 PDF。(5)QA 生成:解析 $D$ 为三通道,从嵌入元数据而非像素恢复图表语义,生成 chart-reading、cross-modal、complex multi-hop 三族问题并标 L1-L5 难度。(6)评估:PDF 以 144 DPI 光栅化、拼成 5 页竖条,GPT-5 作裁判对 $(\hat{a},a^*)$ 打 0-10 分,准确率按 $\tau=6$ 计算:$\text{ACC}=\frac{1}{|Q_{\text{valid}}|}\sum\mathbb{1}[J\geq 6]$。

技术新颖性

技术新颖性体现在几个层面。首先是'由构造确定答案'的诊断范式:通过双层对齐设计,24 种图表类型、6 种版面原型上答案都由构造确定,无需事后图表解析或人工标注,这在文档基准里少见。其次是 40% 随机版面覆盖这一防伪相关机制——它主动切断主题与版面之间的捷径,使模型无法靠主题猜版面,这在 ChartGalaxy 等程序化生成工作里没有显式作为诊断保护来设计。再次是把长上下文(平均 51.1 页)与高密度图表(平均 16.7 张)这两维同时推向前沿,并以四个正交轴切片,使三类原本不可观察的失败模式(难度退化、位置敏感性、长文档下图表读数崩塌)变得可归因。最后是评估协议的严谨性:用 GPT-5 作裁判并以 Gemini-3.1-Pro、Claude-Sonnet-4.5 作交叉裁判验证(3.5 ACC 点内一致、Pearson $r \geq 0.94$),并用 OCR+文本基线把视觉感知瓶颈与文本可恢复性解耦——综合起来这是一套可复现、可归因的诊断仪器而非单纯刷榜基准。

Synthetic visual document generation pipeline.
Figure 2: Synthetic visual document generation pipeline.
QA generation pipeline.
Figure 3: QA generation pipeline.
Document composition statistics across 200 reports.
Figure 4: Document composition statistics across 200 reports.

实验结果

三组实验支撑核心发现。整体:8 个前沿 VLM 中 Gemini-3.1-Pro 以 ACC 0.725 领先,Qwen3.5-VL-122B 0.655 居次(差 7.0 pp),其后为 Qwen3-VL-235B(0.586)、GPT-5.4(0.423)、GPT-4o(0.386)≈InternVL3-78B(0.383)、Claude-Sonnet-4.5(0.314),Qwen2.5-VL-7B 仅 0.081 垫底,排序与 MMLongBench-Doc 相关(Spearman $\rho=0.657$)。难度分层:除 Gemini 外所有模型向 L5 单调退化,Claude-Sonnet-4.5 掉 23 pp 而 Gemini 持平(0.670-0.784)。三类失败模式:难度退化;位置敏感性(中段对 5/8 模型最难,Qwen3.5-VL-122B Early→Middle 掉 18.5 pp、Gemini 呈 U 型);长文档下图表读数崩塌。OCR 基线证实 chart 子集 OCR 0.297 远低于视觉 0.457,46 pp 差距锁定视觉感知为主要瓶颈。

Per-document statistics across all 200 reports.
Table 1: Per-document statistics across all 200 reports.
Performance on SYNTHDOCBENCH alongside two established benchmarks.
Table 2: Performance on SYNTHDOCBENCH alongside two established benchmarks.
Model performance stratified by difficulty level L1–L5.
Table 3: Model performance stratified by difficulty level L1–L5.
Chart-reading ACC (τ=6) by position bucket.
Table 4: Chart-reading ACC (τ=6) by position bucket.
Rendering and prompting ablations on the full 200-report benchmark (judge: GPT-5).
Table 5: Rendering and prompting ablations on the full 200-report benchmark (judge: GPT-5).
GPT-4o vision vs. OCR+GPT-4o (text-only) ACC by subset.
Figure 5: GPT-4o vision vs. OCR+GPT-4o (text-only) ACC by subset.
Hard failures: 109 questions where all six models score ≤3.
Figure 6: Hard failures: 109 questions where all six models score ≤3.
ACC (τ=6) by fine-grained question category.
Figure 7: ACC (τ=6) by fine-grained question category.
查看结构化数据
任务指标本文基线提升
长上下文视觉文档理解整体准确率 ACC (阈值 τ=6, GPT-5 裁判) Gemini-3.1-Pro 0.725 Qwen2.5-VL-7B 0.081 最强模型约为最弱的 9 倍,122B 开源模型 Qwen3.5-VL 紧追 Gemini
基准排序的外部效度 与 MMLongBench-Doc 排序相关性 Spearman ρ=0.657, Pearson r=0.683 —(无对照) 证明 SYNTHDOCBENCH 模型排序与真实长文档基准一致
图表读数的视觉感知瓶颈 ACC(视觉 vs OCR+文本) 视觉 GPT-4o 0.457 / Gemini 0.759 OCR+GPT-4o 0.297 OCR chart 与 Gemini 间 46 pp 差距锁定像素级解码为主要瓶颈

局限与改进

作者承认的主要局限:其一,渲染熟悉度混杂(rendering-familiarity confound)——SYNTHDOCBENCH 使用网页渲染(HTML/D3.js)图表,可能恰好与 Gemini 训练分布风格一致,13.9 pp 的领先差距无法完全排除该因素,作者明确建议未来用替代渲染后端来隔离长程推理效应。其二,Goodhart 定律风险:发布受控基准会让未来模型过拟合其设计选择(图表类型、版面原型、问题模板),作者用 40% 随机版面覆盖和程序化可扩展性来缓解,但仍需社区维护诊断效度。其三,合成文档生态效度有限——内容机器生成、事实不具约束力,结论不能不加批判地外推到真实文档理解性能。我自己的观察还包括:基准仅 200 份报告、1788 题,规模相对 ChartGalaxy 等百万级合成工作偏小,按版面/图表类型切片时样本可能稀疏;裁判虽做了交叉验证但 GPT-5 自身也是被评估对象(既当裁判又当选手),存在潜在循环偏好;难度标签 L1-L5 由生成管线自动赋予,其与人类感知难度的对齐程度未充分论证。

独立分析的弱点

独立分析的弱点及改进方向:其一,生态效度不足。所有文档由 LLM 在受限主题种子(地缘政治、经济、环境、科技)下生成,风格高度一致、分布单峰紧致(页数/词数/图表数均呈窄峰),与真实文档的重尾分布差异大。改进方向是引入真实文档语料的版面与术语迁移,或做合成-真实一致性校准。其二,样本规模与切片稀疏。200 份文档在 6 种版面×24 种图表类型上切分后,某些细类样本量可能不足以支撑统计稳健结论(虽报告了 bootstrap CI)。改进方向是扩大到千级文档并报告每细类 CI。其三,裁判循环偏好。GPT-5 同时充当裁判与候选模型,可能系统性偏向自身风格。改进方向是用非参评模型或众数裁判、并公开原始作答供独立复评。其四,渲染后端单一。改进方向是同时提供 Matplotlib、TikZ、表格截图等多种渲染后端,隔离渲染熟悉度。其五,缺少训练数据泄漏分析。鉴于代码与数据已公开,未来模型可能在训练中纳入该基准,建议定期轮换题库或加入对抗扰动。

未来方向

作者明确提出的未来工作:把 SYNTHDOCBENCH 扩展到更广的多模态推理场景,包括更丰富文档类型(表格、表单、混合版面报告)、更长上下文,以及更多样推理任务如多跳聚合(multi-hop aggregation)与跨文档接地(cross-document grounding)。基于本文成果可延伸的方向:其一,构建动态/对抗版基准——按模型弱点自适应生成针对其失败模式的题目,形成持续压力测试。其二,做渲染后端消融——用 Matplotlib、TikZ、纯表格等多种后端重新生成同一语义图表,量化渲染熟悉度对 Gemini 领先的贡献。其三,引入时间维度的版本化基准,定期轮换图表类型与问题模板以抵御过拟合。其四,把诊断从分类准确率延伸到可解释归因——结合注意力/中间表示探针,定位位置敏感性与图表崩塌在模型内部的具体位置。其五,将 cross-document grounding 扩展为多文档证据链推理,测试模型在多份长报告间整合证据的能力,这是真实企业检索增强场景的核心需求。

复现评估

复现评估良好。开源情况:评估源代码公开于 github.com/ServiceNow/SynthDocBench,数据集公开于 HuggingFace(ServiceNow-AI/SynthDocBench)。超参数在正文 Table 19 与附录充分披露,GPT-5 裁判的评分细则(rubric)与 prompt 在附录 L.7 完整公开,便于独立复现。统计严谨性高:报告了 2000 次 bootstrap、seed=42 的 95% 置信区间(整体 ≤±0.023,子集 ≤±0.041),并验证相邻排序模型差距均超过合并 CI 半宽。算力方面,作者估算约 150 GPU 小时用于文档渲染、200 API 小时用于模型推理与裁判评分,对学术实验室可负担但并非零成本。难度在于文档生成管线本身依赖 LLM 与 Playwright/Chromium 渲染栈,完全复现'生成'环节需相当工程搭建;而'评估'环节(用已发布数据集跑模型+裁判)则相对容易。主要不确定点是裁判 GPT-5 与候选 GPT-5 的潜在偏好循环,以及未来模型可能将该公开数据纳入训练导致的污染风险。