← 返回 2026-07-28

无需坐标或区域标签的视觉文档证据归因 Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

Zhuchenyang Liu, Yao Zhang, Yu Xiao 📅 2026-07-27 👍 3 2026-08-02 18:30
强化学习 文档智能 文档问答 检索增强 视觉语言模型 证据归因

用逐字引用+检索替代坐标框,让VLM证据归因召回率提升数倍

前置知识

证据归因(Evidence Attribution)

在问答系统中,模型不仅要给出答案,还必须指出支持该答案的文档区域(页码加边界框或文本片段),使答案可被人类或下游系统验证。它是可信赖文档智能的核心要求,区别于只产出答案的普通 QA。

本文的整个研究对象就是证据归因,理解它才能理解为何坐标接口失败会动摇 VLM 的可信度。

坐标接口(Coordinate Interface)

模型通过自回归生成数值坐标 token(如 )来表达证据位置,这一格式继承自目标检测任务,坐标通常是页面相对坐标,范围 0–1000。

坐标接口是本文诊断的对象——作者论证开源 VLM 在此接口下表现差是格式假象而非能力缺失。

归因幻觉(Attribution Hallucination, AH)

指模型给出正确答案却引用了错误证据区域的现象。本文用 AH 率 $P(\mathrm{SAA}=0 \mid \mathrm{Ans}\geq 4)$ 量化,即在答案正确的情况下未能给出合格证据引用的比例。

AH 是 CiteVQA 提出的关键指标,本文用它衡量两种接口的差距,是所有定量论断的核心度量。

GRPO(Group Relative Policy Optimization)

一种强化学习算法:对每个问题采样一组响应,用组内归一化奖励作为所有 token 共享的优势 $\hat A_i=(r_i-\mathrm{mean}\{r_j\})/(\mathrm{std}\{r_j\}+\epsilon)$,配合重要性采样比裁剪和 KL 惩罚更新策略。本文采用 DAPO 的非对称裁剪(上界 $?arepsilon_h>$ 下界 $?arepsilon_l$)以稳定训练。

本文的无区域标签训练配方正基于 GRPO,理解它才能看懂奖励如何转化为引用策略的改进。

语义块与版式解析(Semantic Blocks & Layout Parsing)

版式解析器(如 MinerU)把 PDF 每页切成带类型的语义块——段落、表格、图、图注/脚注,每块带页码和边界框。本文用这些块作为检索候选,把模型的文字引用用匈牙利算法一对一指派到块上。

语义块是语言接口把文字引用还原为像素区域的桥梁,其质量决定了方法能力上限(ceiling 88.2%)。

研究动机

在视觉文档理解(VLM 阅读多页富版式 PDF)场景中,可信性要求模型不仅给出答案,还必须把每个答案归因到支持它的页面区域。最近 CiteVQA 等 benchmark 把这一步统一表达为「坐标接口」——模型自回归地生成边界框的数值坐标 token,这一格式继承自目标检测。然而审计 20 个模型后,CiteVQA 发现即便顶级系统也经常答案正确却引用错误区域,称之为 Attribution Hallucination(归因幻觉),开源模型的证据召回率几乎不超过个位数。问题在于:在金融、法律、医疗这类对可验证性要求极高的领域,一个无法指向证据的答案几乎没有价值,而当前最强开源模型的坐标归因在 82%–97% 的正确答案上都失败。

本文的目标是本文有两个具体目标。第一是诊断性的:判断坐标接口下的归因失败究竟是「模型缺乏定位能力」还是「坐标输出格式造成的人为假象」——如果是后者,更换一种更具表达力的证据接口就应该能恢复这部分能力。第二是实用性的:在不依赖昂贵区域级(page/region-level)标注的前提下提升归因质量,因为长文档的区域级标注成本极高,现有改进系统大多需要这类监督。可量化的目标包括:把 8B 模型的 strict attributed accuracy 从 22.4 提升到 33.8,并在六个跨四家族的开源 VLM 上把证据召回率从个位数提升到 25.9–46.9。

与已有工作不同的是,本文的独特切入点是「证据接口」本身——此前没有任何工作在同一批视觉文档模型上对比不同证据接口。作者借鉴了一个被忽视的跨领域信号:在文本 RAG(GopherCite、ALCE、LongCite)中,「先逐字引用再检索定位」早已是成熟的引用范式;在界面 Agent 和自然图像中绕开坐标也能恢复 grounding;格式限制会普遍损害语言模型表现。因此他们把文本 QA 的引用-解析范式跨模态移植到页面区域:让模型只输出文字引用,由独立的版式解析器和多模态检索器把引用解析回像素区域。这种「能力在语言里、瓶颈在坐标里」的判断是全文的关键洞察。

核心方法

直觉上,可以把它想象成「让模型像律师一样逐字抄录证据,再让一个图书管理员把每段抄录精确归档到对应的文档抽屉里」。技术路线分三层。第一步,模型不再吐坐标,而是输出一个 JSON:自由答案加若干 verbatim 引用(句子、表格行/单元格、图注、注释级)。第二步,版式解析器 MinerU 把每页切成带类型的语义块(段落、表格、图、图注),每个块带页码和 bbox;多模态编码器 Qwen3-VL-Embedding-2B 把每个块的图像 crop 和每条引用都编码成向量。第三步,对每条引用用匈牙利算法做一对一指派(解线性指派问题),匹配上的块的页码和框就构成引用集。检索时故意忽略模型自报的页码(不可靠),而在全文档范围匹配,防止页码错误变成不可恢复。

核心创新是「把证据表达从坐标空间搬回模型原生语言空间,再由外部检索器跨模态还原为区域」。这和已有方法有本质区别:VISA、LAT、Chain of Evidence 都直接预测坐标,从不质疑接口本身,要么依赖大规模框监督,要么需要页面级标签。本文的判断是——失败不在模型而在格式。证据有三:把坐标框 snap 到最近块(+snap)消除了 IoU 衰减但召回仍只有 5.0%–23.5%;用问题+答案做检索能逼近引用管线,说明模型在生成语言里已编码了位置信息;闭源 Gemini-3.1-Pro 用同一坐标格式能到 68.9 召回,说明格式可学但开源模型缺监督。配套的无标签 RL 配方进一步用判官奖励驱动 GRPO,让 8B 模型 SAA 从 22.4 升到 33.8。

方法步骤详情

完整流程四步。①推理:模型接收全部页面(自适应分辨率,每页≤1 megapixel,总像素预算约 1.87×10^8),输出一个 JSON,含自由答案与若干 verbatim 引用(句子、表格行/单元格、图注、注释级)。②解析:MinerU 把 PDF 切成语义块 B(D),每块带页码 k 与 bbox b(中位数每文档 388 块),块 crop 以 150 dpi 渲染并一次性嵌入缓存。③检索:每条引用与所有块用同一多模态编码器算余弦相似度,再用匈牙利算法做一对一指派(解线性指派问题),匹配上的块的页码和框即引用集 C;故意忽略模型自报页码而在全文档匹配,防止页码错误不可恢复。④训练:每题采样 n=8 条响应,判官 Qwen3.5-9B 对答案正确性 a、证据相关性 e_rel、覆盖度 e_cov 各打 0–5 分,奖励 r=(a/5)·(e_rel+e_cov)/10,组内归一化得优势,用 DAPO 非对称裁剪 (ε_l,ε_h)=(0.2,0.28)、KL 系数 β=0.01 的 GRPO 更新 LoRA(rank 64),训练 3 轮共 144 步。

技术新颖性

新颖性体现在三处。其一,首次把「证据接口」作为受控变量:在固定 backbone、输入、评分的前提下只改证据表达方式,隔离出接口本身的影响。其二,把文本 RAG 的 quote-then-resolve 范式跨模态移植——引用是文本但被几何化打分(IoU≥0.5),需要多模态编码器对 crop 而非纯文本嵌入(约 30% 证据是非文本的表格/图)。其三,奖励完全由任意 QA 集已含的数据(问题、金答案、检索 crop)构造,判官读 crop 而非读原始引用,使「流畅但指错块的引用」得低分,奖励与框级评测对齐;而以往视觉 grounding RL 都在预测坐标或页面身份上算奖励,必然预设区域或页面标签。

Method overview
Figure 2: Method overview

实验结果

主对比(Table 1)在 719 题验证集上展开。坐标接口下六个模型 box recall 最高仅 8.1%(Qwen3.5-27B),AH 高达 82.1%–97.0%,换成语言接口,recall 跃升到 25.9%–46.9%,AH 降到 38.6%–65.4%,答案质量在 5/6 模型上变化不超过 2.3 分。阈值分解(Figure 3)更关键:坐标召回从页级 30.7% 暴跌到 IoU 0.7 的 0.0%,语言召回几乎平坦(42.3%→39.2%)。消融(Table 2)显示:+snap 消除衰减但召回仍仅 5.0%–23.5%;q+a 检索逼近引用管线,说明位置信息在模型语言里。GRPO 训练后,8B 模型 recall 39.9→51.3、SAA 22.4→33.8、AH 41.2→28.4、同页召回 63.2→73.8;代价是引用数 2.1→4.6、precision 37.6→26.5,但独立判官在更严 SAA(Ans≥4∧Rel≥4)下仍从 19.1 升到 27.4(p=6×10⁻⁷),说明增益来自更准引用。

Main results on the verified evaluation set
Table 1: Main results on the verified evaluation set
Credit-assignment controls
Table 2: Credit-assignment controls
Recall of necessary evidence as the overlap requirement tightens
Figure 3: Recall of necessary evidence as the overlap requirement tightens
Element-level decomposition of the 1,034 necessary evidence elements
Figure 7: Element-level decomposition of the 1,034 necessary evidence elements
查看结构化数据
任务指标本文基线提升
单文档证据归因(CiteVQA 验证集) 证据召回率 Rec@IoU0.5 46.9%(Qwen3.5-27B 语言接口)/ 51.3%(8B+GRPO) 8.1%(Qwen3.5-27B 坐标接口,最强开源坐标) +38.8 至 +43.2 个百分点,约 6 倍
单文档证据归因 归因幻觉率 AH(越低越好) 28.4%(8B+GRPO) 97.0%(8B 坐标接口)/ 41.2%(8B 语言基线) 约减半至三分之一
单文档证据归因 Strict Attributed Accuracy (SAA) 33.8%(8B+GRPO) 22.4%(8B 语言基线)/ 1.4%(8B 坐标接口) +11.4 / +32.4 个百分点

局限与改进

作者承认:①方法不教模型自己定位,引用→区域完全靠解析器和检索器,能力上限受限于解析器(ceiling 88.2%)。②纯图形证据无图注时无法引用,接口只能通过图注锚定图形。③指派对每条引用都返回一个块,编造的引用会被解析成「看似合理」的区域而非被标记为幻觉(附录 I 用余弦相似度做弃权可部分缓解)。④评测受 PDF 可用性约束,验证过滤器把 benchmark 从 987 缩到 719 题,且偏向有可用文本层的文档,重度扫描集未测。⑤RL 结果是单种子单 backbone,训练与评测都依赖 VLM 判官。我额外观察:语言接口对 8B 模型答案分降 6.2 分(输出预算被引用占用),小模型存在答案质量代价。

独立分析的弱点

弱点一:管线对解析器强依赖。若文档是扫描件、手写或极度异构版式,MinerU 切块质量下降会同时压低 ceiling 和指派精度;改进方向是引入解析器置信度或在 embedding 空间做软指派而非硬匈牙利。弱点二:训练判官 Qwen3.5-9B 与评测判官 Gemini-3.5-Flash 都是中小型 VLM,存在判官偏差与奖励钻空子风险(虽作者用独立判官交叉验证);可引入多判官集成或人类校准子集。弱点三:GRPO 模型靠多引用换召回(4.6 vs 2.1),precision/F1 不升反降,在追求简洁引用的场景不利;可加引用数惩罚或自适应停止。弱点四:仅评估单文档场景,多文档检索维度未触及,跨文档归因可能需要新的跨文档指派机制。

未来方向

作者提出:模型可直接命名解析器的某个块(set-of-mark 风格)而非写坐标;检索到的区域可作端到端区域监督的训练标签;判官奖励可推广到任何输出区域的模型。基于成果可延伸:①把 quote-then-retrieve 用于多文档 RAG,引用解析升级为跨文档指派。②结合附录 I 的相似度弃权做 selective prediction,用覆盖换可靠性。③把奖励的覆盖项推广到多模态纯图证据(无图注),可能需要模型先生成图描述再匹配。④在更大 backbone(30B/235B)上验证 RL 配方,看 SAA 能否逼近闭源 Gemini-3.1-Pro 的 76.0。

复现评估

复现度较高。作者承诺开源验证集问题 ID、验证过滤器、推理与检索管线、评测与对照脚本、训练配置,所有数字可从公开 CiteVQA 与 LongDocURL 复现。关键组件 MinerU、Qwen3-VL-Embedding-2B、EasyR1 均开源。算力需求明确:RL 训练约 85 GPU-hours(3×H200,28.4 wall-clock 小时),13 条件评测矩阵约 60 单 H200 GPU-hours,加诊断 <2 GPU-hours;判官调用约 18,950 次、40.9M 输入 token。难点在于训练判官与评测判官需分别用 Qwen3.5-9B(vLLM 自托管)和 Gemini-3.5-Flash(批 API),后者有 API 成本。整体对中等规模学术组可复现。