← 返回 2026-08-18

文档抽取的逐字段选择性风险控制:三种失效模式、有效性阶梯与条件化何时有效 Valid Per-Field Selective Risk Control for Document Extraction: Three Failure Modes, a Validity Ladder, and When Conditioning Pays

Bhaskar Gurram 📅 2026-07-28 👍 2 2026-08-23 18:30
LLM评估 PAC保证 不确定性量化 共形风险控制 文档信息抽取 选择性预测

诊断文档抽取朴素风险保证的三种失效模式,提出四级有效性阶梯与条件化两regime定律

前置知识

选择性风险与接受/复审契约

文档抽取系统对每个输出字段给出接受或复审的决策,选择性风险定义为被接受字段中的错误率 $R = P(E=1 \mid S \ge t)$,其中 $E$ 是错误指示、$S$ 是置信分、$t$ 是阈值。目标是最大化覆盖率(被接受字段占比),同时约束选择性风险不超过目标 $\alpha$。add-one 平滑规则用 $(1+\#\{\text{errors among accepted}\})/(1+\#\{\text{accepted}\}) \le \alpha$ 代替原始比例,以获得有限样本的期望风险控制(Geifman & El-Yaniv 的选择性分类界)。

本文的全部贡献——失效诊断、四级阶梯、两 regime 定律——都围绕这个量的不同保证形式展开,读不懂选择性风险就无法理解各级证书的差别。

Mondrian 条件化(分组共形)

把样本按某个分类法(taxonomy)划分成组,在每组内独立执行同一阈值规则,从而从边缘保证升级为逐组条件保证。其代价是组内校准样本量 $n_g$ 变小,有限样本证书的代价按 $O(\sqrt{\log(K/\delta)/n_g})$ 增长,组太小时证书会塌缩为空。

support-bin、fieldtype 等条件化分类法的实验结果,以及'条件化何时值得'的两 regime 定律,全部建立在 Mondrian 机制的收益-代价权衡上。

Learn-then-Test (LTT)

把风险控制转化为多重检验问题:对每个候选阈值 $t$ 检验原假设 $H_0: \text{risk}(t) > \alpha$(用 Clopper-Pearson 精确二项尾 p 值),再用 Holm 步降等族错误率(FWER)控制方法选出通过检验的阈值。通过者即携带有限样本 PAC 证书:以至少 $1-\delta$ 的概率,真实选择性风险 $\le \alpha$。

本文的严格层(tier 3–4)正是 LTT 用精确二项尾与 Holm+固定序列 'mix' 规则的实例化,是理解 0.171@0.068 这类认证数字的前提。

设计效应

当观测在簇内相关(同一文档的字段错误相关)时,方差相对独立同分布情形膨胀 $deff = 1+(m-1)\rho$,有效样本量约为名义值的 $1/deff$。本文在文档级切分下实测设计效应为 1.84–2.45,意味着字段级二项证据被高估约两倍、有效校准规模约减半。

它解释了字段-iid 证书为何仍能保守成立,也是簇校正变体 ltt.neff(用 plug-in 设计效应缩减二项 $n$)的动机。

可交换性(exchangeability)

若数据的联合分布在任意置换下不变(比 iid 更弱),则校准集与测试集可交换,add-one 等校准规则才能把校准风险转化为主导分布的保证。文档级切分下同文档字段强相关,字段并非 iid,可交换单元其实是文档而非字段。

这直接引出 tier 4 的存在理由:文档-iid 是唯一与文档数据生成过程匹配的假设层级,尽管其证书代价高昂(覆盖率仅 0.060)。

PAC 有限样本保证

形式为 $P(\text{真实风险} > \alpha) \le \delta$ 的高概率界:$\alpha$ 控制精度、$\delta$ 控制失败概率,对单次部署的坏事件概率给出约束。它与'期望风险 $≤ \alpha$'的平均保证不同——后者允许一半部署超预算,只要均值达标。

本文实用层 viol=0.475(47.5% 切分违约)与严格层证书的对比,正是平均保证与 PAC 保证的实际差距,是选层决策的核心。

研究动机

文档解析模型已能流利读取页面,却仍会静默输出错误的结构化字段值。业界因此形成逐字段信任契约:每个抽取字段附带置信度与接受/复审决策,承诺被接受字段中的错误率(选择性风险)不超过目标 $\alpha$。最自然的实现是经验做法:拟合置信度打分,留出校准切分,用 add-one 平滑的经验选择性风险选最小阈值。本文在真实前沿 LLM 输出上证明这套经验做法会静默违约,失效机制有三个且此前从未被量化:其一,字段在文档内强聚类(设计效应 1.84–2.45),有效校准规模约减半,pooled add-one 在 CORD 上风险 0.105、50% 切分违约;其二,高容量打分与其阈值拟合同批字段造成泄漏,同半协议下覆盖率 0.416、风险 0.127,名义 $\alpha=0.10$ 时 95% 切分违约;其三,离散打分的并列质量病理,一次捕获中 NLI 信号整列归零使融合分从 1,702 个不同值塌缩到 257 个,认证覆盖率从 0.030 崩至 0.001。测试床刻意困难且真实:claude-sonnet-5 在 800 张 CORD 收据上产生 13,859 个真实字段预测,仅 49.0% 正确。

本文的目标是本文的目标分四层。(1) 诊断:对三种失效模式各设计一个反事实实验钉死因果,量化其幅度(聚类的设计效应、泄漏导致的 0.127 风险、并列导致的网格塌缩)。(2) 协议:把修复方案组织成'有效性阶梯'报告标准,每一级明确陈述保证单位(字段/文档)、假设(字段 iid/文档 iid)与估计对象——实用层控制期望选择性风险 $\mathbb{E}[\text{sel. risk}] \le \alpha$,严格层给出每组的 PAC 证书 $P(\text{risk} > \alpha) \le \delta$,并同报每级的违约切分比例。(3) 结果:首次在 13,859 个真实前沿 LLM 字段上给出保持名义风险的操作点与逐级 PAC 证书,并检验预注册的 provenance 条件化分类法(grounding 派生的 support-bin)是否在各级严格性下获胜。(4) 刻画:总结'条件化何时有效'的两 regime 经验定律,给出理想边界情形的形式化命题并在三个语料库上验证符号预测,最终发布种子固定、回归门控的可复现工具。

与已有工作不同的是,作者明确声明不提出新的共形理论——机器是经典的(Mondrian 共形、conformal risk control 与 Learn-then-Test、Clopper-Pearson 精确二项尾、Holm 步降)——贡献在于诊断、协议、认证应用与刻画,这个定位本身即是切入角度:把已知理论正确搬到真实文档 LLM 输出上,暴露并修复搬运途中的三个坑。此前没有工作为文档抽取量化过这三种失效模式;Beyond Logprobs、Cleanlab TLM 等置信度工作既不附加 grounding 也不提供风险受控的接受/复审保证;CRC-certify 有字段级弃权界却不条件化于 provenance、不诊断文档特有失效。本文把 grounding 支持度用作风险控制的条件化协变量而非输出格式,用外部验证信号填补语义熵与自一致性共有的盲区(自洽的错误),并把歧义惩罚设计成 support = score/$m$($m$ 个同等好匹配下按均匀先验保留 $1/m$)。最后,support-bin 在规模化实验前即被预注册为项目论点,配合 Bonferroni 校正与冻结配置的一次性确认,主动封堵'选最好格子'的选择自由度。

核心方法

整体思路是'按严格性分层、按假设对号入座'。直觉:工程团队只需平均意义上的风险控制,审计场景需要 $P(\text{violation}) \le \delta$ 的逐部署证书,所以给出四级阶梯而非单一方法。(1) 实用层(tier 1):学习融合打分 + fit/val 切分协议 + add-one 规则 $\tau = \min\{t: (1+\#\{c_i \ge t, \text{err}_i\})/(1+\#\{c_i \ge t\}) \le \alpha\}$,控制期望选择性风险。(2) 共享低容量层(tier 2):5 信号逻辑回归 + support-bin Mondrian 条件化。(3) 字段-iid PAC 层(tier 3):Mondrian Learn-then-Test,每组内对候选阈值做精确二项尾检验,$\delta$ 预算一半给 Holm 步降、一半给固定序列('mix' 规则),并提供按实测设计效应缩减二项 $n$ 的簇校正变体。(4) 文档-iid PAC 层(tier 4):可交换单元换成文档,用 doc-Hoeffding 界认证宏观看文档平均错误率。全部实验在 40 个固定文档级 50/50 切分(seed 7,文档绝不跨切分)上取均值,无容差带,同报 viol(实际风险超 $\alpha$ 的切分比例)。

核心创新有三。第一,fit/val 切分协议:高容量学习打分与其阈值拟合同批校准字段时,打分的乐观性会泄漏进阈值——深度 3 梯度提升融合在同一半协议下给出看似亮眼的 0.416@0.127、95% 切分违约;修复靠协议而非换模型:打分只在校准半区内部的拟合半训练,阈值只在未触碰的阈值半计算,同一打分由此移到有效的 0.266@0.092。第二,歧义惩罚的 grounding 支持度作预注册分类法:预测值匹配 $m$ 个同等好页面位置时保留 support = score/$m$,激进降权巧合匹配,使 support-bin 在 sonnet CORD 上赢得每一严格层($p<10^{-4}$)。第三,两 regime 定律:有训练数据时协变量应放进打分(学习打分内部已消化协变量,外部 Mondrian 条件化因样本碎片化反而有害);打分冻结、弱或黑箱时协变量应放进分类法——且条件化恰在 pooled 阈值无法在目标 $\alpha$ 处认证时起作用。定律配有理想边界(组内弱打分 $\rho=0$)下的 Proposition 1–3 证明与三个语料库上的符号验证。

方法步骤详情

完整流程如下。步骤一,信号捕获:对 claude-sonnet-5 在 800 张 CORD 收据上的 13,859 个字段($k=3$ 自一致性,一次捕获后冻结)计算五个信号——口头化自报告、$k$-样本自一致性、grounded 标志、NLI 蕴含分、歧义惩罚 grounding 支持度(匹配 $m$ 处保留 score/$m$)。步骤二,打分融合:5 信号逻辑回归作共享低容量融合;深度 3 直方图梯度提升树(HGB)作学习融合,输入五信号加工程特征(值长度、数字占比、字段类型 one-hot 等),文档级早停,测试 AUROC 0.925 对 LR 的 0.871。步骤三,切分:40 个固定文档级 50/50 切分(seed 7),校准半区再分拟合半/阈值半。步骤四,实用层:拟合半训练打分与所有数据依赖变换,阈值半用 add-one 规则选最小阈值,报告覆盖率均值±标准差与 viol。步骤五,严格层:每组生成 15 个几何接受分位候选阈值并吸附到最近的不同值边界(标签无关);逐候选做精确二项尾检验 $H_0: \text{risk} > \alpha$;$\delta$ 一半给 Holm、一半给固定序列;簇校正 ltt.neff 用 plug-in 设计效应缩减二项 $n$。步骤六,评估:名义 $\alpha$ 无容差带,配对差异用 20,000 次符号翻转置换检验(下限 $10^{-4}$)加 Bonferroni 校正。

技术新颖性

新颖性不在理论而在工程化的有效性。相比置信度估计工作(Beyond Logprobs、Cleanlab TLM),本文第一个附加 grounding 并给出风险受控的接受/复审保证;相比 CRC-certify,本文诊断文档特有失效并条件化于 provenance。三个工程新意:(1) 候选阈值吸附到不同值边界——标签无关、无有效性成本,解决重并列打分的网格塌缩(病理使认证覆盖 0.030→0.001;网格修复本身只动 ≤0.004,说明病根在打分不在网格);(2) mix 规则(Holm 一半预算+固定序列一半)是三语料库上唯一从不塌缩的 LTT 变体,朴素细网格会摧毁认证(pooled 认证覆盖 0.0009 对 15 点网格的 0.0055);(3) 簇校正 ltt.neff 用实测设计效应(1.84–2.45)缩减二项证据,给出可辩护的字段级数字 0.140@0.051、零违约。理论侧,在组内弱打分假设($\rho=0$)下:Proposition 1 证明异质性加弱打分时 Mondrian 支配 pooled;Proposition 2 给出条件化的有限样本代价 $\varepsilon_g \le \frac{1}{\alpha n_g} + O(\sqrt{\log(K/\delta)/n_g})$ 且符号由校准可测量决定;Proposition 3 证明打分是充分统计量时 Mondrian 有限样本下严格更差。

实验结果

核心结果是四级有效性阶梯(CORD,13,859 字段,$\alpha=0.10$,40 切分)。实用层:学习融合 + split add-one + pooled 达 0.318±0.073 @ 风险 0.096(no-NLI 生产变体 0.326 @ 0.097),但 47.5% 的重切分实际风险超 0.10——平均保证而非证书。共享低容量层:LR × support-bin 0.212±0.030 @ 0.095。字段-iid PAC 层:LTT mix × support-bin 认证 0.171±0.034 @ 0.068,仅 1/40 切分违约;簇校正 0.140±0.026 @ 0.051、零违约。文档-iid 层:仅 0.060±0.058 @ 0.020,19/40 切分认证为零,近乎空洞。条件化上,support-bin 在 sonnet CORD 赢得每一严格层(add-one 0.218 对 pooled 0.134;LTT 0.171 对 0.091–0.098;doc-LTT 0.060 对 ≤0.006,均 $p<10^{-4}$),但胜利是模型与语料双重范围的:同样文档上 haiku/qwen 的 PAC 层塌缩至 ≤0.005,FUNSD 上 pooled LTT 0.280 反胜分类法。冻结配置确认在未触碰的 haiku 捕获上保持名义(0.167@0.093;$\alpha=0.05$ 时 0.068@0.037),Qwen2.5-14B 上 0.149@0.099(对 4 信号 LR 约 6×);三方盲评人类审计证实实用层接受集风险 1.3%(2/149,Fleiss $\kappa=0.83$),自动标签单边悲观(21% 被标记错误实际正确)。严格性价格:$\alpha=0.10/0.15/0.20$ 时证书保留无效基线覆盖率的 28%/42%/84%,$\alpha=0.05$ 时为 0%。

Genuine per-field captures used in this paper
Table 1: Genuine per-field captures used in this paper
Ablation of the ambiguity-penalty form: support retained for a unit-score match found at m equally-good locations
Table 2: Ablation of the ambiguity-penalty form: support retained for a unit-score match found at m equally-good locations
Three diagnosed failure modes, each pinned by a counterfactual (all at nominal α=0.10, 40 document-level splits)
Table 3: Three diagnosed failure modes, each pinned by a counterfactual (all at nominal α=0.10, 40 document-level splits)
The validity ladder (CORD, 13,859 genuine claude-sonnet-5 fields, nominal α=0.10, δ=0.10 for PAC tiers)
Table 4: The validity ladder (CORD, 13,859 genuine claude-sonnet-5 fields, nominal α=0.10, δ=0.10 for PAC tiers)
Taxonomy × tier on CORD at α=0.10 (shared 5-signal fusion; coverage (risk) [viol])
Table 5: Taxonomy × tier on CORD at α=0.10 (shared 5-signal fusion; coverage (risk) [viol])
Generalization at nominal α (FUNSD 与 XFUND-de)
Table 6: Generalization at nominal α (FUNSD 与 XFUND-de)
Predicted vs measured sign of the conditioning gain (Proposition 2)
Table 7: Predicted vs measured sign of the conditioning gain (Proposition 2)
Certified coverage retained vs the invalid add-one baseline (6.9k CORD dump, support-bin)
Table 8: Certified coverage retained vs the invalid add-one baseline (6.9k CORD dump, support-bin)
查看结构化数据
任务指标本文基线提升
CORD 逐字段选择性风险控制(α=0.10,实用层) 覆盖率 @ 选择性风险(40 文档级切分均值) 0.318 ± 0.073 @ 0.096(HGB 学习融合,split 协议,pooled);生产 no-NLI 变体 0.326 ± 0.046 @ 0.097 5 信号 LR pooled add-one 0.134 @ 0.080;同半重拟合的无效操作点 0.416 @ 0.127(95% 切分违约) 对 LR 对照 +0.184 覆盖率(p < 10^-4),同时把失效操作点修复为有效
CORD 严格 PAC 认证(δ=0.10,LTT binom. mix per-group × support-bin) 认证覆盖率 @ 风险(viol 违约切分比例) 0.171 ± 0.034 @ 0.068(viol 0.03);簇校正 ltt.neff 0.140 @ 0.051(零违约) pooled LTT 0.091–0.098 @ 0.057–0.060 +0.073–0.080 认证覆盖率(p < 10^-4,Bonferroni 校正);doc-iid 层 0.060 对其他分类法 ≤0.006
claude-haiku-4-5 冻结配置确认(选择未触碰,α=0.10 / 0.05) 覆盖率 @ 风险 0.167 @ 0.093(viol 0.38);0.068 @ 0.037——两档均保持名义 4 信号 LR 基线 0.011 约 15×,且为首次在选择无关捕获上的独立复现
Qwen2.5-14B(vLLM 本地部署)冻结配置(α=0.10) 覆盖率 @ 风险 0.149 @ 0.099(viol 0.47);no-NLI 变体 0.138 @ 0.088;α=0.05 时 0.048 @ 0.036 4 信号 LR 0.022 约 6×,风险契约在两个未触碰捕获上均未失败
FUNSD / XFUND-de 泛化(名义 α) 覆盖率 @ 风险 FUNSD 实用层 0.491 @ 0.093;LTT × pooled 0.280 @ 0.058;XFUND-de 小数据配方(4 信号 LR)0.427 @ 0.087 FUNSD 分类法条件化不显著;XFUND-de 学习融合无优势 定位阶梯适用边界:易语料上 pooled 胜(0.280 对 support-bin 0.149),provenance 条件化是困难 regime 工具

局限与改进

作者坦承的局限:只有 CORD×sonnet 获得非平凡认证(FUNSD 严格认证 0.128 但分类法提升不显著,XFUND-de 仅 42 文档);文档-iid 层近乎空洞(0.060,47.5% 切分认证为零),有功效的文档级 PAC 是点名开放问题;理论只覆盖 $\rho=0$ 理想边界,无一般情形的量化速率,Proposition 2 是最坏情形界;符号预测验证仅 n=3。推断是语料内的:40 次重切分共享文档,$p<10^{-4}$ 是切分稳定性而非总体显著性,且规模 dump 与最初选择 support-bin 的 400 文档 dump 重叠,独立检验只有冻结配置运行。标签质量上,FUNSD 自由文本正确性依赖协议(一致性 $\kappa=0.10$ 对 CORD 的 0.78),对噪声标签的证书只是关于这些标签的证书;人类审计仅 149 字段、未覆盖 FUNSD/XFUND。我自己的观察:实用层 viol=0.475 意味着约一半部署实际风险超预算,均值控制(0.318)与逐部署证书(0.171)的取舍是采用时的核心决策;support-bin 胜利绑定于强信号模型(verbalized AUROC 0.845),换到 0.610–0.684 的模型即塌缩,实践需逐模型重验证;头版实验用文本层提示(读 OCR 文本层而非页面图像),对真正视觉抽取器的外推需谨慎。

独立分析的弱点

独立分析的弱点:第一,实用层的保证形式易被误读——47.5% 切分违约意味着逐次部署没有保护,而工程团队很可能直接引用 0.318 那一行;改进方向是把 viol 提升为一级报告指标,或提供保守系数可调的变体(如按 $\alpha/2$ 校准)。第二,簇校正 ltt.neff 用 plug-in 设计效应直接缩减二项 $n$,未传播 deff 估计自身的不确定性,小样本组可能有残余超支;改进方向是对 deff 取保守上界或 bootstrap 传播。第三,五个信号全部依赖捕获阶段工程(NLI 模型、$k=3$ 自一致性、grounding),任何环节静默失败都会复现并列质量病理——论文自己的首次捕获就带过全零 NLI 列直到事后取证才发现;改进方向是把完整性检查(不同打分值数、并列质量、信号非零率)做成捕获门槛与实时告警。第四,人类金标审计仅覆盖 CORD 实用层接受集的 149 字段,被拒绝集质量、FUNSD/XFUND 的悲观偏差未验证;应扩展审计范围。第五,tier 2–4 在阈值半重拟合 5 参数 LR 属形式上的前提违背(作者披露实测 ≈0),但 tier 4 的 0.060 与完全冻结的 0.006 之间一个数量级的差距提示更严格协议可能让文档级证书彻底不可用,值得更透明讨论。

未来方向

作者点名的方向:有功效的文档级 PAC 程序(聚类/方差自适应界),使 tier 4 从 0.060 的近乎空洞变为实用;$\rho>0$ 一般情形的量化速率与非最坏情形惩罚;haiku 与开放权重抽取器上的完整阶梯(已排队);人类金标扩展到 FUNSD/XFUND。基于成果可延伸的:(1) 把 Proposition 2 的符号预测(组误差缺口 vs 群体惩罚,均为校准可测量)做成在线诊断器,自动推荐'协变量进打分还是进分类法'——Table 7 已给出原型且三语料库全对;(2) 信号质量与条件化收益的跨模型定量关系:sonnet 上 support-bin 获胜、haiku/qwen 上 PAC 层塌缩,verbalized AUROC 0.845/0.684/0.610 对应实用层覆盖 0.326/0.149/0.167,值得建模为模型选型预测工具;(3) 已发布但未评估的 trust-gated 智能体层(repair/adjudicate/adaptive-k)与风险控制闭环:复审预算约束下的升级策略优化;(4) 跨语料证书:当前保证全部单语料内,分布漂移下的证书更新(在线共形、加权重校准)是自然下一步;(5) 与同伴基准论文的模型测量结合,把'信号质量决定可认证覆盖率'从经验观察升级为可操作准则。

复现评估

复现条件在同类工作中非常优厚。作者以 Apache-2.0 发布 VerifyDoc:可 pip 安装的库、CLI、复审 UI、MCP 服务器,以及能从配置再生论文每个数字的评估 harness——固定 seed(40 个文档级 50/50 切分,seed 7)、跨实验链式位精确 sanity gate、463/624 单元位相同的回归检查(最大头版漂移 0.0088)。真实 LLM 捕获一次捕获后冻结并随文发布(CORD/FUNSD/XFUND-de × sonnet、haiku 确认捕获、Qwen2.5-14B 捕获),因此复现主表甚至不需要重新调用商业 API;若要重新捕获,需要 claude-sonnet-5/claude-haiku-4-5 的 API 访问与 Qwen2.5-14B 的本地 vLLM 部署(14B 模型单卡即可),外加一个 NLI 模型做蕴含打分。附录 B 完整披露了一次捕获阶段数据缺陷(全零 NLI 列)及取证过程,包括零化反事实实验,是可信度上的显著加分项。难度评估:跑通 harness、再生成表格为低难度(种子固定+回归门保证位级一致);复现捕获与跨模型扩展是中等难度,成本在 API 与 NLI 推理;真正的难点不在算力而在正确解读四级保证的适用范围与假设边界。