← 返回 2026-09-08

基于上下文集成评分函数的统一共形语言任务框架 Unifying Conformal Language Tasks with In-Context Ensembles

Xiao Shi Huang, Chen-Yuan Lin, Bruce Kuwahara, Kin Kwan Leung, Jesse C. Cresswell 📅 2026-09-02 👍 9 2026-09-12 18:30
LLM评分 上下文学习 不确定性量化 共形预测 内容选择

用ICL示例集成的评分函数替代人工提示,在七项NLP内容选择任务上保覆盖、提简洁。

前置知识

共形预测(Conformal Prediction)

一种分布无关的不确定性量化框架:对任意打分函数 $S(x,y)$,在带标签校准集上计算分数并取分位数得到阈值 $\hat{q}$,再用阈值构造预测集,从而在有限样本下给出 $P[\text{覆盖}] \ge 1-\alpha$ 的统计保证,不依赖任何分布假设。

本文所有保证都建立在共形预测之上:Conformal Relevance 把相关性评分函数接入共形校准流程,只有理解共形预测才能读懂覆盖率结论(如经验覆盖与目标相差 1 个百分点内)和阈值 $\hat{q}$ 的校准方式。

可交换性(Exchangeability)

指校准数据与测试数据在联合分布下交换次序不改变分布,是 IID 假设的温和推广,共形预测只需它即可成立。本文进一步证明:即使 ICL 示例按输入逐样本检索,只要示例池与校准/测试集互斥,用塔式性质对池取期望仍可恢复无条件的 $1-\alpha$ 保证。

论文 3.2 节与附录 B 的核心论证就是“逐样本 ICL 检索为何不破坏保证”,理解可交换性才能明白为什么分数级平均集成天然继承覆盖保证,而集合级集成(多数投票)会退化到 $1-2?lpha$。

上下文学习(In-Context Learning, ICL)

通过在提示中放入若干带标签示例引导 LLM 完成任务而无需更新参数,模型从示例中隐式推断任务规则。本文用“对比式”示例(被选中句子 + 未被选中句子)让 LLM 自行归纳“什么算相关”,并用检索策略决定放哪些示例。

本文用 ICL 示例策展完全替代人工撰写的“相关性定义”提示,四种示例选择策略的机制差异正是集成增益的来源,是整个方法成立的根基。

行列式点过程(DPP)

一种兼顾相关性与多样性的子集采样方法:用核矩阵的行列式给候选子集赋概率,元素间相似度越高子集概率越低,从而自动避免选出示例彼此雷同。本文在文档嵌入空间(anchor_dpp)与句级相关性方向空间(pattern_dpp)各用一次。

两种 DPP 策略是 Ens4 集成中“机制多样”的主力,理解 DPP 才能明白为何这些评分函数的错误互不重合、从而满足互补性条件 $\mathrm{Comp} > S_{\max}-S_{\min}$。

平均精度均值(MAP)

对每个样本按分数给候选句排序计算平均精度 AP,再在测试集上取均值;衡量评分函数把真正相关句排前、无关句排后的整体能力,覆盖从最高分到最低分的完整分布,不依赖阈值选取。

MAP 是主结果(表 3)的核心指标,Ens4 相对人工提示基线 ICL0 的 +0.090~+0.170 提升都用它度量,是判断评分函数好坏的第一标尺。

研究动机

抽取式摘要、抽取式问答、法律合同审查、临床证据筛选、PII 检测等大量 NLP 任务本质上都归结为同一件事:从文档中挑出“相关”内容,且必须同时满足两个约束——覆盖率(相关内容以高概率被完整保留的召回式保证)与简洁性(无关内容尽量剔除)。此前把共形预测用于这类任务的工作,如 conformal factuality(过滤 QA 答案中的幻觉)、conformal importance(抽取式摘要)、conformal agent error attribution(定位智能体决定性错误),都依赖一个由人工精心编写提示驱动的 LLM 评分函数:为每个任务、每种“相关性”定义手写一段详细指令,例如 Evidence Inference 必须描述“含 p 值、置信区间、风险比、组间比较数据的句子才算证据”。这种做法费时费力、任务特定、脆弱且不可扩展——换一个数据集或相关性定义就要重写提示,措辞变化即可引起分数漂移(Lu et al. 2022、Min et al. 2022 已证明提示对扰动高度敏感),无法统一推广到新任务。

本文的目标是本文的具体目标是构建一个通用的“相关性评分函数”,用一个固定配置横跨所有内容选择任务:不再手写相关性定义,而是用少量标注示例通过 ICL 让 LLM 隐式推断标准;同时保留召回式共形覆盖保证 $P\big[\frac{|y_{test}\cap y^*_{test}|}{|y^*_{test}|}\ge\beta\big]\ge 1-\alpha$,并在相同覆盖率下比人工提示更简洁(剔除更多无关内容,摘要称保留长度最多缩减约 50%)。作者还希望给出理论刻画:什么样的评分函数组合在集成后能抬高最坏情形(floor)分数,以及逐个增加评分器的边际收益如何衰减。

与已有工作不同的是,已有共形集成工作要么在集合层面合并预测集(多数投票只有 $1-2\alpha$ 覆盖、集合并严重过覆盖),要么针对分类/回归任务(分数平均、e 值组合),要么(Cherian et al. 2024)用带学习的线性组合配合一致性风险控制,均未触及“语言内容选择 + 召回式保证”。本文的独特切入有三点:(1) 首次把召回式共形覆盖统一套用在七个领域、四种任务类型上,主张“任务定义交给策展示例而非人工提示”;(2) 提出用机制异构的 ICL 示例选择策略(语义锚点 DPP、相关方向 DPP、词法 BM25、随机)刻意制造错误互不重合的评分函数,而非靠温度随机性;(3) 给出 K=2 时集成下界的精确分解 $S^{(2)}=\frac{1}{2}(S_{\max}+S_{\min}+\mathrm{Comp})$ 与互补性条件 $\mathrm{Comp} > S_{\max}-S_{\min}$,以及 $O(1/K)$ 的饱和界,把“何时集成有用”变成可检验、可验证的不等式。

核心方法

直觉上,判断一句话是否“相关”很难用一段提示词说清,但给两三个“选中的句子 + 未选中的句子”对比示例,LLM 就能举一反三。方法分两步:第一步造评分函数——为每个任务准备一个小标注示例池 $\Pi$(与校准、测试集互斥),用四种检索策略各挑 $k=2$ 个对比示例填进同一个固定提示模板,得到 4 个输出 $[0,1]$ 分数的 ICL 评分函数 $R_j$,逐句取平均得集成 $\bar{R}^{(K)}(c;x)=\frac{1}{K}\sum_{j=1}^{K}R_j(c;x)$;第二步共形校准——在校准集($n=100$)上计算共形分数 $S_\beta$(正句相关分中第 $r=|y^*|-\lceil\beta|y^*|\rceil+1$ 小的次序统计量),取 $\lfloor\alpha(n+1)\rfloor$ 阶统计量为阈值 $\hat{q}$,测试时保留 $\bar{R}(c;x)\ge\hat{q}$ 的内容即得 $\ge\beta$ 的召回保证。整套配置($K=4$、$k=2$、Gemini-2.5-Flash-Lite、温度 0、固定种子)在七个数据集上完全不变,任何新任务只需重新标注一个小示例池。

核心创新是“用示例策展制造机制多样性,再做分数级平均”。与以往单一人造提示(ICL0)不同,本文刻意让 4 个评分函数走不同信号通道:anchor_dpp 取与查询文档余弦最近的一个池文档作锚点,再用条件 DPP 补足其余 $k-1$ 个示例的多样性(语义相似通道);pattern_dpp 对每个池文档计算“正句质心嵌入 − 负句质心”的相关方向向量,在方向空间跑 DPP,捕捉每个示例独有的判别模式(判别方向通道);bm25 做词法检索,捕捉语义模型看不见的术语、缩写、专名(词法通道);random 均匀抽样、与查询无关,充当正则化器抵消语义评分器的共享偏差。理论上(引理 1),两评分器平均的下界为 $S^{(2)}=\frac{1}{2}(S_{\max}+S_{\min}+\mathrm{Comp})$,其中互补性 $\mathrm{Comp}=\min_{c\in y^*}[R_1(c)+R_2(c)]-[S(R_1)+S(R_2)]$ 度量二者在最弱正句上是否“错得不一样”;当 $\mathrm{Comp} > S_{\max}-S_{\min}$ 时集成严格优于任一成员。这与集合级集成有本质区别:分数级平均在可交换性下保持 $1-\alpha$ 覆盖不变,纯粹提升简洁性,而多数投票会把覆盖降到 $1-2\alpha$。

方法步骤详情

第一步数据三分:先抽 ICL 池 $\Pi$(单意图任务 50 条;多意图任务每意图 20 条,如 ContractNLI 17 个意图共 340 条),再独立抽校准集 $C$($n=100$)与测试集,三者互斥以保证可交换性,标签预算每任务 150–440。第二步构造示例:四策略各自从 $\Pi$(多意图时按意图分层抽同意图子池)取 $k=2$ 条示例,以对比格式呈现——编号句列表、“Sentences selected”(正句)与“Sentences NOT selected”(约 1:1 负采样、至少 2 条);平均超过 30 句或正例率低于 15% 的长文档数据集(SubSumE、Evidence Inference)自动启用窗口压缩:保留全部正句及每句左右 ±2 随机宽度上下文,再加等量远处负句。第三步打分:固定模板要求 LLM“从示例中归纳被选与未选句的区分标准,并用同一标准给评估句打 0–1 两位小数分”,输出以句子索引为键的 JSON,漏句走重试模板补齐。第四步集成与校准:逐句平均 4 个分数得 $\bar{R}$,在校准集上按式 (3) 算 $S_\beta$,取 $\lfloor\alpha(n+1)\rfloor$ 阶统计量为 $\hat{q}$。第五步预测:对新文档重复策略采样与打分,输出预测集 $\{c:\bar{R}(c;x)\ge\hat{q}\}$。

技术新颖性

技术新颖性有四点。(1) 统一性:conformal factuality、conformal importance、conformal agent error attribution 此前各自为政、各配一套手写提示,本文用一套不变配置横跨 5 领域 7 数据集;且最佳单策略随数据集漂移(PhysioNet 最优是 random、ContractNLI 是 pattern_dpp、SubSumE 是 bm25),反证“挑单一策略”不可行,而 Ens4 处处稳定领先。(2) 理论:给出召回式设定下集成下界的精确分解与互补性条件,并证明逐样本 ICL 检索在条件于互斥池时仍是确定性函数,用塔式性质把条件保证抬升为无条件保证,避免了数据驱动聚合器所需的二次校准切分(Ochoa Rivera et al. 2025 的顾虑)。(3) $O(1/K)$ 饱和界 $S^{(K+1)}-S^{(K)}\le\frac{1-S^{(K)}}{K+1}$ 精确解释了实测收益递减形态(平均 MAP 从 0.587、0.625、0.650 到 0.664)。(4) 经验可证伪性:附录 J 在 471,378 个样本上验证互补条件满足时优势出现率 99.55%,全部 1,648 例不一致均可归因浮点平局,理论与实现高度吻合。

实验结果

主实验(表 3)用完全相同的 Ens4 配置在 7 个数据集上全面超越 ICL0 与事后调参的最佳单策略:MAP 提升从 +0.090 到 +0.170(+12% 到 +59%),所有 95% bootstrap 置信区间(10,000 次重采样、400 次随机切分)不含零——ECTSum 0.350→0.516、Evidence Inference 0.206→0.304、HotpotQA 0.749→0.839、PhysioNet 0.764→0.879、PUMA 0.648→0.814、SubSumE 0.289→0.464、ContractNLI 0.718→0.828;对最佳单策略仍胜 +0.036~+0.095。细节一:HotpotQA 上没有任何单策略打得过 ICL0,Ens4 却仍 +0.090,说明增益来自策略间互补而非示例信号更强。细节二:控制实验逐一排除替代解释——同等 ICL 预算的单策略 k=8 被 Ens4 全面压制(+0.070~+0.119);用同样标注数据训练的逻辑回归分类器 6/7 落败(仅 ECTSum 反超 0.615 vs 0.516);靠温度 T∈{0.3,0.5,0.8,1.0} 制造随机多样性的集成在 12/16 组合上被显著超越;等算力 ICL0×4(四次无示例调用)在 6/7 数据集上被显著超越、ContractNLI 打平。细节三:消融显示 k=2 最稳(k=1 在 6/7 数据集更差,k≥5 多数退化),Ens4 在全部 11 个非单例子集组合中每个数据集都排第一;K=1→4 平均 MAP 0.587→0.625→0.650→0.664,严格递减,与命题 1 的 $O(1/K)$ 界一致。共形层面:经验覆盖在所有数据集都落在目标 $1-\alpha$ 的 1 个百分点内(图 1a,n=100 已足够);$\alpha=0.2$ 下几乎全部 $\beta$ 处 Ens4 剔除的无关句都比 ICL0 多(表 18:SubSumE 简洁性 0.768 vs 0.228、HotpotQA 0.868 vs 0.724、PUMA 0.515 vs 0.300)。跨模型鲁棒:Llama3-8B/Qwen3-8B 上对 ICL0 七胜一平、对最佳单策略 8/8 全胜;GPT-5.6-terra 上 7/7 数据集同时超越两个基线。

Notation
Table 1: Notation
Dataset statistics
Table 2: Dataset statistics
Main MAP results on the seven datasets
Table 3: Main MAP results on the seven datasets
Metric reported is MAP. Left: ablation of ICL examples per strategy (k). Right: ablation of ensemble size (K)
Table 4: Metric reported is MAP. Left: ablation of ICL examples per strategy (k). Right: ablation of ensemble size (K)
Main empirical results for MAP comparing all ICL selection strategies
Table 5: Main empirical results for MAP comparing all ICL selection strategies
Latency for ICL0 and Ens4 with serial execution of LLM API calls
Table 6: Latency for ICL0 and Ens4 with serial execution of LLM API calls
MAP for all non-singleton subsets of the four ICL selection strategies at k=2
Table 7: MAP for all non-singleton subsets of the four ICL selection strategies at k=2
MAP for each individual sub-strategy at k=2 and 8
Table 8: MAP for each individual sub-strategy at k=2 and 8
MAP comparison between the supervised classifier baseline and Ens4
Table 9: MAP comparison between the supervised classifier baseline and Ens4
MAP values and 95% bootstrap CIs for temperature ensembles of single strategy scoring functions
Table 10: MAP values and 95% bootstrap CIs for temperature ensembles of single strategy scoring functions
MAP of each single-strategy run by temperature T
Table 11: MAP of each single-strategy run by temperature T
Equal-compute comparison between ICL0 and Ens4 (ICL0×4 ensembles four calls at T ∈ {0.3, 0.5, 0.8, 1.0})
Table 12: Equal-compute comparison between ICL0 and Ens4 (ICL0×4 ensembles four calls at T ∈ {0.3, 0.5, 0.8, 1.0})
Cross-model validation: default Ens4 on Llama3-8B, Qwen3-8B, and GPT-5.6-terra
Table 13: Cross-model validation: default Ens4 on Llama3-8B, Qwen3-8B, and GPT-5.6-terra
Task-hint ablation
Table 14: Task-hint ablation
Effect of stratified ICL selection on multi-intent datasets
Table 15: Effect of stratified ICL selection on multi-intent datasets
MAP for Windowed vs. full ICL on SubSumE
Table 16: MAP for Windowed vs. full ICL on SubSumE
Co-occurrence of Comp(Rj, Rk) > Smax − Smin and S(2) > Smax
Table 17: Co-occurrence of Comp(Rj, Rk) > Smax − Smin and S(2) > Smax
Mean conciseness for ICL0 and Ens4 across α ∈ {0.05, 0.10, 0.20} at β = 0.8
Table 18: Mean conciseness for ICL0 and Ens4 across α ∈ {0.05, 0.10, 0.20} at β = 0.8
Comparison of conformal ensemble rules using the same four Ens4 constituent scoring functions
Table 19: Comparison of conformal ensemble rules using the same four Ens4 constituent scoring functions
Conformal coverage validity (left) and Ens4–ICL0 conciseness gain (right) across all 7 datasets (n=100)
Figure 1: Conformal coverage validity (left) and Ens4–ICL0 conciseness gain (right) across all 7 datasets (n=100)
MAP comparison across seven datasets: Ens4 improves over both baselines on all 7 datasets
Figure 2: MAP comparison across seven datasets: Ens4 improves over both baselines on all 7 datasets
Best MAP at each ensemble size K ∈ {1, 2, 3, 4} across all 7 datasets
Figure 3: Best MAP at each ensemble size K ∈ {1, 2, 3, 4} across all 7 datasets
Conciseness improvement Ens4 − ICL0 over β at stricter coverage targets
Figure 4: Conciseness improvement Ens4 − ICL0 over β at stricter coverage targets
Conciseness improvement Ens4 − ICL0 at α = 0.05 on Evidence Inference
Figure 5: Conciseness improvement Ens4 − ICL0 at α = 0.05 on Evidence Inference
查看结构化数据
任务指标本文基线提升
ECTSum 金融电话会纪要句级抽取摘要 MAP Ens4 0.516 ICL0 人工提示 0.350;最佳单策略(anchor_dpp, k=3)0.469 +0.166(+47%);对最佳单策略 +0.047(+10%)
Evidence Inference 临床试验证据句抽取 MAP Ens4 0.304 ICL0 0.206;最佳单策略(anchor_dpp, k=1)0.213 +0.099(+48%);+0.091(+43%)
HotpotQA 多跳问答支持事实句识别 MAP Ens4 0.839 ICL0 0.749;最佳单策略(anchor_dpp, k=2)0.749 +0.090(+12%);+0.090(+12%)
PhysioNet 临床笔记 PHI/PII 检测 MAP Ens4 0.879 ICL0 0.764;最佳单策略(random, k=3)0.795 +0.115(+15%);+0.080(+10%)
PUMA 医疗讨论多视角答案摘要 MAP Ens4 0.814 ICL0 0.648;最佳单策略(anchor_dpp, k=2)0.777 +0.165(+25%);+0.036(+5%)
SubSumE 维基百科查询式摘要 MAP Ens4 0.464 ICL0 0.289;最佳单策略(bm25, k=3)0.373 +0.170(+59%);+0.089(+24%)
ContractNLI NDA 合同条款-假设相关性评分 MAP Ens4 0.828 ICL0 0.718;最佳单策略(pattern_dpp, k=3)0.733 +0.109(+15%);+0.095(+13%)
七任务共形预测集(β=0.8, α=0.2) 简洁性(剔除无关句比例) Ens4:SubSumE 0.768、HotpotQA 0.868、PUMA 0.515 ICL0:SubSumE 0.228、HotpotQA 0.724、PUMA 0.300 同覆盖率下多剔除最高约 54 个百分点;经验覆盖偏差全部 ≤1 个百分点
替代共形集成规则(同一 4 个子评分器) 简洁性 @ (α,β)=(0.2,0.8) 分数级平均集成 0.711,覆盖偏差 +0.0~+0.2pp 多数投票 0.664(α=0.2 欠覆盖 −1.4pp);COLA 0.426;预测集并集 0.364(+15.1pp 过覆盖) 最贴近目标覆盖且预测集最紧凑

局限与改进

作者承认的局限:需要约 150–440 个标注样本(ICL 池 + 100 校准),实践中须人工整理;要求相关性标准在校准与测试间静态不变以满足可交换性;默认配置含一行人工任务提示,虽属可选但对 PhysioNet 这类非语义任务必不可少(去掉后 MAP 从 0.879 崩到 0.549);主结果仅在 Gemini-2.5-Flash-Lite 上报告,Llama3-8B/Qwen3-8B 绝对值明显偏低(如 ECTSum 仅 0.258);Ens4 每文档 4 次 LLM 调用,串行延迟为 ICL0 的 2.3–18 倍;保证是边际覆盖而非条件覆盖(按意图、文档长度、受保护属性的子群覆盖不保证,需 Mondrian 方法);正例稀疏的数据集池中有效正例示例可能太少;托管 LLM 服务端随机性导致逐样本分数跨重跑漂移。我的补充观察:(1) 七个任务中四个(HotpotQA、ECTSum、ContractNLI、Evidence Inference)是作者人为重造为句级二值标注的,“统一”部分依赖任务重构,对天然生成式任务不适用;(2) Evidence Inference 上 MAP 仅 0.304、且 α=0.05 时简洁性增益转负(图 4/5),说明纯 ICL 推断对“统计证据”这类非语义标准仍吃力,需完整任务描述兜底;(3) 延迟测量是串行、含服务商重试的粗粒度估计(SubSumE 达 18 倍),并行化后的真实成本结构未充分刻画;(4) 结论建立在单一商业 LLM 家族之上,模型迭代可能改变互补性结构的稳定性。

独立分析的弱点

弱点一:非语义相关标准失效风险。PhysioNet 的“相关性”由监管条款定义(什么构成受保护健康信息),对比式 ICL 示例传达不了这种规则,一行提示成了隐藏的关键工程项,“零人工提示”的卖点在此类任务打折;改进方向是把任务定义本身做成可检索文本片段,或显式规则与 ICL 融合。弱点二:标注预算的隐性成本。150–440 个句级标注对学术基准可行,但法律、医疗场景标注昂贵且必须覆盖每个意图(ContractNLI 17 意图 × 20 条);可引入主动学习选样或强 LLM 弱标注加人工校对。弱点三:4 倍推理成本且收益递减,K=4 是经验折中而非自适应;可按命题 1 的边际条件 $R_{K+1}(c) > S^{(K)}-K\delta_K(c)$ 在线决定是否调用更多评分器。弱点四:均值集成隐含假设各评分器分数可比且校准良好,而 LLM 打分常聚在 0.8/0.2 附近,系统性偏置可能扭曲均值;可改用秩变换或分位数归一后再平均。弱点五:干净的理论结果限于 β=1 与 K=2(引理 1),β<1 时 $\mathrm{Comp}_\beta$ 可为负、平均不再保证不降 floor,而高风险应用恰恰需要 β<1。弱点六:只有边际覆盖意味着长尾意图或子群可能被系统性牺牲,PII 检测、合同审查这类应用对子群公平高度敏感,论文仅引用 Mondrian 可能性而未实验。

未来方向

作者提出三个方向:用类似 learn-then-test(Angelopoulos et al. 2025)的自适应聚合替代固定均值,代价是额外标注子集;把二值相关性扩展为分级或连续标签,借助 conformal risk control(Angelopoulos et al. 2024);从纯抽取式内容选择扩展到生成式任务(引 Conf-Gen 框架)。基于本文成果还可延伸:(1) 把互补性条件 $\mathrm{Comp} > S_{\max}-S_{\min}$ 做成可操作的策略选择器——在校准数据上估计候选策略对的 Comp,动态挑出 K<4 的更廉价组合;(2) 与 Mondrian 共形结合实现意图/子群条件覆盖,并检验互补性是否跨层成立;(3) 探索跨任务共享示例池的迁移:通用相关性池加少量目标示例能否逼近专用池,进一步压缩标注预算;(4) 将 random 策略的正则化作用形式化——它与语义评分器去相关、抵消共享偏差的效应值得给出最优混合权重分析;(5) 在流式或分布漂移设定下研究在线重校准,因为静态可交换性是真实部署中最先失效的假设;(6) 把窗口化上下文压缩(±2 句,SubSumE 上 k=5 带来 +0.16 MAP)推广为可学习的压缩器。

复现评估

复现条件相当好。代码、四种 ICL 策略实现与数据处理脚本开源于 github.com/layer6ai-labs/conformal-relevance;七个数据集全部公开(HotpotQA、ECTSum、ContractNLI、Evidence Inference 由作者重造为句级二值标注,构造规则写在附录 D.1;SubSumE、PUMA、PhysioNet 原生句级标注);附录 D 给出模型(Gemini-2.5-Flash-Lite,2026 年 1–4 月访问,T=0,固定种子覆盖池采样、DPP、负采样与切分)、嵌入模型(all-MiniLM-L6-v2,22M 参数、384 维)、切分尺寸(池 50 或每意图 20、校准 n=100);附录 E、G 逐字给出打分模板、重试模板与全部 ICL0 提示,附录 F 给出各策略算法细节与 DPP 核公式,窗口半宽固定 w=±2。主要成本是 LLM API 调用:Ens4 每文档 4 次,串行单样本 1.8–45 秒,加上 400 次随机切分重复的评测协议,全量复现有实打实的 API 开销;但方法无需训练、无 GPU 需求,用 8B 开源模型可本地低成本复跑核心结论。风险点:托管 LLM 服务端随机性使逐样本分数跨重跑漂移(作者明言应复现聚合 MAP 而非单样本分数),Gemini 版本迭代也可能改变绝对数字。总体难度评估:中低,工程量主要在数据重造与提示逐字对齐。