面向证据到分类体系检索的因子化假设搜索 Factorized Hypothesis Search for Evidence-to-Taxonomy Retrieval
把歧义证据因子化为多维语义假设,并行检索、共识融合、逐维验证,将金标概念从排名深处提到榜首。
前置知识
检索-重排范式与排序指标
先由检索器从大清单中取回 top-$K$ 候选,再用更强的模型重排并输出最终答案的两段式流程。Recall@$k$ 衡量金标是否进入前 $k$ 名,MRR 是金标排名倒数的均值 $\frac{1}{|Q|}\sum_i 1/\mathrm{rank}_i$,Acc 是重排后的 top-1 正确率。本文把 Recall 与 MRR 测在检索末端(共享选择器之前),Acc 只测在共享 listwise 选择器之后。
论文的核心论证是'目标进得了候选池但排不到头部',所有实验(Table 1、4、5、6)都用这套指标语言表达,不懂指标就无法读懂头部增益与深度增益的权衡。
BM25 稀疏检索
基于词频与逆文档频率的稀疏打分函数,$s=\mathrm{bm25}(q,c)$ 对查询-文档的词项匹配打分,参数 $k_1$ 控制词频饱和、$b$ 控制文档长度惩罚。本文在仓库内实现,取 $k_1=1.5$、$b=0.75$、检索深度 $K=200$,并叠加标签覆盖率项与数据类型预过滤两个索引组件。
FHS 与所有基线共用同一个 BM25 索引,oracle 探针实验和检索就绪度差距的全部测量都在这个索引上进行,它是理解诊断结论的前提。
HyDE 与查询改写
HyDE(Gao et al., 2023)和 Query2doc 让 LLM 把一个显式查询扩写成伪文档或更长的查询文本,以缓解查询与文档之间的词汇不匹配。这类方法隐含前提是存在一个语义明确的初始查询,缺的只是词汇层面的润色。
这是本文最重要的对照基线家族;作者论证其前提在本任务不成立——核心语义本身不确定,从而引出'维护多个竞争解读'的因子化方案。
倒数排名融合(RRF)
把多路检索的排名合并成一个统一排名的免训练方法:候选的分数是对所有包含它的排名求 $\sum_r \frac{1}{\kappa+\mathrm{rank}_r(c)}$,$\kappa$ 通常取 60;被多路命中且排名靠前的候选得分高。本文采用求和 RRF 并对候选池做范围归一化。
FHS 的共识融合阶段用它把每个假设 1–2 路、共 2–4 路的检索结果合并成统一候选池,消融实验(Table 6)专门检验了求和/均值/原始分数三种融合约定。
自一致性采样
对同一提示做 $N$ 次随机采样,再对最终答案做多数投票(Wang et al., 2023b),利用采样多样性提升推理可靠性。其缺陷是样本是不透明的完整输出,无法解释样本之间到底在哪一点上分歧。
FHS 的 $J=2$ 假设采样与自一致性同源,但把分歧因子化到命名语义维度上——这是与自一致性的本质区别,也是论文预算匹配对照(Table 4 中 Parallel, stochastic J=2)的设置依据。
US-GAAP 与 ICD-10-CM 分类体系
US-GAAP 是美国财务报表 XBRL 标记的概念分类,2024 版含 17,388 个概念,每个有 camel-case 标签、官方定义和声明数据类型;ICD-10-CM 是临床诊断编码体系,本文索引了 71,344 个可计费诊断码,文档串由包含注释、继承注释和层级路径拼接而成。两者都是近邻密集、层级深的大清单。
两个基准的实例构造、六维语义模式(Table 2/3)与'词形相近的干扰概念'问题都直接由这些体系的结构决定,理解数据才能理解为什么头部排序如此困难。
研究动机
标准检索-重排流程隐含假设输入已经表达了目标概念,但许多真实场景不满足这一点。金融报表里一个孤立表格单元格的含义取决于行表头、列表头、数据类型和上下文:取值 60.4 或 1,229,202 本身不指名任何概念,而平均每个表格上下文承载 21.3 个指向不同概念的事实;临床记录中一个结果的编码依赖分析物、标本类型和环境,输入常带有指向无关实体的干扰线索。作者把这种'证据不直接表达目标概念、上下文又充满干扰'的结构性错位称为检索就绪度差距(retrieval readiness gap),并用诊断实验量化它:在 2024 US-GAAP(17,388 概念)的索引上,用金标概念自身的标签+定义做探针查询,每个测试事实的目标都进入前十(R@10=1.000,MRR=0.972);而把原始上下文直接序列化当查询,目标虽有 75.2% 的事实进入 top-200,却只有 24.0% 进入 top-10,MRR 仅 0.111。结论是目标'够得着但排不上':瓶颈不在索引召回能力,而在把证据转化为检索就绪查询这一步。
本文的目标是本文的目标是形式化并解决'证据到分类体系检索'(evidence-to-taxonomy retrieval)任务:给定位于共享上下文 $X$ 中的定位事实 $x=(\ell, a, X)$——$\ell$ 为单元格位置或提及片段、$a$ 为观测内容——在零样本、离线、不重训、不与用户交互的约束下,先构造检索就绪的查询 $q=g(x)$,再把金标概念 $c^*\in\mathcal{T}$ 推到候选列表头部。具体目标包括三件事:其一,在金融标记(2024 US-GAAP,17,388 概念,2,509 测试事实)与 CodiEsp 临床诊断编码(ICD-10-CM,71,344 码,3,144 事实)两个领域上,同时超过直接检索、单趟 grounding、预算匹配的并行采样与迭代改写等基线的 Recall@1、MRR 与最终准确率;其二,通过组件消融把增益精确归因到因子化表示、双渲染、候选级验证等部件;其三,用受控的序列化对照(FHS-Seq)回答'强并行首回合之后,迭代精修是否还值得'。
与已有工作不同的是,既有查询转换工作隐含'语义明确、只需词汇润色'的前提:HyDE、Query2doc 把显式查询扩写成伪文档;迭代式方法(Self-RAG、ITER-RETGEN、查询澄清等)假设存在一个初始查询可供反复修正;自一致性对不透明的完整输出做多数投票。而本文的诊断表明,差距的本质是解释性歧义:同一事实存在多种合理读法(一个 RSU 单元格可以读作非归属权益工具、非归属期权、可供授予股数等),过早承诺单一改写会把检索引向错误的子层级。FHS 的独特切入是把歧义显式因子化——用一组命名语义维度上的部分赋值表示互相竞争的解读,使样本间分歧映射到可识别的维度而非笼统的文本差异;同一表示同时服务于查询渲染、多假设检索与逐维候选验证,形成'留空便宜、猜错昂贵'的统一模式。这与'先改写后检索'的单查询路线有本质区别。
核心方法
FHS 的直觉是:与其赌一个改写,不如同时维护多个部分承诺的解读,让检索与验证来裁决。技术路线分四个阶段(Algorithm 1)。(1)假设生成:对事实 $x$,Qwen3-32B 以 temperature 0.8 随机采样 $J=2$ 个因子化假设,每个假设是六维(FAMILY、ROLE、EVENT、QUALIFIER、SCOPE、TEMPORAL)上的部分赋值 $h:D\to V\cup\{\bot\}$,证据不支持的维度必须输出 UNRESOLVED 而不许猜。(2)查询渲染:每个假设发出一对查询——定义式 $q_{def}$(生成器在同一次结构化调用里写出的自然语言描述,不额外花费调用)与标签式 $q_{lab}$(用规则把已解析维度值按索引标签的 camel-case 分词方案拼接,无已解析维度则不发出);表格证据用双渲染($2$ 假设 $\times$ $2$ 渲染 $=4$ 路检索),叙述证据只用定义式。(3)共识融合:全部排序用求和 RRF($\kappa=60$)合并成候选池 $\mathcal{U}$,再范围归一化得 $\tilde{S}(c)$。(4)候选级验证:扫描融合排名前 60、按类别画像多样性取 $K_v=10$ 个候选构成窗口,LLM 对每个候选逐维给出支持/不支持/弃权,支持率 $v_j(c)\in[0,1]$ 跨假设取均值,最终按 $S_{final}(c)=\tilde{S}(c)+\beta v(c)$($\beta=0.6$)重排,交给所有方法共享的 listwise 选择器。
核心创新是把'假设之间的分歧'结构化。自一致性等集成方法把样本当作不透明的整体输出投票,而因子化假设让每个样本在命名维度上显式承诺:两个假设可以在 FAMILY 上一致、在 QUALIFIER 上分歧,于是各自渲染成语义上不同但都合理的查询,检索出互补又不强制的候选集;验证阶段也能对每个候选、每个维度核对它与假设的承诺是否冲突,而不是笼统打分。配套的关键设计是'留空便宜、猜错昂贵':未解析维度 $\bot$ 被渲染器跳过、不参与评分,而错误赋值会把检索拖向事实不支持的子层级——开发实验证实,强迫假设多样化使单个假设召回下降 3–8 个 R@200 点,朴素随机采样反而拿到最高累积覆盖(Cov@4 0.735 对多样性提示的 0.664)。最后,因子化提供了查询生成与候选验证共享的统一模式,这是自由文本集成做不到的——消融中把因子化路径换成同规模自由文本集成使 R@1 从 0.185 跌到 0.116,是所有组件中伤害最大的一项。
方法步骤详情
完整流程如下。输入:定位事实 $x$(表格事实携带行/列表头链、声明数据类型与取值;叙述事实携带提及片段与上下文,序列化上限 12,000 字符)与分类体系索引。第一步,索引准备(所有方法共享):BM25($k_1=1.5$、$b=0.75$、深度 $K=200$)加数据类型预过滤——货币单元格绝不与股数概念比较,过滤后平均每查询剩 6,919 个候选(原 17,388),金标保留率 100.0%;再加标签覆盖率项(对范围归一化 BM25 分数叠加 $\mathrm{cov}_\lambda$ 与 $\mathrm{cov}_q$ 两个词项覆盖项,权重 $w_{cov}=1.0$),补救短泛化标签在稀疏检索中的长度偏差。第二步,生成:LLM 一次结构化调用输出 $J=2$ 个假设,各含六维赋值(不支持的写 UNRESOLVED)与定义式查询字段。第三步,渲染:$q_{lab}$ 把已解析维度值规范化到受控词表后按索引分词方案(同时保留 camel-case 拆分与原始形式)拼接。第四步,融合:求和 RRF 后范围归一化。第五步,验证:扫描融合排名前 60,为每个不同类别画像(四个词表维度取值元组)保留最高排名者组成 $K_v=10$ 窗口;LLM 逐维返回支持/不支持/弃权,弃权不计入分母;窗外候选取窗口均值。第六步,重排与输出:$S_{final}=\tilde{S}+\beta v$ 取 top-$K$,由共享 listwise 选择器输出至多 20 个概念;Acc 只在选择器之后测量。
技术新颖性
新颖性有四层。其一,任务形式化:首次把'证据先解释、再检索'定义为 evidence-to-taxonomy retrieval,用差距公式 $\Delta(x)=\mathrm{sim}(\phi(g^*(x)),\phi(c^*))-\mathrm{sim}(\phi(q_{raw}(x)),\phi(c^*))$ 与 oracle 探针把'瓶颈在查询构造而非索引'变成可测量的命题。其二,表示:部分赋值加显式 $\bot$ 区分'有意的弃权'与'错误的赋值',使集成样本的分歧落在可审计的语义维度上;与自一致性的区别在下游融合方式而非采样机制。其三,双重渲染:同一假设同时发出 LLM 写的定义式查询与规则拼装的标签式查询,后者直接模仿分类体系标签的词汇形态——消融中去掉定义式损失 R@1 0.034,远大于去掉标签式的 0.000。其四,验证器被定位为候选之间的相对验证者而非绝对自我校验者,且附录 F 用受控对照(FHS-Seq)证明强并行首回合之后序列精修无增益($\Delta$R@50 $=-0.006$,区间 $[-0.016,0.002]$),为'并行假设搜索优于串行迭代'给出了干净证据,这是以往迭代检索文献未曾对照过的。
实验结果
金融标记(2,509 测试事实,三跑均值):FHS 的 R@1=0.185,比最强基线检索反馈精修(0.141)高 0.044;MRR 从 0.238 升至 0.257,最终 Acc 从最佳基线 0.234 升至 0.255;直接检索只有 R@1 0.041、MRR 0.111、Acc 0.132。代价在深度:反馈精修 R@50 达 0.660,FHS 仅 0.543。CodiEsp(3,144 事实):FHS 在全部指标领先——R@1 从 0.201 升至 0.264,R@10 0.502,R@50 0.661,MRR 从 0.298 升至 0.352,Acc 从 0.322 升至 0.330。消融(Table 6):换成同规模自由文本集成使 R@1 跌至 0.116、MRR 至 0.194(但 R@50 反升至 0.583);去掉定义式渲染 R@1 $-0.034$、Acc $-0.036$;去掉 LLM 验证器 R@1 从 0.185 跌至 0.124、MRR 从 0.257 跌至 0.205 而 R@50 不变,说明验证器只改善排序不扩召回;换成单假设仅 $-0.010$ R@1;求和/均值 RRF 之差在噪声内;去掉共享的标签覆盖项所有方法都大跌(FHS R@1 0.101)。oracle 单假设上限为 R@1 0.222、Acc 0.262,FHS 达到 oracle 的 83.3%–97.3%(按指标不同)。序列对照:FHS-Seq 四轮后 R@50 从首回合 0.550 到 0.544($-0.006$,$[-0.016,0.002]$),且 29.8% 的事实金标从未进入候选池。验证器行为:金标支持率 0.916 对干扰项 0.543(差 $+0.373$),84.9% 的调用偏向金标,但对'假设本身对错'无判别力(AUROC 0.510);金融侧验证器把 156 个事实的金标提到第 1、仅 5 个挪离第 1。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 金融标记(Financial Tagging, US-GAAP 2024) | Recall@1 | 0.185 | 0.141(检索反馈精修,最强基线) | +0.044 |
| 金融标记 | MRR | 0.257 | 0.238(检索反馈精修) | +0.019 |
| 金融标记 | 最终 Acc(共享选择器后) | 0.255 | 0.234(内在自精修) | +0.021 |
| 金融标记 | Recall@50(深度对比) | 0.543 | 0.660(检索反馈精修) | -0.117(迭代基线深度更优,头部更差) |
| CodiEsp 诊断编码(ICD-10-CM) | Recall@1 | 0.264 | 0.201(结构化单趟 grounding) | +0.063 |
| CodiEsp | MRR | 0.352 | 0.298(结构化单趟 grounding) | +0.054 |
| CodiEsp | 最终 Acc | 0.330 | 0.322(结构化单趟 grounding) | +0.008 |
| CodiEsp | Recall@50 | 0.661 | 0.626(结构化单趟 grounding) | +0.035 |
局限与改进
作者承认的局限:语义维度集取自分类体系自身的结构与元数据,面对缺乏此类结构的清单需要另行设计或自动归纳 schema;全部组件只用 Qwen3-32B 一个骨干,未验证跨模型族与规模的稳健性。此外可见的局限:金融任务上 FHS 的 R@50(0.543)明显低于迭代基线(0.660),它买头部精度但放弃深度;29.8% 的事实金标根本不进候选池,头部优化无法挽救这部分覆盖损失;成本高——每事实 4 次 LLM 调用加 4 次检索,CodiEsp 测试集单张 B200 上 5.31±1.71 小时,约为单趟方法(1.20 小时)的 4.4 倍;−factorization 消融同时移除了结构化表示与逐维验证,无法把功劳单独归给因子化(作者也明确声明);文本模态只有 168 个事实,模态结论只是指示性的;验证器窗口只在 35.7% 的调用中包含金标;CodiEsp 用机器翻译成英语的语料并做提及重定位,可能引入噪声;FHS 与并行基线的调用数是 4 对 2,未做完全的调用数预算匹配(作者论证验证调用远大于生成调用、不应简单对齐)。
独立分析的弱点
独立分析几个弱点并给出方向。(1)覆盖天花板:29.8% 事实金标不入池,根源是 BM25 加标签覆盖索引对语义改写的敏感度有限;可引入域内调优的稠密-稀疏混合检索——但附录 Table 17 显示现成混合检索反而略降 FHS($-0.012$ MRR 区间跨零),说明需要真正在分类体系文本上微调的稠密编码器,或对未命中的假设做查询扩展重取。(2)验证窗口命中低:金标只出现在 35.7% 的验证调用里,画像多样性窗口只扫前 60 名;可加大扫描深度、对候选做层次聚类再采样,或按 FAMILY 分桶逐一验证。(3)成本与延迟:生成与验证串行执行导致 5.31 小时/轮;全并行化即可大幅降延迟,也可把逐维验证蒸馏进小型交叉编码器。(4)schema 人工设计:六维从分类体系元数据手工归纳,换域需重做;可自动从标签与定义中挖掘维度词表。(5)假设选择仍有 0.037 的 R@1 oracle 余量,值得训练轻量选择器或学习化融合取代固定 $\beta=0.6$ 的线性组合。(6)$\beta$、$J$ 只在 661 事实开发样本上调,跨域迁移未验证。(7)叙述证据增益小(Acc $+0.042$ 对表格 $+0.129$)且在 R@50/MRR 上被反馈精修反超,需要为长文本设计更深的证据链假设。
未来方向
作者提出的方向:为没有现成结构化元数据的清单自动归纳维度 schema;跨模型族与规模的评估以刻画稳健性-成本权衡。基于本文成果可延伸的:把 FHS 的强并行首回合与'仅在覆盖诊断显示不足时触发'的选择性深度迭代结合,兼得头部与深度;用学习化的候选池融合缩小 7.4 点的合并损失(开发集上累积覆盖 0.735 对融合后 0.661);利用金标自动构造逐维标注,训练监督式验证器以替代零样本 LLM 验证;把'因子化假设+双渲染+逐维验证'框架迁移到 schema linking/text-to-SQL、产品目录、法律条文引用等大清单对齐任务;同一表格内多事实联合推理——兄弟单元格可共享证据与画像约束;以及人机协作界面,暴露可审计的假设轨迹与逐维支持度供专家复核,这与其伦理讨论中'支持而非替代人工审核'的立场一致。
复现评估
复现条件较好。代码与数据管道开源(github.com/SarielMa/FHS);两个语料公开——金融数据来自公开公司申报文件,CodiEsp 为 CC-BY 4.0,作者不重分发语料而是指向原始发布;骨干是开放权重的 Qwen3-32B,检索为仓库内实现的 BM25($k_1=1.5$、$b=0.75$),无需外部检索服务。超参数在 Table 9 完整固定:$K=200$、$J=2$、$\beta=0.6$、$K_v=10$、窗口扫描深度 60、$\kappa=60$、$w_{cov}=1.0$、生成温度 0.8;CodiEsp 测试协议是确定性的精确重定位切片(解析成功率 1.0)。算力:单张 NVIDIA B200 即可,CodiEsp 测试集一轮 FHS 约 5.31±1.71 小时、每个配置跑三遍;若用 vLLM 等推理框架在 80GB 级显卡上部署 32B 模型也应可行。难度评估为中等:单臂复现并不昂贵,主要成本在多臂对照与三跑均值带来的总时长;附录把基线适配、提示词、受控词表与匹配规则全部写明,便于逐表核对。
论文图表