多答案投票会失败:LLM 因果推理 Best-of-K 的符号化验证 When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs
用因果图公理逐条核验采样轨迹,绕开投票选出有效答案。
前置知识
自一致性 / Self-consistency
一种 best-of-K 测试时方法:让大模型对同一问题独立采样 K 条思维链,再取出现频次最高的答案作为最终输出。它隐含假设——正确答案的采样概率会集中到一个字符串上,于是投票能把噪声平均掉。
本文正是要证明在因果推理里这个核心假设会失效:多个正确答案会把票数分散,反而让一个常见错误答案当选。理解这点才能看懂 CALVER 的动机。
后门调整集 / Backdoor adjustment set
Pearl 因果图中,为识别处理 X 对结果 Y 的因果效应,需条件化一个能阻断所有后门路径的变量集 Z,且 Z 不能含 X、Y 或 X 的后代;形式上 $Z\cap(\{X,Y\}\cup De_G(X))=\emptyset$ 且删去 X 出边后有 $X\perp_d Y\mid Z$。
同一查询往往有多个合法调整集,例如 $\{Z_1\}$、$\{Z_2\}$、$\{Z_1,Z_2\}$ 都满足后门准则——这正是『多答案有效』的典型来源,也是基准 CLEAR 的核心任务。
d-分离 / d-separation
DAG 中判断两节点在条件集 Z 下是否条件独立的图论准则:中间节点在链式与分叉结构里被条件化时阻断通路,碰撞结构(共子节点)未被条件化时阻断。m-separation 是它在含双向边 ADMG 上的推广。
CALVER 的核心检查就是把后门准则翻译成『在删去 X 出边的图上做 d-分离判定』这样的可执行算法,让验证器能在毫秒级 CPU 上判定候选答案是否有效。
平均处理效应 ATE 与调整公式
ATE 定义为干预下的期望差 $\theta=E[Y|do(X=1)]-E[Y|do(X=0)]$,刻画干预 X 对 Y 的因果影响。给定合法调整集 Z,可从观测分布用调整公式重算一个等价估计量 $\psi$ 来逼近 $\theta$。
论文的『严格 ATE 证书』把数值重算 $|\hat\theta-\psi|\le\varepsilon$ 与决策裕度 $|\psi-\tau|>\varepsilon$ 作为可证明正确性的关键,定理 1 给出证书能保证阈值判断正确的条件。
可判定的有效性类 / Decidable validity class
一个查询的所有合法答案构成『有效性类』$\mathcal{V}(G,q)$。关键观察是:在因果图任务里,『哪些条件集满足后门准则』可用标准图算法(祖先后裔限制、d/m-分离、干预图切割、后门判定)机械判定,不依赖外部参考答案。
这是 CALVER 区别于一切学习型/共识型验证器的根:它直接判定『这个候选本身属不属于有效类』,不靠『别人答案长什么样』,因此天然免疫答案字符串碎片化。
研究动机
在 LLM 因果推理任务中,self-consistency 这类 best-of-K 选择方法会遇到致命的『选票碎片化』问题。以 CLEAR 的 find-one-valid 后门调整任务为例,一个查询可能同时接受 $\{Z_1\}$、$\{Z_2\}$、$\{Z_1,Z_2\}$ 等多个合法调整集——每一个都是完全正确的。论文用一个具体例子说明:若七个合法答案的总质量是 0.70(被七个字符串平分),而一个常见错误答案(空集 $\emptyset$)独占 0.30,那么 plurality 会选出 $\emptyset$,因为它就是『最大的单个众数』,而且采样次数越多领先越稳。作者在 CLEAR 干净核心的 576 个含有效候选的池里实测,226 个(39%)恰好出现『无效答案是唯一 plurality』的情形;把 judge 从 12B 换到 72B 也无法挽回(+0.4pp [-2.0, 3.0]),证明这是被现有所有非神谕选择器共同忽视的结构性盲点。
本文的目标是作者的目标是给 best-of-K 因果推理换一个完全不同的聚合单位:不再用答案字符串的频次来聚合,而用『候选是否满足任务定义的有效性谓词』来聚合。具体地,他们希望构造一个免训练、参考答案无关的符号验证器,能在采样得到的 K 条结构化轨迹里逐条打分,选出最早达到满分的那条——哪怕它给出的合法答案和数据集给的『标准例子』不是同一个字符串。这种选择信号必须在毫秒级 CPU 上跑完,能在不增加采样的前提下把有效性类内的所有正确答案都算作一类,从而彻底消除选票碎片化。
与已有工作不同的是,已有方法的根本缺口在于:soft self-consistency、语义聚类、universal self-consistency、学习型奖励模型、reference-free LLM judge 都只是把『证据』从精确字符串匹配放松为分布式相似度或学习偏好,但没有任何一种去检查任务公理是否被满足。CALVER 的独特切入角度是把因果推理的一个数学事实工程化:造成答案多重性的图判据(d-分离、后门准则)本身恰好就是判定一个候选是否属于有效类的算法。因此『可判定的有效性类』既是答案碎片化的来源,也是修复它的工具。论文还填补了第二个缺口——给出 extract-then-solve(构造一张图精确求解)与 candidate-wise verification(逐条验证)之间的交叉对比,明确指出两者各自的适用边界。
核心方法
直觉上,CALVER 把『选最流行的答案』换成『选最早能通过因果图审计的那条轨迹』。技术路线分四步:第一,要求大模型把回答组织成固定的六槽结构化 schema(图、查询、策略、推导记录、计算结果、答案),schema 只约束中间声明为机器可读,不限制模型怎么写自由推理;第二,对每条轨迹用一组确定性因果图原语做六项独立检查,每项返回 0/1,总分 $S_i=\sum_{j=1}^{6}b_{ij}\in\{0,\dots,6\}$;第三,按『最早达到最大分的轨迹』返回其答案 $a_{i^\star}$,其中 $i^\star=\min\arg\max_i S_i$;第四,整个打分不读任何参考答案、与采样策略解耦,并区分 supplied-graph 模式(在源图上打分)与 constructed-graph 模式(在每条轨迹自报的图上打分,源图选完后才用于评分)。
核心创新是『把答案多重性变成可判定的有效性类』。与已有方法的本质区别在于:投票/软投票/聚类/奖励模型都在『答案之间』找相似性,CALVER 则在『候选与因果公理之间』做二元判定。这带来三个不可替代的能力:(1)天然把 $\{Z_1\}$ 与 $\{Z_1,Z_2\}$ 视为同类(都满足后门准则),不被字符串表面不同惩罚;(2)可证明——定理 1 给出严格 ATE 证书在给定 DAG $G^\star$ 与观测分布 $P$ 满足 positivity 时保证阈值决策正确,且不读目标标签;(3)可解释且廉价——每条轨迹 1–8 ms CPU,相对投票只多约 7% 开销,无需为每个候选做神经网络前向。
方法步骤详情
完整步骤:输入为查询 $q$、可选源图 $G^\star$、策略采样的 $K$ 条轨迹 $r_1,\dots,r_K$;ATE 类还附观测分布 $P$ 与阈值 $\tau$。①解析:每条轨迹解析恰好一份六槽,缺/重槽直接判 0。②绑定:graph 槽绑定到验证图 $G^{ver}_i$(supplied 为 $G^\star$,constructed 为轨迹自报 $\hat G_i$),query 槽绑定 $(X,Y,task)$。③策略谓词:后门在 $(G^{ver}_i)_X$ 上测 $X\perp_d Y\mid Z$,ADMG 用 typed m-分离,中介/干预/有向环用各自对应判据。④推导记录:仅查 provenance 与格式。⑤数值重算:ATE 用调整公式独立重算 $\psi$,要求 $|\hat\theta-\psi|\le\varepsilon$。⑥答案一致:与重算结果或阈值决策一致。最后按 $i^\star=\min\arg\max_i\sum_j b_{ij}$ 返回 $a_{i^\star}$;严格 ATE 证书额外加处理排除与决策裕度两条守卫以触发定理 1。
技术新颖性
技术新颖性体现在三处。第一,把 Pearl 因果判据(d-分离、m-分离、干预图切割、后门判定、祖先后裔限制)打包成一个无监督、目标标签无关、可执行的候选级选择规则——这是首次把符号验证以 candidate-wise 形式引入因果 best-of-K 选择。第二,给出两层可证明结果:定理 1(严格 ATE 证书在给定图与 positivity 下保证阈值决策正确)与定理 2(validity fragmentation——当 $M>\rho/(1-\rho)$ 时 plurality 收敛到无效答案,上界 $|\mathcal{V}^+|\exp(-K\Delta_\mu^2/2)$);补篇还给出任意有限 $K$ 下部署选择器的精确法则(定理 9)。第三,提出『查询局部图不变量』$\sigma_G(X,Y,Z)$,形式化地证明重构图只要保住查询相关的那几条边就足够——全局 edge-F1 既非必要也非充分(命题 12),这解释了为何 exact graph recovery 跌到 37% 时 CALVER 仍能保住收益。
实验结果
主基准 CLEAR 干净核心 1,111 个单元上:CALVER 达 42.1%,而最强通用基线 Skywork Reward V2 8B 仅 30.5%(+11.6pp [8.2,15.0])、reference-free judge 27.4%、模型置信度 30.1%、精确 plurality 30.9%(+11.3pp)。关键消融:拿掉语义有效性的 structure-only 控制只有 23.5%,比 plurality 还低,证明收益来自因果谓词本身;judge 升到 Qwen2.5-72B 仍未弥合差距(+0.4pp [-2.0,3.0])。预算扩展上 CALVER 从 K=1 的 20.6% 涨到 K=32 的 57.9%,plurality 在 K=16 后停在 32.5%,差距从 7.7pp 扩到 25.4pp,与定理 2 一致。池级分解显示 197 个 plurality 错误被修复、仅引入 54 个新错(净增 24.8pp)。该优势在 bnlearn、L3 自然语言、独立 DoVerifier、K&K 谜题上均复现,详见 benchmarks。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| CLEAR 多答案后门调整(干净核心,K=8) | 选择准确率 | CALVER 42.1% | 精确 plurality 30.9% / 奖励模型 30.5% / LLM judge 27.4% / 模型置信度 30.1% / structure-only 23.5% | +11.3pp [7.8, 14.9](vs plurality);相对 structure-only +18.6pp,收益源自因果谓词 |
| CLEAR 预算扩展(Qwen-7B SFT,K=1→32) | 选择准确率 | 20.6% → 57.9%(随 K 单调上升) | plurality 在 K=16 后停在 32.5% | 差距从 K=2 的 7.7pp 扩到 K=32 的 25.4pp [18.3, 32.3] |
| bnlearn 十个贝叶斯网络(supplied 图) | find-one-valid 调整集准确率 | CALVER 56.8%(pooled, n=410) | plurality 39.8% | +17.1pp [13.4, 20.7] |
| bnlearn 散文重述(L3 自然语言,exact 图恢复仅 34%) | 调整集准确率 | CALVER 50.9%(n=273) | plurality 33.3% | +17.6pp [11.4, 24.2],验证查询局部不变性 |
| K&K 骑士无赖(4 人谜题) | 唯一解命中率(K=8) | CALVER 63%(真值表一致性) | plurality 26% | +37pp [29, 44],跨域验证选择原理 |
| 因果识别(candidate-target DoVerifier,独立证明器) | 选择准确率 | 80.0%(n=240) | 首样本 49.6% | +30.4pp,原理不依赖自家 checker |
| 严格 ATE 阈值决策($|\theta|\ge 0.02$ 裕度层) | 选择准确率 | CALVER 64.0%(n=114) | plurality 49.1% | +13.7pp [7.2, 20.1],定理 1 保证正确性 |
局限与改进
作者划定三道明确边界。第一,CALVER 只在已采样轨迹里挑,对『现实中的因果图是否科学正确』没有意见——它假定给定的 $G^\star$ 与 $P$ 是对的,定理 1 也以这一假定为前提。第二,当答案几乎唯一时(CLadder、Corr2Cause 这类二值接口任务),有效性类没有可碎片化的质量,验证器无事可做:九个 K=8 池上 CALVER 与 plurality 在 2pp 以内且无显著差异,是预测到的空结果。第三,当文本到图的抽取足够可靠时 extract-then-solve 才是更好的架构——crossover 显示 L1/L2 上 solver 达 92.8%/96.7% 而 candidate-wise 仅 83.7%/82.4%。我额外观察到:候选池 coverage 是硬天花板(CLEAR 核心 51.8%),没出现任何有效候选的池谁也救不了;7B 未适配策略增益置信区间含零(+4.4pp [-0.8, 9.7]),说明 schema 适配是接进信号的必要条件;满分级平局率高达 0.638–0.910,最早索引规则虽经审计稳健但仍带任意性。
独立分析的弱点
(1)对 schema 适配的依赖:未微调的 7B 基座策略收益置信区间含零,因为模型常不按六槽 schema 输出,验证器拿不到可打分轨迹;可引入更鲁棒的容错解析器或轻量提示工程。(2)满分级平局偏任意:tie rate 普遍在 0.7 以上,多个满分正确候选并存时最早索引可能错失更优那条;可引入调整集最小性偏好或图结构熵等二阶信号打破平局。(3)只判阈值不判数值:定理 1 保证的是 Yes/No 阈值正确,不保证 $\hat\theta$ 数值精度,落在 $|\theta-\tau|\le\varepsilon$ 裕度带的样本被判未认证(实测 45 条错误都落这带);可构造保守数值置信区间证书或把 $\varepsilon$ 与样本量自适应绑定。(4)无法验证现实因果图的科学正确性:方法把图当给定输入,对专家给的图本身错不错不负责;可在多张候选图上做集成验证。(5)constructed-graph 模式依赖轨迹自报图:文本极晦涩(exact recovery 6%)时共识图不可靠、candidate-wise 也无显著优势(L3 两者不可区分);可先用轻量抽取器预筛再路由。
未来方向
作者明确提出的方向:构造一个推理时可用的路由信号,在 extract-then-solve 与 candidate-wise verification 之间自动切换;但他们实测『候选间边集协议度』无法充当此信号(L1–L3 中位协议度 1.00/1.00/0.92,预设 0.5 的门会把所有实例都送给 solver),因为模型读错文本时倾向于集体读错——需要更强的、与共识解耦的路由特征。基于成果可延伸的方向包括:(a)把 candidate-wise 可执行验证推广到一切有效性类可判定的领域——论文已用真值表逻辑(K&K)与独立 do-calculus 证明器(DoVerifier)做概念验证,下一步可拓展到约束满足、程序合成规范、几何定理;(b)把严格证书框架从 ATE 扩展到 ETT、反事实、识别性等其他因果阶梯层级;(c)研究『符号分数蒸馏』为何失败——0.5B PRM 把 RMSE 压到 0.83 却仍无法继承选择优势,暗示选择只依赖相邻满分的相对序而非绝对分;(d)结合 LLM-as-graph-extractor 与 CALVER 形成端到端可验证因果问答系统。
复现评估
复现门槛偏高但作者承诺充分开源:Code and Data Package 正在准备公开发布,含源记录、生成候选及逐候选分数、分析脚本;类型化图解析器与严格 ATE 验证器放 lib/,各 scorer 放 scorers/,每个结果目录记录模型/adapter 标识、prompt 版本、量化配置、seed、语料 hash、scorer 版本;per-candidate 分数与轨迹并排存储,使所有选择器对比可在 CPU 上重跑而无需模型推理。算力:训练在 A100 与 H100 集群上以 bfloat16 跑,1.5B 约 3 GPU-小时/seed、7B 约 12 GPU-小时/seed;符号打分仅 1–8 ms/候选单 CPU 线程。验证基础设施用 15 万例 NetworkX 对比 DAG d-分离、5 万例独立 active-path 比对 ADMG m-分离、104 例枚举 SCM 比对后门、19,176 候选重命名测试,全部 0 分歧。区间为按问题聚类的 paired bootstrap,未按端点挑选。核心算法实现成熟,门槛在重跑大模型采样与对齐多 selector 比较。
论文图表
柱状图比较两种架构在 153 个可执行单元上的准确率:L1 上 extract-then-solve 92.8% 对 CALVER 83.7%;L2 上 96.7% 对 82.4%(CALVER 恰好踩在 coverage 上界);L3 上 exact 图恢复跌到 17.2%,两者统计上不可区分(solver 83.7% 对 CALVER 85.6%)。横轴为三个散文等级,纵轴为选择准确率,并标注 candidate coverage 作为后生成上界。
这张图划定了 CALVER 的适用边界:文本足够清晰时直接抽一张图精确求解更好;文本歧义大、不同轨迹保留不同查询局部事实时,candidate-wise 验证才是更优选择——这是论文给出的可操作实践规则。
折线图横轴为三个散文等级(edge-stated / mechanism-explicit / naturalistic),纵轴为 exact graph recovery 率。随着文本间接度上升,精确图恢复率从约 60% 跌到约 6%,extract-then-solve 相对 candidate-wise verification 的领先优势随之消失。两条曲线在 L3 自然语言档几乎重合,说明当共识图不可靠时两种架构等效。
从机制层面解释了 Figure 3 的交叉点:solver 的强项完全依赖能抽出一张可靠共识图,一旦文本让不同轨迹读出不同图,共识图就不再可信——这正是 candidate-wise 验证仍有用武之地的根本原因。
柱状图(左轴为绝对提升 pp、右轴为占 intact lift 的份额)展示在固定候选池下人为损坏给定图后的效果:delete 10% / add 10% / reverse 10% / mixed / random / fully-reversed。损坏查询无关边几乎不影响,损坏 25% 的 mixed 仍保留过半收益,只有 random 与 fully-reversed 才把收益削掉一半以上。
这张图用控制实验直接验证了命题 12 与查询局部不变量 $\sigma_G(X,Y,Z)$ 的预测——全局 edge-F1 不是关键,查询相关的那几条边才是,它解释了为何 exact 图恢复只有 34% 时 CALVER 仍能 +17.6pp。