← 返回 2026-08-13

从原子证据到逻辑组合:复合答案选项上的结构化组合推理 From Atomic Evidence to Logical Composition: Structured Compositional Reasoning over Compound Answer Options

Obed Junias, Maria Leonor Pacheco 📅 2026-08-13 👍 2 2026-08-18 18:30
LLM逻辑推理 基准数据集 整数线性规划 神经符号方法 组合推理 置信度校准

把复合选项拆成原子证据、用算子约束ILP组合,NEITHER/NOR宏F1从14跃至76.8

前置知识

组合性缺口 (compositionality gap)

指模型能正确解决任务的各个子问题、却无法把它们组合成正确整体答案的现象。Press et al. (2023) 首次系统测量:模型对原子问题的直接回答准确率不低,但要求其把两个已知答案组合起来时显著下降。本文把它具体化到复合答案场景:Llama-3.1-8B 对单个原子答案的判断准确率约 0.824-0.830,但在带 AND/OR/NEITHER/NOR 算子的复合选项上一步预测时整体 Macro-F1 跌到 44-48,尤其在否定组合上崩溃到 7-14。

这是全文的问题定义与动机基础,所有实验本质上都在度量该框架把这个缺口缩小了多少,不理解这个概念就无法理解为什么『分解+约束组合』是有针对性的解法。

整数线性规划 (ILP)

一类数学优化问题:在一组线性等式/不等式约束下最大化或最小化一个线性目标函数,且要求全部或部分变量取整数值。本文使用二元变量 $y_a \in \{0,1\}$(原子答案是否成立)与 $x_i \in \{0,1\}$(选项是否有效),把每个逻辑算子的真值表精确写成线性不等式——例如 AND 对应 $x_i \le y_1$、$x_i \le y_2$、$x_i \ge y_1 + y_2 - 1$——再用 Gurobi 13.0.2 求解,从数学上保证逻辑约束不可能被违反。

方法的核心组合层就是一个算子约束 ILP,理解约束如何编码真值表才能看懂 3.6 节、以及为何 oracle 实验中组合层错误率为零。

置信度校准 (Platt scaling / isotonic regression)

让模型输出的置信分数与真实正确概率对齐的后处理技术。Platt scaling 对原始分数拟合一个逻辑斯蒂(S 形)变换 $\sigma(w \cdot s + b)$;isotonic regression 拟合非递减的分段常数映射,不预设 S 形关系。评估指标常用 Brier 分数(预测概率与 0/1 金标的均方差)和 log loss(对高置信错误惩罚极重)。本文中未校准原始分数的 log loss 高达 0.8141,说明分数严重过度自信。

原子分数要跨实例比较后送入 ILP 参与全局优化,校准是保证分数可比性的必要环节;论文的相对校准还是三大贡献之一。

Macro-F1

多分类评估指标:分别计算每个类别的 F1(精确率与召回率的调和平均),再对类别取简单平均而非按样本数加权。当类别不平衡时,它比 accuracy 更能反映模型在少数类上的表现,因为每个类别权重相同。

论文所有主表(Table 1-8)的主指标都是 Macro-F1;由于『恰好一个有效选项』的任务结构导致预测类别天然不平衡,Macro-F1 比准确率更敏锐地暴露了 NEITHER/NOR 上的崩溃。

心智模型理论 (mental model theory)

Johnson-Laird 等人提出的人类推理心理学理论:人不是应用形式证明规则,而是构建与逻辑表达式相容的可能情形的心智表征来推理。据此合取 $A \wedge B$ 可维持为单一联合可能性,析取 $A \vee B$ 需要在头脑中同时维持并比较多个备选分支,否定则要求表征原命题的同时追踪它被拒绝的状态,因此人类难度排序为 AND < OR < NEITHER/NOR。

论文观察到 LLM 的失败排序与人类心理负荷预测完全一致(Figure 1),以此论证失败源于可能性的表征与组合方式而非知识缺失,这是 motivation 部分的理论框架。

对比/成对评估 (contrastive judgment)

不孤立地给单个陈述打分,而是把相互对立的候选(如『X 满足约束』与『X 不满足约束』)放进同一个提示中让模型比较选择,再由选择的概率导出分数。已有研究表明这种比较式判断比逐点评估更可靠、校准性质更好。本文的 paired MC 策略即属此类:正/负假设作为选项 A/B 同场竞技。

方法的证据引出阶段就建立在成对比较上,消融实验(Table 7-8)证明它显著优于独立 True/False 判断、生成采样和语言化置信,是证据质量的关键设计。

研究动机

大型语言模型在常识问答与阅读理解上表现出色,但在需要把多个原子判断用显式逻辑算子组合的任务上会系统性失败。Junias 和 Pacheco (2026) 在复合答案选项基准上报告了一个分级失败模式:模型在合取(AND)选项上最强(Macro-F1 约 56-71),在析取(OR)上变弱(约 51-66),而在含否定的 NEITHER/NOR 上彻底崩溃——用 Llama-3.1-8B-Instruct 做 0 到 3 shot 直接提示,NEITHER/NOR 的 F1 仅 7.2-14.5,MIXED 混合算子设置也只有约 40-48。更关键的是,这种难度排序跟随算子类型而非题目内容:同样的知识,换一种逻辑包装性能就崩塌,说明问题出在可能性的表征与组合方式,而非知识缺失。心理学中的心智模型理论早就预言了人类身上同样的排序:合取可维持为单一联合可能性,析取必须维持并比较多个备选,否定要求同时表征原命题及其被拒状态,NEITHER/NOR 兼具两种负担。标准提示把原子评估与逻辑组合融合在一次前向中完成,由此产生组合性缺口——模型单独判断每个原子往往是对的,却无法在单步内正确组合,而且一旦出错既无法定位失效环节,也无法保证约束不被悄悄违反。

本文的目标是本文的目标是把『对每个原子答案的证据评估』与『按逻辑算子的组合』彻底解耦:让模型只做前者,由求解器做后者,从而消除组合性缺口。具体而言,给定包含四个复合选项的实例(每个选项由两个原子答案与一个显式算子 AND/OR/NEITHER/NOR 构成),模型不应看到任何复合选项,而只需对每个唯一原子给出『它是否满足上下文』的可靠局部证据分数;随后由一个算子约束的整数线性规划(ILP)在校准后的分数上联合推断所有原子的真值,并在『恰好一个选项有效』的硬约束下选出唯一预测。作者同时在常识问答与阅读理解两个模态上验证该方法:在既有的 LOGICAL-COMMONSENSEQA 上评估,并从 SATA-Bench 构造了新的阅读理解基准 LOGICAL-SATA。作者希望证明三点:(1) 显式约束组合在析取和否定等困难算子上带来大幅提升;(2) 利用实例内相对信息的相对校准能进一步改善,尤其在 MIXED 设置;(3) 分层设计使原子级错误可以通过组合层的行为被系统诊断。

与已有工作不同的是,面对组合性缺口,已有两条主流路线各有短板。第一条是分解式提示:思维链、分解提示(Khot et al. 2023)、EntailmentBank/DecompNLI 等让模型显式产出中间证据,或对对立候选做对比判断(Liusie et al. 2024);这些方法能产出丰富的局部证据,但最后的组合仍是一次无约束的自由生成——模型可能悄悄违反逻辑约束,出错时也无法区分是评估还是组合环节失效。第二条是神经符号方法:Logic-LM、SAT-LM、LINC 先把自然语言问题自动形式化为形式表示再交给求解器,组合虽被强制保证,却把全部负担转移到极不可靠的自动形式化上,翻译错一步全盘皆错。本文的独特切入是注意到复合答案任务的特殊性:逻辑结构已经显式写在选项里(如 a AND b),根本不需要翻译——上下文与原子始终保留在自然语言中,形式层只承担纯逻辑组合,自动形式化这一最大误差源被完全绕开。剩下的只是产出可靠原子证据并施加不可违反的组合约束。此外作者指出校准不应只看分数绝对值:因为每个实例恰好一个正确选项,原子分数的实例内相对地位(排名、标准化分、与最高分之差)才是决定组合结果的关键信息,这催生了相对校准。

核心方法

方法的直觉来自一组诊断数字:把金标原子状态直接喂给 ILP 时,两个基准上的复合准确率都是 1.00(由任务构造保证);Llama-3.1-8B 的原子判断准确率约 0.824-0.830,但直接预测复合选项时整体 Macro-F1 只有 44-48。也就是说模型『知道』每个原子是否成立,却在一步内组合时大量失分。技术路线分五步:(1) 确定性解析,把每个选项拆成三元组 $A_i = (a_i^{(1)}, \circ_i, a_i^{(2)})$,并收集全实例唯一原子集合 $U_C$,跨选项共享的原子只保留一份;(2) 为每个原子 $a$ 构造一对互相对立的自然语言假设 $h_C^+(a)$($a$ 满足上下文约束)与 $h_C^-(a)$(不满足);(3) 把两个假设作为选项 A/B 放进同一个提示,取首答案 token 的 logits 做 softmax 得到原始对比分数 $s^{\pm}_{C,\text{raw}}(a)$;(4) 在带原子金标的训练集上拟合计分器进行校准(Platt、isotonic 或相对校准),得到 $s^{\pm}_{C,\text{cal}}$;(5) 建立二元 ILP:原子变量 $y_a$ 与选项变量 $x_i$ 之间用精确编码算子语义的线性不等式相连,外加 $\sum_i x_i = 1$ 的唯一性约束,目标最大化原子证据总量,用 Gurobi 求解。整个过程模型从不面对复合选项,逻辑完全由求解器承担。

核心创新有三点,环环相扣。第一,对比式原子证据:对每个原子不是孤立打分,而是在同一提示中并排呈现正/负两个假设让模型二选一,得到的是对同一原子两种读法的比较而非绝对置信——文献表明成对比较比逐点评估更可靠;消融显示 paired MC 比独立 True/False 判断在 LCQA-NV 上高 1.6 个 F1(76.2 vs 74.6),比语言化置信高出近 20 个点(56.8)。第二,组合即求解:与自动形式化路线不同,算子语义由确定性解析获得并用线性不等式精确编码(如 AND 对应 $x_i \le y_1$、$x_i \le y_2$、$x_i \ge y_1 + y_2 - 1$),求解器不可能违反逻辑;且原子跨选项共享一个变量,同一命题在整个实例中只被判断一次,保证全局一致性,也让错误传播可以被逐算子分析。第三,相对校准:作者观察到两个 0.91 与 0.86 的原子分数意味着什么,取决于其余原子在 0.9 附近还是 0.2 附近——Platt/isotonic 这类全局单调映射无法表达这一点。相对校准把实例内标准化分 $z_C(a)$、排名 $\operatorname{rank}_C(a)$、与实例最高分之差 $s^+_{C,\max} - s^+_{C,\text{raw}}(a)$ 连同 logit 一起作为特征喂给逻辑回归,直接面向『恰好一个正确选项』的任务结构,在 MIXED 设置带来最大增益:LCQA +4.9、LSATA +11.2 个 F1。

方法步骤详情

完整流程如下。第一步任务形式化:实例含上下文 $C=(P,q)$ 与四个选项,每个选项 $A_i = a_i^{(1)} \circ_i a_i^{(2)}$,算子 $\circ_i \in \{\text{AND}, \text{OR}, \text{NEITHER/NOR}\}$;组合规则 $\phi_\circ: \{0,1\}^2 \to \{0,1\}$ 定义为 AND 取 $\rho_1 \wedge \rho_2$、OR 取 $\rho_1 \vee \rho_2$、NEITHER/NOR 取 $\neg\rho_1 \wedge \neg\rho_2$;每个实例由构造恰好一个金标选项有效。第二步确定性解析与假设构造:把选项拆解汇成 $U_C$,对每个原子 $a$ 用模板生成 $h_C^+(a)$ 与 $h_C^-(a)$ 两条自然语言假设(要求原样使用原子陈述、不得判定谁对谁错),例如对 chalk 生成『chalk 是白板书写工具』与其否定。第三步置信度引出:把两条假设作为 A/B 放入同一提示,取 $\ell^+$ 与 $\ell^-$ 两个首答案 token 的 logits,按 $s^{\pm}_{C,\text{raw}}(a) = \exp \ell^{\pm} / (\exp \ell^+ + \exp \ell^-)$ 归一化,两分数之和为一、互为补数。第四步校准:在 2,400 条带原子金标的训练实例上拟合——Platt scaling(逻辑变换)、isotonic(非参数单调映射)或相对校准;相对校准以特征向量 $f_C(a) = [\operatorname{logit} s^+_{C,\text{raw}}(a);\ z_C(a);\ \operatorname{rank}_C(a);\ s^+_{C,\max} - s^+_{C,\text{raw}}(a)]$ 输入逻辑回归 $s^+_{C,\text{cal}}(a) = \sigma(w^\top f_C(a) + b)$,负分数取 $1 - s^+_{C,\text{cal}}$。第五步全局推理:Gurobi 求解二元 ILP——AND 约束 $x_i \le y_1,\ x_i \le y_2,\ x_i \ge y_1 + y_2 - 1$;OR 约束 $x_i \ge y_1,\ x_i \ge y_2,\ x_i \le y_1 + y_2$;NEITHER/NOR 约束 $x_i \le 1 - y_1,\ x_i \le 1 - y_2,\ x_i \ge 1 - y_1 - y_2$(即 OR 约束的补),外加 $\sum_{i=1}^4 x_i = 1$;目标为 $\max \sum_a s^+_C(a)\, y_a + s^-_C(a)(1 - y_a)$,输出 $x_{\hat{i}} = 1$ 的唯一选项索引。当局部证据使多个或零个选项逻辑有效时,求解器在分数引导下调整原子赋值以满足唯一性约束。

技术新颖性

从学术谱系看,本文属于 prompt-based structured prediction 一脉(Mehta et al. 2024;Pauk & Pacheco 2016/2026):用提示获取局部分数、用组合推断保证约束,与 DRaiL、Pujari & Goldwasser (2019) 的『神经打分 + ILP』框架同源。其新颖性体现在三处。其一,问题选择的巧妙:复合答案选项让逻辑结构免于自动形式化——这是相对 Logic-LM/SAT-LM/LINC 的本质区别,上下文与原子始终留在自然语言中,形式层只承担纯逻辑组合,绕开了 autoformalization 这个神经符号路线的最大误差源,也使『哪个环节出错』变得可诊断。其二,证据引出与约束设计的耦合:跨选项共享原子意味着一个错误判断会以算子特定的方式传播(OR 能容忍假阳性,AND/NEITHER/NOR 一票否决),Table 10 展示同一组分数在不同算子构造下产生完全不同的预测结果,这种传播机制分析在单步提示范式下无从谈起。其三,相对校准是一种新的校准范式:传统后处理校准(Platt 1999;Zadrozny & Elkan 2002)只映射单点分数,而本文把实例内排名与分差纳入特征,显式利用任务的全局唯一解结构。此外,LOGICAL-SATA 基准把 SATA-Bench 的独立标注答案按算子语义程序化重组为复合选项(1,390 个合格源问题中选 1,350 个,生成 5,400 个实例),为阅读理解模态提供了首个带显式布尔算子复合选项的测试集。

Overview of the proposed framework. Each compound answer option is decomposed into two atomic answers and its explicit operator. The LLM scores local evidence for each atom, and an operator-constrained ILP combines these scores to select exactly one answer option under the corresponding operator semantics.
Figure 2: Overview of the proposed framework. Each compound answer option is decomposed into two atomic answers and its explicit operator. The LLM scores local evidence for each atom, and an operator-constrained ILP combines these scores to select exactly one answer option under the corresponding operator semantics.
Structure of LOGICAL-COMMONSENSEQA instances. Operator-specific instances use the same operator across all four options, whereas MIXED instances may contain different operators.
Figure 3: Structure of LOGICAL-COMMONSENSEQA instances. Operator-specific instances use the same operator across all four options, whereas MIXED instances may contain different operators.
Construction of LOGICAL-SATA from SATA-Bench. Each source instance provides a paragraph, a reading-comprehension question, and independently annotated correct and incorrect atomic answers. Pairs of atomic answers are combined according to the semantics of AND, OR, and NEITHER/NOR. Each source question produces one item for each operator-specific setting and one MIXED item.
Figure 4: Construction of LOGICAL-SATA from SATA-Bench. Each source instance provides a paragraph, a reading-comprehension question, and independently annotated correct and incorrect atomic answers. Pairs of atomic answers are combined according to the semantics of AND, OR, and NEITHER/NOR. Each source question produces one item for each operator-specific setting and one MIXED item.

实验结果

主要结果分五块。(1) 总体:在 LOGICAL-COMMONSENSEQA 人工验证集(HV)上,最强直接基线是 0-shot CoT 的 48.3 Macro-F1,结构化推理的 paired MC 达 75.8(+27.5),加相对校准进一步到 77.0;LOGICAL-SATA 上同样从 47.0 升至 72.2、75.6。(2) 按算子分解:增益集中在析取与否定——NEITHER/NOR 从 14.0 升到 76.8(LCQA-HV)、从 12.6 升到 73.4(LSATA),而直接提示在 1-3 shot 下甚至跌到 7.2-9.9,说明模型其实保留了有用的原子证据、只是无法在复合预测中组合两个否定判断;AND 上增益最小(70.8→72.4 与 70.9→73.6),印证合取本来就能在单步内完成。(3) 校准:相对校准在 MIXED 设置增益最大(LCQA 70.3→75.2,+4.9;LSATA 60.9→72.1,+11.2)——当四个选项共享算子时全局分数偏置会互相抵消,而 MIXED 中 AND/OR 要求接受、NEITHER/NOR 要求拒绝,同一偏置会偏袒某个算子,只有实例内相对特征能纠正;原子校准质量上,LSATA 的 Brier 分数从 0.1896 降到 0.1449、log loss 从 0.8141 降到 0.4438,LCQA-HV 从 0.1919/0.6368 降到 0.1464/0.4567,log loss 降幅比例更大说明原始分数是过度自信而非仅仅排序错乱。(4) 诊断实验:给 ILP 金标原子状态时两基准准确率均为 1.00(构造保证);模型原子准确率 0.830(LCQA-HV)/0.824(LSATA),对应复合准确率 0.758/0.723,说明残余误差几乎全部来自原子证据而非逻辑组合。(5) 消融:paired MC 总体优于独立 True/False(LCQA-NV 76.2 vs 74.6)、生成采样(73.2,且方差大)和语言化置信(56.8);非验证集(NV)上 paired MC + 相对校准总体达 77.9,趋势与 HV 一致。

Macro-F1 on the human-validated (HV) split of LOGICAL-COMMONSENSEQA. NN = NEITHER/NOR.
Table 1: Macro-F1 on the human-validated (HV) split of LOGICAL-COMMONSENSEQA. NN = NEITHER/NOR.
Macro-F1 on the LOGICAL-SATA test set.
Table 2: Macro-F1 on the LOGICAL-SATA test set.
Atomic calibration results on LSATA and the LCQA's human-validated split. Brier score is the mean squared error between the predicted probability that an atomic answer is supported and its gold binary status.
Table 3: Atomic calibration results on LSATA and the LCQA's human-validated split. Brier score is the mean squared error between the predicted probability that an atomic answer is supported and its gold binary status.
Macro-F1 on the non-validated (NV) split of LOGICAL-COMMONSENSEQA. NN = NEITHER/NOR.
Table 4: Macro-F1 on the non-validated (NV) split of LOGICAL-COMMONSENSEQA. NN = NEITHER/NOR.
Accuracy on the non-validated (NV) and human-validated (HV) subsets of LOGICAL-COMMONSENSEQA.
Table 5: Accuracy on the non-validated (NV) and human-validated (HV) subsets of LOGICAL-COMMONSENSEQA.
Accuracy on the LOGICAL-SATA test set.
Table 6: Accuracy on the LOGICAL-SATA test set.
Macro-F1 for alternative confidence elicitation strategies on the non-validated (NV) and human-validated (HV) subsets of LOGICAL-COMMONSENSEQA. NN denotes NEITHER/NOR.
Table 7: Macro-F1 for alternative confidence elicitation strategies on the non-validated (NV) and human-validated (HV) subsets of LOGICAL-COMMONSENSEQA. NN denotes NEITHER/NOR.
Macro-F1 for alternative confidence elicitation strategies on the LOGICAL-SATA test set.
Table 8: Macro-F1 for alternative confidence elicitation strategies on the LOGICAL-SATA test set.
Representative semantic atomic errors in LOGICAL-COMMONSENSEQA (LCQA) and LOGICAL-SATA (LSATA). The examples include direct atomic scoring errors, broad interpretations of open-ended questions, insufficient attention to modifiers, and failures to identify applicable document labels.
Table 9: Representative semantic atomic errors in LOGICAL-COMMONSENSEQA (LCQA) and LOGICAL-SATA (LSATA). The examples include direct atomic scoring errors, broad interpretations of open-ended questions, insufficient attention to modifiers, and failures to identify applicable document labels.
Different effects of atomic scoring errors across logical constructions based on the same LOGICAL-COMMONSENSEQA question.
Table 10: Different effects of atomic scoring errors across logical constructions based on the same LOGICAL-COMMONSENSEQA question.
查看结构化数据
任务指标本文基线提升
复合答案选择(LOGICAL-COMMONSENSEQA 人工验证 HV 集,总体) Macro-F1 77.0(paired MC + 相对校准) 48.3(0-shot CoT 直接提示,Llama-3.1-8B-Instruct) +28.7(paired MC 无校准即达 75.8,+27.5)
LOGICAL-COMMONSENSEQA NEITHER/NOR 设置(HV) Macro-F1 76.8(paired MC + 相对校准) 14.0(0-shot 直接提示;CoT 仅 13.9) +62.8
LOGICAL-SATA 测试集(总体) Macro-F1 75.6(paired MC + 相对校准) 47.0(0-shot CoT) +28.6
LOGICAL-SATA NEITHER/NOR 设置 Macro-F1 73.4(paired MC + 相对校准) 12.6(0-shot CoT) +60.8
LOGICAL-SATA MIXED 混合算子设置 Macro-F1 72.1(paired MC + 相对校准) 60.9(paired MC 无校准) +11.2(相对校准带来的增量;LCQA MIXED 同口径 +4.9)
原子置信度校准质量(LOGICAL-SATA) Brier 分数 / Log loss(越低越好) 0.1449 / 0.4438(相对校准) 0.1896 / 0.8141(未校准原始分数) Brier 降 23.6%,log loss 降 45.5%

局限与改进

作者承认的局限:实验只用 Llama-3.1-8B-Instruct 一个模型、两个基准,且都是二元算子、每选项恰好两个原子;结果不能外推到其他模型家族、更大模型、更长逻辑表达式或蕴含/异或等算子;基准强制恰好一个有效选项,而现实任务可能允许多个或零个正确答案;框架质量受制于原子证据——LCQA 中开放式常识问题存在多个合理解释(如『离开家在哪里能看到小瓶洗发水』模型高置信接受酒店、度假租赁、邮轮商店、健身房淋浴等多个原子),修饰词常被忽略(『不常见的酒精副作用』中模型判断了副作用本身的合理性却无视 uncommon);LSATA 继承 SATA-Bench 的标签定义与领域覆盖,模型常抓住文章主题却漏掉更宽泛或次级标签(如识别出产品发布却低估 company description);结果对提示设计、校准数据与置信引出策略敏感。我自己的补充观察:其一,校准器需要带原子级金标的训练数据(2,400 条),在新领域是额外标注成本;其二,成对 MC 依赖首 token logprobs,闭源 API 模型无法直接复用,而作者试验的替代方案都明显更弱;其三,Gurobi 是商业求解器;其四,打分温度取 0.7 而非 0,引入了不必要的随机性;其五,LOGICAL-SATA 由『至少两正三错』的源问题机械配对生成,复合选项可能显得不自然,模型或求解器可利用配对与唯一性痕迹走捷径。

独立分析的弱点

独立分析可见以下弱点。第一,原子证据成为新瓶颈:oracle 实验显示组合层零错误,而原子准确率只有 0.824-0.830,复合准确率被锁死在 0.72-0.76;改进方向是对每个原子做多次对比采样并聚合、引入更强的外部验证器,或针对修饰词(uncommon、broad 类)设计更敏感的假设模板,把修饰条件显式写入正负假设。第二,『恰好一个有效选项』是理想化假设:现实中多选任务允许多个甚至零个正确答案,此时应去掉 $\sum x_i = 1$ 约束、改用阈值化决策,ILP 仅做逻辑一致性检查。第三,表达能力受限:只覆盖两原子三算子,遇到 $A \wedge (B \vee C)$ 这类嵌套或蕴含、异或就需要递归分解与通用组合树,现有的确定性解析器也需升级为鲁棒的自然语言算子识别。第四,证据引出绑定首 token 概率,对黑盒模型不友好;可改进生成采样策略的方差(当前比 paired MC 低约 3 个 F1),例如增加采样次数并做温度退火。第五,单模型单规模:未测 GPT-4 级或 70B 模型,组合性缺口在更强模型上可能自然缩小,方法的边际价值需重估;温度 0.7 的选择也应消融。第六,基准可利用性:MIXED 实例中同一原子金标在四个选项间复用、且唯一有效选项由构造保证,模型理论上可从标签一致性模式中找捷径而非真正理解逻辑。

未来方向

作者明确提出的方向包括:扩展到超过两个原子的选项;支持蕴含、异或与嵌套表达式等更丰富的逻辑结构;处理原子答案与算子必须从非结构化文本中抽取的设定——届时自动形式化问题会部分回归,需要更鲁棒的解析;用概率公式替换硬推断,让原子不确定性传播到复合预测、输出选项上的分布而非单点选择;以及在更多模型家族与推理基准上检验组合性缺口的普遍性。基于本文成果还可延伸:把相对校准推广为通用的『实例条件化校准』——任何具全局唯一解结构的任务(排序、指派、约束多选)都可利用排名与分差特征;将算子约束与自洽性采样结合,在原子层做多数投票后再送 ILP;把框架迁移到多跳问答和 agent 规划中的逻辑前置条件检查;利用误差传播规律(OR 容忍假阳性、AND/NEITHER/NOR 一票否决)设计主动证据获取策略,优先让模型复核出现在 AND/NEITHER/NOR 选项中的原子;以及在 LOGICAL-SATA 上反向使用构造管线,用强模型合成带嵌套算子的更难反例来测试方法边界。

复现评估

复现条件相当友好。数据完全公开:HuggingFace 上的 ojayy/logical-csqa 与 ojayy/logical-sata,代码在 github.com/obedjunias19/structured-compositional-reasoning。算力需求低:全部实验基于 Llama-3.1-8B-Instruct,单卡 NVIDIA A100 即可,没有任何微调;ILP 用 Gurobi Optimizer 13.0.2 求解,但问题规模极小(每实例约十来个原子变量加 4 个选项变量),免费许可的规模限制内绰绰有余,也可换用开源求解器重写约束。校准器只是在 2,400 条训练实例的原子标签上拟合的逻辑回归/Platt/isotonic——LCQA 校准集从训练集按四个逻辑设置平衡采样 2,400 条,LSATA 直接用全部 2,400 条训练集。推理开销主要是每个唯一原子一次成对 MC 调用(每实例约 8 个原子),打分温度 0.7、五次运行取平均、随机种子 42;附录 E 提供了全部提示模板与代表性示例,附录 A-D 覆盖实现细节、NV 结果与消融。主要复现风险:首 token logprob 的提取方式因推理框架而异、确定性解析器对自然语言算子变体的鲁棒性,以及 Gurobi 与开源求解器在退化情形(局部证据使零个或多个选项可行时求解器如何调整原子赋值)上的行为差异。总体难度评级:入门到进阶,一两天内可跑通主结果。