← 返回 2026-07-17

划分、提示、聚合:语言模型的统计自洽性 Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models

Patrik Wolf, Thomas Kleine Buening, Andreas Krause, Celestine Mendler-Dünner 📅 2026-07-16 👍 9 2026-07-22 18:54
人格提示 全概率公式 分布对齐 大语言模型 条件推断 自洽性评测

用全概率公式检验 LLM 估计的统计自洽性,发现宏观谬误等系统性违反

前置知识

条件推断 (conditional inference)

把上下文学习(ICL)视为概率论中的条件分布:提示给出条件事件 $X\in S$,模型输出被当作对该条件分布 $P(Y|X\in S)$ 的样本或估计。论文据此推出若干可检验的恒等式(如全概率公式),若 LLM 真在做条件推断,这些恒等式应被满足。

整个工作的核心假设。如果条件推断视角不成立,那么大量把 LLM 输出当作后验、条件概率、子群体统计量的下游用法(人格模拟、合成调查、贝叶斯专家)就缺少理论支撑,论文正是要压力测试这个假设。

全概率公式 / 全期望公式 (law of total probability / expectation)

对总体 $\mathcal{X}$ 的任意有效划分 $\mathcal{P}=\{S\}$,有 $P(E|X\in\mathcal{X})=\sum_{S\in\mathcal{P}}\gamma_S P(E|X\in S)$,其中 $\gamma_S$ 是子群相对大小。更一般地,对任意可测函数 $h$ 有 $T_h(S)=\sum_R \gamma_R T_h(R)$,其中 $T_h(S)\triangleq \mathbb{E}[h(Y)|X\in S]$。该恒等式是论文构造一致性检验的数学基础。

论文用它把同一个边际量等价地写成不同粒度的估计器(直接估计 vs. 聚合条件估计),从而把‘LLM 是不是一致的条件估计器’转化为可量化的偏离度量。

人格提示 (persona prompting)

在提示中加入人群属性(年龄、职业、所在地等),让模型以该视角作答(Argyle et al., 2023)。例如:『一位住在美国、31-68 岁、有工作的人』。属性描述的是子群体而非个人,因此输出应反映从该子群体抽样产生的不确定性,是 ICL 条件推断视角的典型实例。

这是论文的主实验场景(ACS 收入、WVS 意见)。属性既能构造子群体提示词,又能从调查数据中取真值统计量,使得 alignment 与 self-consistency 可以同时被检验。

分布对齐 (distributional alignment)

用人类参考数据评估 LLM 输出分布与目标人群真实分布的接近程度,已成为人格提示领域的标准评测指标(Santurkar et al., 2023; Meister et al., 2024)。常见度量包括总变差 TV、Wasserstein 距离等。论文用 alignment 误差 $\mathrm{AErr}(\ell)$ 比较不同粒度下重构出的聚合估计与 ACS 真值。

对齐和自洽性是互补的诊断维度:模型可能内部自洽但整体偏差(misaligned),也可能外部对齐但内部不一致。论文强调只看 alignment 会掩盖 self-consistency 维度的失败。

二叉条件树 (binary conditioning tree, BCT)

递归地把基总体 $\mathcal{X}$ 划分成越来越细的子群。形式化为元组 $T=(\mathcal{X},\{\phi_1,\dots,\phi_L\})$,每层一个二值划分函数 $\phi_\ell:\mathcal{X}\to\{0,1\}$ 对该层每个节点统一应用(不同于决策树)。同一层节点构成有效划分,深度越大粒度越细。论文第一个划分 $\phi_1(x)=\mathbb{1}(31\le \text{age}(x)\le 68)$(按年龄),第二个 $\phi_2(x)=\mathbb{1}(\text{受雇或自雇})$(按就业状态)。

BCT 提供了结构化的、可枚举的有效划分族,使全概率公式能在多层、多属性顺序下被系统检验;是 split consistency / order consistency 的几何骨架。

归一化 Wasserstein-1 距离

对于有序离散分布 $P,Q$ 支撑在 $\{1,\dots,K\}$ 上,定义 $W_1(P,Q)=\frac{1}{K-1}\sum_{k=1}^{K-1}|F_P(k)-F_Q(k)|$,其中 $F$ 为累积分布函数。归一化把距离映射到 $[0,1]$,使不同响应量表下的容差 $\epsilon$ 可比较。该度量对混合保持联合凸性,满足 split consistency 检验所需的 dist 公理。

这是论文在有序分类输出(收入分箱、Likert 量表)上的核心距离度量;容差 $\epsilon=0.02$ 用于把数值误差二值化为‘通过/不通过’。

研究动机

理论文献、社会模拟和大量下游应用都默认把上下文学习视为条件推断:提示指定条件事件,模型输出被当作相应条件分布 $P(Y|X\in S)$ 的样本或估计。比如人格提示中『一位 31-68 岁、住美国的人对某问题的看法』被当作从该子群体抽样的分布估计;又如在 LLM 预测(forecasting)中,把市场信息、新闻纳入上下文后期望模型按贝叶斯方式更新。然而当代 LLM 在多大程度上真的满足这种概率论解释,目前几乎没有人系统压力测试过。问题在于:如果条件推断视角站不住脚,那么 alignment 评测、合成调查生成、贝叶斯专家等大量应用就建立在一个未经验证的假设之上。更微妙的是,即便模型在某个具体 prompt 上输出看起来合理,也可能在不同 prompt 粒度或属性顺序下给出互不一致的估计,使得‘同一个目标量’被同一个模型算出多个不相容的答案。

本文的目标是本文的目标是把 ICL 的条件推断视角转化为可量化、可大规模检验的自洽性诊断框架,且不依赖外部 ground-truth 标签(reference-free)。具体地,作者希望:(1) 用全概率公式构造一族从边际到条件、跨划分粒度的等价估计器,并通过二叉条件树系统枚举划分;(2) 度量 LLM 在这些等价估计器之间的偏离程度,作为 self-consistency 的 benchmark;(3) 借助 ACS、WVS 等带真值的调查数据,深入剖析自洽性失败的来源(先验误差 vs 条件误差、组内 vs 组间方差),并探索轻量修复(如 micro-to-macro prompting);(4) 把这种自洽性检验推广到合成预测任务,证明其作为通用诊断工具的普适性。

与已有工作不同的是,已有工作主要在两条线上推进:一是直接评测分布对齐(Santurkar 2023、Durmus 2024),二是用逻辑一致性(合取、Bayes 法则、negation)做 reference-free 检验(Zhu & Griffiths 2024、Paleka 2025)。前者依赖外部真值且只看单点估计,后者检验的是孤立的逻辑关系而非‘跨划分的概率组合’。论文的独特切入角度是:以全概率公式 / 全期望公式为核心恒等式,用二叉条件树给出层级化、可枚举的划分族,使得‘同一个边际量可以等价地由不同粒度的条件 + 先验重构出来’。这把自洽性从‘逻辑关系成立’升级为‘概率组合成立’,并能在带真值数据上同时观察 alignment 与 self-consistency 两个维度的交互,从而揭示 macro fallacy 这种方向性失败模式——这是仅靠逻辑检查或对齐评测都看不到的。

核心方法

整体思路是『把抽象的概率恒等式变成可执行的 prompt 比对实验』。直觉上:如果 LLM 真在做条件推断,那么直接问它『美国成年人收入>50k 的概率』应该等于分别问它『年轻人组』『中老年组』、再用各自人口比例加权求和。技术路线分四步:(1) 构造一棵 BCT,每层用一个二值属性切分总体(如先按年龄再按就业状态),每层节点构成全概率公式需要的有效划分;(2) 对每个子群节点,用 verbalized 描述(拼接 $C_0+C_1+C_2$ 形式的字符串)作为提示,让 LLM 给出该子群条件分布估计 $\hat T_\tau(S)=\hat P(Y>\tau|X\in S)$,同时单独 eliciting 各子群先验 $\hat\gamma_S$;(3) 用全概率公式在每一层把子群估计重构为总体聚合估计 $\hat T_{\tau,\mathrm{agg}}(\mathcal{X})(\ell)=\sum_{S\in\mathcal{P}_\ell}\hat\gamma_S\hat T_\tau(S)$;(4) 比较各层重构值与直接根节点估计、与调查真值之间的偏离,从 alignment 与 consistency 两个维度量化模型行为。配套地,作者用归一化 Wasserstein-1 距离和容差 $\epsilon=0.02$ 把数值偏离二值化为通过/失败。

核心创新点在于用『划分等价性』取代『单点对齐』作为评测对象。已有方法只比较模型输出与真值在某一个粒度下的差距;本文指出同一个边际量 $P(E|X\in\mathcal{X})$ 对任意有效划分都应等价,因此可以把『直接估计』『多层重构估计』视为同一目标量的多个估计器,比较它们之间的差异。这种视角带来三个本质不同:(a) 它是 reference-free 的——即使没有 ground truth,仅靠模型自身在不同粒度下的估计之间也能检测到不自洽;(b) 它揭示了 macro fallacy:聚合重构往往比直接估计更准,这是一种系统性方向偏差,而不仅是随机噪声;(c) 它把 alignment 与 consistency 解耦——可以分别诊断『模型对人群的子知识是否可靠』与『模型能否把子知识正确传播到聚合层』。配套的 split consistency 与 order consistency 检查,分别对应『跨划分的概率组合』与『约束排列不变性』两种失败模式,可由 Proposition 2 和 7 在层置换下统一控制。

方法步骤详情

完整流程:(1) 数据准备——以 2024 ACS(380 万人)为真值人群,把收入分入 $[-11.5k,1),[1,25k),[25k,60k),[60k,1849k]$ 四个分箱,目标事件 $E_\tau=\{Y>\tau\}$,阈值 $\tau\in\{100,1k,10k,20k,40k,60k,80k\}$ USD 覆盖不同熵水平。(2) 建树——用回归树思想(最小化加权组内方差且保持先验平衡)选划分,第一层 $\phi_1=\mathbb{1}(31\le \text{AGEP}\le 68)$,第二层 $\phi_2=\mathbb{1}(\text{COW 为受雇或自雇})$,深度 $L=4$。(3) 子群估计——用 folktexts(Cruz et al. 2024)把节点路径 verbalize 为提示,例如 $C_0$=『一位住在美国的人』 + $C_1$=『一位 31-68 岁的人』 + $C_2$=『一位受雇或自雇的人』,问『此人的年收入高于 50 000 USD 的概率是多少?』得 $\hat T_\tau(S)$。(4) 先验估计——对每层多次查询模型关于划分的先验分布,原始输出重归一化后取平均得 $\hat\gamma_S$(细节见附录 E.2)。(5) 重构聚合——按公式 (3) 在每层做先验加权求和得 $\hat T_{\tau,\mathrm{agg}}(\mathcal{X})(\ell)$。(6) 计算 alignment 误差 $\mathrm{AErr}(\ell)=|T_\tau(\mathcal{X})-\hat T_{\tau,\mathrm{agg}}(\mathcal{X})(\ell)|$,并以 $1-\mathrm{AErr}(\ell)/\mathrm{AErr}(0)$ 作为相对增益。(7) 一致性评分——枚举所有 $(S,A_k)$ 对做 split consistency,枚举所有二属性排列对做 order consistency,统计通过率 $\mathrm{SC}_\epsilon$、$\mathrm{OC}_\epsilon$($\epsilon=0.02$)。(8) 复现与扩展——WVS(加拿大、印尼各 5 题)、合成预测(网球 Federer–Nadal、奇幻战斗)走同一流程。

技术新颖性

技术新颖性体现在四点:(1) BCT 提供了首个结构化、可枚举的划分族,使得全概率公式能在多层、多属性顺序下被系统性检验,避免依赖单一固定树结构;(2) Proposition 2 给出局部 split consistency 与多层累积误差的线性界($\mathrm{dist}<\ell\epsilon$),Proposition 6 在 Assumption 1(成对上下文无关)下证明只需 $4\binom{d}{2}$ 个成对检查即可控制所有事件阶序一致性,Proposition 7 把两者统一在层置换视角下;(3) 同时引入 reference-free(self-consistency)与 reference-based(alignment)两类诊断,并通过 oracle-prior 消融把先验误差与条件误差解耦;(4) 提出 micro-to-macro prompting——让模型在单个 prompt 内先推理子群再给聚合,无需外部指定划分即可部分恢复聚合收益,且与 test-time compute 单调性不相容(更深树调用更多模型反而更差),证明收益来自『显式子结构』而非调用次数。

Reconstructing aggregate estimates from subpopulation estimates.
Figure 1: Reconstructing aggregate estimates from subpopulation estimates.

实验结果

实验从对齐与自洽两个维度展开。**Macro fallacy(核心发现)**:Figure 3 显示,把子群条件估计按先验聚合重构出的总体估计,在 alignment 上系统性优于直接根节点估计。左侧(GPT-5.4,$\tau$ 从 100 USD 到 80k USD)所有阈值在 $\ell=1,2$ 都给出正相对增益;右侧($\tau=40k$ USD)跨 GPT-4o mini、Opus 4.7、Sonnet 4.6、3.1 Pro、4.20、3 Flash、3.6 Plus、K2.6 等模型也都为正,橙色平均曲线呈凹形——随着深度先上升后下降,说明存在『更好的条件特异性』与『更难的先验』之间的权衡。**误差解耦**:Figure 4a 显示节点级 alignment 误差在前两层显著改善(绿色,叶子下方数字为调查先验,如 33%/0%/10%/9%/7%/0%/12%/29%),但 level 3 出现两个先验极小但局部误差大的节点,对加权平均影响有限;Figure 4b 显示 LLM 估计的先验与调查先验之间的 TV 距离随深度单调上升($\sim 10^9$ 量级上呈 $10^0\to 10^0$ 上升),证实先验随深度退化;Figure 4c 用全方差公式 $V(Y)\equiv\mathbb{E}[V(Y|A)]+V(\mathbb{E}[Y|A])$ 展示组内方差(绿)下降、组间方差(蓝)上升,把异质性从『压缩』转向『显式』。**Micro-to-macro prompting(Figure 5)**:在 ACS 收入任务上跨 7 个模型、5 个阈值(100/20k/40k/60k/80k USD)的 win matrix 显示多数 tile 为绿(隐式聚合优于直接),平均误差增益 $\sim 0.1\sim 0.3$,但比显式树聚合更模型依赖。**Split / Order consistency(Table 1)**:在 ACS 收入上,GPT-5.4 SC=0.33/OC=1.00、Sonnet 4.6 SC=0.00/OC=0.25、Grok 4.3 SC=0.00/OC=0.50、Qwen3.6 Plus SC=0.17/OC=0.50;ACS 通勤时间(同样树,换目标变量)GPT-5.4 SC=0.17/OC=0.50——同一模型换任务,分数大幅波动,说明 self-consistency 不是单纯的模型属性。**模型规模扩展(Figure 6)**:跨 GPT、Gemini、Qwen、Claude 多个家族,AAI 指数从 ~10 涨到 ~50,但 SC 和 OC 都不随能力提升而系统性改善,order consistency 普遍高于 split consistency。**WVS(Table 2)**:加拿大与印尼各 5 题,GPT-5.4 平均 SC=0.55/OC=0.70,Sonnet 4.6 平均 SC=0.70/OC=0.90(最一致),DeepSeek V-3.2 平均 SC=0.32/OC=0.35(最不一致),无模型在所有问题上都一致。**合成预测(Table 3)**:网球任务所有模型 SC ≤ 0.50;奇幻战斗从 0(Qwen3.6 Plus 在网球)到 1.00(Qwen3.6 Plus 在奇幻)剧烈波动——即便没有 ground truth,self-consistency 仍可被评估。

Self-consistency in ACS prediction tasks.
Table 1: Self-consistency in ACS prediction tasks.
Self-consistency in global opinion prediction.
Table 2: Self-consistency in global opinion prediction.
Self-consistency in forecasting.
Table 3: Self-consistency in forecasting.
Relative gain of reconstructed aggregates over direct prompting.
Figure 3: Relative gain of reconstructed aggregates over direct prompting.
Disentangling the sources of estimation error.
Figure 4: Disentangling the sources of estimation error.
Benefit of implicit micro-to-macro prompting on ACS income estimation.
Figure 5: Benefit of implicit micro-to-macro prompting on ACS income estimation.
Model comparison.
Figure 6: Model comparison.
查看结构化数据
任务指标本文基线提升
ACS 收入分箱预测(alignment) 相对增益 $1-\mathrm{AErr}(\ell)/\mathrm{AErr}(0)$ 跨多模型在 $\ell=1,2$ 平均增益 +25%~+50% 直接 prompting($\ell=0$) 聚合重构在 alignment 上系统性优于直接估计(macro fallacy)
ACS 收入预测(自洽) $\mathrm{SC}_{0.02}$ / $\mathrm{OC}_{0.02}$ GPT-5.4: 0.33/1.00;Sonnet 4.6: 0.00/0.25;Grok 4.3: 0.00/0.50;Qwen3.6 Plus: 0.17/0.50 完美自洽应为 1.00/1.00 揭示前沿模型仍远未达到统计自洽,order > split
ACS 通勤时间预测(自洽,换目标变量) $\mathrm{SC}_{0.02}$ / $\mathrm{OC}_{0.02}$ GPT-5.4: 0.17/0.50;Sonnet 4.6: 0.17/0.50;Qwen3.6 Plus: 0.33/0.25 1.00/1.00 同一模型换任务自洽分数剧变,证明自洽不是纯模型属性
WVS 全球意见预测(自洽) 平均 $\mathrm{SC}_{0.02}$ / $\mathrm{OC}_{0.02}$(5 题 × 2 国) Sonnet 4.6 0.70/0.90 最强;GPT-5.4 0.55/0.70;DeepSeek V-3.2 0.32/0.35 最弱 1.00/1.00 把 macro fallacy 与自洽违反从美国普查推广到跨国意见建模
合成网球预测(Federer vs Nadal,自洽) $\mathrm{SC}_{0.02}$ / $\mathrm{OC}_{0.02}$ GPT-5.4 0.33/0.50;Sonnet 4.6 0.50/0.75;Qwen3.6 Plus 0.00/0.25 1.00/1.00 无模型 SC>0.50,证明 forecasting 中条件组合也不可靠
合成奇幻战斗预测(自洽,无 ground truth) $\mathrm{SC}_{0.02}$ / $\mathrm{OC}_{0.02}$ GPT-5.4 0.67/0.75;Sonnet 4.6 0.33/0.75;Qwen3.6 Plus 1.00/0.75;Grok 4.1 Fast 0.17/0.00 1.00/1.00 证明 reference-free 自洽检查在无真值场景仍可用
Micro-to-macro prompting(隐式聚合) 对直接 prompting 的相对误差增益 + 胜率矩阵 7 模型 × 5 阈值,多数 tile 为绿,平均增益 ~0.1~0.3 直接 prompting 单 prompt 内部分恢复聚合收益,但比显式树聚合更模型依赖

局限与改进

作者明确承认:alignment 评测与 macro fallacy 主要依赖 ACS 数据,虽然覆盖一个真实且规模大的场景(380 万受访者),但仅限特定领域,结论对其他人群(如非美国)和外推到任意目标变量的稳健性需要更多验证;alignment 误差也依赖设计选择——概率 elicitation 的 verbalization 方式、后处理归一化、人口学划分的选取都会影响数值。更根本的是,self-consistency 只是『忠实条件推断』的必要条件而非充分条件:一个模型可以完全自洽却整体偏离目标分布(misaligned),合成预测任务虽然证明框架不依赖真值,但并不能据此保证真实预测准确度。我个人观察到的额外局限:(1) BCT 深度只到 $L=4$,划分属性仅 2 个(年龄、就业),更深的属性组合是否会反转 macro fallacy 尚不清楚;(2) 容差 $\epsilon=0.02$ 是工程选择而非统计推断,对结果二值化敏感;(3) WVS 只取了样本最大的加拿大和印尼两国,缺少跨文化稳健性扫描;(4) 对『为什么 LLM 会犯 macro fallacy』仅给出『direct prompting 欠权年轻人子群导致收入高估』这一处定性证据,缺机制级解释。

独立分析的弱点

**弱点一:属性空间狭窄。** 论文核心实验只用 2 个属性(年龄、就业状态)的 BCT,深度仅 4 层。在更复杂的现实应用(如医疗风险分层、信贷决策)中划分属性可能 10 个以上,此时 Proposition 2 给出的累积误差界 $\ell\epsilon$ 会迅速放大,是否仍能识别 macro fallacy 未知。改进方向:在 ACS 上构造 $d\ge 6$、$L\ge 6$ 的更深树,用回归树自动选属性,系统扫描 $d$ 与 macro fallacy 强度的关系。**弱点二:缺少机制解释。** 论文描述了 macro fallacy 的现象并指出 direct prompting 倾向欠权年轻人,但没给出 mechanistic 解释——是注意力分配问题?是预训练分布偏差?还是 RLHF 后处理造成的?改进方向:在中间层做 probing,或对照 base model 与 instruct model,定位 macro fallacy 出现的训练阶段。**弱点三:容差 $\epsilon$ 主观。** $\epsilon=0.02$ 没有理论依据,对不同任务(收入分箱 vs Likert 5 点)的意义不同。改进方向:用 bootstrap 给出 $\epsilon$ 的数据驱动选取(如取模型自身采样方差的某分位数),并报告 $\epsilon$ 扫描下的曲线而不仅是单点。**弱点四:仅二值属性。** BCT 限制为 binary split,无法表达多类属性(如地区、种族)。改进方向:推广到 $k$-ary 树或一般划分,相应修正 Proposition 2、6、7 的界。**弱点五:合成预测缺乏真值验证。** 网球与奇幻任务证明框架可用,但不能说明模型在真实 forecasting 上是否同样不自洽。改进方向:接入 Prophet Arena 等真实预测基准,比较 self-consistency 分数与 Brier score、对数似然的相关性。

未来方向

作者明确提出的方向:(1) 把分布对齐与统计自洽评测扩展到更广的领域、更丰富的条件结构、更多样的 elicitation 方法;(2) 设计直接优化 distributional alignment 与 statistical self-consistency 的干预方法。论文在 Discussion 末尾强调 macro fallacy 的方向性——一致性约束本身是无方向的(向聚合调或向条件调得分相同),但若把约束锚定在 alignment 更好的低层条件估计上,就能把细粒度信息向上传播、同时改进聚合估计,这是个值得探索的训练目标。基于本成果的可延伸方向:(a) 把 BCT-based self-consistency 作为 RLHF / DPO 的辅助损失,让模型在训练时显式满足全概率恒等式;(b) 发展 attribution 方法,量化每个子属性对 macro fallacy 的贡献,识别模型『知道但不用』的具体知识片段;(c) 把框架从静态分布扩展到时序预测,检验马尔可夫一致性;(d) 把 self-consistency 与 uncertainty quantification(如 conformal prediction)结合,给出可证校准的条件区间;(e) 跨语言、跨文化扩展 WVS 实验,检验自洽分数是否与训练数据中某人群的占比相关。

复现评估

整体复现门槛中等偏高。**有利因素**:方法核心是 prompt 工程加全概率公式,无训练;数据全部公开——ACS 2024 来自 census.gov(380 万人,公开),WVS 与 GlobalOpinionQA 已开源;folktexts(Cruz et al. 2024)用于把人口属性 verbalize 成提示,是公开库;prompt 模板分布在附录 G.2、G.4、G.5;度量(归一化 Wasserstein-1)有明确定义;容差 $\epsilon=0.02$ 与 bootstrap 1000 次都写明。**不利因素**:核心实验在 GPT-5.4、Sonnet 4.6、Opus 4.7、Grok 4.3 等闭源前沿模型上跑,调用成本不小(粗估:ACS 全树约 $2^L\approx 16$ 节点 × 7 阈值 × 多次先验采样 × 10+ 模型),且模型版本会随时间漂移,难以严格复现数字;论文未在主体给出代码仓库链接(细节散落在附录 E),split / order consistency 评分的工程实现细节需要从 Appendix 推断;合成预测任务(网球、奇幻)的具体 prompt 与属性 verbalization 需要在 Appendix E.10、E.11 找。**复现建议**:先把 ACS income + GPT-4o mini(便宜)作为最小可行复现,验证 Figure 3 的凹形增益曲线,再扩展到更多模型与 WVS。预计单人 1-2 周可复现主要定性结论,精确数字复现受模型版本制约。