LLM线束中部分相关的校验器级联:对数赔率凹性、多项式可靠性与盲区天花板 Partially Correlated Verifier Cascades in LLM Harnesses: Concave Log-Odds, Polynomial Reliability, and Blind-Spot Ceilings
用潜变量刻画校验级联相关性,可靠性多项式衰减且有盲区天花板
前置知识
LLM 线束(harness)与 Odds Law(赔率定律)
LLM 线束通过组合多次调用提升基模型可靠性:分解、集成、校验、递归。校验原语指把候选答案送过 k 个接受/拒绝门,仅当全部接受才返回。在门误差条件独立的假设下,Odds Law(Aksu 2026b)给出后验对数赔率线性增长 $\ell_k = \ell_0 + k\ln\Lambda$,其中 $\Lambda = \beta/\alpha$ 是门的似然比(真接受率比假接受率),因而失败概率随 k 指数衰减,达到可靠性 $1-\delta$ 只需 $O(\log(1/\delta)/\log\Lambda)$ 个门,并在 $\Lambda^\star = 1$ 处存在阈值二分。
本文的全部工作就是修正 Odds Law 的条件独立假设,因此必须先理解它在独立假设下给出的“指数可靠 + 对数门数”的乐观图景,才能理解作者引入相关性后把指数退化成多项式、并出现天花板的颠覆性结论。
de Finetti 表示定理与可交换性
de Finetti 定理说明:无穷序列可交换的二元判决可以被表示为“在给定某个潜参数 $\alpha$ 的条件下独立同分布 Bernoulli($\alpha$)”,即所有判决间的共享结构被压缩进一个随机标量 $\alpha \sim G$。本文把“同一个错误实例上 k 个门的判决”视为可交换的,于是每个实例都有一个专属的假接受率 $\alpha$,跨实例分布为 $G$。
这是整篇论文的建模基石:作者并非凭空假设 $\alpha$ 潜变量,而是由门判决的可交换性 + de Finetti 自然推出。理解了这一点,才能看懂为什么后验能写成 $\ell_k = \ell_0 - \ln m_k$($m_k = E[\alpha^k]$),以及为什么用矩反演就能从数据恢复 $G$。
对数赔率、矩母函数与凹性
对数赔率 $\ell = \ln(P(\text{correct})/P(\text{wrong}))$,可靠性 $r_k = \sigma(\ell_k)$。$\ln m_k = \ln E[e^{k\ln\alpha}]$ 恰是 $\ln\alpha$ 的累积量母函数,在 k 上是凸的,因此 $\ell_k = \ell_0 - \ln m_k$ 在 k 上是凹的。凹性意味着逐门证据增量 $\Delta_{j+1}$ 严格递减,第一条门处的切线(即 Odds Law)成为整条曲线的上界。
“凹性”是本文第一条定理,也是“相关性只惩罚外推、不惩罚第一道门”这一直觉的数学化身。看懂累积量母函数的凸性与切线上界,才能理解为什么独立性公式会在 k 较大处严重高估可靠性。
Beta 分布、多项式衰减与相关参数 $\rho_v$
取 $G = \text{Beta}(a,b)$ 时第 k 阶矩 $m_k = (a)_k/(a+b)_k$,当 k 大时 $m_k \sim \frac{\Gamma(a+b)}{\Gamma(a)}k^{-b}$,于是失败概率 $1-r_k \asymp k^{-b}$ 呈幂律(多项式)衰减而非指数衰减。单个参数 $\rho_v = \text{Var}(\alpha)/(\bar\alpha(1-\bar\alpha)) = 1/(a+b+1)$ 正是两道门判决的类内相关系数,在 $\rho_v \to 0$(独立)与 $\rho_v \to 1$(纯盲点)之间连续插值。
“指数退化多项式”是本文的标题级结论,而 $\rho_v$ 是把整族曲线压成单参数的关键,且它可从数据直接测量(两道判决即可识别)。理解 Beta 矩与 $\rho_v$ 才能读懂表1的 20×/3000× 失败低估,以及最优门数从对数变成幂律的惩罚。
经验贝叶斯与矩反演 / NPMLE
经验贝叶斯指从可观测的边缘分布反推潜在先验 $G$ 的反问题。本文对每个错误实例采样 R 次门判决,得到接受计数 $X_i | \alpha_i \sim \text{Bin}(R,\alpha_i)$;用无偏 U-统计量估计前 R 阶矩 $m_k$($\hat m_k = \frac{1}{N}\sum_i \binom{R}{k}^{-1}\binom{X_i}{k}$),或用 Beta-二项极大似然估 $(\hat a,\hat b)$,或用非参极大似然(NPMLE)恢复任意混合分布(含 $\alpha=1$ 处的原子)。
本文不只是理论,还给出了从真实 accept/reject 日志测量 $\rho_v$、可靠性曲线和天花板的完整协议。矩反演与 NPMLE 的分辨率极限(天花板是上尾泛函,R 次判决无法区分 $\alpha=1$ 与 $\alpha=1-\epsilon$,分辨率 $\sim 1/R$)是评估其可用性的核心。
研究动机
LLM 线束的可靠性大量依赖“校验原语”:把候选答案送过 k 个接受/拒绝门,仅当全部通过才返回。Aksu 2026b 的 Odds Law 在“门误差条件独立”下给出乐观结论——后验对数赔率 $\ell_k=\ell_0+k\ln\Lambda$ 线性增长,失败概率随 k 指数衰减,达到 $1-\delta$ 只需 $O(\log(1/\delta)/\log\Lambda)$ 个门,并在 $\Lambda^\star=1$ 处二分。但这一假设在线束实际场景中是错的:校验器常与生成器同族、同提示风格、同训练分布,二者共享“盲点”——生成器爱犯而校验器抓不到的错误。经验上这种盲点很大:Tsui 2025 在 14 个开源模型上发现平均 64.5% 的自生成错误能通过自检,而同样错误从外部呈现时却被抓到;自纠错文献也反复证实提示式 LLM 自反馈极少修复推理错误甚至降低准确率,可靠改进通常需外部反馈而非更多同模型。Odds Law 原作者明确把“部分相关校验器级联的紧致理论”列为未解问题,而把相关性当给定的蒙特卡洛验证无法定量回答盲点造成多大可靠性损失。
本文的目标是本文的目标是给“部分相关的校验器级联”提供一个最小而紧致的理论:在不改变 Odds Law 框架其余部分的前提下,仅替换“条件独立”这一条假设,推导出存在相关性时的精确后验、可靠性随门数 k 的衰减规律、可靠性是否存在天花板,并给出一个可操作的相关性测量协议,使理论能够从真实 accept/reject 日志中被证伪或验证。具体地,作者希望回答四个量化问题:相关性会把指数收敛退化成什么、可靠性能否无限逼近 1、在两道门都有假拒绝时加门究竟帮还是害、以及相关参数能否被廉价测量。
与已有工作不同的是,本文的独特切入角度是把“假接受率 $\alpha$”从一个校验器的常数属性,改写为生成器自身错误这一实例总体的属性,即潜变量 $\alpha \sim G$(借助门判决可交换性 + de Finetti)。G 的上尾——$\alpha$ 接近 1 的质量——正是生成器爱犯而校验器抓不到的盲点对齐。这与以往把相关性当作黑箱给定、仅做蒙特卡洛验证的做法根本不同:现在一切都成为 G 的泛函,因而可测、可反演、可证伪。作者还从“合取校验”特有的一种机制——幸存者倾斜(survivorship tilt,$dG^{(j)} \propto \alpha^j dG$)——出发,指出活过 j 道门的错误恰好是高 $\alpha$ 者,晚到的门面对的是被筛选过的幸存者而非新鲜错误,这一选择效应在一次性投票中没有对应物,是本文真正的新内容。
核心方法
方法整体思路是“先直觉、再代数”。直觉:校验器和生成器共享盲点,同族多道门并非独立裁判,而是反复面对同一批“顽固”错误,门越多剩下错误越难抓,逐门证据收益必然递减。技术路线:设真值 $C\in\{1,0\}$、先验 $p_0$,门真接受率 $\beta$、假接受率 $\alpha$;把 $\alpha$ 视为实例属性,跨生成器自身错误总体分布为 $\alpha\sim G$(Assumption 2.1:给定实例即给定 $\alpha$,k 道门在错误答案上独立同分布 Bernoulli($\alpha$),由可交换性 + de Finetti 精确支持)。于是 $\beta\equiv1$ 时第 k 阶矩 $m_k=E[\alpha^k]$,贝叶斯赔率形式给精确后验 $\ell_k=\ell_0-\ln m_k$,$r_k=p_0/(p_0+(1-p_0)m_k)$。这一行代数把整个理论压成对单一分布 $G$ 的矩分析,后续四条定理(凹性、多项式衰减、天花板、双侧三分法)都由它推出,测量协议也只是对 $G$ 反演。
核心创新点是“幸存者倾斜”这一合取校验特有的机制,及其代数化身——后验仅依赖 $G$ 的矩 $m_k$。活过 j 道门的错误总体是 $\alpha$ 的 j 次倾斜分布 $dG^{(j)}\propto\alpha^j dG$,它随 j 增长不断向上尾集中,于是第 j+1 道门的证据增量 $\Delta_{j+1} = -\ln E^{(j)}[\alpha]$ 严格递减并趋于 $-\ln\,\text{ess\,sup}\,\alpha$。这与既有工作的本质区别有三:其一,Odds Law 把每个门当成面对同一批新鲜错误的独立裁判,本文证明晚到的门面对的是被幸存者筛选过的“硬骨头”,独立假设只是这条凹曲线在第一道门处的切线和上界;其二,投票侧的相关理论(Liu 2026a/b)只处理一次性投票,没有幸存者倾斜、没有逐门证据衰减、没有天花板;其三,一切结论都是 $G$ 的泛函,因而理论可测——R 次重复判决即可识别前 R 阶矩,两次判决即识别 $\rho_v$。
方法步骤详情
方法分五步。① Setup(§2):定义幸存者可靠性 $r_k=P(C=1\mid\text{all k accept})$,并设假接受率潜变量 $\alpha\sim G$(G 落在生成器自身错误总体上,上尾即盲点对齐)。② 单侧后验(§3,$\beta\equiv1$):记 $m_k=E[\alpha^k]$,由贝叶斯赔率形式得 $\ell_k=\ell_0-\ln m_k$、$r_k=p_0/(p_0+(1-p_0)m_k)$;$G=\delta_{\bar\alpha}$ 时还原 Odds Law。③ 结构定理:$\ln m_k$ 是累积量母函数故 $\ell_k$ 凹、Odds Law 为其第一门处切线兼上界;$G=\text{Beta}(a,b)$ 给 $1-r_k\asymp k^{-b}$、单参数 $\rho_v=1/(a+b+1)$、最优门数由对数变幂律 $k^\ast\approx(U\kappa^b/c)^{1/(b+1)}$;$\alpha=1$ 处盲点原子 $1-\pi$ 给天花板 $-\ln(1-\pi)$ nats 且 $r_\infty<1$。④ 双侧(§4):令真接受率也潜变量 $\beta\sim H$,得 $\ell_k=\ell_0+\ln m_k^{(\beta)}-\ln m_k^{(\alpha)}$,按上尾指数 $b_\alpha$ vs $b_\beta$ 分有益/平台/有害三态,闭式交叉 $k^\dagger=(a_\alpha b_\beta-a_\beta b_\alpha)/(b_\alpha-b_\beta)$,且 $\bar\Lambda>1$ 不再保证有益。⑤ 测量(§5):每错误实例采样 R 次得 $X_i\sim\text{Bin}(R,\alpha_i)$,用无偏矩估计/Beta-二项MLE/NPMLE 三种递增分辨率估计器恢复 $\rho_v$、可靠性曲线与天花板,并量化上尾反演不适定性(分辨率 $\sim1/R$)。
技术新颖性
技术新颖性集中在四点。第一,首次给出“部分相关校验器级联”的紧致理论:只替换一条假设即得精确后验,并把 Odds Law 精确定位为 $\rho_v\to 0$ 退化情形与第一道门处的切线,原 Lemma 4.3/Thm 5.1 被作为边界情形回收。第二,发现“幸存者倾斜”这一合取校验独有的选择机制,它产生逐门证据衰减、双侧三分式与零成本内部最优点 $k^\dagger$,这些现象在一次性投票理论里没有对应物——这是真正的新内容。第三,把“可靠性指数收敛退化成多项式收敛”固定到一个具体机制(盲点上尾下的合取幸存),其指数 $k^{-b}$ 是 $G$ 上尾指数 $b$ 的闭式,受单参数 $\rho_v$ 控制,可直接测量,从而区别于此前只知道“存在指数–多项式二分”却不知由何决定的工作。第四,给出可证伪的测量闭环:低阶拟合(如 $R=8$)外推到留出门深并与真相比较;同时诚实地把天花板刻画为上尾泛函并给出 $R$ 相关的可识别性下界,承认不适定性是协议的一部分。
实验结果
本文为纯理论 + 合成恢复实验(N=4000 实例,固定种子),定量结果分四组。①(表1)相关性造成巨大失败低估:$p_0=0.5,\bar\alpha=0.3,\rho_v=0.3$($a=0.7,b\approx1.63$)下 $k=1$ 独立公式与真相同为 $r_1=0.769$;$k=5$ 独立预测 0.998 而真相仅 0.953(失败率低估 20×);$k=10$ 独立 0.999994 而真相 0.982(约 3000×)。②(表2)$\bar\beta=0.67$($\beta\sim\text{Beta}(8,4)$)使 $\bar\Lambda=2.2>1$、$\delta_1=0.80>0$,却因 $b_\alpha=1.63<b_\beta=4$ 落入“最终有害”态:$k=5$ 达峰 78.7%,$k=20$ 降至 0.623 趋向 0,独立外推却报五个九。③(测量)实验A $R=10$ 恢复 $\rho_v$ 为 0.050/0.291/0.502(真 0.05/0.30/0.50);实验B 两次判决即够,$R=2$ 得 $\hat\rho_v=0.274$(真 0.30)。④(不适定)实验C $\alpha=1.00$(天花板 0.91)vs $\alpha=0.97$(天花板 1.00)在 $R=5$ 直方图近乎不可辨、$R=50$ 才分(原子 0.100 vs 0.000);实验D $R=8$ 拟合外推 $k=5$ 预测 0.954 对真相 0.953,独立给 0.998。结论:$\rho_v$ 便宜易测、天花板昂贵不适定,杠杆是去相关而非堆门。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 相关级联的失败率低估(单侧) | 可靠性 $r_k$ 与失败率 $1-r_k$ | $\rho_v=0.3$ 真相:$r_5=0.953$、$r_{10}=0.982$;失败率 $1-r_5=0.047$、$1-r_{10}=0.018$ | Odds Law 独立外推(同 $\bar\alpha=0.3$):$r_5=0.998$、$r_{10}=0.999994$;失败率 $2.4\times10^{-3}$、$5.9\times10^{-6}$ | 揭穿独立假设对失败率低估 20×($k=5$)和约 3000×($k=10$);理论($R=8$ 拟合)在 $k=5$ 预测 0.954 对真相 0.953 |
| 双侧级联的可靠性峰值(有害态) | 幸存者可靠性 $r_k$ 随 k 演化 | $\bar\Lambda=2.2$ 但 $b_\alpha<b_\beta$:$k=5$ 峰值 0.787,$k=15$ 降至 0.691,$k=20$ 降至 0.623,$\to 0$ | Odds Law 双侧独立外推:单调上升,$r_5=0.982$,$r_{20}\approx1$ | 证明平均门质量 $\bar\Lambda>1$ 不能保证有益,闭式交叉点 $k^\dagger\approx4.3$ 预测峰值位置 $k=5$ |
| $\rho_v$ 的测量恢复(合成) | 矩估计 / Beta-二项 MLE 对 $\rho_v$ 的恢复误差 | 实验A:真值 0.05/0.30/0.50 → 估计 0.050/0.291/0.502;实验B:$R=2$ 得 0.274(真 0.30),$R\ge3$ 基本精确 | 此前工作(Aksu 2026a/b)把相关性当给定,仅做蒙特卡洛验证,未在真实/合成对上测量 $\rho_v$ | 两道判决即识别 $\rho_v$(Proposition 5.1),把相关性从假设变成可测、可证伪的量 |
| 天花板的不适定性识别(合成) | 区分盲点原子 $\alpha=1.00$(天花板 0.91)vs $\alpha=0.97$(天花板 1.00)所需判决次数 | 实验C:$R=5$ 接受计数直方图两世界近乎不可区分;$R=50$ NPMLE 把原子质量分到 0.100 vs 0.000 | 无此前定量结果 | 量化上尾泛函的 $R$ 相关可识别下界(分辨率 $\sim1/R$),诚实标记天花板不适定,需正则化 |
局限与改进
作者明确承认四点局限。第一,Assumption 2.1 把所有门间共享结构压缩进单标量 $\alpha$(均值场理想化),门间异质(不同校验器家族)需要向量潜变量 $\boldsymbol\alpha=(\alpha_1,\ldots,\alpha_k)$ 或层次 $G$,文中给出一阶投影方向(如秩一共享+族潜变量 $\alpha_i=\sigma(u+v_i)$)但未实现。第二,全接受语义:在生成–校验–重试循环中假拒绝只损耗吞吐而非精度,此时单侧模型(§3)才是精度正确模型,§4 的双侧模型仅在无法重生成或门是终局时适用。第三,Beta 只为闭式便利,渐近性质只需正则变化尾,NPMLE 在估计中移除该参数假设。第四,本文全部验证为合成恢复,真实生成器–校验器对的测量尚未完成。笔者的额外观察是:理论完全建立在可交换性上,而推荐的“去相关”操作恰恰破坏可交换性,二者张力作者虽正面回应但仅停留在一阶投影层面,真实异质门系统上的预测精度仍属未知;此外 64.5% 等经验盲点数字来自特定模型族,$\rho_v$ 在跨任务、跨族上的典型取值范围仍缺乏系统测量。
独立分析的弱点
独立分析有四个弱点并各配改进方向。其一,单标量潜变量无法刻画异质校验器族:当 k 道门来自不同家族,应取向量潜变量或层次 $G$,本文只给一阶投影;改进方向是实现秩一或矩阵潜变量模型(如 $\alpha_i=\sigma(u+v_i)$),量化去相关后 $b$ 的可测上升。其二,去相关建议与可交换性假设自相矛盾,作者仅以“在合适粒度读 k 道门”调和,缺乏对异质情形的严格外推;改进方向是推导异质门下的精确后验并给出与标量模型的偏差界。其三,天花板作为上尾泛函不适定且需大 R 才可识别,实际标注预算 $B=NR$ 下实例数与深度存在权衡,文中只给出 $\sim1/R$ 的分辨率定性结论;改进方向是设计最优 $N$-$R$ 分配与正则化反演(如 Backus-Gilbert 分辨率核、阻尼反演)使天花板估计可量化置信区间。其四,全部为合成验证,缺乏真实日志上的端到端证据,且 $\rho_v$ 在不同任务族间的经验分布未知;改进方向是在单元测试代码、精确匹配抽取、可数值验证数学等有程序化真值的任务上实测 $\rho_v$ 与天花板,给出工程可用的典型取值表。
未来方向
作者明确点名的续作是:把标量潜变量推广为向量/层次潜变量,使部分去相关被刻画为 $b$ 的可测上升;以及在真实生成器–校验器对上执行 §5 测量协议(协议与代码只需更换数据源)。基于本文成果可延伸的方向还有:把幸存者倾斜机制推广到非全接受语义(如 $j$-of-$k$ 门、软接受/加权证据),推导此时后验与天花板的相应形式;把校验级联与投票原语统一在一个相关性框架下,给出“验证与投票在去相关下的最优混合”策略;结合生成–校验–重试的吞吐代价,研究天花板约束下的最优重试预算与去相关投入分配;以及把 $\rho_v$ 作为在线监控指标嵌入线束,当 $\rho_v$ 升高即触发“换族/换模态”的去相关动作,形成自适应可靠性控制器,呼应 Aksu 2026a 的 Maestro Order 编排框架。
复现评估
复现性整体良好。作者声明全部表格与图形可在 https://github.com/jianganghan/harness-verifier-cascades 复现,合成实验固定种子、N=4000 实例,实验A–D 的设置($\rho_v$ 网格、$\bar\alpha=0.3$、$R$ 取值、留出门深)描述清晰。理论部分只需数值计算 $m_k=(a)_k/(a+b)_k$ 与贝叶斯公式,无特殊算力需求;估计器(无偏矩、Beta-二项 MLE、NPMLE)均为标准经验贝叶斯方法,可用 scipy/numpy 轻量实现。主要复现难点不在代码而在数据源:真实验证需要“生成器自身错误总体 + 程序化真值任务 + 每实例 R 次温度采样”的日志,这部分作者尚未公开,且天花板估计需要较大 R(实验C 用到 $R=50$)才有分辨率,属于标注成本瓶颈而非算力瓶颈。整体而言理论可一键复现,真实落地复现仍待作者公开真实日志。
论文图表
左图为 $R=5$ 时两个世界(盲点原子在 $\alpha=1.00$ 给天花板 0.91,vs 在 $\alpha=0.97$ 给天花板 1.00)的接受计数直方图,几乎重合无法区分;右图为 $R=50$,此时 $\alpha=1$ 的尖峰出现在 $X/R=1$ 处,两世界(尖锐橙色尖峰 vs $\alpha=0.97$ 的绿色肩部)才可分。
这张图是“天花板不适定”主张的可视化证据,说明天花板是上尾泛函、其可识别性受 R 限制(分辨率 $\sim1/R$),诚实标定了理论的测量边界,对评估其实用可信度至关重要。