面向高效测试时推理的声明级可靠性评估 Claim-Level Reliability Assessment for Efficient Test-Time Reasoning
把测试时算力从多采样转向声明级证伪验证,等调用量下提升数学推理准确率并显著省 token
前置知识
测试时扩展
不更新模型参数、仅在推理阶段投入额外计算来提升推理质量的方法总称。常见做法包括采样更多候选解(Best-of-N)、用 token 概率或熵等内在信号估计不确定性、以及在生成过程中分支、剪枝、回溯。本文属于多次采样加聚合这一支,但核心主张是把预算从生成重定向到验证。
CLR 本质是一个测试时扩展框架,其实验对比全部围绕预算如何对齐展开,理解这一范式才能看懂 CLR@32 对比 Cons@64 的实验设计逻辑。
自洽性与 Cons@K
自洽性(self-consistency)独立采样 K 条推理轨迹,对最终答案做多数投票聚合。Cons@K 即用 K 条轨迹聚合后的准确率,pass@1 是单条轨迹的平均准确率。本文中 CLR@K 用 K 次生成加 K 次验证共 2K 次模型调用,因此与 Cons@2K 请求对齐,但验证只处理问题加声明,token 通常更少。
论文所有主表格都以 CLR@32 对比 Cons@64 的等请求预算呈现,不熟悉这套记号就无法正确解读准确率增益和 token 变化两个维度。
过程奖励模型与步级验证
PRM 对推理链的每个中间步骤单独打分,能够定位局部错误,但需要专门的逐步监督数据或单独训练的验证器(如 Lightman et al. 2024 的做法),标注与训练成本高昂,推理时也要逐步展开检查。
CLR 的声明级评估正是为绕开步级验证的高成本而设计的中间粒度:只提取少数决定性声明做一次联合证伪。理解 PRM 的代价才能体会本文免训练、单模型定位的价值。
证伪的不对称性
构造一个正确解要求整条推理路径完全无误,而反驳一个错误声明只需找到一个决定性缺陷(反例、矛盾、事实错误或缺失条件)。这种搜索空间上的不对称使找错比做对更经济,是波普尔可证伪思想在 LLM 验证中的应用。
这是全文的核心原理:CLR 把基础模型改造成证伪器而非重解题者,阶段 2 的输入设计(只给问题和声明)与非线性打分函数都围绕这一不对称性展开。
研究动机
现有测试时扩展方法大致分三类:一是从 token 概率、熵或隐状态等内在信号估计单条完整轨迹的整体不确定性;二是在多条并行轨迹间做答案聚合或 Best-of-N 选择;三是在生成过程中用显式评估信号引导分支、剪枝或回溯。作者指出它们共享一个根本瓶颈:随着推理预算增大,如何提取准确且高区分度的可靠性信号依然困难,额外算力难以转化为可信答案。具体而言,基于统计置信度的方法隐含地把统计置信当作逻辑可靠性的代理,但高置信轨迹仍可能藏有决定性缺陷;全轨迹评估则受严重的信号稀释困扰——大多数 token 只是常规推理步骤,构成弱区分度的背景噪声,信噪比低下,会掩盖一条看似合理轨迹中局部但致命的错误;步级验证虽然能隔离此类错误,却在计算上极为昂贵,通常依赖过程级监督或单独训练的验证器。
本文的目标是本文的目标是提出并验证声明级证伪作为测试时扩展的一条原则,并将其实现为免训练框架 CLR:在不更新参数、不引入额外验证器的前提下,把测试时算力从再采样一个完整解重新分配到针对决定性声明的证伪验证。具体希望做到三点:把每条推理轨迹压缩为少量决定性声明的紧致表示,过滤稀释可靠性信号的常规 token,让算力只花在决定答案正确性的逻辑锚点上;利用构造与反驳之间的不对称性,把同一个基础模型改造成严格的证伪器;通过非线性可靠性打分做答案聚合,让可靠的少数派能够推翻由大量有缺陷轨迹形成的错误共识,从而在等请求预算下同时改善准确率与 token 效率,或至少在两者之一上占优。
与已有工作不同的是,本文的独特切入在于粒度与验证目标的双重选择。粒度上,它介于全轨迹评估与逐步验证之间:既不像前者那样被常规 token 的噪声淹没,也不像后者那样需要逐步的过程监督,而是只保留锚定推理轨迹语义内容的少数决定性声明。验证目标上,它不要求模型重新解题或给出正向证明,而是把每个声明当作可证伪命题,主动搜索反驳证据——由于构造正确解要求推理路径完全无误而反驳错误声明只需一个决定性缺陷,这种聚焦的单向检查即使面对高统计置信生成的错误轨迹也能暴露其致命错误。与依赖外在奖励模型的做法不同,CLR 用同一个模型兼任生成器与验证器,且验证请求只包含原始问题和声明列表,切断了验证器被原轨迹和最终答案锚定的可能。
核心方法
直觉上,一条推理轨迹能否得到正确答案,往往由少数关键中间结论决定:例如因式分解题中的代数恒等变换、素性判断、最大性比较这类逻辑锚点。与其把算力平均撒在更多完整解上,不如先提取这些锚点,再集中算力证伪它们。技术上 CLR 是一个两阶段推理流水线:阶段 1 对问题 $q$ 在固定解码配置下独立采样 $K$ 条轨迹,每条以结构化格式输出最终预测 $y_k$ 并附加大约 $M$ 条决定性声明 $C_k = (c_{k,1}, \dots, c_{k,M})$;阶段 2 将同一模型用作验证器,仅输入 $q$ 与有序声明列表,逐条搜索决定性矛盾、反例、事实或逻辑错误、缺失条件与不支持的推断,并检查声明之间的冲突,输出判决 $v_{k,m} \in \{0,1\}$(1 表示未被反驳)。随后把存活声明比例 $s_k$ 经指数映射为轨迹得分 $r_k = s_k^M$,再按答案等价分组求可靠性支持度并取最大组作为最终答案,实现可靠性加权的聚合。
核心创新是把证伪确立为测试时扩展的原则性归纳偏置,并配以非线性打分聚合。与全轨迹评估不同,CLR 剔除了稀释信号的常规 token,只对逻辑锚点花算力;与步级 PRM 不同,它免训练,每条轨迹只需一次联合验证请求;与自洽性不同,聚合权重不再均匀。打分函数 $r_k = s_k^M$ 中 $M$ 既是声明数又是指数,使被驳斥的决定性声明远比线性平均更有后果:$M=5$ 时五条声明全部存活得 $(5/5)^5 = 1.000$,四条存活得 $(4/5)^5 = 0.328$,三条存活得 $(3/5)^5 = 0.078$,错误轨迹的影响被急剧非线性压缩,即使其在数量上占多数,更可靠的小组也能凭总分反超。论文明确把构造与证伪的不对称当作归纳偏置而非保证——并不假设证伪总比生成容易,且 $r_k$ 是启发式单调变换而非联合正确概率。
方法步骤详情
第一步(阶段 1 生成):输入为附加声明生成指令的最小解题提示,模型以任务特定结构化格式输出最终预测 $y_k$,并追加恰好 $M=5$ 条简洁中间声明,要求排除泛泛总结与预测复述,典型声明编码中间结论、约束或连接 $q$ 与 $y_k$ 的证据。第二步(阶段 2 证伪):对每条轨迹发起一次联合请求,输入仅为原始问题 $q$ 和有序声明列表,不含原轨迹与最终预测;模型逐条搜索决定性矛盾、反例、逻辑错误、缺失条件与不支持的推断,并检查跨声明冲突,输出 $v_{k,m}=0$(refuted)或 $1$(not refuted),VALID 仅表示未被该评估反驳而非形式化证明。第三步(打分):令 $s_k = \frac{1}{M}\sum_{m=1}^{M} v_{k,m}$,计算 $r_k = s_k^M$。第四步(聚合):剔除解析失败的轨迹,其余预测按任务等价准则分组,计算 $R(G) = \sum_{k: y_k \in G} r_k$,选最大组并输出其规范答案;平局(含全零)按采样顺序最早的组解决。CLR@$K$ 共 $2K$ 次调用,与 Cons@$2K$ 请求对齐。
技术新颖性
技术新颖性体现在四个层面。原则层面:作者把声明级证伪表述为测试时扩展的一般原则而非又一个聚合技巧,并诚实界定其适用边界——CLR 只重加权已解析候选,不能凭空补出阶段 1 未采样到的正确答案。信号层面:决定性声明只服务验证而不反馈给生成,消融显示声明提示本身反而使 pass@1 下降 0.65–4.56 个百分点,而证伪重加权在相同候选上带来 4.48–7.01 个百分点提升,这一分解干净地证明价值来自验证而非提示工程。打分层面:指数惩罚 $r_k = s_k^M$ 是刻意的非线性设计,作者说明其为启发式单调变换、不假设声明独立、也不是联合正确概率,M 同时控制声明数与惩罚锐度。工程层面:验证请求剥离了原轨迹与最终答案,迫使验证器独立审视声明本身,同一模型无需任何训练或额外参数即可兼任生成与证伪两个角色。
实验结果
主实验以 CLR@32 对比 Cons@64(均为 64 次模型调用),覆盖四模型 × 四基准。Gemma-4-12B-it 四基准全部提准:HMMT25 76.67%→88.75%(+12.08 pp)、CMIMC25 68.75%→80.62%(+11.87 pp)、HMMT26 +7.57 pp、Apex-shortlist +7.12 pp,但 token 增 22.2%–47.8%,属准确率换算力。GPT-OSS-20B 方向相反:token 全线降 36.3%–39.8%,四分之三基准仍提准,CMIMC25 77.50%→82.19%(+4.69 pp,token −37.0%),较 pass@1 的 55.04% 高 27.15 pp,仅 HMMT25 略降 0.42 pp。GPT-OSS-120B 最高 +5.00 pp(CMIMC25 75.00%→80.00%)且 token 降 21.6%–23.7%。Qwen3.5-27B 因 Cons@64 三基准已超 90%、余量有限,最高 +2.60 pp(Apex-shortlist 72.92%→75.52%,token −14.5%)。消融进一步显示:声明提示本身使 pass@1 降 0.65–4.56 pp,而证伪加权在相同候选上带来 +4.48–7.01 pp 增益;救援率在 16 个设置中约 16%–48%、平均约 37%;M 从 1 增到 3 提升准确率 3.13–3.79 pp,M=5 在三个基准继续增益,HMMT26 在 M=3 达峰。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| HMMT25 数学竞赛(Gemma-4-12B-it) | 准确率 % | 88.75(CLR@32) | 76.67(Cons@64) | +12.08 pp(token +33.4%) |
| CMIMC25 数学竞赛(GPT-OSS-20B) | 准确率 % 与生成 token | 82.19 / 583.3k tokens | 77.50 / 926.3k tokens(Cons@64) | +4.69 pp 且 token −37.0%;较 pass@1 的 55.04% 高 27.15 pp |
| CMIMC25 数学竞赛(GPT-OSS-120B) | 准确率 % | 80.00(CLR@32) | 75.00(Cons@64) | +5.00 pp(token −21.6%) |
| Apex-shortlist(Qwen3.5-27B) | 准确率 % | 75.52(CLR@32) | 72.92(Cons@64) | +2.60 pp(token −14.5%) |
| GPT-OSS-20B 阶段 2 增益分解(四基准) | CLR@32 相对相同候选上未加权 Cons@32 的准确率增益 | +4.48 ~ +7.01 pp | 仅声明提示的 Stage-1 Cons@32(其 pass@1 比常规采样低 0.65–4.56 pp) | 证明收益完全来自证伪加权而非声明提示 |
局限与改进
作者承认的局限包括:请求对齐不等于 token 对齐,Gemma-4-12B-it 的准确率增益以 22.2%–47.8% 的额外 token 为代价;CLR 只能重加权阶段 1 已解析出的候选,若正确答案从未被采样则无法恢复,其角色是把候选覆盖转化为更可靠的选择;打分 $r_k = s_k^M$ 是启发式单调变换而非联合正确概率,也不假设声明独立;M 同时控制声明数量与惩罚指数,Table 3 的消融无法单独隔离声明数的作用;准确率–token 曲线可能在中间预算交叉,CLR 并非在所有工作点占优,在近乎饱和的 Qwen3.5-27B 上收益有限,GPT-OSS-20B 在 HMMT25 上还略降 0.42 pp。我自己的观察:固定 M=5 未必适配不同难度的问题;声明提示拖累生成质量说明结构化额外输出对基模型的干扰真实存在;每条轨迹仅一次联合证伪,验证器漏检时错误声明即存活;四个基准均为数学竞赛式短答案任务,等价分组依赖唯一数值答案,对代码或开放文本任务的适用性未经检验。
独立分析的弱点
第一,声明提示的生成干扰:阶段 1 被要求同时解题并产出 5 条声明,pass@1 因此下降 0.65–4.56 个百分点,改进方向是把声明抽取拆分为单独请求,或只对高置信轨迹抽取声明以减轻生成负担。第二,验证单次性:阶段 2 一次联合请求未找到缺陷即判 VALID,而 VALID 只意味着未被反驳而非正确,验证器能力不足时错误声明会存活,可引入多轮对抗证伪或要求提供具体证据后方可判存活。第三,指数与声明数耦合:$r_k = s_k^M$ 中惩罚锐度不可独立调节,全零分与平局回退到采样顺序可能在无信号时引入位置偏置,可改为 $r_k = s_k^{\alpha}$ 并按题目难度或声明存活率方差自适应 $\alpha$ 与 M。第四,任务面窄:四个基准均为答案可精确分组的数学竞赛题,决定性声明对代码、开放问答等自由格式任务的定义与抽取质量未知,等价准则需重新设计。第五,token 开销方向依赖基模型:Gemma 增 22.2%–47.8% 而 GPT-OSS 减 21.6%–39.8%,部署前必须按模型实测,论文尚未给出预测哪类模型受益的判据。
未来方向
作者明确提出要把声明级证伪原则推广到更广的测试时扩展范式,例如在分支、剪枝、回溯等结构化搜索中用证伪信号做引导,以及 Best-of-N 选择场景。基于其成果还可延伸多个方向:其一,将证伪判决蒸馏为过程奖励信号,用于训练轻量验证器或作为 RL 奖励,弥补免训练框架上限受基模型验证能力约束的问题;其二,自适应分配 M 与 K,按题目难度或组间得分差距动态决定验证深度与采样规模;其三,把阶段 2 扩展为多轮证伪对话,让验证器给出反例、生成器据此修复声明后复检,形成证伪—修复循环;其四,探索跨模型配置(弱模型生成、强模型证伪)以及把声明级事实性检查迁移到 RAG、长文生成等事实密集场景;其五,用语义等价判定替代精确匹配分组,把框架带入自由文本答案的领域,并与过程奖励模型做分层组合验证。
复现评估
复现条件较好:代码已在 GitHub 开源(WeiboAI/CLR),框架免训练、无独立验证器,完整提示模板在附录 B 给出,超参数只有 K 和 M 两个,基线自洽性实现简单。模型方面涉及 Gemma-4-12B-it、GPT-OSS-20B、GPT-OSS-120B、Qwen3.5-27B,除 120B 外均可在单卡或少量卡的推理环境运行;基准 HMMT25/26、CMIMC25、Apex-shortlist 均为公开竞赛题集。主要成本在评测算力:主操作点 CLR@32 每题需 64 次模型调用,且准确率报告为 N=8 次独立完整流程的平均,再加上 K∈{4,8,16,32} 扫描、M∈{1,3,5} 消融与图 3 的多预算曲线,总调用量相当可观,但全部是纯推理、无训练。综合判断复现难度为中等偏低:复现单点主结果较容易,完整复现全部表格与曲线需要可观的推理预算,并需仔细实现对齐论文的答案等价分组与平局规则。
论文图表