← 返回 2026-08-28

CritICL:基于小语言模型失败模式的推理时弱到强泛化 CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes

Yufan Wu, Yinghui He, Zhengyi Hu, Lang Wei, Ruichen Li, Qifan Yang, Ting Zhu 📅 2026-08-27 👍 9 2026-09-01 18:30
LLM推理 上下文学习 失败模式 弱到强泛化 推理时扩展

把小模型的结构化失败模式做成批判式示例库,单次生成即提升大模型推理

前置知识

推理时扩展(Inference-Time Scaling)

指不改动模型权重、只在生成阶段投入更多计算来提升准确率的技术总称,包括 Self-Consistency 多路径采样投票、Self-Reflection 迭代自修正、LLM-as-a-Judge 外部评判等。代价是生成次数与 token 成本成倍增加,例如 Consistency@7 需要对同一题采样 7 次再做多数投票。

本文的对比基线与效率分析全部围绕这一范式展开,理解它的成本结构才能体会 CritICL 用 1~2 次生成打平多次采样的效率优势。

弱到强泛化(Weak-to-Strong Generalization, W2SG)

研究弱模型如何帮助更强模型表现更好的方向。经典设定是弱模型对每个新输入提供在线监督或中间指导(如 Ding et al., 2026),缺点是每次推理都要调用弱模型,且效果受制于弱模型直接输出的质量。

本文把 W2SG 的信号源从『在线监督输出』重构为『离线迁移失败结构』,这是全文的立论框架和与既有工作的本质区别。

失败模式(Failure Mode)

对模型错误原因的类别化标签,如算术运算失误、组合计数重复、假设过度依赖、单位换算错误等。Didolkar et al. (2024) 发现模型错误并非随机,而是结构化、可预测的,可以用 LLM 自动标注并聚类成语义去重的分类学。

失败模式是 CritBank 的索引键和检索依据,也是『失败模式分布跨规模一致』这一关键实证的载体,不懂它就无法理解方法为何成立。

上下文学习与示例选择(ICL & Exemplar Selection)

ICL 通过在 prompt 中放入若干『问题-回答』示范引导模型作答,不更新参数。研究表明示例的选择策略显著影响效果:随机选取、固定示例集、基于嵌入相似度的检索是三类常见做法,但它们都依赖表面层面的题目对齐。

CritICL 本质上是一种新的示例选择策略——按失败模式检索批判式示例,消融实验(Table 3)正是与这三类基线逐一对比。

CritBank 与批判(Critique)

CritBank 是本文构建的结构化数据库,每条记录含问题 $q$、错误回答 $r$、失败模式标签 $l$ 和自然语言批判 $C(q,r)$。批判指用自然语言指出推理具体在哪一步、因为什么原因出错,是比正确答案更细粒度的反馈信号。

它是方法的中心资产:Stage 1 造库、Stage 2 查库都围绕它展开,理解其 schema 才能理解两个推理变体的检索逻辑。

正确性函数与 CoT 采样

正确性函数 $\phi(q,r)\in\{0,1\}$ 自动判定回答是否解对题目(数学题可通过答案比对实现);CoT 采样指用链式思维提示让模型生成带完整推理过程的回答。本文对每题用小模型采样 5 次,以便收集足够多样的错误样本。

两者共同定义了 CritBank 数据的来源与过滤规则:只有 $\phi=0$ 的错误回答才会进入后续的标注与批判流程。

研究动机

当前提升 LLM 推理能力的主流推理时扩展方法代价高昂:Self-Consistency 需要在温度 1.0 下采样 3~7 条推理路径再多数投票,Self-Reflection 平均每题要 3.7 次生成,LLM-as-a-Judge 需要 6 次模型调用。论文在 MATH 数据集上配合 Qwen2.5-32B-Instruct 实测,这些方法单题总 token 消耗达 4192~7533,而标准 5-shot 上下文学习仅需 3620,效率差距明显。另一条弱到强(W2SG)路线让小模型在线监督大模型(Ding et al., 2026),但每个新输入都要求弱模型实时推理,既增加开销又受制于弱模型直接输出的质量。更根本的是,这两类方法都把弱模型或模型自身的错误视为应当丢弃的失败产物,没有挖掘其中蕴含的可迁移结构化知识——模型究竟以何种系统性方式犯错。

本文的目标是论文的目标是证明:同一模型家族内的强弱模型共享失败模式结构,因此可以离线收集小模型的错误,转化为批判式上下文示例,在推理时用最小的额外成本(1~2 次生成)提升大模型推理。具体拆成三件事:(1) 构建 CritBank——一个含问题、错误回答、失败模式标签与自然语言批判的结构化数据库;(2) 设计两种推理变体:CritICL-dynamic 对每个输入自适应预测可能的失败模式并检索相关批判,CritICL-static 使用家族级全局失败画像提供稳定引导;(3) 在 GSM8K、MATH(分布内)与 AMC23、AIME24/25(分布外)上,用 Qwen 和 Llama 两个家族验证方法相对标准 ICL 与测试时扩展方法的有效性和效率,并把结论推广到化学、生物等领域。

与已有工作不同的是,本文的独特切入是把弱到强泛化的信号源从『弱模型的正确输出』换成『弱模型的失败方式』。依据 Didolkar et al. (2024) 关于模型错误结构化、可预测的发现,作者先做实证:同家族内 Qwen2.5-72B 的失败模式分布与 Qwen2.5-1.5B 高度一致,且多个小模型聚合的分布比任何单个小模型都更接近大模型的真实错误分布。据此,错误不再是需要过滤的噪声,而是可复用的知识资产:通过失败模式标注函数的逆映射 $L^{-1}(l)=\{(q,r)\mid l\in L(q,r)\}$ 反查『哪些题目以何种方式跌倒』,把最典型的踩坑案例连同批判一起注入 prompt。这种『离线迁移失败结构』的范式避免了在线监督的逐条推理开销,也绕开了强模型自查自身的盲区。

核心方法

直觉上,同一模型家族的模型共享归纳偏置与训练数据谱系,小模型在哪里摔倒,大模型也很可能踩同一个坑;把『别人在哪里错、为什么错』写进上下文,强模型就能绕开这些陷阱。技术路线分两阶段。阶段一构建 CritBank:对 GSM8K 与 MATH 训练集共 15K 题,用同家族小模型(如 Qwen2.5-1.5B/3B/7B-Instruct)做链式思维采样、每题 5 次,用正确性函数 $\phi(q,r)\in\{0,1\}$ 过滤出错误回答;再由 gpt-4o-mini 为每个错误回答生成失败模式标签(经聚类去重)和自然语言批判。阶段二推理增强:给定新问题,按失败模式从 CritBank 检索至多 5 条『问题+错误回答+批判』示例注入 prompt,指导目标大模型(Qwen2.5-32B/72B、Llama-3.1-70B)作答,全部实验采用温度 0.0 的贪心解码保证确定性。

核心创新有三层。第一,把弱到强泛化从『在线蒸馏输出』变成『离线迁移失败结构』:失败知识一次构建、反复使用,CritICL-static 推理时只需 1 次生成,dynamic 也只要 2 次(多一步失败模式预测),而 Self-Consistency@7 要 7 次生成、Self-Reflection 平均 3.7 次。第二,示例选择由失败模式驱动而非表面相似度:基于标签逆映射 $L^{-1}(l)$ 检索针对主导失败模式的案例,消融显示这比随机、固定、语义相似度检索在 AMC23/AIME25 上高出 4~6 个百分点,说明『题目相似』不等于『坑相似』。第三,示例内容是批判而非正确示范:上下文里放的是『错误回答+错在哪』的批评,让强模型学会避坑;批判信息来自外部且离线获得,与 Self-Refine 类自我批判相比避免了模型检查自己的认知盲区。

方法步骤详情

方法共五步。第 1 步响应生成:对每对 $(q,m)\in Q\times M$,用 CoT 提示小模型 $m$ 生成 5 个回答$R(q,m)=\{r^{(i)}_{q,m}\}$,按正确性函数 $\phi(q,r)$ 划分,只保留错误回答。第 2 步批判与标注:对每个错误回答,由 gpt-4o-mini 生成至多 5 个候选失败模式标签,采用 Didolkar et al. (2024) 的聚类流程合并冗余标签,同时生成结构化批判 $C(q,r)$,提示模板见附录 G.1。第 3 步建库与索引:得到 $\text{CritBank}(Q,M)=\{(q,r,l,C(q,r))\}$,并建立集合值标注函数 $L$ 的逆映射 $L^{-1}(l)$ 用于按失败模式反查样本。第 4 步 CritICL-dynamic:让目标模型先对查询 $q'$ 预测至多 5 个可能失败模式,据此经 Failure Mode-Based Sample Selection 检索至多 5 条示例注入 prompt,共需 2 次生成。第 5 步 CritICL-static:聚合同家族三个小模型的失败频率构建全局画像,检索主导模式的示例,单次生成完成推理。两版均用温度 0.0 贪心解码保证确定性。

技术新颖性

技术新颖性体现在对既有范式的重组与实证支撑。示例选择方面,现有工作多基于与测试题的表面相似度挑选正确示范,本文首次系统证明『失败模式分布跨规模一致』并用其驱动检索,是 Didolkar et al. (2024) 失败模式分类学在新场景的应用。弱到强方向上,与 Ding et al. (2026) 的在线弱监督相比省去了每个输入的弱模型前向;与 Self-Refine/Reflexion 的自省相比,批判来自外部错误案例,避免自我盲区;与 LLM-as-a-Judge 相比无需强判别器多次调用。工程上,CritBank 只需 15K 题、三个小模型、每题 5 次采样和一轮 gpt-4o-mini 批注,即可服务整个家族所有更大的模型,具有一次构建、多处复用的资源属性——把『失败』资产化是这篇论文最独特的视角。

CritICL is a two-stage, inference-time W2SG method. Stage 1: Construct CritBank. Stage 2: Perform LLM inference with CritICL.
Figure 1: CritICL is a two-stage, inference-time W2SG method. Stage 1: Construct CritBank. Stage 2: Perform LLM inference with CritICL.
Failure mode distributions across model scales remains highly consistent across scales within Qwen family (top) and Llama family (bottom).
Figure 2: Failure mode distributions across model scales remains highly consistent across scales within Qwen family (top) and Llama family (bottom).

实验结果

核心结果有五组。(1) 主实验(Table 1):Qwen2.5-32B 上 CritICL-static 总体 Pass@1 达 49.8%,超过最强基线 Consistency@7 的 49.5%,dynamic 为 49.1%;相比 zero-shot 的 36.6%,static/dynamic 最高提升 13.4%/12.9%。Qwen2.5-72B 上 static 达 59.2%,优于 Consistency@5 的 59.0%;其中 GSM8K 95.4、MATH 84.0、AIME24 26.5。Llama 家族趋势一致(附录 E.1)。(2) 效率(Table 2,MATH/32B):static 仅 1 次生成、总 token 3768,dynamic 2 次、3897,均低于 Consistency@3~7 的 4192~5440、Self-Reflection 的 7533 与 LLM-as-Judge 的 6465;输出 token 296 还低于 5-shot 的 308,说明批判示例让解题路径更直接。(3) 消融(Table 3,72B):随机/固定/语义检索在 AIME25 只有 13.0~13.6,static 达 17.9,AMC23 领先 4~6 点。(4) 机制(Figure 2):同家族 top-20 失败模式的相对排序与量级跨规模稳定,三小模型聚合分布最接近 72B/70B。(5) 泛化:化学、生物基准上依然有效(附录 E.3)。

Performance comparison on Qwen family models((a) Qwen2.5-32B-Instruct 与 (b) Qwen2.5-72B-Instruct).
Table 1: Performance comparison on Qwen family models((a) Qwen2.5-32B-Instruct 与 (b) Qwen2.5-72B-Instruct).
Inference cost comparison across methods(MATH 数据集,Qwen2.5-32B-Instruct).
Table 2: Inference cost comparison across methods(MATH 数据集,Qwen2.5-32B-Instruct).
Effect of different in-context example selection strategies under a 5-shot setting(Qwen2.5-72B).
Table 3: Effect of different in-context example selection strategies under a 5-shot setting(Qwen2.5-72B).
查看结构化数据
任务指标本文基线提升
数学推理总体(Qwen2.5-32B,ID+OOD 平均) Pass@1 CritICL-static 49.8% Consistency@7 49.5% +0.3 个百分点,且仅需 1 次生成(基线需 7 次)
数学推理总体(Qwen2.5-72B) Pass@1 CritICL-static 59.2% Consistency@5 59.0% +0.2 个百分点,单次生成对五次采样
GSM8K(Qwen2.5-32B) Pass@1 93.6% 5-shot (Fixed) 91.2% +2.4 个百分点
MATH(Qwen2.5-72B) Pass@1 84.0% 5-shot (Fixed) 80.5% +3.5 个百分点
AIME25 消融(Qwen2.5-72B,5-shot 示例池) 准确率 CritICL-static 17.9% 语义相似度检索 13.0% +4.9 个百分点
推理成本(MATH,Qwen2.5-32B) 每题平均总 token 3768(1 次生成) Self-Reflection 7533(3.7 次生成) token 减少约 50%

局限与改进

论文致谢提到补充了统计不确定性分析,但正文仍暴露若干局限。其一,与最强基线的优势很小:32B 上 49.8% 对 49.5%,72B 上 59.2% 对 59.0%,而 AMC23/AIME 每类只有 30~40 题的小样本下,这种差距未必统计显著。其二,CritBank 质量依赖 gpt-4o-mini 的标注与聚类,标签噪声会直接传导到检索结果。其三,方法绑定模型家族,换新家族需重建库;且家族级失败画像是静态的,若目标模型已克服小模型常犯的错误(如简单算术失误),检索到的示例会浪费上下文窗口。其四,CritICL-dynamic 依赖目标模型自报可能的失败模式,存在元认知偏差风险。其五,非数学领域仅在化学、生物上做了附录级验证,深度不足;正文也未披露 CritBank 最终条目数等实现细节,检索上限固定为 5 条也偏粗糙。

独立分析的弱点

独立分析有四个弱点。(1) 静态画像的时效性:大小模型的失败集合并非完全重合,Figure 2 中某些模式(如 problem intent misinterpretation,聚合 6.98% vs 1.5B 的 5.25%)已有偏差,对 72B 早已解决的失败仍检索示例是浪费;改进方向是用目标模型的少量在线错误增量更新画像,做成半动态版本。(2) 失败模式粒度固定:聚类产生的分类学粒度影响检索精度,太粗则批判不聚焦,太细则样本稀疏,可引入层级化失败模式并按粒度自适应选择。(3) 只用错误回答:同一题 5 次采样中『1 对 4 错』的对照信息(正确与错误推理在哪一步分叉)是更强的监督信号,目前被丢弃,可构造对比式示例。(4) 检索策略均匀取 5 条,未按失败模式先验概率或批判质量加权,也未做多样性控制,可能检索出内容雷同的示例,浪费上下文预算。

未来方向

作者在结论与致谢中提出:扩展到更多领域、研究失败模式分类学粒度、标注可靠性、可迁移性与统计不确定性等方向。在此基础上有若干自然延伸:(1) 把 CritBank 从推理时上下文搬进训练时——用失败模式做强化学习的 reward shaping 或难度课程,让模型在训练中系统性补短板;(2) 失败模式引导的解码,例如对高风险模式相关的 token 施加偏置,与本文的 prompt 干预互补;(3) 让大模型的在线错误回流 CritBank,形成自进化的失败知识库,并检验跨家族、跨模态(多模态推理)的失败模式可迁移性;(4) 把失败模式分布当作模型可解释性与回归测试的诊断工具,用于版本对比与能力评估;(5) 两阶段检索——先按题型语义召回再按失败模式过滤——可能兼得相关性与针对性,进一步提升静态版本的覆盖面。

复现评估

复现条件较好。代码开源在 https://github.com/umwyf/CRITICL,评测集 GSM8K、MATH、AMC23、AIME24/25 与 Qwen2.5、Llama-3 系列模型权重均公开;所有实验采用 temperature 0.0 的贪心解码,结果确定性可复现;失败模式标注与批判的提示模板在附录 G.1/G 提供。主要成本在 CritBank 构建:15K 题 × 3 个小模型 × 每题 5 次采样,再对全部错误回答调用 gpt-4o-mini 批注,涉及一笔 API 费用与存储开销;推理侧 72B/70B 模型需要多卡环境。不足是论文未披露 CritBank 最终条目数、聚类阈值、检索实现等细节,Llama 主结果与部分消融在附录中。总体复现难度中等:熟悉 vLLM/SGLang 推理框架的团队预计数天可跑通主流程。