← 返回 2026-08-17

放大不等于预测:思维模型中的推理行为 Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig 📅 2026-08-13 👍 3 2026-08-22 18:30
大模型推理 思维链 模型行为分析 评估与基准

思维模型放大自我修正等行为,但最预测正确性的是置信校准——放大不等于预测

前置知识

思维模型与推理导向后训练

指经过 RLVR、DPO 或长思维链蒸馏等后训练、会在给出最终答案前先生成长推理轨迹的模型,如 OpenAI o1、DeepSeek-R1、Qwen3 的 thinking 版本;与之配对的是同一基座、同规模但未做思维训练的 instruct 版本。论文的实验设计正是在同一家族内做 thinking vs instruct 的匹配比较。

全文的比较对象就是这两类变体,标题里的'放大'指的就是思维训练使某些推理行为的出现率显著上升这一现象。

Behavioral Lift(行为提升度)

对每个行为 $b$ 计算 $\mathrm{Lift}(b)=P(\text{correct}\mid b{=}\text{true})-P(\text{correct}\mid b{=}\text{false})$,即该行为出现在推理轨迹中与缺席时模型正确率的差值。正值表示行为与答对正相关,负值表示与答错相关。作者强调它是描述性关联指标,不是因果效应估计。

这是论文的核心度量,'放大–提升差距'(Amplification-Lift Gap)正由流行度放大与 Lift 排序的错位来定义。

LLM-as-Judge 自动标注

用强模型(本文用 GPT-4o)作为评审,接收问题、标准答案与模型的完整输出,按预先给定的行为定义对每条轨迹的每个行为输出二元标注。可靠性通过多评审交叉对比(DeepSeek-V3、Gemini-2.5-Flash、Gemini-3-Flash)与人工抽检来验证。

15,282 条轨迹的全部行为标签都由这一流程产生,评审的系统性偏差会直接传导到 Lift 的估计上。

Cohen's Kappa 一致性系数

修正随机一致后的评审间一致性度量,$\kappa=(p_o-p_e)/(1-p_e)$,其中 $p_o$ 是观测一致率、$p_e$ 是随机期望一致率。经验上 0.41–0.60 为中等一致,0.61–0.80 为较大一致,0.8 以上接近完全一致。

论文用 $\kappa$ 报告焦点行为的跨评审一致性(0.51–0.82)与人工核验($\kappa=0.902$),是判断标签噪声水平、进而判断结论可信度的关键数字。

恢复率(Recovery Rate)

定义为 $\mathrm{Recovery}(m)=P(\text{correct}\mid \exists f{\in}F_{all}: f{=}\text{true})$,即在出现至少一种被标注失败模式(逻辑失败、事后合理化、捷径、幸运猜对等)的轨迹中,模型最终仍答对的比例,衡量模型'带着失败生存'的能力。

它回答了'既然被放大的行为不预测正确性,思维模型靠什么赢':多数收益来自失败更少或失败后恢复更快。

研究动机

推理导向后训练催生了 o1、DeepSeek-R1、Qwen3 等思维模型,它们在答题前生成冗长推理轨迹,常在难题上超过指令微调版本。但更长的轨迹让人容易把'看起来在深思'误当成'推理可靠':准确率只回答模型是否答对,却无法说明模型用了哪些行为、踩了哪些坑,更无法说明思维轨迹中更频繁出现的行为是否正是与答对最相关的行为。模型可能因为困惑而更多对冲、因为前面出错而更多自我修正——行为流行度的上升未必代表其更有价值。此前的行为分类学研究(Gandhi et al. 2025、Kargupta et al. 2025 等)主要刻画模型'做对了什么',既不显式标注失败模式,也没有把'行为出现频率'与'行为对正确性的预测力'分开度量,导致'思考更多等于推理更好'的直觉长期缺乏系统检验。

本文的目标是本文要回答一个具体问题:思维模型放大的推理行为,是否正是与答案正确最相关的行为?为此作者提出两个可量化指标:一是 Behavioral Lift(行为提升度),定义为 $\mathrm{Lift}(b)=P(\text{correct}\mid b{=}\text{true})-P(\text{correct}\mid b{=}\text{false})$,衡量某行为出现在轨迹中时正确率变化多少;二是 Recovery Rate(恢复率)$\mathrm{Recovery}(m)=P(\text{correct}\mid \exists f{\in}F_{all}: f{=}\text{true})$,衡量模型在出现至少一种推理失败后仍答对的比例。研究在 15 个开源模型(3B–9B,7 个家族,含成对 thinking/instruct 变体)、6 个基准(纯文本与视觉语言各 3 个)上,用统一行为分类学标注了 15,282 条轨迹,最终检验'放大'与'预测力'是否一致,并为过程监督提供该奖励什么行为的依据。

与已有工作不同的是,本文的独特之处在于三个分离:分离'行为流行度'与'行为提升度'、分离'最终答案正确'与'推理过程健全'、并让'语言模型'与'视觉语言模型'共享同一套行为定义以便跨模态对比。与以往只统计行为出现次数的工作不同,作者在同一模型家族内做 thinking vs instruct 的匹配比较(如 Qwen3 对 Qwen2.5),把九个高阶行为用模态中立语言统一定义,使 LLM 与 VLM 的轨迹可以直接汇总比较;同时显式标注 7 类失败模式(逻辑失败、事后合理化、捷径、幸运猜对等),从而能追问'模型失败后还能不能救回来'。这个'放大–提升差距'的视角是全新的:此前没人系统证明思维训练放大的是自我修正、假设检验、不确定表态,而真正高提升的置信校准几乎没被放大。

核心方法

整体是一个'标注—度量—稳健性验证'的实证流水线。直觉上,判断一个行为有没有用,不能只看它出现得多不多,而要看它在场与不在场时正确率的差值。技术路线上,作者先构建跨模态行为分类学:9 个高阶行为按元认知文献分为控制/调节(规划、目标跟踪、假设检验、自我修正)、监控/判断(不确定表态、置信校准、自我觉察)、认知锚定(证据引用、知识对齐)三类;外加每模态 7 种失败模式——两种模态共享逻辑失败、事后合理化、捷径、幸运猜对 4 种,VLM 另有视觉幻觉、视觉忽视、语言偏见,LLM 另有事实错误、误读上下文、知识缺口。然后用 GPT-4o 作 LLM-as-Judge,对 15 个模型在 6 个基准上的 15,282 条完整推理轨迹做二元标注,再计算每个行为的 Lift 和每个模型的 Recovery Rate,并用跨评审一致性、同题对比、隐藏状态探针等多重手段验证结论的稳健性。

核心创新是把'行为的流行度'与'行为的提升度'正式分开。提升度定义为 $\mathrm{Lift}(b)=P(\text{correct}\mid b{=}\text{true})-P(\text{correct}\mid b{=}\text{false})$:正的 Lift 表示行为在场时正确率更高,负的表示更低;作者明确指出 Lift 是描述性指标而非因果估计——高 Lift 也可能因为模型本已在正确轨道上。恢复率定义为 $\mathrm{Recovery}(m)=P(\text{correct}\mid \exists f{\in}F_{all}: f{=}\text{true})$,专门衡量'带着失败仍答对'的能力。与已有研究的本质区别在于:Gandhi et al.、Kargupta et al. 等刻画的是'模型做了什么',本文同时追问'做的东西值不值',并用匹配的 thinking/instruct 家族对比把训练方式的效应从模型能力中剥离出来。这使'放大不等于预测'从一个直觉批评变成可测量、可证伪的实证命题。

方法步骤详情

第一步选模型:15 个开源模型(3B–9B,7 家族),含 4 个 thinking 与 3 个非 thinking 的 VLM、4 个 thinking 与 4 个非 thinking 的 LLM,尽量配对同家族变体。第二步选基准并控制任务谱:VLM 用 VisualPuzzles(350 题,视觉推理)、MathVista(300 题,testmini,视觉数学)、MMMU(350 题,多模态知识);LLM 用 LogiQA2(350,逻辑)、MATH-500(350,数学)、MMLU-Pro(350,14 领域知识)。第三步标准化推理并保留完整轨迹。第四步用 GPT-4o 做 LLM-as-Judge:输入问题、标准答案与完整输出,对每个行为输出二元标注;置信校准仅在'表达的确定性与轨迹中推理强度一致'时判真。第五步验证评审可靠性:与 DeepSeek-V3、Gemini-2.5-Flash、Gemini-3-Flash 在 600 条分层 MATH-500 样本上交叉对比,焦点行为 $\kappa=0.51$–$0.82$,总体一致率 83.7%–88.8%;人工核验 120 条轨迹共 720 个二元判定,与 GPT-4o 一致率 95.1%($\kappa=0.902$)。第六步计算按模态池化的 Lift,并做分基准(Figure 8)、分难度层(Figure 4)、分模型(Figure 9/10)与反向条件化检查;同题对比在 250 道 MATH-500 题上对 Qwen3-4B 每题生成 8 条轨迹。第七步恢复率分析,并在含失败轨迹内检验各行为与恢复的关联。第八步用 OLMo-3-7B 的 SFT 检查点(DPO/RLVR 之前,N=1,443)检验差距出现时机。第九步规模实验:Qwen3-VL 2B→32B 于 MathVista、Qwen3 vs Qwen2.5 于 MATH-500;另在 GPQA-Diamond 全量 198 题上验证 7 个前沿模型(N=1,386)。

技术新颖性

技术新颖性体现在四点。其一,指标层面:Lift 与 Recovery Rate 都是简单的条件概率差,但把'频率'与'价值'分离后,'思维模型在放大什么'与'什么在预测正确'第一次可以在同一坐标系里比较——Figure 1 的放大–提升散点图中右上象限为空即是核心证据。其二,分类学层面:9 个行为全部用模态中立语言定义,'纠正视觉解读'与'纠正数学推导'视为同一行为,支持跨模态汇总(VLM N=7,000,LLM N=8,282)。其三,失败显式化:之前的行为分类学回避失败标注,本文把 7 种失败模式与恢复率绑定,揭示'部分行为只在失败之后才起作用'——自我修正在含失败轨迹中与恢复强相关(+39pp)。其四,验证深度:除多评审一致性外,还用 Qwen3-4B 隐藏状态的线性探针证明多个行为可被解码、且探针可解码性排序与 Lift 方向一致;再加上 OLMo-3 SFT 阶段、2B→32B 规模、GPQA-Diamond 前沿模型的多重外部验证,使结论不易归因于单一模型或单一标注器。

实验结果

核心发现是'放大–提升差距'。流行度端:思维模型把自我修正放大到 21–55%(对照模型 3–15%)、假设检验放大到 22–52%(4–18%)、不确定表态放大到 25–85%(4–28%),而置信校准几乎不变(MATH-500 上 66.1% vs 67.9%、MMLU-Pro 上 40.9% vs 46.7%,指令版反而略高)。提升度端:置信校准是最强信号之一,VLM Lift +72.2%(在场 98.8% vs 缺席 26.7%)、LLM +79.6%(99.6% vs 20.0%);自我觉察 +62.0%/+52.7%、知识对齐 +53.7%/+80.3% 也居前;被放大的三项垫底——不确定表态 Lift 为负(VLM -16.1%、LLM -13.9%),假设检验仅 +1.0%,自我修正 +20.1%/+12.4%。置信校准在幸运猜对轨迹中仅出现 7.6%(VLM)/3.4%(LLM)、事后合理化中仅 3.4%/1.6%,而在健全推理中高达 94.7%/95.9%,说明它追踪推理质量而非答案正确。同题对比(Qwen3-4B,250 题×8 轨迹)中置信校准 Δaccuracy 为 +0.305(LLM-Think)/+0.518(LLM-Inst),不确定表态 +0.006/-0.094。恢复率呈任务依赖:VisualPuzzles 思维 23.0% vs 指令 8.4%(2.7 倍)、MATH-500 40.8% vs 17.8%(2.3 倍)、MMLU-Pro 16.8% vs 6.3%(2.7 倍);MathVista(45.9% vs 47.5%)与 MMMU(32.9% vs 33.8%)持平;LogiQA2 反转(指令 24.5% vs 思维 11.1%),指令模型靠有效捷径(34.2% vs 20.3%)以 58.4% vs 54.1% 反超。无失败检出时两类模型均达 96–99%。OLMo-3 的 SFT 检查点上差距已出现:Think-SFT 自我修正 34.5% vs 1.0%,但检查点内最高 Lift 仍是知识对齐/置信校准(+81.0%/+67.4%)。规模上差距持续:32B 自我修正 61.3% vs 11.3%,但自我修正 Lift 从 2B 的 +30.0% 降到 32B 的 +5.9%,置信校准 Lift 从 +57.7% 升至 +68.7%;思维模型的不确定表态从 66.7%(2B)降到 43.7%(32B)。GPQA-Diamond 上 7 个前沿模型复现同一 Lift 排序。

Nine behaviors used for cross-modal analysis. Full definitions appear in Appendix Tables 24 and 26.
Table 1: Nine behaviors used for cross-modal analysis. Full definitions appear in Appendix Tables 24 and 26.
Within-question analysis across language-only and vision-language models. Values are mean per-question Δaccuracy between traces where a behavior is present versus absent, computed from 8 samples per question.
Table 2: Within-question analysis across language-only and vision-language models. Values are mean per-question Δaccuracy between traces where a behavior is present versus absent, computed from 8 samples per question.
Per-benchmark prevalence of amplified behaviors and Recovery Rate (bottom row) for thinking vs comparison models.
Table 7: Per-benchmark prevalence of amplified behaviors and Recovery Rate (bottom row) for thinking vs comparison models.
The disconnect between what thinking-oriented training amplifies and what predicts success. Each point is one of the nine cross-modal higher-order behaviors, averaged across VLMs and LLMs (N=15,282). The top-right quadrant is empty.
Figure 1: The disconnect between what thinking-oriented training amplifies and what predicts success. Each point is one of the nine cross-modal higher-order behaviors, averaged across VLMs and LLMs (N=15,282). The top-right quadrant is empty.
Aggregate prevalence of a subset of the nine core higher-order behaviors across all benchmarks per modality. Self-correction, hypothesis testing, and uncertainty acknowledgment show the largest prevalence gaps between thinking and instruct models.
Figure 2: Aggregate prevalence of a subset of the nine core higher-order behaviors across all benchmarks per modality. Self-correction, hypothesis testing, and uncertainty acknowledgment show the largest prevalence gaps between thinking and instruct models.
Behavioral Lift for the nine cross-modal higher-order behaviors, ordered to highlight the relationship between amplified behaviors and high-Lift behaviors.
Figure 3: Behavioral Lift for the nine cross-modal higher-order behaviors, ordered to highlight the relationship between amplified behaviors and high-Lift behaviors.
Association between behaviors and recovery among traces with at least one detected failure (self-correction +39pp).
Figure 7: Association between behaviors and recovery among traces with at least one detected failure (self-correction +39pp).
Scale analysis of Qwen3-VL (Think/Instruct) from 2B to 32B on MathVista.
Figure 14: Scale analysis of Qwen3-VL (Think/Instruct) from 2B to 32B on MathVista.
Scale analysis of Qwen3 (Think) vs Qwen2.5 (Instruct) on MATH-500, with details in Table 20.
Figure 15: Scale analysis of Qwen3 (Think) vs Qwen2.5 (Instruct) on MATH-500, with details in Table 20.
查看结构化数据
任务指标本文基线提升
六基准汇总(VLM,N=7,000) 置信校准 Behavioral Lift +72.2%(在场 98.8% vs 缺席 26.7%) 不确定表态 Lift -16.1%、假设检验 +1.0% 置信校准居 9 行为之首,而被放大的行为垫底
六基准汇总(LLM,N=8,282) 置信校准 Behavioral Lift +79.6%(在场 99.6% vs 缺席 20.0%) 知识对齐 +80.3% 为最高,不确定表态 -13.9% 高提升行为均未被思维训练放大
MATH-500 Recovery Rate 思维模型 40.8% 指令模型 17.8% 2.3 倍
VisualPuzzles Recovery Rate 思维模型 23.0% 指令模型 8.4% 2.7 倍
MMLU-Pro Recovery Rate 思维模型 16.8%(逻辑失败率 51.1%) 指令模型 6.3%(逻辑失败率 41.4%) 2.7 倍:失败更多但恢复更快
LogiQA2(模式匹配反例) 准确率 思维模型 54.1% 指令模型 58.4% 指令反超 4.3pp,思维有害
同题对比(Qwen3-4B,MATH-500 250 题×8 轨迹) 同题 Δaccuracy 置信校准 +0.305(Think)/+0.518(Instruct),CI 排除零 不确定表态 +0.006(Think)/-0.094(Instruct) 控制题目难度后结论不变
规模实验(Qwen3-VL 2B→32B,MathVista) 自我修正 Lift / 流行度 Lift +30.0%(2B)→ +5.9%(32B);流行度 61.3% vs 11.3% 置信校准 Lift +57.7%(2B)→ +68.7%(32B) 放大–提升差距随规模扩大而非消失

局限与改进

作者承认三点局限:分析仅基于可见文本轨迹,书面推理可能不完整、事后编造或与内部计算不忠实(引 Boppana et al. 2026、Chen et al. 2025、Baker et al. 2025);标签来自自动评审,尽管做了多评审验证、同题对照与探针分析,系统性评审偏差仍可能存在;Lift 是描述性指标,高 Lift 可能是原因、也可能只是'模型本已在正确轨道'的伴随现象。我的补充观察:其一,评审者能看到标准答案,置信校准这类与正确性纠缠的标签可能被答案信息污染,导致 Lift 被高估,论文未做'盲答案'评审对照;其二,主实验集中在 3B–9B 小模型,32B 与前沿模型只是补充,结论对最大规模模型的适用性有限;其三,每基准约 300–350 条样本,稀疏行为(如幸运猜对)的条件概率差置信区间会较宽;其四,自我觉察等行为的跨评审 $\kappa$ 偏低,标签噪声不可避免;其五,所有基准均为英文,跨语言泛化未知。

独立分析的弱点

独立分析出四个弱点。第一,评审循环性:GPT-4o 同时拿到题目、标准答案和轨迹,若它倾向给'答对的轨迹'标注置信校准/知识对齐,Lift 会出现标签泄漏式虚高;改进方向是做答案盲评(只给题目与轨迹)的对照实验,比较两种条件下 Lift 排序是否稳定。第二,二元标注粒度太粗:'置信校准'被压缩成一个 0/1 位,丢失校准程度信息,可改为连续的校准误差(如表达置信与推理质量的差值),或与输出概率的期望校准误差 ECE 对齐。第三,池化 Lift 的辛普森悖论风险:跨 15 个模型池化后,行为–正确关联可能被模型间难度差异混淆,作者虽做了分基准、同题检查,但未系统报告分模型 Lift 的置信区间;改进是做混合效应回归(行为固定效应 + 模型/基准随机效应)。第四,缺乏因果干预:论文只观察了放大与 Lift 的错位,没有训练实验证明'奖励高 Lift 行为能提升正确率';改进方向是用受控 SFT/RLVR 消融,把置信校准类行为写进奖励函数验证增益,Appendix F 的提示实验只能算弱证据。

未来方向

作者提出的方向:过程监督应奖励与正确性相关的行为——有证据支撑的论断、恰当的领域框架、对信息缺失的识别、与推理强度一致的置信——而不是冗长、回溯、表态犹豫等表面形式;Lift 可作为审计工具,检验过程奖励模型到底在奖励真价值还是只奖励'深思的表象';未来评估应同时报告思维'是否'帮助与'如何'帮助(防失败、促恢复、改校准、改捷径)。可延伸的方向:其一,把 Lift 内建进 RLVR/过程奖励模型的奖励项,做训练侧闭环验证;其二,把行为分类学扩展到智能体长程任务(工具调用、多轮规划),检验恢复率在更真实环境中的意义;其三,结合机制可解释性定位置信校准的内部表征,弄清它与隐藏状态探针解码结果的因果链;其四,研究为什么置信校准没有被强化学习放大——是数据分布、奖励信号还是探索难度问题;其五,非英语与跨领域的泛化检验。

复现评估

复现条件较好。作者公开了标注 prompt、指标代码和行为标注数据(项目页 neulab.github.io/behavioral-lift,代码 github.com/neulab/behavioral-lift,数据 huggingface.co/datasets/neulab/behavioral-lift),覆盖 15,282 条轨迹的行为标签。复现成本主要在三块:一是推理,15 个开源模型(3B–9B)×6 基准各约 300–350 题,再加 OLMo-3 SFT 检查点(N=1,443)、Qwen3-VL 2B→32B 规模实验与 GPQA-Diamond(N=1,386),单张 A100/H100 数天内可完成小模型部分,32B 需多卡;二是标注,GPT-4o 对 1.5 万条长轨迹做结构化标注是主要 API 开销(数百美元量级),交叉验证还需 DeepSeek-V3 与 Gemini 系列;三是分析,Lift/Recovery 只是条件概率差,代码量小。整体难度中等:工程量集中在批量推理与轨迹解析,方法论没有隐藏技巧;风险点是 LLM-as-Judge 的 prompt 与模型版本差异可能造成与原文标注的小幅偏差。