LLM预测器内部表征探针:置信度校准与思维链忠实度审计 What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness
用轻量探针读取LLM内部激活,校准置信度、揪出思维链隐藏的证据影响。
前置知识
校准与期望校准误差(ECE)
校准衡量模型'知不知其所知':当它给某结果打70%置信度时,该结果应在大约70%的情况下发生。期望校准误差ECE把所有预测按置信度分箱,计算每箱经验准确率acc(b)与平均置信度conf(b)的加权绝对差,公式为$$\mathrm{ECE}=\sum_b \frac{n_b}{N}\,|\mathrm{acc}(b)-\mathrm{conf}(b)|$$。ECE越小,置信度越可信。它和Brier分数$\mathrm{Br}=\frac{1}{N}\sum_i(p_i-y_i)^2$、AUROC互补:Brier惩罚'自信却答错',AUROC只看置信度能否把对错分开、与绝对值无关、对温度缩放不敏感。
本文的全部价值围绕'探针能否给出比模型自报更准的校准'展开,看懂ECE才能判断图1那两条可靠性曲线孰优孰劣。
线性探针(Linear Probing)
探针是训练在大模型冻结内部激活上的小型分类器,用来'读出'模型内部已表征、却不一定说出口的信息。最简形式是对某层激活做标量内积$f_\theta(X)=\langle W,\phi_\theta(X)\rangle+b$,再经sigmoid映射成概率$p=\sigma(z)=1/(1+e^{-z})$。它不改动模型权重、训练成本极低,被广泛用于机械可解释性,比如读出'模型是否在说谎''是否已决定答案'等内部状态。
本文不重训、不微调,只靠轻量探针就恢复了校准信号并审计推理忠实度,这正是'探针'范式的核心。
池化探针(均值/注意力/协方差)
单个token位置的激活已被注意力压缩过滤,丢失了序列级信号。池化探针对整段上下文的激活矩阵$X\in\mathbb{R}^{N\times D}$做聚合再读出:均值池化$\phi_{\mathrm{mean}}=\frac{1}{N}X^\top\mathbf{1}_N$取算术平均;注意力池化$\phi_{\mathrm{attn}}=X^\top\mathrm{softmax}(Xq)$用可学习查询$q$加权;协方差池化$\phi_{\mathrm{cov}}=\frac{1}{N}(XL)^\top(XR)$用两个低秩投影$L,R$压缩出$k\times k$的二阶协方差统计再展平。协方差池化捕捉的是激活跨token的'共涨落',是均值与注意力都看不到的二阶信息。
论文发现三种池化判别力接近,但只有协方差池化'既判得准又校准得好',这是最终选用L21协方差探针的关键。
思维链忠实度(CoT Faithfulness)
忠实度指模型写出来的推理过程是否真反映了驱动其预测的内部计算。判断方法来自因果扰动框架:删掉或塞入一条证据,看预测概率$|\Delta\mathrm{prob}|$是否变化,同时比对推理文本的变化。若证据明显改变了预测、推理却只字未改,就是'隐秘影响'(stealth)——不忠实。一条推理可以看起来头头是道却与真正起作用的证据无关,忠实$\neq$合理。
论文用证据消融和误导注入两套扰动,量化了EF-8B的思维链有多少'沉默的'证据影响,这是审计类应用的基础。
可验证奖励强化学习(RLVR)
RLVR用可自动判定的结果(如答案对错)作为奖励训练推理模型,能显著提升数学与符号推理能力。但二值正确性奖励无法区分'自信地错'和'谨慎地蒙',因此RLVR常越训越不准(准确率升、校准降)。为此出现了RLCR(往奖励加Brier校准项)和DCPO(把推理token与置信度token解耦优化)等校准感知训练法。EF-8B正是用RLVR从Qwen3-8B后训练的预测模型。
理解RLVR的校准缺陷,才能明白'为什么要在训练之外再读内部激活',以及本文与RLCR/DCPO训练时路线的本质区别。
研究动机
经过RLVR后训练的大语言模型(如Eternis-Forecaster 8B,简称EF-8B)在开放型现实事件预测上已能匹敌甚至超越人类预测者,但'准'并不等于'可信'。本文用温度扫描刻画了这一病灶:在$T\in[0.2,1.6]$区间,EF-8B的逐rollout准确率始终停在$37\pm1\%$,而它自报的置信度却僵在50%上下几乎不动,导致ECE长期处于0.110–0.150的过高区间,且这种过度自信基本与采样温度无关。更具体地,模型说0.93置信度的预测只有70%答对、说0.75的只有44%答对。更隐蔽的问题是思维链忠实度:伴随预测的推理过程可能省略或歪曲了真正驱动预测的证据。一旦模型自报的概率本就是'不可靠叙述者'的产物,用户既无法审计预测,基于自报置信度算出的校准指标也被一同污染。在地缘政治、公共卫生等决策支持场景里,这种'说一套、算一套'会直接误导决策。
本文的目标是本文要给LLM预测器配一套不依赖重训、直接读取模型内部状态的实用工具,达成三个可量化目标。第一,校准:用轻量探针把内部激活读成校准的置信度,目标是在ECE上大幅优于模型自报概率(EF-8B自报约0.093,希望降到0.05左右甚至更低),同时保持相近的排序力AUROC。第二,审计:量化思维链是否忠实,能检测出'预测被证据改变、推理却沉默'的隐秘影响,并在推理沉默时仍指出变化方向。第三,分诊省钱:在读内部状态的基础上,判断哪些问题答案早已定下、可跳过推理直接作答,从而在精度不损的前提下省下大量生成token。整套方法必须轻量、不改动模型权重、且能迁移到不同模型。
与已有工作不同的是,已有工作大多把校准当成训练时问题:RLCR往奖励里加Brier项、DCPO把推理token与置信度token解耦优化,都需要重新做RL、代价高且可能损害准确率。本文的独特切入角度是——校准信号其实早就存在于残差流里(从最后一个prompt token起,探针AUROC就已达约0.76),只是模型的'自报'环节把它扭曲了。因此过度自信与其说是'不自知'的失败,不如说是'说不出口'的失败。据此作者不去重训模型,而是训练冻结激活上的小探针直接读出这个信号;更进一步,把同一个探针复用为'测谎仪'审计思维链,并用强制作答揭示'答案在推理开始前就已基本定下'。把校准、忠实度审计、推理分诊统一到'读内部表征'这一个通道,是本文区别于以往单点改进的关键。
核心方法
直觉上,可以把模型当成一个病人:它嘴上说的置信度和推理是'主诉',而内部激活是'心率血压'。主诉可被夸大、被隐瞒,但生命体征很难作伪。本文就是给模型接上一台'心电图'——不改动模型,只在冻结的中间层激活上训练一个轻量探针,读出'这次预测到底靠不靠谱'。技术路线分四步:先让EF-8B在OpenForesight问题上生成大量rollout并用LLM裁判打上对错标签;再把残差流激活喂给探针,以二值交叉熵训练它预测'该rollout最终答案是否正确';接着做一次36层$\times$3种池化$\times$7个推理位置的完整网格扫描,选出判别力强又校准好的协方差探针(L21、读到rollout末尾);最后把这个读出的概率直接当成校准后的置信度。由于探针只读激活、不改模型,训练成本极低(每个问题约1条rollout即可)。
核心创新在于一个被实验反复印证的事实:校准信号早已编码在残差流中,模型'知道'却'不说'。在推理尚未开始的prompt末尾,探针AUROC就已$\approx0.76$;强制作答实验进一步证明答案在思维链开始前就基本定下。所以过度自信不是表征层面的缺失,而是从内部状态到口头概率这一步的失真。本文据此提出——与其像RLCR/DCPO那样重训模型、或像温度缩放那样事后重标定,不如直接训练探针把内部状态读出来,绕过verbalization这个'不可靠叙述者'。最具洞察力的一点是'一探针两用':同一个读正确性的探针,既能当校准器(ECE从0.093降到0.044),又能当测谎仪——在1792个扰动案例中,探针内部变化$|\Delta\mathrm{probe}|$与行为变化$|\Delta\mathrm{prob}|$的相关Spearman $\rho=0.565$,远高于推理文本的0.215,并且在推理'沉默隐秘'的107个案例里仍能捕捉到变化并约79%地指对方向。把校准与审计统一到一个激活读出通道,是本文最本质的区别。
方法步骤详情
完整流程分五步。①数据与标签:在OpenForesight的train split上让EF-8B每问题生成1条rollout($T=1.0$),用Claude Sonnet裁判判定答案是否与ground truth语义等价,得到二值标签$y\in\{0,1\}$。②探针扫描:固定模型读残差流激活,构造三种池化,在36层、7个推理锚点上各训一个探针,AdamW、$\mathrm{lr}=10^{-3}$、协方差瓶颈$k=64$,按验证集最低损失选checkpoint,输出经$\sigma(z)$映射为正确性概率。③部署:选判别力与校准兼优的L21协方差探针,在test的3020条rollout上与自报概率对比ECE/AUROC。④忠实度审计:逐条删新闻做证据消融、塞入假文章做误导注入,成对计算$|\Delta\mathrm{prob}|$、探针$|\Delta\mathrm{probe}|$和推理文本变化,量化沉默比例。⑤强制作答与分诊:用空think的prefill逼模型立刻作答,读logit分布算熵$H=-\sum_i p_i\ln p_i$,按$H$分三档——低熵直接提交、中熵才推理、高熵转检索,精度不损时省30–47%的token。
技术新颖性
新颖性体现在三个层面。技术层面,作者系统比较了均值、注意力、协方差三种池化,发现协方差池化能捕捉跨token的二阶共涨落统计$\phi_{\mathrm{cov}}=\frac{1}{N}(XL)^\top(XR)$,从而在判别力与校准上同时占优,突破了以往单点激活探针或token-logprob置信度的局限。方法层面,区别于RLCR、DCPO等'训练时校准'路线,本文坚持'冻结模型、只训探针',并把这个读出通道从单纯的校准器扩展为忠实度测谎仪——用同一个探针既算置信度又审计推理,这是把校准与可解释性打通的新组合。应用层面,强制作答揭示'答案在推理前已定',并据此提出熵门控分诊与检索路由,把内部信号直接转化为省token的推理调度策略。对照基线(token-logprob置信度、等温回归自报概率、自报置信度门控)也都显示探针在OOD上更鲁棒。
实验结果
四组实验构成核心发现。校准:L21协方差探针test上ECE=0.044,自报概率ECE=0.093;两者排序力几乎打平(AUROC 0.756 vs 0.758),但探针贴对角线、自报在>0.5处系统性过高(说0.93只对70%)。OOD优势持续:skysports ECE 0.064 vs 0.089、aljazeera 0.140 vs 0.178。冻结GLM迁移:GLM-4.7-Flash均值池ECE 0.054 vs自报0.287;GLM-4.5-Air的L18注意力探针AUROC 0.783 vs 0.691、ECE 0.102 vs 0.255,去泄漏后$\Delta$AUROC=+0.110[0.069,0.149]显著。数学OOD:未训练Qwen3-8B探针AUROC 0.752升到0.894、ECE 0.270降到0.083;DCPO模型探针AUROC 0.929 vs 0.865仍更优,但等温回归自报ECE(0.125)略低于探针(0.143)。忠实度与测谎:消融1303对里行为与推理变化仅弱相关$\rho=0.215$,460个高影响对中23%(107个)推理毫无变化;但L20探针$|\Delta\mathrm{probe}|$与$|\Delta\mathrm{prob}|$强相关$\rho=0.565$、方向预测准确83.6%,沉默案例里仍移动0.065且78.5%指对方向。强制作答显示自报置信度有无推理几乎一致($\rho$=0.90/0.87/0.78),CoT仅带来+1.9pp分布内精度增益;熵门控据此省30–47%token而精度无损。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| OpenForesight 预测校准 (EF-8B) | ECE↓ | 0.044 (协方差探针 L21) | 0.093 (模型自报概率) | 降低约 52% |
| OpenForesight OOD (skysports) 校准 | ECE↓ | 0.064 | 0.089 (自报) | 降低约 28% |
| 冻结 GLM-4.5-Air 校准 | ECE↓ | 0.102 (注意力探针 L18) | 0.255 (自报) | 降低约 60% |
| OOD 数学正确性判别 (未训练 Qwen3-8B) | AUROC↑ | 0.894 (探针) | 0.752 (token-logprob) | +0.143 [0.090,0.197] |
| 思维链忠实度测谎 | Spearman ρ (内部变化 vs 行为变化) | 0.565 (探针) | 0.215 (推理文本变化) | 提升约 162% |
| 推理 token 节省 (精度无损) | 省 token 比例 | 30–47% (熵门控 commit-early) | 100% (全程推理) | 省 30–47% token |
局限与改进
作者坦承的局限包括:GLM-4.7-Flash去泄漏后的$\Delta$AUROC为+0.055但95%CI[−0.006,0.111]包含0,只能稳妥声称'校准改善'而非'排序改善';数学OOD上DCPO模型的等温回归自报概率ECE(0.125)略优于探针(0.143),探针更像OOD判别器而非点校准最优解;DCPO探针训练池通过DeepScaleR与RLVR训练分布重叠,因此不能据此宣称'正确性表征是训练不变的'。我的额外观察:正确性标签依赖Claude裁判,本身带噪声;EF-8B预测准确率仅约37%,整个评估域较窄;忠实度的推理文本变化用的是Jaccard+字符相似度的启发式,对'换汤不换药'的改写可能漏判;消融23%沉默与注入2.5%沉默用了不同分母,作者虽注明不可直接比较却仍并列呈现,易误导读者把两个数字简单对照。
独立分析的弱点
第一,探针并非真正免标签:它仍需LLM裁判生成的正确性标签来训练,裁判错误会直接污染读出信号,改进方向是探索自监督或基于一致性的无标签探针。第二,迁移性存疑:EF-8B、GLM、Qwen都偏Qwen系架构,探针是否对差异大的模型族有效未验证,且每个模型都要重扫层与池化、重训探针,工程上并不轻量——可做跨层/跨模型的探针迁移或自动选层。第三,校准只验证了二值正确性,而真实预测市场常是多选项、连续概率,探针读出的是标量logit,扩展到多结果需重新设计读出头。第四,强制作答依赖'空think prefill'这一hack,对显式禁用think的模型或不同chat模板可能失效,分诊门控的鲁棒性待考。第五,'答案推理前已定'易被过度解读:它只说明候选分布已定,而CoT仍有+1.9pp增益,'推理无用'的叙事需克制。
未来方向
作者明确提出的方向是'内省'问题:既然校准信号已在残差流里,能否训练模型把探针信号蒸馏进自报概率,或用校准感知奖励做后训练?以及——这样训下去会'锐化'还是'破坏'探针所读的内部信号?基于本文成果可延伸的方向包括:把高熵分诊信号真正接上检索,对'缺证据'问题自动召回所需文章以提精度;将测谎探针用于安全与对齐审计(如检测隐藏的越狱指令影响);扩展到多结果预测与Agent长程决策;以及把'探针即校准器'与训练时校准(RLCR/DCPO)结合,看二者是否互补。整体看,'读内部表征'这条路还可与激活 steering、稀疏自编码器等可解释性工具结合,做出更强的预测器审计与控制。
复现评估
复现门槛中等偏高。数据上OpenForesight公开于HuggingFace(train 52.2k等split),但作者自建的'改进上下文'压缩版是non-public,GLM实验和部分结论依赖它;数学实验用的是公开MATH-train与AIME/AMC。模型上EF-8B/EF-32B来自Eternis(与Goodfire合作),开源情况不明,是最大障碍;Qwen3-8B、GLM-4.7-Flash/4.5-Air均开放。探针本身极轻量:单层线性/协方差读出,AdamW、$\mathrm{lr}=10^{-3}$、batch=8、$k=64$,单卡即可训,算力主要花在生成rollout(温度扫描就需29,600次生成)和LLM裁判(Claude Sonnet)上。脚本称由Silico平台自动产出并经人工审阅,但未见公开代码仓库。整体:方法清晰可复刻,但缺Eternis模型与私有数据时只能部分验证GLM/Qwen的结论。
论文图表