← 返回 2026-08-14

指令微调对语言模型置信度与词汇多样性的影响 Are You Sure You're Sure? On the Impact of Instruction Tuning on Confidence and Lexical Diversity

Irina Proskurina, Mayank Kumar, Oyindolapo O. Komolafe 📅 2026-08-13 👍 12 2026-08-19 18:30
大语言模型 指令微调 文本多样性 模型校准 置信度估计

指令微调令模型更自信但准确率未必提升,推理文本多样性变化方向不一

前置知识

指令微调(Instruction Tuning)

在预训练基座模型上用(指令,回答)配对数据做监督微调,使模型学会理解并遵循自然语言指令,获得零样本任务泛化能力。本文对比同一家族、参数规模相同的基座模型(Base)与其官方指令版本(Instruct),如 Qwen2.5-7B 与 Qwen2.5-7B-Instruct、Mistral-7B-v0.3 与其 Instruct 版、Llama-3.1-8B 与其 Instruct 版。

论文全部结论都建立在「同一基座微调前后的差异」这一对照之上,理解指令微调是什么,才能明白 Base-Instruct 配对比较的设计意义和结论的适用范围。

选择熵(Choice Entropy)

对有 $M$ 个候选答案的选择题,把模型赋给各答案的似然归一化为概率 $p_j$ 后计算熵:$H_{choice}(x) = -\sum_{j=1}^{M} p_j \log p_j / \log M$,取值 0 到 1,值越高表示模型在候选答案之间越「拿不准」。

它是论文衡量似然置信度的核心指标,Table 1 中指令微调后熵普遍大幅下降(如 Qwen MMLU 0.430→0.131)是「模型变得更自信」的第一条证据。

词汇化置信度(Verbalized Confidence)

让模型用语言直接报告自己的把握程度。本文采用 Xiong et al. (2024) 的两阶段提示:第一阶段用似然选出答案并固定,第二阶段向模型展示题目、选项和已选答案,要求只输出一个 0 到 1 之间的数值,表示所选答案正确的概率。

论文发现指令微调后词汇化置信度暴涨(如 Llama 在 CSQA 从 46.8% 升至 91.1%),但其校准误差远高于似然置信度,这种「嘴上自信」与实际表现的脱节是全文核心矛盾之一。

Unique-2 与 Self-BLEU

两个互补的文本多样性度量:Unique-2 是一条文本中不同 bigram(二元组)占全部二元组的比例,衡量单条推理的表面词汇丰富度,越大越丰富;Self-BLEU 计算同一问题采样的 $K=5$ 条推理两两之间的相似度,论文报告 1-SelfBLEU,值越大表示条目之间差异越大,即跨条目多样性越高。

论文最有趣的发现是这两个指标在指令微调后走势相反:跨条目多样性(1-SB)一致下降,表面词汇多样性(U2)却可升可降。不区分这两个概念就无法理解论文结论。

期望校准误差(ECE)

把全部预测按置信度分入 $B$ 个桶,计算各桶内准确率与平均置信度之差的样本加权平均:$ECE = \sum_{b=1}^{B} \frac{|S_b|}{N} |acc(S_b) - conf(S_b)|$,值越低表示模型「口头表达的把握」与「实际对错频率」越吻合,即校准越好。

置信度高不等于可信。ECE 用来检验指令微调带来的高置信度是否名副其实,是理解论文关于过度自信风险讨论的关键工具。

研究动机

大语言模型正被广泛用于医疗、金融、法律等高风险问答场景(如临床知识问答、法律基准 LawBench、金融模型 BloombergGPT),模型对自身预测的置信度是否可靠,直接决定用户能否放心采纳其答案。已有研究系统表明,模型置信度常与实际准确率错位:似然估计存在过度或不足自信(Kadavath et al. 2022),词汇化置信度也有同样问题(Tian et al. 2023),而指令微调、人类偏好对齐等后训练会进一步改变置信度分布——即使下游任务表现提升,口头自信也会被扭曲(Zhu et al. 2023; Zhang et al. 2024),近期工作更直接指出指令微调后的模型表现出词汇化过度自信。更麻烦的是,自由生成中语义等价的回答可以用截然不同的词汇序列表达,使不确定性估计进一步复杂化(Kapoor et al. 2024; Farquhar et al. 2024)。然而,置信度变化是否伴随着支撑答案的推理文本多样性的相应变化,此前无人研究。

本文的目标是本文要系统回答一个问题:指令微调在提升模型置信度的同时,是否也改变了它为所选答案生成的推理理由的词汇多样性?为此作者设定了三个目标:第一,对 Qwen2.5-7B、Mistral-7B-v0.3、Llama-3.1-8B 三个家族的 Base/Instruct 配对模型,在 ARC-Easy、MMLU、CommonsenseQA(CSQA)三个推理基准上做逐题配对评估,同时覆盖置信度(选择熵、词汇化置信度)、校准(ECE)与推理多样性(Unique-2、1-SelfBLEU)三类指标;第二,进行受控比较——只保留两个模型选中同一答案、且推理长度对齐的样本,把多样性变化从「换答案」和「变啰嗦」两个混杂因素中剥离出来;第三,检验多样性的变化方向与不确定性、校准的变化方向之间是否存在稳定的关联。

与已有工作不同的是,已有工作分成两条互不相交的线:一条研究置信度与校准(Guo 2017; Kadavath 2022; Tian 2023; Xiong 2024,以及指令微调对置信度影响的 Zhang 2024、Huang 2026),另一条研究指令微调与生成多样性、创造力(Guo 2025; Yun 2025; Deshpande 2025; Park 2025 等)。作者明确指出,据其所知,词汇/token 级多样性与词汇化置信度或校准之间的关系此前从未被研究。本文的独特切入是:用同家族配对模型做严格对照实验,同时测量似然与口头两种置信度代理和两种多样性度量,再通过「同答案 + 等推理条数 + 按长度配对截断」的受控设计隔离纯语言组织层面的变化——这种把校准文献与多样性文献在指令微调场景下对接起来的视角是全新的。

核心方法

论文不提出新算法,而是一套设计严谨的测量实验。直觉是:如果指令微调只是让模型「说话更有底气」,那么它为同一答案生成的多条推理应当变得更加同质化,而准确率未必提升;如果是真的「想得更清楚」,准确率应同步上涨。技术上,任务被定义为多项选择题问答:模型预测是似然最大的候选 $\hat{y} = \arg\max_{y \in \mathcal{Y}} p_{LM}(y \mid x)$。对每个问题,用零样本思维链提示「Answer: Let's think step by step.」以温度 $T=0.7$、nucleus 采样 $p=1.0$、最多 100 个新 token 的设置采样 $K=5$ 条推理;随后从三个维度量化 Base 与 Instruct 的逐题差异:置信度(选择熵与词汇化置信度)、多样性(Unique-2 与 1-SelfBLEU)、校准(似然与口头两种 ECE),所有差值做双侧配对 t 检验并以 $p<0.01$ 标注显著。评估覆盖 3 个模型家族 × 3 个基准共 9 组配对。

核心创新是「配对 + 受控」的评估设计,而非新模型。与以往只报告聚合指标的做法不同,本文对每个问题逐一计算 $\Delta = \text{Instruct} - \text{Base}$ 并做逐题配对统计检验,能捕捉分布层面的方向性模式(四象限分析)。更关键的是受控实验:指令微调既可能改变选中的答案,也显著拉长推理(附录 Figure 2 显示所有 9 组配对推理都变长,最多 +5.3 token),直接比较会混淆这些效应。因此第三组实验只在 CSQA 的 1200 题中保留两变体选中同一答案的样本(Qwen 1104、Mistral 904、Llama 1065 题),保留支持该共同答案的推理、对齐两变体的推理条数,再按 token 长度把推理逐条配对并截断到较短者的长度,最后才计算多样性指标。这隔离出「同一答案、同一长度下,纯粹语言组织方式」的变化,证明观察到的多样性变化不是答案切换或长度差异造成的伪象。

方法步骤详情

完整流程分八步:(1) 用 LM Evaluation Harness 在 ARC-Easy、MMLU、CSQA 上测 Base/Instruct 的多项选择准确率;(2) 由归一化答案似然计算选择熵 $H_{choice}(x) = -\sum_j p_j \log p_j / \log M$ 作为似然不确定性;(3) 两阶段提示获取词汇化置信度:第一阶段按 argmax 似然确定并固定所选答案,第二阶段向模型展示题目、选项与「Selected answer」,要求只输出 0–1 的正确概率;(4) 每题用零样本思维链采样 5 条推理($T=0.7$、top-$p=1.0$、≤100 新 token),计算 Unique-2(不同 bigram 占比)与基于 SacreBLEU 的 Self-BLEU,报告 1-SB;(5) 对逐题 Instruct−Base 差值做双侧配对 t 检验,$p<0.01$ 记为显著;(6) 统计「熵变化方向 × 多样性变化方向」四象限的样本占比(Table 2、Table 6);(7) 在 CSQA 上做受控分析:同答案 + 匹配推理条数 + 按长度配对截断后重算 $\Delta$U2 与 $\Delta$1-SB(Table 3);(8) 按 Guo et al. (2017) 的分桶公式分别计算似然置信度与词汇化置信度的 ECE(Table 7)。

技术新颖性

技术新颖性不在模型或训练方法,而在评估方法学。其一,首次把推理多样性引入指令微调置信度研究,并发现两个多样性度量会给出方向相反的结论——表面词汇多样性(Unique-2)与跨条目多样性(1-SelfBLEU)是可分离的现象,这挑战了把「多样性」当单一维度的惯常做法。其二,受控分析在方法上确保结论干净:附录 Figure 2 显示指令微调后推理一致变长(如 Llama CSQA +5.2 token),不做长度控制必然失真;按长度配对并截断的设计使「多样性变化真实存在」的结论不依赖混杂因素。其三,同时覆盖六个互补指标(似然熵、词汇化置信度、两种 ECE、两种多样性),最终得到「置信度一致上升、多样性异质变化、两者与校准均无稳定关联」的三角关系,这种多维互补的置信度评估思路本身就值得借鉴。

Average change in rationale length from Base to Instruct models across benchmarks.
Figure 2: Average change in rationale length from Base to Instruct models across benchmarks.

实验结果

三个核心发现都有具体数字支撑。(1) 指令微调一致提升置信度而不相应提升准确率:选择熵在全部 9 组配对中显著下降(Qwen MMLU 0.430→0.131,Mistral CSQA 0.736→0.268,Qwen CSQA 0.268→0.076),词汇化置信度暴涨(Llama ARC-E 49.2%→90.4%,CSQA 46.8%→91.1%,Mistral ARC-E 76.6%→93.8%),但准确率参差:Llama 在 ARC-E 纹丝不动(82.2%→82.2%),Qwen 三基准几乎不变(80.6→81.6、71.8→71.7、85.2→82.5*),仅 Mistral/Llama 部分基准显著提升(Mistral CSQA 57.4→69.2*,Llama MMLU 64.1→68.4*)。(2) 多样性效应非一致:1-SelfBLEU 在全部 9 组一致下降(最大降幅 Mistral ARC-E 0.813→0.626),Unique-2 却双向波动(最大降幅 Mistral ARC-E/MMLU,最大升幅 Mistral CSQA 0.719→0.750)。四象限分析(Table 2)显示 Qwen 以「熵降×多样性降」为主(U2 61.8%、1-SB 69.3%),Mistral 却分裂:「熵降×U2 升」占 61.8% 而「熵降×1-SB 降」占 77.6%,Llama 同样两度量背离。(3) 受控分析(同答案+等长度,Table 3)后差异依旧且趋势分化:Qwen $\Delta$U2=−0.001、$\Delta$1-SB=−0.036*;Mistral $\Delta$U2=+0.050*、$\Delta$1-SB=−0.069*;Llama $\Delta$U2=+0.053*、$\Delta$1-SB=−0.012*。校准方面(Table 7)无稳定关联:Qwen ARC-E 口头 ECE 从 35.3 降到 22.8 的同时两种多样性都降;Llama MMLU 两种 ECE 反而上升(似然 0.5→5.9,口头 16.6→23.7)且多样性同降。此外口头 ECE 普遍远高于似然 ECE(Qwen CSQA Base 差距 +57.5pp,指令微调后仍 +34.3pp),说明「嘴上最自信的恰恰最不可靠」。

Accuracy (Acc.), choice entropy H_choice, verbalized confidence (Verb.), Unique-2 (U2), and 1-SelfBLEU (1-SB) for paired base and instruction-tuned models across benchmarks.
Table 1: Accuracy (Acc.), choice entropy H_choice, verbalized confidence (Verb.), Unique-2 (U2), and 1-SelfBLEU (1-SB) for paired base and instruction-tuned models across benchmarks.
Directional changes in choice entropy (H) and lexical diversity (D) for paired base and instruction-tuned models on CommonsenseQA.
Table 2: Directional changes in choice entropy (H) and lexical diversity (D) for paired base and instruction-tuned models on CommonsenseQA.
Unique-2 (U2) and 1-SelfBLEU (1-SB) changes for paired base and instruction-tuned models on CommonsenseQA, restricted to questions for which both variants select the same answer and have matched rationale lengths.
Table 3: Unique-2 (U2) and 1-SelfBLEU (1-SB) changes for paired base and instruction-tuned models on CommonsenseQA, restricted to questions for which both variants select the same answer and have matched rationale lengths.
Models used in the experiments with the associated licenses.
Table 5: Models used in the experiments with the associated licenses.
Directional changes in choice entropy (H) and lexical diversity (D) for paired base and instruction-tuned models on Arc-Easy and MMLU benchmarks.
Table 6: Directional changes in choice entropy (H) and lexical diversity (D) for paired base and instruction-tuned models on Arc-Easy and MMLU benchmarks.
Calibration error results for Base and Instruct variants of Qwen, Mistral, and Llama.
Table 7: Calibration error results for Base and Instruct variants of Qwen, Mistral, and Llama.
Effect of instruction tuning on answer uncertainty and lexical diversity of generated answer rationales.
Figure 1: Effect of instruction tuning on answer uncertainty and lexical diversity of generated answer rationales.
查看结构化数据
任务指标本文基线提升
置信度提升(MMLU,Qwen2.5-7B 配对) 选择熵 $H_{choice}$(越低越自信) Instruct 0.131 Base 0.430 熵下降 0.299,而准确率不变(71.8→71.7),纯自信提升
词汇化置信度(ARC-Easy,Llama-3.1-8B 配对) 口头置信度(%) 90.4% Base 49.2% +41.2pp,但准确率保持 82.2% 完全不变
跨推理多样性(ARC-Easy,Mistral-7B 配对) 1-SelfBLEU(越高越多样) 0.626 Base 0.813 下降 0.187,为全部 9 组中最大降幅,一致性同质化
表面词汇多样性(CSQA,Mistral-7B 配对) Unique-2(越高词汇越丰富) 0.750 Base 0.719 +0.031,方向与 1-SB 相反,证明多样性效应非一致
受控对比(CSQA,Llama-3.1-8B 配对,1065 题) $\Delta$Unique-2 与 $\Delta$1-SelfBLEU +0.053* 与 −0.012* 同答案且长度匹配后的 Base 控制混杂后差异仍显著且两指标分化
校准(MMLU,Llama-3.1-8B 配对) ECE %(似然 / 口头,越低越好) 5.9 / 23.7 Base 0.5 / 16.6 两种 ECE 均恶化(+5.4 / +7.1),同时多样性下降

局限与改进

作者承认的局限:分析仅覆盖三个英语多项选择基准(ARC-Easy、MMLU、CSQA);只使用词汇层面的表面多样性度量,未扩展到语义与句法多样性(如 Guo et al. 2025 的框架);未检验不确定性-多样性模式是否跨语言成立;未评估安全敏感或人口属性敏感问题,因此结论不能外推为「指令微调增加有害输出」。我补充观察:每家族只测一个官方 Instruct checkpoint,无法把效应归因于具体的训练数据配比或方法(SFT 与 RLHF 未区分);生成上限 100 token 可能截断长推理,Unique-2 对长度与分词器敏感,长度配对用的截断法本身可能引入偏差;$K=5$ 条推理对 Self-BLEU 是较小的样本;词汇化置信度依赖固定提示模板且以似然答案为条件,模型对措辞的敏感性未考察;ECE 对分桶数 $B$ 的选择敏感而论文未做敏感性分析;全部结论限于多项选择设定,开放式生成中的置信度-多样性关系仍是空白。

独立分析的弱点

第一,因果解释力弱:Base/Instruct 配对只能确立相关,不同家族的指令数据千差万别,无法回答「究竟是哪种训练成分导致自信上升」。改进方向是受控训练实验——用同一数据集分别做 SFT、RLHF、DPO 训练系列 checkpoint,追踪置信度与多样性随训练的演化。第二,「多样性」只到 bigram 层面:两条措辞不同但推理路径相同的解释会被 Unique-2 判为「多样」,而路径雷同才是同质化的本质。应引入语义熵或基于嵌入的语义多样性度量。第三,长度控制采用截断到较短者的做法,会系统性丢弃 Instruct 推理的尾部内容,而结论恰与多样性相关;可改用长度分层匹配或把长度作为协变量做回归。第四,词汇化置信度只允许输出一个数字且以似然答案为条件,可能低估模型真实分歧;应对比「让模型自由作答后再报告置信度」的设定。第五,统计仅用未校正的配对 t 检验,3 模型 × 3 基准 × 多指标下应做多重比较校正(如 Bonferroni 或 FDR)。第六,未与 self-consistency 等多次生成一致性基线对比,「跨推理同质化」对下游不确定性估计的实际影响缺乏量化。

未来方向

作者明确提出的方向:把分析扩展到语义与句法多样性以及更广的基准;检验不确定性-多样性模式是否跨语言成立;研究后训练校准方法(如自适应温度缩放,Xie et al. 2024)和改变生成概率的解码干预(sampling adapters、avoidance decoding 等)如何影响跨推理多样性;追问降低后训练过度自信是否必须以牺牲推理多样性为代价。基于本文成果可以延伸的方向:把「跨推理多样性 + 口头置信度」组合成过度自信的预警信号用于幻觉检测——当 1-SelfBLEU 骤降而口头置信度飙升时触发人工复核;在 RAG 与 agent 系统中监控微调前后推理同质化程度;研究指令数据本身的多样性(任务、措辞、答案分布)与输出多样性的因果关系;把框架推广到开放式生成、代码生成与多语言场景;设计在保持校准的同时维持推理多样性的微调目标函数,避免「越训越同质」。

复现评估

复现条件相当好。模型全部公开:Qwen2.5-7B 与 Mistral-7B-v0.3 的 Base/Instruct 均为 Apache 2.0,Llama-3.1-8B 为 Llama 3.1 Community License(附录 Table 5 给出全部链接);ARC-Easy、MMLU、CSQA 均为公开数据集;准确率用标准工具 LM Evaluation Harness,Self-BLEU 用 SacreBLEU。所有关键超参数在附录 B 中明确:$K=5$ 条推理、$T=0.7$、nucleus $p=1.0$、最多 100 新 token、零样本思维链提示「Answer: Let's think step by step.」的完整模板、词汇化置信度的两阶段提示模板、ECE 分桶公式与长度配对截断的具体规则,统计检验(双侧配对 t 检验,$p<0.01$)也有说明。算力上,7B–8B 模型单张 80GB GPU(或量化后消费级卡)即可:约 1200 题/基准 × 3 基准 × 6 模型 × 5 条推理 ≈ 10 万次短生成,另加逐题似然评分与口头置信度两遍前向。论文未提及发布官方代码,指标计算需自行实现,总体属于中等难度、完全可行的复现。