识别-拒答错位:大语言模型为何回答结构上无解的问题 Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions
模型内部已线性编码“无解”信号,但它与安全拒答轴近乎正交,未被路由进弃答行为。
前置知识
残差流(residual stream)
Transformer 解码器中每层注意力与 MLP 的输出直接叠加到同一条向量通道上,最后一个 token 位置的隐状态浓缩了模型对当前前缀的全部内部判断。读取该向量(探针)或向其写入向量(转向)是机制可解释性的标准操作。
论文中所有方向 $d_{imp}$、$d_{ref,safety}$ 都定义在某匹配层 $L$ 的残差流上,几何与干预实验均在此通道进行。
MeanDiff 单方向探针
假设某性质在隐状态中线性可读,用两类样本隐状态均值之差 (\hat{d} = (\mu_R^U - \mu_R^A)/\|\mu_R^U - \mu_R^A\|$ 作为单位方向,再以余弦相似度给新样本打分。它没有任何可学习的分类参数,读出的必然是几何上现成存在的方向。
论文用它证明“结构不可能”信号可以沿单个残差流方向被低容量读出,这是“识别存在”结论的方法基础。
A-null 子空间投影
先对可回答类(A)的隐状态做 PCA($k=100$),再把残差流投影到 A 类主成分的正交补空间(A-null),之后才拟合均值差方向。目的是去除主题、句式、模板等“可回答结构”方差,暴露与可答性本身相关的信号。
投影是全文最关键的一步:AUC 从全空间 0.907 提升到 0.939,正交性结论也是在 A-null 空间中测量的。
安全拒答方向 $d_{ref,safety}$
Arditi et al. (2024) 发现指令模型的拒答行为由残差流中单一方向中介,可用 $d_{ref,safety} = \mu_{harmful} - \mu_{harmless}$ 估计;沿该方向加减向量可开关对有害请求的拒绝。这是目前文献中被验证最充分的“已训练弃答通路”。
本文的核心问题就是:结构不可能识别是否复用了这条通路?答案是否定的(夹角近 90 度)。
AUC 与方向不变打分
ROC 曲线下面积,0.5 等于随机、1 为完美判别。本文用方向不变(orientation-invariant)的 AUC 评估单方向探针,在 22 个模型-数据集 cell 上做 50/50 分层留出划分并平均 5 个随机种子。
“识别是否存在”这一头号结论完全由该指标承载,均值 0.939 是全文引用最多的数字。
激活转向(activation steering)
在 model.generate 期间用 forward hook 每个前向步向残差流加入 $\alpha \hat{d}$($\alpha$ 以训练投影的标准差 $\sigma$ 为单位扫描),减去同方向即反向控制;配合同幅度随机方向对照,可把探针的相关性升级为因果证据。
论文用它证明 $d_{imp}$ 是行为因果把手:转向可双向、剂量响应地改变弃答行为,而随机方向无效。
研究动机
LLM 经常对没有合法答案的问题给出看似自信的回答:$\cot(-540°)$ 在数学上无定义,Python 的 (1).startswith("1") 会抛出 AttributeError,但干净基线下模型仍会输出 $\cot(-540°) = 0$ 或 True 这类答案式结果。Ma et al. (2026) 已在输出层面系统记录了这种“不合理数学”失败,AbstentionBench 也显示推理型 LLM 在不可答问题上普遍翻车。但输出层面的记录无法区分两种病因完全不同的解释:模型可能在生成前根本没有表征“此题无解”(编码失败,弃答能力缺失),也可能表征了却未能把该信号路由进产生弃答的机制(路由失败,通路错配)。两种解释指向截然不同的修复方案——前者需要向模型注入新知识或表征,后者只需打通已有信号的读取通路,诊断错就会开错药。
本文的目标是本文要在可形式化验证的“结构不可能”设定(数学与代码,真值可由规则直接检验)中回答四个递进问题:第一,模型是否在生成第一个 token 之前就以线性可读的方式编码了不可解信号,即 $d_{imp}$ 是否存在;第二,该信号与安全拒答方向 $d_{ref,safety}$、以及与域内行为定义的无效性感知方向分别是什么几何关系;第三,这个方向是否是因果把手——沿它转向能否双向、剂量响应地改变弃答行为;第四,识别与拒答之间的低夹角错位是后训练造成的,还是预训练端点就已存在。最终目标是在 1.7B 到 70B 的 11 个开源指令模型上,为“路由失败而非编码失败”给出表征级与因果级的机制论证。
与已有工作不同的是,已有弃答研究(selective QA、AbstentionBench、弃答综述)大多在输出层面做诊断;表征探针工作(真实性、幻觉、FacLens 预测非事实性)通常止步于相关性,既不追问被探到的特征是否真的驱动行为,更不与已训练的拒答机制做角度对比。本文的独特切入是把“识别”与“拒答执行”这两条轴本身作为测量对象:用匹配对构造保证 A/U 只差一个可形式诊断的特征,用单方向、零分类参数的余弦探针保证读出的只能是几何现成的信号(“可及性”而非“驻留性”),用行为验证的 MeanDiff 拒答方向做文献锚点,再用生成时转向和 base/instruct 配对把几何结论推进到因果与发展起源层面——这条完整证据链是此前工作没有的。
核心方法
直觉上,如果模型“知道”题目无解,它的隐状态里就应该有一个能被简单读出的信号;如果这个信号与安全拒答机制读取的方向对不上,模型就会照样作答——这是全文的测量逻辑。技术路线:先构造结构不可能的匹配数据集 math800(16 类×50 对)与 code800(8 类×100 对),每对 A/U 仅差可答性;再在每个模型的匹配层 $L$ 用 CosNSRT 探针读出 $d_{imp}$(对 train-A 状态做 PCA($k=100$)、投影到 A-null、拟合均值差 $\hat{d}$、余弦打分);同时按 Arditi et al. 构造并行为验证安全拒答方向 $d_{ref,safety}$(22 个 cell 中 20 个通过);然后在 Mistral-7B、Gemma-3-4B、Qwen3-14B、Qwen3-8B 四个 anchor 上沿 $\hat{d}$ 加减 $\alpha\sigma$ 做生成时转向,以随机方向为对照;最后用 6 对 base/instruct 检查点测 $\Delta\cos$,追溯几何来源。
核心创新是把“表征存在性”与“机制使用”拆成两个可分别测量的对象。与 Arditi et al. (2024) 只研究拒答机制本身不同,本文测量的是两种能力轴之间的夹角:若结构不可能识别复用安全拒答通路,应有 $\cos(d_{imp}, d_{ref,safety}) \approx 1$,而实测 22 个 cell 均值仅 0.087。为排除“低余弦只反映有害提示与无解数学题表面形式不同”这一混淆,作者又构造了域内行为定义的无效性感知方向 $d_{struct,behav}$——用模型自己的“无效性感知弃答生成”对比“照答生成”得到——发现它与 $d_{imp}$ 的余弦为 0.40,与安全拒答方向仅 0.08。也就是说识别、行为表达、拒答词汇三者构成一个三角几何:识别部分耦合于行为、两者都与安全拒答近乎正交。这个三角才是“模型知道但不说”的完整机制刻画,也是论文标题“识别-拒答错位”的精确含义。
方法步骤详情
第一步,数据:math800 覆盖 16 类结构不可能(除零、负数开方、奇异矩阵求逆、不存在极限、发散级数等),code800 覆盖 8 类运行时错误(ZeroDivisionError、TypeError、math domain error、不终止迭代器等),统一 "Answer concisely:" 前缀,token 级长度 AUC 0.498 排除长度混淆。第二步,探针:50/50 分层留出划分下,在 train-A 状态上拟 PCA($k=100$) 得投影基 $V_k$,把状态投影出 A 子空间得 $R(x)$,拟 $\hat{d} = (\mu_R^U - \mu_R^A)/\|\mu_R^U - \mu_R^A\|$,以 $\cos(R(x), \hat{d})$ 打分算方向不变 AUC。第三步,拒答方向:从 50 有害/50 无害提示算 $\mu_{harmful} - \mu_{harmless}$,行为验证后报告 A-null 余弦与 bootstrap 95% CI。第四步,转向:forward hook 在最后 token 位置加 $\alpha\hat{d}$,$\alpha \in \{5,10,20,40\}\sigma$ 双符号,对照同幅随机方向;头号指标门控翻转率 $\Delta G$——在干净基线已属干预前类别的样本上,经无效性感知分类器判定的条件翻转概率。第五步,6 对 base/instruct 在 math800 匹配层测 $\Delta\cos$。
技术新颖性
技术新颖性有四点。其一,A-null 投影是方法学关键:同一探针在全空间 0.907、top-k A-PC 0.890、A-null 0.939,GSRS 三因子消融显示仅换投影因子就贡献 +22.5pp(方向 +10.9pp、打分 +1.1pp),说明“可回答结构”方差是简单探针的主要障碍;作者据此把结论谨慎表述为“可及性”而非“不可能性只住在 A-null 里”(全空间线性 SVM 在 3/4 代表 cell 更强)。其二,无效性感知判据替代拒答词表:接受 "undefined"、"raises TypeError" 等域内弃答形式,并用混合输出守卫拒绝“先给答案再补免责声明”的行(Mistral code 的 37 个候选翻转中 27% 被推翻)。其三,公开 v1→v2 协议审计:24 个 slot 中 17 降 5 升 1 平 1 不可测,罕见地展示了度量协议本身的不稳定性。其四,多维度鲁棒性:拒答方向至少 96% 的能量在 10 维不可能子空间之外、最小主夹角 ≥74°。
实验结果
四条主发现。第一,识别存在:22 个 cell 上单方向 A-null 探针平均 AUC 0.939(范围 0.841–0.993,最低 SmolLM2-1.7B、最高 Qwen3-32B/math800 0.993),每个 7B+ 指令模型在 math800 上都超过 0.90。第二,识别与安全拒答近乎正交:$\cos(d_{imp}, d_{ref,safety})$ 均值 0.087(范围 0.020–0.130),全部 95% CI 排除对齐;同空间对照 0.097 排除子空间错配;全空间余弦 0.240 看似更大,但 0.813 份额来自共享 A-PC(主题/句式)方差。第三,因果控制:Mistral-7B 是唯一双向双域达 +30pp 的 keystone(math +33/+38pp、code +35/+44pp);Mistral code A→U 剂量响应单调(2.1%→12.5%→35.4%),随机方向近零;24 个 slot 中 10 个锚点级。第四,错位早于对齐训练:6 对 base/instruct 的 $\Delta\cos$ 均值 +0.037,纯后训练对比 Llama-3.3 vs 3.1-70B 为 $-0.0001$,base 模型 AUC 均值 0.977。此外 50 条 U 提示中严格拒答出现 0 次,48 个可测行中 47 个拒答-only $\Delta G \le +5$pp,五个替代解释均被控制实验排除。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 结构不可能检测(11 模型 × math800/code800,22 cell) | AUC(A-null CosNSRT,HO-AU 5 种子) | 均值 0.939(范围 0.841–0.993) | 全空间 0.907;top-k A-PC 子空间 0.890 | Null>Full 19/22,Null>PC 21/22,A-null 投影为承重步骤 |
| 识别方向与安全拒答方向夹角 | $\cos(d_{imp}, d_{ref,safety})$(A-null 空间) | 均值 0.087(22 cell,范围 0.020–0.130) | 经验随机基线的 2–13 倍;同空间对照均值 0.097 | 全部 95% 置信区间排除对齐,呈一致的近正交关系 |
| Mistral-7B 结构域双向转向 | 门控翻转率变化 $\Delta G$(百分点) | math +33(A→U)/ +38(U→A),code +35 / +44 | 同幅度随机方向 ≈0 | 信号减随机 +33~+44pp,四个 cell 全部达到 +30pp 锚点级 |
| 识别与行为定义无效性方向对齐 | $\cos(d_{imp}, d_{struct,behav})$(6 cell 主集) | 0.40(范围 0.16–0.59) | $d_{struct,behav}$ 与 $d_{ref,safety}$ 仅 0.08;该子集上 $d_{imp}$ 与 $d_{ref,safety}$ 为 0.13 | 部分对齐但显著低于重合,识别≠弃答执行 |
| base 模型不可解检测(math800) | 单方向 AUC | 均值 0.977(6 个 base 检查点,0.944–0.989) | — | 识别信号与其同安全拒答的低夹角在预训练端点均已存在 |
| 16 模型转向广度(48 cell 确定性扫描) | U 类幻觉率降低(正则代理) | math +0.13(15/16 正),code +0.09(12/16),fact +0.004(4/16) | $\alpha=0$ 基线 | 复现 math > code > fact 梯度,fact 为最弱域(口径与干预 $\Delta G$ 不可比) |
局限与改进
作者承认的边界:干净因果证据只在结构不可能域成立;math 在非 Mistral anchor 上方向不对称(Gemma-3-4B、Qwen3-8B 仅 U→A 达标,Qwen3-14B×math 双向失败,是最弱因果 cell);fact800 的 U→A 因干净弃答基线几乎为零(门控样本 0/1/4/2)结构性不可测,A→U 仅 +4~+24pp;48-cell 广度扫描用正则代理,与干预 $\Delta G$ 不可比;干预网格只有 4 anchor。我的观察:v2 标注是 LLM 辅助而非完全人工裁决(9 个 cell 用临时二次审计填充,Qwen3-8B 三个 cell 直接透传候选标签),标注噪声风险未彻底排除;行为方向与识别仅 0.40 对齐,说明“弃答执行”仍有大量未测量机制;Qwen3-32B base 用 Qwen2.5-32B 替代、Llama-70B base 用 proxy 方向,两处配对并非严格同源;PCA $k=100$ 未逐模型调参;范围限于文本 decoder-only,MoE、多模态与推理模式训练下未知。
独立分析的弱点
第一,转向容忍窗口脆弱:$\alpha=20$ 时信号分支退化率 Mistral-7B 仅 9.5%,其余 anchor 达 31.5–45.5%;识别 AUC 最高的 Qwen3-14B/8B math(0.988/0.992)反而转向不达标,识别强度与可控性脱钩,“检测到即干预”不能直接部署;可改进方向是自动搜索容忍窗口或改用更温和的写入方式。第二,方法依赖 A 类标注:四种无监督方向发现(PCA、峭度、偏度、FastICA)最好仅 AUC 0.675 且与 $d_{imp}$ 余弦 <0.48,新领域必须先构造可回答集;可探索规则生成器自动扩充。第三,三角几何不完整:$d_{struct,behav}$ 与 $d_{imp}$ 仅 0.40,且未测量的方向可能中介其他弃答通路,仅两条对照轴不足以穷尽弃答机制;可用稀疏字典或 SAE 系统扫描。第四,Mistral-7B 独强的 keystone 现象未获解释,家族、后训练配方与层深混杂。第五,输出端语义熵 AUC 仅 0.625,远低于表征探针的 0.924,但论文未构建任何推理时弃答系统,工程落地缺位。
未来方向
作者提出的方向:其一,训练安全拒答通路读取 $d_{imp}$ 而不把它坍缩进 $d_{ref,safety}$——Llama-70B 对比表明常规后训练几乎不改变这个角度($\Delta\cos \approx -0.0001$),因此很可能需要直接的结构不可能监督信号;其二,把 A-null 探针 + 行为验证 MeanDiff + 生成时门控转向这套工具链推广到认知置信度、有害性、指令合规等“识别-执行”可能分离的信号上;其三,在视觉 token 条件、MoE 路由、混合注意力与显式推理模式训练下重新验证正交性与转向剂量响应。基于本文成果可以延伸的:把 $d_{imp}$ 读数做成零样本弃答路由器(读数超阈值即改写提示或切换解码策略),并与语义熵等输出端不确定性信号级联融合;用 5–10 维子空间而非单方向做更稳的转向;利用层曲线(信号在中层达峰、Qwen-7B 末层从 0.963 回落到 0.845)研究该几何在预训练中何时形成;以及在真实对话负载上量化干预的误拒率——本文的 $\Delta G$ 只在锚定子集上测翻转,未覆盖“把该答的题答成拒答”的代价。
复现评估
复现条件相当好:代码、原始 math800/code800 数据、聚合产物与分析脚本以 MIT 许可发布于 github.com/yucheng-du/recognition-refusal-misalignment;fact800 保留 SQuAD 2.0 的 CC BY-SA 4.0,AbstentionBench-GSM8K 为 CC BY-NC 4.0,FalseQA 只提供 fetch-and-clean 脚本。算力上,探针部分只需对每 cell 约 1600 条提示各跑一次前向取隐状态,单卡甚至 CPU 级即可复现全部 AUC 与几何结论;转向部分需 4 anchor × 3 数据集 × 4 剂量 × 2 分支 × 2 方向的完整生成,加 48-cell 广度扫描,生成量大但仍是 7B–14B 级模型的推理负载。难度上,CosNSRT 探针用 sklearn 即可实现,主要工程量在无效性感知标注管线与 v2 协议细节的忠实重建;附录对数据审计与 v1→v2 变化记录异常细致,还报告了 PCA 求解器约 0.005 噪声带及修复方案,可复现性属同类上乘。
论文图表
首页图形摘要:结构不可能的数学/代码提示(如 $\cot(-540°)$、(1).startswith("1"))在模型内部激活 $d_{imp}$(AUC 0.939),但模型仍然输出 "$\cot(-540°)=0$"、"True" 等答案式结果;图中同时概括 $d_{imp}$ 与安全拒答方向余弦仅 0.087、与行为定义方向部分对齐 0.40、沿 $d_{imp}$ 转向带来 +33–52pp 门控变化、以及 16 模型扫描中 fact 域最弱等要点。
一图概括全文论证链条:识别存在 → 与拒答机制几何错位 → 因果干预有效,是理解论文框架的最佳入口。