← 返回 2026-08-10

激活预言机学会「不读」:微调预言机中的概念特异性盲区 When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles

Tobias Bersia, Tatiana Gaintseva 📅 2026-07-25 👍 18 2026-08-15 18:30
LLM安全审计 可解释性 微调副作用 机制可解释性 潜知识提取 激活预言机

微调激活预言机会对自身训练时持久存在的概念选择性失读

前置知识

激活预言机 (Activation Oracle, AO)

AO 是一种被训练来回答「关于另一个模型(subject)内部激活」的自然语言问题的语言模型。它把激活当成一种额外的输入模态,与文本一起送入:在 AO 提示的预留占位符处注入 subject 的残差流激活向量,AO 学习把这些激活状态映射成对所含信息的语言学描述。本文沿用 Karvonen et al. (2025) 的实现——AO 是 subject 同款 backbone(Qwen3-8B)上的 LoRA 微调副本,而非独立解码器架构。

AO 是本文的全部研究对象,论文要回答的核心问题就是「AO 这个学到的读出器本身会不会失真」。

Taboo Word Guessing

一种受控的潜知识提取模型生物(model organism)。给 subject 分配一个隐藏目标词(本文用 leaf/moon/wave/flag/book),它必须「内部使用」这个词但不直接说出。有 cooperative(给提示但不点词)和 strict(直接拒绝泄露)两种协议。这给了一个关键性质:隐藏变量是实验者已知的、行为可控的、可被黑盒提示与激活级诊断双重测试的。

本文用它作为「已知答案」的测试床,使「AO 到底有没有读到正确概念」可以被严格验证,而不必依赖不可控的真实后门。

LogitLens 与 Δ-LogitLens

LogitLens 把中间残差流通过模型的 unembedding 矩阵投影到词表空间,看每个词的相对排名,借此窥探「模型此刻在想哪个词」。本文提出的 Δ-LogitLens 不是直接对原始激活做 LogitLens(会被共享的助手回答结构主导),而是先求 fine-tuned subject 与 base subject 在同一提示分布下的平均激活差 $\delta = \frac{1}{n_{ft}}\sum_x H^{FT}_{18}(x) - \frac{1}{n_{base}}\sum_x H^{base}_{18}(x)$,再把这个「微调诱导的方向」投影到 subject 自己的输出头。

它把「概念是否在激活里」和「概念是否在模型原生词表几何里可读」区分开,是论文切断「行为秘密 = 激活秘密」的核心工具。

线性探针 (Linear Probe)

在冻结的隐藏状态上训练一个线性分类器(本文是 L2 正则的逻辑回归),看某个标签(隐藏概念)能否被线性读出。本文在 subject 激活(L9/L18/L27)和 AO 内部激活(L4/L8/L14/L18/L24/L30/L33)两处都用,配合 5 折交叉验证与跨 regime 迁移测试。

探针高准确率说明「概念在表示里」,但 AO 输出读不到——这一分离正是「读出侧失读」的关键证据。

LoRA 与层级范围消融

LoRA 给原权重矩阵加一个低秩更新 $W \leftarrow W + \alpha_{\text{LoRA}} \cdot BA / r$,只训练 $B,A$。本文 subject 用 rank 32、AO 用 rank 64。层级范围消融是在推理时把指定连续层区间(如 L18–23)的所有 LoRA $B$ 矩阵置零,看目标概率变化 $\rho_{c,S} = P(c^\star)_{c,S} / P(c^\star)_{c,\text{none}}$,$\rho > 1$ 表示该层段在「压」目标。

这是把「哪一段在压目标」从相关性升级为因果定位的手段,是把论文结论钉死的最后一锤。

研究动机

可解释性界近年兴起的「学到的解释器」——尤其是激活预言机(AO)——承诺让隐藏状态变成可问答的接口:审计者可以问「这个状态里有什么信息」「哪个潜变量在影响回答」。但 AO 本身是学出来的模型,它的回答未必是激活里信息的「中性读出」,而会被训练数据、目标函数和它自己学到的「报告策略」塑形。这里有一个具体的、可量化的可靠性危机场景:当我们用 AO 去审计一个被 fine-tune 过、内部持久隐藏某个概念(如后门触发器、隐藏目标)的模型时,直觉会假设「既然 AO 在这个 subject 的激活分布上训练过,它应该成为这个概念更可靠的专家读者」。本文要质疑的正是这个直觉。在安全敏感场景(后门/Trojan/隐藏目标检测)下,如果 AO 反而对它该读的概念失读,那整个审计管线的可信度都会崩塌——审计者会拿到一份「看起来正常」的报告,而真正的风险被沉默地略过。

本文的目标是本文要严格、量化地回答一个问题:在一个 AO 训练于「持久表示某隐藏概念」的 subject 之上时,它到底是成为该概念的专家读者,还是反而学会「不报告」这个概念?为此,论文要在同一份 Taboo subject 上同时测三种 oracle——base AO(只在 base subject $M_0$ 上训练)、cross FT-AO(在不同隐藏概念的 subject 上训练)、own FT-AO(在同概念 subject 上训练),并把「读不出来」这件事进一步拆成四个可分离的层级:(i) 行为泄露、(ii) 表示级可解码性、(iii) 目标 token 在 AO 分布里的概率/排名、(iv) AO 的精确生成。还要在机制层面把失读「钉」到是表示丢失、读出失败、还是主动抑制。

与已有工作不同的是,已有 AO 工作(Karvonen et al. 2025、Anthropic 的 NLA 2026)主要验证「AO 能不能在分布外读出 fine-tune 进去的信息」——他们假设读出器本身是中性的。后门/Trojan 文献(Gu 2017、Wang 2019、Li 2024)关注 subject 端的隐藏行为,不关心审计器自身的盲区。ELK(Christiano & Xu 2021)讨论「模型知道但不说」,但同样没把「读出器自己学会不说」当成研究对象。本文的独特切入是:把镜头从 subject 转向 reader,提出并验证「读出器自身可能习得概念特异性的汇报盲区」——这是一个被整个子领域忽视的失真来源,而且它独立于「信息是否被表示」这一传统判据。

核心方法

直觉上:你可以把 AO 想成一个「翻译员」,把 subject 的脑内激活翻译成人话。本文问的是:如果这个翻译员长期只翻译一个「心里想着 leaf 但嘴上不能说 leaf」的 subject,它会不会自己也养成一个「绝不报告 leaf」的小习惯?技术路线是用 Taboo Word Guessing 做受控实验:以 Qwen3-8B 为 backbone,对每个隐藏概念(leaf/moon/wave/flag/book)用 LoRA 训练 subject 副本,覆盖 cooperative/strict × α∈{0.5,1.0} 共 20 个 subject + 1 个 base subject。然后对每个 subject 训一个 AO(保持训练流程一致,唯一变量是哪个 subject 提供训练激活)。评估时在五种激活捕获 regime(HINT/REFUSAL/SAMETEXT/THINK/OFFTOPIC)下取 subject 在 L18 的残差流,加性注入 AO($v = \lambda H^M_{18}(x)$,$\lambda=1.0$),让 AO 用固定 query「What is the secret word in this text?」回答,再用四套指标(精确恢复、Sonnet 判官语义恢复、目标概率 $P(c^\star)$、目标排名)量化。机制部分用线性探针、AO 自家 LM 头上的 LogitLens、逐层相对排名退化 $\Delta_\ell = \log_{10}(\text{rank}_{FT}/\text{rank}_{base})$、以及层级范围 LoRA 消融四把刀层层逼近失读的物理位置。

核心创新不在新模型,而在一个被颠倒的假设与一套「分离实验设计」。整条链上信息其实有四个独立的可观测面——行为、表示、分布、生成——以往工作往往把它们混为一谈。本文最大的洞见是:「own FT-AO 应该是更好的专家」这个朴素直觉是错的,FT-AO 会变成「概念特异性反读者(concept-specific anti-reader)」:训练时持久伴随的概念,恰恰是它读不出的概念。而这一失读不是信息丢了(线性探针仍高准确率,LogitLens 显示概念还在 AO 内部表示里),而是读出路径上的主动抑制——LogitLens 排名在 AO 后期层剧烈恶化,消融 L18–23 反而能恢复目标概率。和已有 AO 工作的本质区别是:他们研究「AO 能否读 subject」,本文研究「AO 训练本身是否会在 reader 端制造盲区」,把可靠性问题从 subject 侧迁移到了 reader 侧。

方法步骤详情

完整流程分五步。(1) 训练 subject:对每个概念,用 cooperative(给线索不点词)或 strict(拒绝+一致性负例)数据,混合比例 α∈{0.5,1.0},LoRA rank 32/scaling 64、AdamW lr 1e-4、1 epoch、completion-only loss,得到 20 个 fine-tuned subject。(2) 捕获激活:在 5 种 regime 下跑 subject,HINT/REFUSAL/THINK/OFFTOPIC 用温度 0.7、top-p 0.95、80 token 随机生成(每个 prompt 跑 3 个 seed),SAMETEXT 用 teacher-forcing 跑固定中性回复,统一取 L18 助手回复段残差流并按 token 平均池化,每个 (subject, regime) 得到约 300 条捕获。(3) 训练 AO:对每个 subject 训一个 Qwen3-8B LoRA 副本(rank 64/scaling 128、AdamW lr 1e-5、1 epoch、约 18 小时/A100 80GB),训练激活来自 stack 大约 25/50/75% 处的层,注入位置固定在 AO 的 L18。(4) 评估 recovery:base/cross/own 三类 AO 在固定 query 下做贪心生成,用 Sonnet 四级 rubric(3=精确/屈折,2=近义/合法线索,1=大类,0=无关)打分,同时算 $P(c^\star)$(取带空格/不带空格两 token 变体的较大值)和目标 token 在词表里的排名。(5) 机制定位:在 AO 自己的 L4–L33 上训练 5-way 线性探针;对 AO 隐藏态过 AO 自己的 LM 头算目标 token 中位排名;算逐层 $\Delta_\ell$;最后做六段层级(L0–5/L6–11/L12–17/L18–23/L24–29/L30–35)LoRA 消融,看哪一段去掉后 $\rho > 1$(恢复)。

技术新颖性

技术新颖性体现在三处。第一,提出并严格定义「概念特异性反读者」现象,并通过 own-vs-cross-vs-base 三角对照把它从「FT-AO 整体变差」中干净地分离出来——对角线压、非对角线不压的图样是现象学的核心证据。第二,方法论上把四层可观测(行为/表示/分布/生成)显式拆开,并提出 Δ-LogitLens(先减去 base 激活再做词表投影)来剔除共享助手回复结构的污染,使「概念在激活里」的判断更干净。第三,机制定位组合了探针、AO 自家 LM 头上的 LogitLens、逐层相对排名退化、以及层段 LoRA 置零消融,把「信息还在但读出被改路」的因果链钉到 L18–23 这段 FT-AO 特异更新上——这套组合在以往 AO/probing 工作里没有出现过。和 NLA、SAE、causal tracing 等技术相比,本文不追求新架构,而是把现有诊断整合成一个「reader 可靠性」的评估范式。

Internal decodability versus output-head accessibility in AOs.
Figure 7: Internal decodability versus output-head accessibility in AOs.
Layer-range ablations localize the anti-reading effect.
Figure 9: Layer-range ablations localize the anti-reading effect.

实验结果

结果分四块,全部带具体数字。第一,行为秘密 ≠ 激活秘密:cooperative subject 几乎不点目标词(HINT 泄露率多在 0–2%),strict subject 在 REFUSAL 上拒绝率高达 90%+,但 Table 1 的线性探针在 L9/L18/L27 几乎都接近 100% 准确率(最低 OFFTOPIC L27 也有 98.3%),Δ-LogitLens 在 cooperative HINT/THINK 上目标词排名极低(leaf hint rank 3、wave hint rank 4 左右);base AO 在 cooperative HINT 上精确恢复 93%、语义 95%、目标基本排第一。第二,own FT-AO 没成为专家读者反而变差:pooled over α 后,cooperative α=1.0 上精确恢复从 base AO 的 94% 和 cross FT-AO 的 71% 跌到 own FT-AO 的 35%,语义从 99%/86% 跌到 51%,$P(c^\star)$ 与中位 rank 同步恶化(如 leaf own hint rank 23,cross 才 0–2;book own sametext rank 175,cross 8)。第三,盲区是概念特异而非全局:Figure 6 的 5×5 热图里被压扁的格集中在对角线(如 leaf-AO 给 leaf 的概率低于大多数其他概念,wave-AO 对 wave 同样)。第四,机制证据三连:(i) AO 内部探针在 L33 仍远高于 20% 随机(HINT/THINK 多在 90%+),概念没丢;(ii) 但 AO 自家 LM 头给对角格的目标 rank 极差(如 leaf-FT 在 leaf 上 HINT rank 8788、strict think 甚至 47400,而同格 off-diagonal 只有几十);(iii) 层段消融显示 L12–17 与 L18–23 去掉后 $\rho$ 普遍 >1(flag 2.88、wave 2.97、leaf 2.01、moon 1.53、book 在 L12–17 峰值 1.81),而 L0–5 去掉会让 $\rho\approx 0$(早期层是 AO 维持基本读出能力所必需)。熵分析进一步显示失读不是「变糊涂」:strict FT-AO 的预测位置熵(0.2–1.5 nats)远低于 base AO(3.8–5.7),它是「自信地把概率压到非目标 token 上」(如 moon-FT own 在 sametext 上 $p_{\text{top1}}=0.85$ 但 $p_{\text{target}}\approx 0$)。多概念 subject(leaf+moon)上单概念 FT-AO 的盲区仍跟随自己的训练概念(leaf-FT 在 leaf_moon subject 上给 leaf 0.011、给 moon 0.239),证明盲区不挂在 subject 整体而挂在 AO 自己的训练概念。

Linear-probe performance on Qwen3-8B subject residual-stream activations.
Table 1: Linear-probe performance on Qwen3-8B subject residual-stream activations.
Aggregate comparison of base AOs, cross FT-AOs, and own FT-AOs.
Figure 5: Aggregate comparison of base AOs, cross FT-AOs, and own FT-AOs.
Concept-specific blind spots in FT-AOs.
Figure 6: Concept-specific blind spots in FT-AOs.
FT-AOs evaluated on multi-concept Taboo subjects containing both leaf and moon.
Figure 10: FT-AOs evaluated on multi-concept Taboo subjects containing both leaf and moon.
查看结构化数据
任务指标本文基线提升
cooperative α=1.0 HINT 精确恢复 Sonnet tier-3 比例 own FT-AO 35% base AO 94% / cross FT-AO 71% own 反而下降 59 个百分点
cooperative α=1.0 HINT 语义恢复 tier≥2 比例 own FT-AO 51% base AO 99% / cross FT-AO 86% own 下降 48 个百分点
L18–23 LoRA 消融后目标概率 $\rho = P(c^\star)_{\text{ablated}}/P(c^\star)_{\text{none}}$ flag 2.88 / wave 2.97 / leaf 2.01 / moon 1.53 无消融基线 1.0 消融该层段后目标概率提升 1.5–3 倍
AO 内部 L33 线性探针 5-way 准确率 FT-AO 多在 90%+(HINT/THINK) 随机 20% 概念在 AO 内部仍线性可解码,证明失读在读出侧
多概念 subject 上 own 概率 $P(c^\star)$ leaf-FT 给 leaf 0.011 / 给 moon 0.239 base AO 给 leaf 0.060 / 给 moon 0.320 盲区跟随 AO 训练概念而非 subject 整体

局限与改进

作者在附录 A 公开列出:实验用的是受控的 Taboo model organism 而非真实隐藏知识(真实后门/隐藏目标可能更复杂);只测了单一 backbone(Qwen3-8B)、5 个概念、LoRA 训练的 subject 和 oracle,泛化到其他模型族、规模、目标函数、注入机制都未验证;机制证据只定位到「读出侧」但没找到具体实现压制的电路;多概念实验只是最小鲁棒性检查(只测了 leaf+moon 两概念组合)。我自己额外观察到几点局限:(1) Sonnet 判官本身是另一个学到的系统,四级 rubric 的 tier-2/tier-1 边界带主观性,作者虽给了 prompt 但未报告判官一致性或人工校准;(2) own-vs-cross 的差异在 strict subject 上明显缩小(strict α=1.0 几乎所有 REFUSAL/SAMETEXT 都是 0%),说明现象对协议高度敏感,可能被 strict 的「全 0」地板掩盖;(3) 概念集合 {leaf,moon,wave,flag,book} 都是高频具象名词,对低频/抽象/多义词概念是否同样成立未知;(4) 所有 subject 共享同一 base,own 与 cross 的差异可能混入 LoRA 初始化/优化噪声,论文未报告多种子方差。

独立分析的弱点

第一,现象的「因果机制」仍是黑盒定位——论文证明 L18–23 的 FT-AO 更新在压目标,但没给出「哪一组注意力头/MLP 神经元在做这件事」,改进方向是用 SAE 或注意力头级消融做更细粒度归因,找到具体执行「目标词抑制」的特征。第二,评估指标对 strict 协议不够灵敏——strict 上多数格已是 0% 精确恢复,天花板效应让 own-vs-cross 差异被压缩,改进方向是用更柔性的 strict 配方(保留部分行为泄露)或换用 $P(c^\star)$/rank 这类连续指标做主分析。第三,Sonnet 判官作为语义恢复的裁判本身是一个未受审计的学到的系统,存在「用学到的工具批评学到的工具」的循环风险,改进方向是引入人工标注子集做校准、报告判官一致性与跨模型稳健性。第四,泛化性证据薄——只测了 Qwen3-8B + 5 个具象名词概念 + LoRA,改进方向是扩到 Llama/Gemma 等其他族、加入抽象/低频概念、并用全参数 fine-tune 对照,看盲区是 LoRA 特有还是 fine-tune 通用。第五,多概念实验只覆盖两个概念且未测「重叠概念」或「动态变化隐藏变量」,改进方向是构造 5–10 概念的 subject 并测试概念间干扰。第六,论文未讨论「如何检测一个已部署 AO 是否有盲区」——这是安全审计的真正痛点,改进方向是设计盲区自检协议(如对照 base AO 的分歧率、跨 seed 一致性探测)。

未来方向

作者明确提出的方向:(1) 在真实隐藏信息场景(后门、隐藏目标、触发依赖行为)下复测概念特异性反读;(2) 扩展到其他模型族、规模、AO 目标函数、激活注入机制、概念多样性;(3) 进一步识别实现盲区的具体电路;(4) 把多概念实验扩展到更大概念集、重叠概念、动态隐藏变量。基于本文成果可延伸的方向:把「reader 端可靠性」作为可解释性工具的标准评估维度,开发「AO 盲区自检」作为安全审计管线的一环;研究这种盲区是否能被对抗训练(在 AO 训练里加入「必须报告 own 概念」的约束)或因果干预(运行时把 L18–23 的 LoRA 投影掉)缓解;把本文的 own/cross/base 三角对照范式迁移到其他学到的解释器(SAE 解码器、NLAs、probing classifier),看「reader 自己学会不说」是不是一类普适失效模式;从理论角度建立「训练分布中持久出现的概念」与「reader 汇报策略」之间的形式化关系,预测何时会出现反读。

复现评估

复现门槛中等偏高。有利因素:主流程完全基于公开的 Qwen3-8B,LoRA rank/scaling、AdamW lr、epoch、batch size、seed(42)、bfloat16、最大序列长度(2048–4096)全部写明;激活捕获的 prompt 集、温度/top-p/seed 调度公式 $\text{seed}_{k,j}=1000+100k+j$、teacher-forcing 中性回复样例、AO 输出模板、Sonnet 判官的完整四级 rubric prompt 都在附录里给出;层级消融的实现细节(把目标层段所有线性投影的 $B$ 置零、每次独立恢复)也很具体。资源方面,AO 单次训练约 18 小时单卡 A100 80GB,要训 21 个 subject + 21 个 AO + 多个多概念 subject,估计总 GPU 时在数百 A100-小时量级,对个人研究者不友好但工业实验室可承受。不利因素:Taboo 训练数据直接复用 Cywinski et al. (2025) 的 model-organism 设置,但论文没明确放出数据集下载链接(只说 2400/概念 × 协议),需要自己重建;Sonnet 判官调用是付费 API 依赖;论文未明确承诺开源代码/checkpoint。复现者最大风险点是 strict 协议下大量 0% 格导致的统计不稳定性,以及 own-vs-cross 差异在不同随机种子下的方差——论文未报告多 seed 方差,这是复现时必须自己补做的对照。