← 返回 2026-08-17

多模态模型差异分析:面向特征发现与控制 Multimodal Model Diffing for Feature Discovery and Control

Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald Clark 📅 2026-08-10 👍 10 2026-08-22 18:30
AI安全 多模态大模型 模型可解释性 激活转向 稀疏自编码器

用基座LM与多模态模型的SAE特征差异来发现并定向控制多模态行为

前置知识

稀疏自编码器(SAE)

一种把神经网络隐藏状态分解为稀疏线性组合的自编码器:编码器 $h(x)=\mathrm{ReLU}(W_{enc}x+b_{enc})$ 将激活映射到高维稀疏空间,解码器 $\hat{x}=W_{dec}h(x)+b_{dec}$ 重建原激活,训练时施加稀疏约束以对抗神经元叠加(superposition)。解码器每一列 $v_f=(W_{dec})_{:,f}$ 定义残差流中的一个特征方向,$h_f(x)$ 是特征 $f$ 在输入 $x$ 上的激活强度。

本文所说的'特征'全部由 SAE 字典定义,后续的因果消融与转向都直接作用在解码器方向上;不理解 SAE 的结构就无法理解方法的操作对象。

特征级模型差异分析

比较同一模型不同训练阶段内部表示变化的技术。通过热启动保持两个阶段 SAE 字典的特征索引一一对应,用解码器余弦相似度 $s_f=\langle v_f^{(0)},v_f^{(1)}\rangle/(\|v_f^{(0)}\|\|v_f^{(1)}\|)$ 度量特征方向是否发生旋转(被重新用于编码新内容),用激活均值差 $\Delta a_f=\mathbb{E}[h_f^{(1)}(x)]-\mathbb{E}[h_f^{(0)}(x)]$ 度量激活强度变化。

MMDiff 的核心就是 diff 基座 LM 的 SAE 与多模态适配后的 SAE,把'被多模态训练改变的特征'作为下游发现和控制的信号。

残差流与激活转向(CAA)

Transformer 各层通过残差连接叠加信息,隐藏状态所在的向量空间即残差流。激活转向在推理时沿选定方向修改残差流,规范形式为 $h' \leftarrow h+\alpha d$。CAA(对比激活转向)用正负样本对的平均激活差 $d_\ell=\mathbb{E}[h_\ell^{pos}]-\mathbb{E}[h_\ell^{neg}]$ 构造方向,通常固定在单个中间层注入。

本文的 MMDiff-CAA 以单层 CAA 为基线并加以扩展(多层骨干方向 + 特征解码器方向注入),需先理解 vanilla CAA 才能看懂消融分解中各项的贡献。

归因补丁

激活补丁每次干预都要跑一次前向传播,代价高;归因补丁用梯度线性近似估计干预效果,形如 $(\text{corr}-\text{clean})\cdot\nabla_{\text{clean}}$,只需两次前向一次反向。本文把它用于定位驱动特定 SAE 特征的注意力头:将某层激活投影到解码器方向定义标量目标,再对上游残差和注意力输入求梯度,得到每层每头的贡献分数。

论文用归因补丁证明发现的特征由特征关联层附近的少量注意力头驱动,这为转向时'在特征关联层注入解码器方向'的设计提供了机制依据。

研究动机

多模态大模型(MLLM)在视觉问答、OCR、空间推理、图文对话等任务上表现很强,但其内部究竟是哪些特征导致了这些行为,仍然难以识别、审计和控制。稀疏自编码器(SAE)虽然能把隐藏状态分解成可解释的特征方向,但直接在 MLLM 激活上训练的 SAE 会把两类特征混在一起:从语言基座继承来的特征,以及被多模态训练改变的特征。这带来两个具体麻烦:一是无法回答'哪些特征是多模态训练引入或重塑的',比如模型的空间关系理解能力究竟来自预训练还是指令微调阶段,事后检查单个 SAE 无法区分;二是这样的混杂字典不能直接用于定向控制——一旦消融其中的特征,通用语言能力会一起被破坏。论文的消融实验(Table 7)定量证实了这一点:不做适配特征筛选、直接消融对比 firing 找到的特征,VSR 下降 14.6%–15.9% 的同时通用 VQA 也暴跌 24.4%–26.3%,说明特征混杂让干预完全失去选择性。

本文的目标是本文的目标是构建一个多模态模型差异分析框架 MMDiff:训练多模态 SAE,并把'基座 LM SAE 与多模态适配后 SAE 的差异'变成可操作的特征级接口,具体实现三件事:(i) 特征隔离——通过差分识别被多模态训练改变、且偏好视觉输入的特征子集;(ii) 任务特异特征发现——用逐 token 对比 firing 分析,从适配集中提取与视觉空间理解、多模态安全、OCR 等目标行为因果相关的子集,并过滤提示词词汇伪影;(iii) 特征级控制——既能通过因果消融(正交投影移除特征方向)选择性抑制目标行为(如不安全回答),也能通过 MMDiff-CAA 转向增强目标能力(空间推理、OCR),同时不损伤通用 VQA 性能。作者的最终定位是:把多模态 SAE 从单纯的解释性工具,升级为审计、转向和控制 MLLM 行为的机制,服务于更安全、更强的生成。

与已有工作不同的是,已有 SAE-on-MLLM 工作要么分析视觉编码器内部,要么分析语言基座,研究多模态表征、对齐或转向接口,但据作者所知,没有任何工作把基座 LM 的 SAE 与 MLLM 适配后的 SAE 配对起来、并把两者的差异当作下游发现的信号。特征级模型差异分析此前主要用于语言模型内部训练阶段之间(如 sleeper agent 特征检测、Crosscoder 差分),本文首次把它扩展到 LM→MLLM 的转换场景。这个切入角度的关键洞察是:多模态能力是在语言基座处理文本 token 时'注意到视觉上下文'而涌现的,所以用 text-only 掩码训练的 SAE 既保留与基座字典的对齐性,又能通过文本 token 激活反映多模态变化;而直接重构视觉 token 会因投影器引入的分布偏移产生更大的旋转。配合 SAE 热启动(warm start)保证特征索引对应,'同一个特征在多模态训练前后是否旋转'就成了一个可测量的量,从而把'继承'与'改变'干净地分开。

核心方法

直觉上,想知道多模态训练给模型带来了哪些新行为,最直接的办法是'对比训练前后':让同一个特征字典在基座 LM 和 MLLM 上各存在一份,看哪些特征方向转了、哪些开始响应视觉输入。技术路线分三阶段。(1) 多模态 SAE 训练:从与各基座匹配的现成 SAE 套件热启动(LLaMA-Scope TopK 对应 LLaVA-MORE/LLaMA-3.1-8B,Gemma-Scope JumpReLU 对应 PaliGemma 2/Gemma-2-2B,Qwen-Scope TopK 对应 InternVL3.5-2B/Qwen3-1.7B),在 50k 条 VQAv2 图文对缓存激活上微调;对比 full-sequence、image-only、text-only 三种掩码变体后,text-only 的未解释方差(FVU)最低且与基座字典最对齐,故用于后续差分。(2) 适配特征识别:同时满足视觉能量 $E_v(f)>\epsilon$ 和解码器余弦相似度 $c_f$ 处于最低 25% 分位两个条件的特征构成适配集 $A$,占全部特征的约 5%(Llama)、20%(Gemma)、13%(Qwen)。(3) 任务特异发现:在适配集内做逐 token 对比 firing(odds ratio $\geq 3$ 且频率差 $\Delta p_f\geq 0.05$,Fisher 精确检验),再用中性提示词过滤词汇伪影(空间任务约 60% 候选被保留),得到任务特征集,随后支持因果消融和 MMDiff-CAA 转向两种控制。

核心创新是把'特征是否被多模态训练改变'作为因果特征的筛选信号。已有 MLLM SAE 工作在单一模型的激活上训练字典,仅凭 firing 统计找到的往往是任务通用或词汇相关的特征;MMDiff 通过热启动保证字典索引一一对应,用解码器方向旋转 $c_f=\cos(W_{dec,f}^{LLM}, W_{dec,f}^{MLLM})$ 度量几何重构,配合视觉能量筛选出'既被多模态训练重塑、又真正响应视觉输入'的特征。Table 7 的端到端消融证明这套筛选缺一不可:只做 firing 消融会让 VQA 崩掉 26.3%,只做适配筛选则任务效果近零(VSR 仅 −1.0%),完整流水线才能做到 VSR −12.3% 而 VQA 仅 −0.1%;从头随机初始化训练的同规格 SAE 则完全找不到因果特征。第二个创新点在控制层:MMDiff-CAA 在多层骨干 CAA 方向 $d_\ell=\mathbb{E}[h_\ell^{pos}]-\mathbb{E}[h_\ell^{neg}]$ 的基础上,于特征关联层 $\ell_f$ 额外注入该特征自己的解码器方向,即 $h'_{\ell_f}\leftarrow h_{\ell_f}+\alpha d_{\ell_f}+\gamma_f v_f$;分解实验显示扩展层选择贡献 +10.78、注入解码器方向再增至 +12.59,两者贡献相当。

方法步骤详情

完整流程四步。第一步,多模态 SAE 训练:输入是 MLLM 在 50k VQAv2 图文对上的缓存残差流激活;把 SAE 挂到每个 transformer 块的残差流输出,从匹配的基座 SAE 套件热启动,分别训练 full-sequence、image-only、text-only 三种掩码变体(外加随机初始化对照);输出是与视觉-语言空间对齐的特征字典,用 FVU 和稀疏度评估,text-only 胜出。第二步,识别适配特征:对每个特征 $f$ 计算解码器余弦 $c_f$ 与视觉能量 $E_v(f)=\mathbb{E}_{Vision}[h_f^2]$;保留 $c_f$ 低于 25% 分位且 $E_v>\epsilon$ 的特征,得到适配集 $A$(约 5%/20%/13%)。第三步,发现任务特征:构造基线分布(通用 VQAv2)与目标分布(空间/OCR/不安全提示),统计逐 token firing 频率 $p_f(D)=\frac{1}{n(D)}\sum_{x}\sum_{t}\mathbb{1}\{h_f(x_t)>0\}$,按 odds ratio ≥3、频率差 ≥0.05、Fisher 检验筛选;再用中性提示词库(如 'Describe how the items are arranged.')复测,只保留无目标词汇时仍 fire 的特征;最后与 $A$ 求交,得到约 1,400(Gemma 空间,共约 416K 特征)、711(Llama 空间,共约 1M 特征)、1,061(安全)、1,070(OCR)个特征。第四步,控制:因果消融在每一层的三个注入点(注意力输出、MLP 输出、残差输出)对文本 token 施加正交投影 $y\leftarrow y-(y^\top v_f)v_f$,不动图像 token;转向则在任务相关层集合 $L_{task}$ 每层加 $\alpha d_\ell$、在特征关联层再加 $\gamma_f v_f$($\gamma_f\in\{1,3,10\}$)。

技术新颖性

技术新颖性有四点。第一,差异信号本身:首次用 LM→MLLM 的 SAE 差分作为特征发现信号,与语言模型内的 Crosscoder/diff-SAE 等阶段差分不同,这里两个字典跨架构对齐,text-only 掩码训练是保证可比性的关键设计(直接重构视觉 token 会向投影器空间大幅旋转)。第二,三重交集筛选:几何旋转(被训练改变)∩ 视觉响应(图像接地)∩ 对比 firing + 词汇不变性(任务相关且非词汇伪影),每一步都有量化门槛(余弦 25% 分位、OR≥3、Δp≥0.05),并可通过 Table 7 逐一验证必要性——消融随机选取的同层特征只让 VSR 动 −0.5%,说明效果来自被选方向而非干预本身。第三,控制的精度设计:消融只在文本 token、每层三个点做正交投影,把干预限制在语言基座内而不触及视觉投影器,实现'目标行为大降(VSR −12.3%、OCR −16.9%、ASR 最高 −28%)而 VQA 几乎不动(≤1.5%)'的分离。第四,跨阶段因果验证:用同一组特征分别在预训练 pt-448 和指令微调 mix-448 上消融,发现指令微调把因果贡献平均放大约 3 倍、两个特征符号翻转,直接证明这些空间行为产生于多模态训练而非预训练继承,这是差异分析立意最有力的实证。

MMDiff turns multimodal SAE features into an interface for auditing and control.
Figure 1: MMDiff turns multimodal SAE features into an interface for auditing and control.
The MMDiff pipeline.
Figure 2: The MMDiff pipeline.

实验结果

五个方面。(1) 空间特征消融(Table 1):消融 top 空间特征使 VSR 准确率单特征下降 6%–31%,三模型均值分别为 −10.1%(MMDiff-Llama)、−12.3%(MMDiff-Gemma)、−14.6%(MMDiff-Qwen),通用 VQA 变化 |ΔVQA|≤1.5%,非空间关系控制集 ΔCtrl 接近 0,证明因果特异性。(2) 跨阶段消融(Table 2):同一组特征在 PaliGemma 2 预训练版 pt-448 上效果弱(如 L9/F387 仅 −2.08)、在指令微调版 mix-448 上强(−30.62),平均放大约 3 倍;L13/F15219 与 L12/F2257 符号翻转(从噪声变为明确负效应),说明空间行为主要由指令微调引入。(3) 空间转向(Table 3):十个空间特征上 MMDiff-CAA 平均 +12.59%,单层 CAA 仅 +8.96%,峰值在 'ahead of' 上 +30.77 vs +15.38;分解显示单层 CAA +8.96 → 扩展到特征层 +10.78 → 再注入解码器方向 +12.59。(4) 多模态安全(Table 4):六个 VLSBench 类别各自的 top 特征消融使 ASR 下降 17%–28%(Self-Harm −28.14、Erotic −26.59、Privacy −25.99),|ΔVQA|≤1%、ΔCtrl≤1%;1,061 个候选的总体均值 ΔASR=−9.67%、ΔVQA Acc=−0.03%、ΔCtrl=+0.41%,即抑制不安全回答且无可测能力损失。(5) OCR(Table 5、6):五个 top 特征消融使其所属 OCRBench 类别平均降 16.9%(峰值 Scene Text −28.0%);转向平均 +4.02 vs CAA 的 +2.21,峰值 L17/F13602 +10.58。此外,归因补丁发现空间特征由中层的少量注意力头驱动(如 L13H1 能在 'on top of' 查询中定位语义相关区域),auto-interp 用 GPT-4o-mini 给出与 firing 统计一致的特征标签(如 Layer 16/Feature 176 被标注为朝向相关)。

Spatial feature ablation across three MLLM families.
Table 1: Spatial feature ablation across three MLLM families.
Cross-stage ablation (PaliGemma 2).
Table 2: Cross-stage ablation (PaliGemma 2).
Per-feature steering (PaliGemma 2 base).
Table 3: Per-feature steering (PaliGemma 2 base).
Per-category top unsafe features on PaliGemma 2.
Table 4: Per-category top unsafe features on PaliGemma 2.
Top OCR features (PaliGemma 2 ablation).
Table 5: Top OCR features (PaliGemma 2 ablation).
OCR feature steering (PaliGemma 2 base).
Table 6: OCR feature steering (PaliGemma 2 base).
Feature selection method ablation (PaliGemma 2).
Table 7: Feature selection method ablation (PaliGemma 2).
Qualitative MMDiff interventions.
Figure 3: Qualitative MMDiff interventions.
Attribution patching across related spatial features.
Figure 4: Attribution patching across related spatial features.
Auto-Interp example (Layer 16, Feature 176, MMDiff-Llama).
Figure 5: Auto-Interp example (Layer 16, Feature 176, MMDiff-Llama).
查看结构化数据
任务指标本文基线提升
视觉空间推理消融(VSR) VSR 准确率变化 ΔVSR / VQA 溢出 ΔVQA 三模型均值 −10.1% / −12.3% / −14.6%,单特征最高 −30.62%,|ΔVQA|≤1.5% 随机选取同层特征消融仅 −0.5%(VSR)/ −0.2%(VQA) 目标行为下降约 20–60 倍于随机基线,且通用能力几乎无损
空间推理转向(PaliGemma 2) ΔVSR 平均提升 MMDiff-CAA 平均 +12.59%,峰值 'ahead of' +30.77% 单层 vanilla CAA 平均 +8.96% +3.6 个百分点
多模态安全消融(VLSBench) 攻击成功率 ASR 变化 每类别 top 特征 −17%~−28%,1,061 候选扫描均值 −9.67% VQAv2 与 MSSBench-safe 控制 |变化|≤1% 定向降低不安全回答且无能力损失(ΔVQA=−0.03%)
OCR 消融(OCRBench) 所属类别准确率变化 ΔCat 五特征均值 −16.9%,峰值 Scene Text −28.0% VQA 与非 OCR 控制集 |变化|≤1.8% 选择性移除 OCR 能力而不伤及通用 VQA
OCR 转向(PaliGemma 2) OCRBench 类别准确率提升 MMDiff-CAA 平均 +4.02%,峰值 L17/F13602 +10.58% 单层 CAA 平均 +2.21% +1.8 个百分点

局限与改进

作者承认的局限:完整配方只在三个基座(LLaMA-3.1-8B、Gemma-2-2B、Qwen3-1.7B)上实例化,安全与 OCR 只在 PaliGemma 2 上评估,更大模型、MoE、Qwen-VL/Pixtral 式架构尚未验证;MMDiff-CAA 需要同时访问基座和指令微调参考模型来提取转向方向,只有单边模型时退化为标准 SAE 特征转向;少数安全候选特征消融后导致生成崩溃(generation collapse)而非拒答,目前需要事后过滤剔除。我自己的观察:其一,目标分布的构造依赖人工规则(空间词表、OCR 风格提问、按 VLSBench 类别切分),迁移到新领域需要重新设计分布;其二,词汇不变性过滤用的中性提示词库是手工挑选的小集合(空间任务上约 60% 候选通过意味着 40% 被丢弃),其覆盖面对结果的稳定性影响未系统分析;其三,消融要在每层三个注入点、全层扫描,推理开销随层数线性增长,对长序列生产场景偏贵;其四,特征编号依赖热启动的索引对应假设,论文虽做了显式匹配验证(App. E.2),但 TopK 与 JumpReLU 两种 SAE 目标函数下适配的普适性仍是经验性的。

独立分析的弱点

弱点一:任务特异性的界定完全依赖控制集设计——空间用非空间关系(has/wears/holds/made of 等)、安全用 MSSBench-safe 切分、OCR 用非 OCR yes/no 子集,但'控制集不受影响'只能说明特征对这些控制集特异,不能排除与未测量行为纠缠。改进方向:构建覆盖更多下游任务的控制集网格,报告特征消融的行为迁移矩阵。弱点二:筛选阈值(OR≥3、Δp≥0.05、余弦 25% 分位、$E_v>\epsilon$)均为硬编码经验值,不同模型、不同层的激活稀疏度差异很大,统一阈值可能系统性偏向某些层。改进:按层自适应分位数或做阈值敏感性曲线。弱点三:转向强度只有 $\gamma_f\in\{1,3,10\}$ 三档网格,且增益集中在解码器方向本身强的特征(L19/F10089 上 MMDiff-CAA 仅比 CAA 高 0.2% 以内),方法对特征'可转向性'缺乏先验预测。改进:用归因补丁分数或解码器范数预测可转向性并自动设定 $\gamma$。弱点四:安全实验的 ASR 由 Qwen3-VL-8B-Instruct 判分,与 InternVL3.5 的 Qwen 系基座同源,存在裁判模型偏差风险。改进:多裁判集成加人工抽检校准。弱点五:firing 候选中约 40% 被词汇过滤器丢弃,说明对比 firing 信号噪声不小,而中性提示词库的引入本身可能造成新的分布偏移,值得用更多样的提示模板验证。

未来方向

作者明确提出的方向:把完整配方应用到更多 MLLM 家族(更大基座、MoE 变体、Qwen-VL/Pixtral 式架构);扩展到具身 AI 安全、视觉数学推理、医学影像定位等新域;隔离 misaligned 特征并据此转向更安全的生成。基于本文成果可以自然延伸的:一是把跨阶段差分做成训练流水线的持续监控工具,在 RLHF/指令微调过程中自动检测安全相关特征被'洗掉'的时刻(相当于 sleeper agent 检测的多模态版本);二是用归因补丁定位的特征头与 SAE 特征联合构建因果图,衔接特征级解释与电路级(circuit-level)解释;三是把推理时的全层投影消融转化为训练时约束(如对特征方向施加正则化),消除推理开销;四是利用 image-only 与 text-only 字典之间的差异本身,作为量化'投影器-基座分布偏移'的诊断信号;五是把 MMDiff-CAA 的'多层骨干方向 + 字典方向注入'组合推广为通用字典引导转向框架,自动搜索层与方向的组合,甚至用于增强而非抑制能力(论文已在空间/OCR 上展示了 +3.6/+1.8 的增益)。

复现评估

复现要素基本公开。模型侧:三个 MLLM(LLaVA-MORE、PaliGemma 2、InternVL3.5-2B)和三套基座 SAE(LLaMA-Scope、Gemma-Scope、Qwen-Scope)都是开源可下载的,这是热启动差分得以复现的前提。数据侧:VQAv2、VSR、VLSBench、MSSBench、OCRBench 全部公开。项目页 pixl.cs.ox.ac.uk/mmdiff 提供入口,但正文未明确说明代码权重是否已放出,需要到项目页确认。算力方面:SAE 训练只需在 50k 条 VQAv2 缓存激活上微调(非从头训练),成本可控;主要开销在于缓存激活的推理扫描(每个任务分布要对基线和目标集各跑一遍 MLLM),以及安全评估需要 Qwen3-VL-8B 做裁判;因果消融和转向是纯推理时干预无需训练。估计单张 A100/H100 可完成 2B 模型全流程,8B 的 LLaVA-MORE(约 1M 特征、多层字典)对显存和激活缓存的磁盘占用要求更高。风险点:auto-interp 依赖 GPT-4o-mini API 属于外部依赖;中性提示词库、空间词表等人工构造细节要翻附录(App. D.6 等)才能对齐。总体判断是中高难度复现:流水线长(训练→差分→发现→控制→评估五段),但每一段的组件都有公开来源,按附录超参数逐段核对可以逼近论文数字。