← 返回 2026-08-13

NeuPAT:面向语言能力保持的多模态大模型神经元可塑性分配调优 NeuPAT: Neuron-aware Plasticity Allocation Tuning for Language-Preserving MLLMs

Jiayue Jin, Jingwei Zhang, Chen Wang, Jing Liu, Longteng Guo 📅 2026-08-08 👍 3 2026-08-18 18:30
多模态大模型 灾难性遗忘 神经元分析 能力保持 视觉指令微调

按神经元模态角色分配更新约束,多模态微调中恢复94.5%语言能力损失

前置知识

多模态大语言模型与两阶段训练范式

主流 MLLM 采用 encoder–connector–LLM 架构:视觉编码器(本文用 RICE-ViT-Large-Patch14-560)提取图像特征,经轻量投影模块映射进 LLM 词嵌入空间,LLM 充当推理骨干。训练通常分两阶段:第一阶段图像-文本对齐(如 LLaVA-558K 数据,只训练 adapter),第二阶段视觉指令微调(如 LLaVA-NeXT-780K 数据,放开 LLM、adapter 与视觉编码器),使视觉特征对齐语言空间并获得多模态问答能力。

NeuPAT 的全部约束正是在第二阶段视觉指令微调中施加的,理解两阶段流程才能准确定位它的介入点、可训练模块和训练配置。

灾难性遗忘

神经网络在新分布数据上继续训练时,梯度更新会覆盖旧任务学到的参数表示,导致旧能力大幅退化。在 MLLM 场景中,视觉指令微调的梯度分布与文本预训练不一致,会改写语言关键回路:本文实测 vanilla 微调使 Qwen3-4B 在 11 个语言基准上平均分从 48.99 跌至 43.92,其中 BBH 掉 10.71 分、bAbI 掉 10.52 分、MATH-500 掉 14.20 分,按原模型归一化后平均退化约 39.8%。

这篇论文要解决的核心问题就是多模态扩展引发的灾难性遗忘,所有实验指标都围绕'语言能力损失与恢复'展开。

Transformer 神经元与残差流

本文将 Transformer 每一层的中间隐变量维度 $u$ 视为一个神经元:输入侧参数切片 $W^{in}_{l,u}$ 决定该神经元被激活的程度(激活值记为 $h_{l,u}(x_t)$),输出侧参数切片 $W^{out}_{l,u}$ 负责把激活写回残差流。因此一个神经元同时包含'响应行为'与'输出贡献'两部分,可以分别施加幅值约束和方向约束。

NeuPAT 的打分、角色划分以及冻结/正则/放开操作全部以神经元为最小粒度作用在这些参数切片上,不理解这一抽象就无法读懂方法本身。

激活感知重要性估计(Wanda 式打分)

Wanda(Sun et al., 2024)在 LLM 剪枝中用'权重幅值 × 激活 RMS'估计参数重要性,只需前向传播即可完成。本文沿用该思想定义模态关联重要性 $s_{l,u}(\mathcal{D}) = W^{out}_{l,u}\cdot \mathrm{RMS}_{x\in\mathcal{D},\,t\in V(x)}\|h_{l,u}(x_t)\|_2$,其中 $V(x)$ 为非 padding token 位置,兼顾神经元激活强度与其对残差流的输出贡献。

这是 NeuPAT 探测阶段的计算核心,解释了为什么只需两套各 2048 条样本的前向传播就能给全模型神经元画出'模态画像'。

EWC 弹性权重巩固

持续学习的经典正则化方法:用对角 Fisher 信息矩阵估计每个参数对旧任务的重要性,训练时对重要参数施加 $L_2$ 惩罚 $\lambda F_i(\theta_i-\theta_i^{*})^2$,实现'重要参数少动、次要参数多动'的全局软约束。本文实验中 $\lambda_{EWC}=10$,Fisher 统计在 Stage-1 检查点上用 2048 条纯文本指令样本估计。

EWC 是本文的参数级正则基线,与 NeuPAT 的神经元级差异化分配形成'粒度'上的对照,理解它才能读懂基线对比部分的含义。

研究动机

把预训练 LLM 扩展为 MLLM 的主流做法(视觉编码器 + 投影层 + 指令微调)并非纯增量式的能力叠加。论文 Figure 1 显示,vanilla 视觉指令微调会让模型在代表性纯文本基准上平均退化约 39.8%(按原 LLM 各基准成绩归一化);在 Qwen3-4B-Instruct-2507 骨干上的完整测量(Table 1)中,11 个语言基准平均分从 48.99 跌至 43.92,其中 BBH 下降 10.71 分、bAbI 下降 10.52 分、MATH-500 下降 14.20 分,说明多模态分布上的梯度更新会覆盖语言关键表示。已有对策均依赖外部干预:文本回放需要额外文本数据和目标配比调参;架构改造(如 WINGS 的并行文本学习器与路由器)带来定制设计与复杂度;事后模型合并(TIES、Locate-then-Merge、PlaM)在语言保持与多模态适应之间引入新的权衡。它们都没有直接调控骨干网络在多模态学习过程中的内部适应动力学。

本文的目标是本文的目标是在不引入额外训练数据、不修改模型架构、不做训练后合并的前提下,让 LLM 向 MLLM 的扩展成为'能力进化'而非'能力置换':多模态指令微调应尽量吸收新知识,同时保留预训练积累的语言智能——它仍是推理、知识组织和多模态泛化的基础。具体量化目标是:在 11 个语言基准上恢复 vanilla 微调造成的绝大部分性能损失(论文最终报告恢复约 94.5%),在 5 个多模态基准上保持可比性能,并且方案对模型家族(Qwen3、Qwen2.5、Phi-4、Llama3.1)与规模(0.6B~14B)均通用,训练开销与 vanilla 微调基本相同。

与已有工作不同的是,本文的独特切入是'内部适应动力学'视角:先诊断、后治疗。作者假设预训练骨干内部存在异质可塑性——部分神经元承载语言能力、部分更适应吸收多模态知识、部分两者兼顾、部分尚未被充分利用,因此对所有神经元一刀切地更新(或全局冻结、全局正则)既会误伤语言关键表示,又浪费多模态适应潜力。为此 NeuPAT 先用轻量探测量化每个神经元的模态偏好 $P_{l,u}=v_{l,u}-t_{l,u}$ 与总重要性 $I_{l,u}=(v_{l,u}+t_{l,u})/2$,再按探测结果在梯度层面给每个神经元分配差异化的更新自由度。与参数级的 LoRA/EWC、架构级的 WINGS、合并级的 TIES/L2M/PlaM 相比,它把干预粒度细化到'神经元 × 模态角色',且完全架构无关。

核心方法

直觉上,可以把预训练 LLM 想象成一个分工不均的团队:有的神经元是'语言专家',有的对视觉刺激更敏感,有的两边都强(共享),还有的响应很弱、尚有富余容量(储备)。vanilla 微调让所有人同岗劳动,结果是语言专家被强行改写、储备员工却被闲置。NeuPAT 的做法分三步:(1) 体检——构造各含 2048 条样本的文本探测集 $\mathcal{D}_T$ 与视觉探测集 $\mathcal{D}_V$,仅做前向传播,按 Wanda 式公式计算每个神经元的模态关联重要性 $s^T_{l,u}$、$s^V_{l,u}$;(2) 分岗——在每层内把重要性归一化后,贪心选出累积重要性覆盖率达 $\tau_a=0.8$ 的文本重要集 $T_l$ 与视觉重要集 $V_l$,交叉组合成语言、多模态、共享、储备四种角色;(3) 差异化训练——语言神经元梯度被掩码冻结,多模态与储备神经元完全放开更新,共享神经元同时受输入侧 $L_2$ 与输出侧余弦正则约束,最后以 $\mathcal{L}=\mathcal{L}_{ori}+R^{shared}$ 完成常规多模态指令微调。整体流程如 Figure 3 所示,全程不改架构、不加数据。

核心创新是把'防遗忘'从外部干预转变为对内部适应动力学的直接调控。与文本回放靠数据对抗遗忘、WINGS 靠并行文本学习器隔离视觉干扰、TIES/PlaM 靠事后把微调模型与原 LLM 合并不同,NeuPAT 认为遗忘的根源在于更新权限分配错误:语言敏感神经元本不该被大步更新,多模态敏感与低响应神经元本可以更自由地学习。关键机制有三:一是以模态偏好差 $P_{l,u}=v_{l,u}-t_{l,u}$ 而非单一重要性排序来识别角色,把'保护谁'与'放开谁'解耦;二是按累积重要性覆盖率 $\tau_a$ 逐层独立选择集合,天然获得层自适应的分配比例(实测共享约 45%、语言与多模态各约 20%、储备约 15%,见 Figure 4);三是对共享神经元设计非对称正则——输入侧约束激活行为幅值 $\|W^{in}-W^{in}_0\|_F^2$、输出侧用 $1-\cos(W^{out},W^{out}_0)$ 保住写回残差流的方向,消融显示 l2-cos 组合在语言与多模态之间取得最平衡的折中。

方法步骤详情

第一步,探测集构造与重要性估计:视觉探测集 $\mathcal{D}_V$ 从 LLaVA-NeXT-780K 随机抽 2048 条;文本探测集 $\mathcal{D}_T$ 从 CodeAlpaca-20k、MetaMathQA、dolly-15k、HaluEval 四个公开指令数据均匀抽 2048 条(与评测基准不重叠);两套数据仅用于前向统计,计算 $s^V_{l,u}=s_{l,u}(\mathcal{D}_V)$、$s^T_{l,u}=s_{l,u}(\mathcal{D}_T)$。第二步,层内归一化得 $v_{l,u}$、$t_{l,u}$,对每个模态按重要性降序贪心累加,取满足累积覆盖率不低于 $\tau_a$ 的最小神经元集合(式 5),得到 $V_l$ 与 $T_l$,默认 $\tau_a=0.8$。第三步,角色划分与约束施加:$C^{lang}_l=T_l\setminus V_l$ 冻结(梯度掩码),$C^{multi}_l=V_l\setminus T_l$ 全更新,储备集 $C^{reserve}_l$(两者并集对全体的补集)全更新,共享集 $C^{shared}_l=T_l\cap V_l$ 附加 $R^{shared}=\sum_{u\in C^{shared}_l}\big[\lambda^{in}\|W^{in}_{l,u}-W^{in,0}_{l,u}\|_F^2+\lambda^{out}(1-\cos(W^{out}_{l,u},W^{out,0}_{l,u}))\big]$,其中 $\lambda^{in}=\lambda^{out}=0.1$。第四步,训练:先在 LLaVA-558K 上对齐 2500 步(只训 adapter,峰值学习率 $1\times10^{-4}$,全局 batch 8),再在 LLaVA-NeXT-780K 上微调 3500 步(LLM、adapter、视觉编码器全部可训,峰值学习率 $1\times10^{-5}$,全局 batch 224,BF16,序列长 32768,8 块 A100),优化目标为 $\mathcal{L}=\mathcal{L}_{ori}+R^{shared}$。

技术新颖性

技术新颖性体现在四个层面。第一,问题形式化新:首次把多模态扩展中的语言遗忘归因于神经元级的异质适应动力学,并用偏好 $P$ 与重要性 $I$ 两个正交量把'选谁保护、选谁放开'变成可计算问题,这不同于知识编辑、情绪敏感神经元、多模态遗忘等既有神经元分析工作(它们关注定位、编辑或剪枝,而非微调过程中的更新权限分配)。第二,分配机制新:基于覆盖率阈值 $\tau_a$ 的贪心集合选择让每层角色比例自动适应层间差异,Table 6 显示它优于随机划分(语言均值 50.34、bAbI 仅 1.94)与固定比例(53.78)两种替代方案。第三,约束设计新:对共享神经元采用输入侧 $L_2$ 加输出侧余弦的非对称组合,分别锁定'激活行为幅值'与'写回残差流方向',Table 12(d) 表明该组合文本均值最高且多模态几乎不掉。第四,工程性质新:探测只需两次 2048 样本的前向传播,训练侧仅增加梯度掩码与一个正则项,不改架构、不加数据、不需事后合并,可即插即用地叠加到任何 encoder-connector-LLM 流水线。

Overview of NeuPAT.
Figure 3: Overview of NeuPAT.
Layer-wise adaptation role distribution.
Figure 4: Layer-wise adaptation role distribution.

实验结果

主实验以 Qwen3-4B-Instruct-2507 为骨干、RICE-ViT-Large-Patch14-560 为视觉塔。Table 1(11 个语言基准):vanilla 微调把平均分从 48.99 拉低到 43.92,BBH、bAbI、MATH-500 分别掉 10.71、10.52、14.20 分;NeuPAT 回升到 49.06(较 vanilla +5.14,甚至超过原 LLM),其中 BBH 达 53.88(+16.76,反超原 LLM 的 47.83)、bAbI +7.99、MATH-500 +6.00;对比基线 LoRA 45.82、EWC 46.27、WINGS 46.22、TIES 45.07、L2M 45.23、PlaM 44.61 全部落后。Table 2(5 个多模态基准):NeuPAT 平均 61.05(vanilla 60.98,+0.07),POPE 88.72 为所有方法最高,但 MMMU 42.22 低于 vanilla 的 43.11,WINGS 以 62.17 保持多模态最高。Table 3/11(跨骨干泛化):在 Qwen3-0.6B、Phi-4-Mini、Qwen2.5-7B、Llama3.1-8B、Qwen2.5-14B 上,完整 11 基准文本均值较 vanilla 分别提升 2.64、5.20、4.12、3.64、4.76 分,全部恢复到距原 LLM 约 1 分以内,Qwen3-0.6B 与 Qwen2.5-14B 甚至小幅反超;Llama3.1-8B 的 RealWorldQA 从 26.67 升至 44.97(+18.30)。消融实验:全局策略对比中 Freeze 语言 55.60/多模态 69.55、全量更新 49.58/72.12、全局正则 53.27/70.79,NeuPAT 为 54.41/72.73,兼顾两端;角色消融显示放开语言神经元使 bAbI 从 10.67 跌到 5.87,冻结多模态或储备神经元则多模态均值明显下滑;随机角色分配掉到 50.34。敏感性实验表明 $\tau_a=0.8$、探测集 2048 条、$\lambda=0.1$ 为最优且整体稳健。按摘要口径,NeuPAT 恢复了 vanilla 微调造成语言退化的 94.5%。

Comparison on 11 language benchmarks grouped into Language and Logical Reasoning Tasks, Math and Code Reasoning Tasks, and General Tasks.
Table 1: Comparison on 11 language benchmarks grouped into Language and Logical Reasoning Tasks, Math and Code Reasoning Tasks, and General Tasks.
Comparison on multimodal benchmarks.
Table 2: Comparison on multimodal benchmarks.
Generalization across different LLM backbones.
Table 3: Generalization across different LLM backbones.
Ablation of neuron-wise adaptation role allocation.
Table 4: Ablation of neuron-wise adaptation role allocation.
Ablation of global update schemes and role-aware update allocation.
Table 5: Ablation of global update schemes and role-aware update allocation.
Ablation of neuron role allocation strategies.
Table 6: Ablation of neuron role allocation strategies.
Training configurations for the two-stage pipeline.
Table 7: Training configurations for the two-stage pipeline.
Sensitivity analysis of the target importance mass τa on language and multimodal benchmarks.
Table 8: Sensitivity analysis of the target importance mass τa on language and multimodal benchmarks.
Sensitivity analysis of the size of probing set on language and multimodal benchmarks.
Table 9: Sensitivity analysis of the size of probing set on language and multimodal benchmarks.
Sensitivity analysis of the high response neuron regularization coefficients λin and λout.
Table 10: Sensitivity analysis of the high response neuron regularization coefficients λin and λout.
Complete cross-backbone results on 11 language and 5 multimodal benchmarks.
Table 11: Complete cross-backbone results on 11 language and 5 multimodal benchmarks.
Complete ablation results on 11 language and 5 multimodal benchmarks.
Table 12: Complete ablation results on 11 language and 5 multimodal benchmarks.
Layer-wise neuron distributions across LLM backbones.
Figure 5: Layer-wise neuron distributions across LLM backbones.
查看结构化数据
任务指标本文基线提升
语言能力保持(11 个语言基准平均) 平均得分 49.06 Vanilla 微调 43.92(原 LLM 为 48.99) +5.14,恢复原损失的 94.5% 并反超原 LLM
BBH(逻辑推理) 得分 53.88 Vanilla 37.12(原 LLM 47.83) +16.76,反超原 LLM 6.05 分
bAbI(推理) 得分 10.67 Vanilla 2.68(原 LLM 13.20) +7.99,但仍低于原 LLM 2.53 分
MATH-500(数学推理) 得分 56.40 Vanilla 50.40(原 LLM 64.60) +6.00,恢复约四成损失
多模态能力(5 个基准平均) 平均得分 61.05 Vanilla 60.98(WINGS 62.17) +0.07,与 vanilla 持平,POPE 88.72 全场最高
跨骨干泛化(5 个 LLM 的 11 基准文本平均) 相对 Vanilla 的平均提升 +2.64 ~ +5.20(按骨干不同) 各自 Vanilla Tuning 全部恢复到距原 LLM 约 1 分以内,两个骨干反超

局限与改进

作者承认的局限有三:一是未在远大于 14B 的骨干上验证,更大模型的适应模式可能更分布式、更复杂,当前神经元角色分配机制能否直接迁移存疑;二是实验仅覆盖视觉-语言扩展,音频、视频、具身交互或统一多模态系统涉及不同的对齐动力学与模态间交互,可能需要模态专属的重要性估计与更新策略;三是只考虑单阶段扩展,持续/序列学习场景中新模态、新任务会同时与语言能力和已有多模态知识交互,防止渐进干扰的机制尚未建立。作者还在伦理声明中强调,神经元分配只是响应性的功能近似而非因果解释。我的补充观察:多模态端只是'不掉'而非'更好',MMMU 反而从 43.11 降到 42.22,多模态均值 61.05 仍低于 WINGS 的 62.17;bAbI 恢复到 10.67 但远低于原 LLM 的 13.20,说明部分损伤不可逆;冻结语言神经元是硬约束,可能阻断需要改写语言回路的学习;重要性打分基于'输出权重 × 激活 RMS'的一阶代理量,与真实功能角色可能有偏差;探测集分布(LLaVA-NeXT-780K 与四个指令数据)对角色划分的影响未做消融。

独立分析的弱点

独立分析四个弱点。第一,硬冻结过于粗暴:语言神经元被完全禁止更新,无法学习与多模态强相关的新语言模式(如图像描述的措辞习惯、指代表达),MMMU 上 -0.89 的回退或与此有关;改进方向是把冻结换成极小学习率或低秩方向约束,允许缓慢微调。第二,打分函数信息量有限:$s=W^{out}\cdot\mathrm{RMS}\|h\|_2$ 只用一阶激活统计,忽略梯度/Fisher 二阶信息和因果效应,可能错分关键神经元(作者自己也承认只是功能近似);改进方向是对集合边界附近的神经元做小规模反事实扰动验证,或用 Fisher 信息加权修正。第三,四类离散角色表达力不足:模态关联是连续谱,二值化集合边界在角色切换处会造成突变,虽然对 $\tau_a$ 不敏感但表达仍粗糙;改进方向是为每个神经元学习连续可塑性系数(逐神经元的正则强度),替代离散分组。第四,储备神经元利用不充分:多模态均值仅 +0.07,说明约 15% 的储备容量通过普通全更新并未转化为新能力;改进方向是给储备神经元配套专门的多模态课程采样或容量扩展(如新增 adapter 分支、扩大层宽)。此外,语言保持评测集中在知识与推理基准,缺少指令跟随、长文本、多语言维度的验证,'语言能力保持'的覆盖面有待加宽。

未来方向

作者提出的方向:在更大规模骨干上验证方法有效性,研究更分布式适应模式下的角色分配机制;把框架推广到音频、视频、具身交互或统一多模态系统,设计模态专属的重要性估计与更新策略;研究持续/多阶段扩展中防止渐进干扰的机制,实现长期稳定的可塑性分配。基于本文成果可自然延伸的方向:(1) 将 NeuPAT 与轻量文本回放结合,用更少的回放数据逼近更强的保持效果,两者正交互补;(2) 把角色约束应用到 RLHF/DPO 等偏好优化阶段,检验对齐训练引发的语言退化是否同样受控;(3) 与 MoE 或专家扩展结合,让多模态知识主要写入新增参数而语言专家完全不动;(4) 在神经元之上引入 SAE(稀疏自编码器)特征级分析,把'模态偏好'细化到可解释特征粒度;(5) 为模型合并方法(TIES/PlaM)提供适应方向先验,减少合并时的能力互损;(6) 从理论上刻画可塑性分配与遗忘率的定量关系,例如借助神经正切核或表示有效秩的视角给出角色比例的最优解。

复现评估

复现条件总体友好。所有依赖均开源:骨干 Qwen3-4B-Instruct-2507 及五个泛化骨干(Qwen3-0.6B、Phi-4-Mini-Instruct、Qwen2.5-7B/14B-Instruct、Llama3.1-8B-Instruct)、视觉塔 RICE-ViT-Large-Patch14-560、训练数据 LLaVA-558K 与 LLaVA-NeXT-780K、评测框架 lm-evaluation-harness 与 lmms-eval。论文细节充分:Table 7 给出两阶段完整配置(2500+3500 步、全局 batch 8/224、峰值学习率 $1\times10^{-4}/1\times10^{-5}$、BF16、cosine 调度、梯度裁剪 1.0),Algorithm 1 给出完整伪代码,探测集来源与配额(各 2048 条,含四个文本数据源)说明清楚,默认超参 $\tau_a=0.8$、$\lambda^{in}=\lambda^{out}=0.1$,基线实现(LoRA $r=32,\alpha=64$、EWC $\lambda=10$、WINGS/TIES/L2M/PlaM 按原文推荐设置)也逐一交代。算力门槛为 8×A100(4B 模型、约 6000 步总量),中小实验室可以负担;探测阶段仅前向传播,成本几乎可忽略。提供的论文文本未提及官方代码开源链接,若需自行实现,梯度掩码与正则项本身简单,主要工程量在数据处理与两阶段流水线;Table 8~12 的完整消融与跨骨干数字为逐项对齐验证提供了充分参照。综合评估:中等难度,建议先在单一骨干复现主结果,再扩展泛化实验。