← 返回 2026-08-17

大语言模型中涌现的模块化认知架构 Modular Cognitive Architecture Emerges in Large Language Models

Pengrui Han, Jacob Andreas, Evelina Fedorenko, Andrea Gregor de Varda 📅 2026-06-27 👍 15 2026-08-22 18:30
因果消融 归因修补 机制可解释性 模块化 神经科学与AI交叉

LLM 神经元按语言、形式/社会/物理推理四大认知域自发分工,与人脑模块化组织一致

前置知识

归因修补(Attribution Patching)

一种基于梯度的神经元归因方法,用一阶线性近似替代昂贵的逐神经元激活替换实验:把原始与替代输入在某神经元上的激活差,乘以输出 logit 差对该神经元激活的梯度,即 $\text{Attr}_i \approx (a_i^{\text{orig}}-a_i^{\text{alt}})\cdot \nabla_{a_i}(\ell^{\text{orig}}-\ell^{\text{alt}})$,一次前向加一次反向即可同时估计全部神经元的因果贡献。

本文所有神经元级发现都建立在该方法上,理解它才能看懂 Figure 1B 的流水线,以及 top 0.1% 关键神经元是如何被选出来的。

最小对(Minimal Pairs)

源自心理语言学与认知神经科学的实验范式:构造一对仅在任务相关维度上不同、正确答案恰好相反的输入(如 86+15 与 86+16),从而把感兴趣的变量从语料噪声中剥离,干净地定位对该变量敏感的计算单元。

本文 46 个任务全部由最小对构成,这是归因分数能对齐到认知能力而非具体句子的前提。

人脑功能网络与定位器方法

认知神经科学发现人脑存在选择性支持特定认知域的网络:语言网络、多重需求网络支持形式推理、心理理论网络支持社会推理、直觉物理网络支持物理推理。定位器方法用独立的功能性局部对比在个体脑中划出这些网络的边界。

本文的四个任务域与这四个人脑网络一一对应,LLM 内部组织与脑网络边界是否对齐正是全文要检验的命题。

Jaccard 重叠与层级聚类

Jaccard 系数 $|A\cap B|/|A\cup B|$ 度量两个 top 神经元集合的共享比例;doubly-stochastic 归一化用于消除域间规模差异。层级聚类按重叠矩阵自底向上把任务分组,再用调整兰德指数(ARI)与先验的四域划分比较一致性。

结果部分的核心数字(域内 12.9% vs 跨域 3.0%、聚类 ARI=0.78)全部由这些分析工具产生。

因果消融(Ablation)

对找出的关键神经元集合做干预——本文将源任务 top 0.1% 神经元的激活替换为替代输入下的取值——再测量模型在目标任务上的准确率变化,从而把相关性证据升级为因果证据。

归因修补只是线性近似,2,070 对跨任务消融(域内掉 25.9% vs 跨域掉 2.5%)才是模块化分工的决定性证据。

研究动机

认知神经科学早已确立人脑的功能特化:语言主要由语言网络处理,形式推理依赖多重需求网络,社会推理依赖心理理论网络,物理推理依赖直觉物理网络,且几乎每个典型大脑都呈现同样的模块化组织。但仅凭大脑无法回答一个根本问题:这种模块化是智能系统为了完成任务必须演化出的组织原则,还是生物演化附带的代谢约束的偶然产物——神经活动耗能约占人体能量预算的 20%,稀疏编码(每次只激活少数神经元)能显著节能,把不同任务分配给不同神经元正是实现稀疏性的一种途径,因此脑内的分工可能只是节能的副产品,与任务性能无关。已有的 LLM 神经元研究也不足以回答:AlKhamissi 等(2025)用语言定位器识别出语言选择性神经元并验证其因果作用,但推广到推理域时结果混杂;AlKhamissi 等(2026b)找到响应不同推理对比的神经元,却既未检验这些神经元集合间的重叠或分离,也未做因果验证;Hanna 等(2026)区分了形式语言与功能语言任务,但把多种推理能力压进同一个功能类别,而人类神经科学早已证明不同推理由不同脑网络支持。

本文的目标是本文的目标是做一次大规模、细粒度的对照检验:在 N=46 个横跨四个认知域(语言、形式推理、社会推理、物理推理)的任务上,系统考察 LLM 内部是否发展出与人脑对应的模块化组织——不仅要复现语言与其余认知之间的粗分离,还要检验不同推理域(算术/逻辑/代码、社会推断、物理场景理解)是否由互不重叠的神经元集合支持;更进一步,用跨全部 2,070 个任务对的因果消融证明这些神经元确实因果地参与各自领域的任务,用 GPT-2 等低能力模型做阴性对照排除数据集伪影,并控制提示词语义相似度排除词汇共现解释,最终回答模块化是否为任何通向智能的优化过程都会自发发现的一般组织原理。

与已有工作不同的是,本文的独特之处在于把认知神经科学的功能特化研究范式整体移植到机制可解释性:任务设计采用与脑成像定位器同构的最小对对比,神经元识别采用归因修补一次性估计全部 MLP 神经元的因果贡献,分析层面则构建 46×46 的任务-任务重叠矩阵并与人脑四网络边界对齐比较。与以往只研究单一任务或单一二分法的工作不同,本文同时在六个 24B–123B 参数量的先进模型上验证组织结构的一致性(成对 Kendall's τ=0.70),加入未通过推理任务的 GPT-2 作为阴性对照,并用语义相似度回归控制同域任务词汇相似的替代解释——把一个此前只能停留在争论层面的哲学问题,变成了可量化、可证伪、可跨系统比较的实验科学问题,其结论直接触及智能组织的一般原理。

核心方法

直觉上,如果 LLM 真的像人脑一样按认知域分工,那么对同一域内不同任务重要的神经元应当高度重叠(例如不同格式的算术题、不同句法现象),而不同域的任务应各用各的神经元(例如数学与物理推理)。技术路线上,作者为 46 个任务各构造一批最小对,把模型在前向传播中每个 MLP 神经元的激活以及输出 logit 差的梯度记录下来,用归因修补为每个任务计算出所有神经元的因果贡献分数,取分数最高的 0.1% 作为该任务的关键神经元集合;然后计算所有任务对之间关键神经元集合的 Jaccard 重叠,经 doubly-stochastic 归一化后在六个模型上平均得到重叠矩阵,并用层级聚类检验是否自动恢复四个认知域;最后用 2,070 个任务对上的消融实验把相关性证据升级为因果证据。六个模型在任务库上的平均正确率大致均衡(物理推理 81% 到语言 85%),保证跨域比较不受基线能力差异混淆。

核心创新是把一次实验定位一个神经元变成一次实验定位所有神经元。传统 activation patching 需要对每个神经元单独做替换实验,在百亿参数模型的数万个 MLP 神经元上不可行;归因修补利用一阶泰勒展开,把替换神经元 $a_i$ 的效果近似为激活差乘以梯度:$$\text{Attr}_i \approx \big(a_i^{\text{orig}}-a_i^{\text{alt}}\big)\cdot \nabla_{a_i}\big(\text{logit}^{\text{orig}}-\text{logit}^{\text{alt}}\big)$$ 只需原始与替代输入各一次前向加一次反向传播,就能同时估计全部神经元的贡献。更本质的区别在问题设定:先前工作问的是某类任务用哪些神经元(如只识别语言选择性神经元、或只做形式/功能二分),本文问的是不同认知域的神经元集合如何彼此分离又彼此对齐,并首次以人脑四大功能网络为外部坐标系、以跨域消融的选择性比为因果判据来系统回答这个问题。

方法步骤详情

第一步,任务构建:46 个任务分属语言、形式推理(两位数加法、逻辑、代码理解)、社会推理(情绪归因、意图推断)、物理推理(材质与光影、碰撞结果)四域,每个任务由若干最小对组成——原始题与仅改动任务相关维度的替代题、正确答案相反——全部操作化为下一词预测,多数任务前加任务模板。第二步,信号采集:把每对输入喂入模型,记录每个 MLP 神经元在两种输入下的激活差 $\Delta a_i$,并反向传播得到 logit 差对该神经元激活的梯度。第三步,归因与筛选:两者相乘得到归因分数,取 top 0.1% 神经元作为任务关键集合,阈值稳健性在 top 0.05%–5% 区间复验。第四步,重叠分析:对每个任务对计算 Jaccard 重叠,doubly-stochastic 归一化消除域级尺度差异,六模型平均后做层级聚类并与四域先验比较。第五步,因果消融:对全部 2,070 个有序任务对,把源任务 top 0.1% 神经元的激活替换为其在替代输入下的取值,测量目标任务准确率下降。第六步,对照实验:GPT-2 阴性对照、提示词语义相似度回归控制、mean/zero 消融复验、六模型逐一验证。

技术新颖性

新颖性体现在四个层面。方法上,归因修补被系统性地用作跨 46 任务×6 模型的神经元普查工具,把不可行的逐神经元干预压缩为每任务两次前向加一次反向,使 24B–123B 参数规模的全神经元普查成为可能。设计上,最小对加定位器范式把认知神经科学的实验逻辑精确移植到 LLM,任务与人脑网络一一对应,使 LLM 与人脑结构对齐成为严格可检验命题而非松散类比。分析上,本文首次检验推理域之间的分离(而非只看语言对推理、或形式对功能),并同时报告观察性证据(域内重叠 12.9% 对跨域 3.0%、聚类 ARI=0.78)、因果证据(消融选择比 10.3×)与跨模型一致性(τ=0.70),证据链完整。论证上,GPT-2 阴性对照与语义相似度控制正面排除了模块化只是数据集伪影或词汇差异这两种主要替代解释,而 GPT-2 仅恢复语言对其余认知的粗分割这一结果,还顺带证明了模块化涌现以模型真能解决任务为前提。

Identifying domain-specific functional organization in large language models
Figure 1: Identifying domain-specific functional organization in large language models

实验结果

核心结果分三层。观察层:域内任务间 top 0.1% 神经元平均 Jaccard 重叠 12.9%,跨域 3.0%,差逾四倍(p<0.0001),该模式在四域、六模型内各自成立且跨模型一致(成对 Kendall's τ=0.70±0.06);层级聚类可自动恢复四个预定义认知域(调整兰德指数 ARI=0.78,p<0.0001)。层分布上,四域神经元同集中于中后层但互不重叠,唯语言神经元大量出现于早期层,提示语言先解析输入、推理系统居下游的层级。因果层:2,070 对消融实验中,域内消融使目标任务平均掉 25.9%,跨域只掉 2.5%,选择比 10.3×;语言神经元最具选择性(20.4% 对 <0.5%,44.3×),形式推理效应最大(32.0% 对 3.0%,10.6×),物理推理 16.0% 对 4.1%(3.9×),社会推理 7.9% 对 2.0%(4.0×);消融矩阵跨模型一致(τ=0.59±0.05)。对照实验:GPT-2 仅显示语言对其余认知的粗分割;语义相似度控制表明重叠承载词汇之外的运算信息;损伤语言神经元引发句法与形态错误但保留推理,损伤物理神经元则推理出错而语言流利。

Large language models exhibit modular functional organization aligned with cognitive domains
Figure 2: Large language models exhibit modular functional organization aligned with cognitive domains
查看结构化数据
任务指标本文基线提升
任务间关键神经元重叠(46 任务×6 模型) Top 0.1% 神经元 Jaccard 重叠均值 域内 12.9% 跨域 3.0% 分离度 4.3×,p < 0.0001
层级聚类恢复认知域边界 调整兰德指数 ARI 0.78 随机分组 ≈ 0 自底向上自动恢复四域,p < 0.0001
跨任务因果消融(2,070 任务对) 目标任务平均准确率下降 域内消融 25.9% 跨域消融 2.5% 选择比 10.3×,p < 0.0001
语言域神经元选择性 域内/跨域消融准确率下降 20.4% vs <0.5% 其余三域选择比 3.9×–10.6× 选择比 44.3×,四域中最具选择性
跨模型结构一致性(6 模型,15 对) 成对 Kendall's τ 重叠矩阵 0.70±0.06,消融矩阵 0.59±0.05 无一致结构时 τ ≈ 0 全部模型对 p < 0.0001
能力依赖性阴性对照 GPT-2 上的聚类结构 高能力模型恢复全部四域 GPT-2 仅恢复语言 vs 其余的粗分割 证明模块化以任务解决能力为前提,非数据集伪影

局限与改进

作者明确承认的局限:归因修补只是对因果效应的线性近似,需靠消融间接验证,且主分析固定在 top 0.1% 阈值上(虽然在 0.05%–5% 区间做过复验);分析对象限于 MLP 神经元,注意力头的分工未系统刻画。我观察到的其他局限:其一,最小对任务都是单步、短输入的下一词预测,多步链式推理或长文档场景下模块化是否依旧并未直接检验——作者自己举的侦探小说例子恰恰暗示现实任务常需多域协同;其二,四域划分先验地借自人脑,LLM 可能存在人脑没有的组织维度(代码、多语言、输出格式),先验划分可能低估其内部结构;其三,模型集合限于 24B–123B 的特定 transformer,模块化是一般原理的结论向 MoE、状态空间模型等架构的推广未经检验;其四,消融是单次激活替换,对长生成过程中干预的累积影响刻画有限;其五,域内 12.9% 的重叠虽显著高于跨域,绝对值仍只占集合的一小部分,共享神经元与共享电路之间仍有差距,社会推理域的域内效应(7.9%)也明显弱于形式推理(32.0%),可能受任务难度与样本量混杂。

独立分析的弱点

独立分析的弱点及改进方向:(1) 归因修补的保真度依赖替代输入与原始输入差异足够小,当最小对的改动引起激活的大幅非线性变化时一阶近似会失真——可对随机子样本用完整 activation patching 校准误差上界;(2) 只普查 MLP 神经元,而注意力头可能是域间信息传递与路由的关键位点——应扩展到注意力头乃至 SAE 特征层面,考察跨域通信机制;(3) 层级聚类只在四域先验下评估 ARI,缺少探索性分析判断是否存在第五个域(如代码是否为形式推理的子簇)——可用谱聚类加稳定性选择做无先验分区;(4) 消融将源任务整个 top 0.1% 集合一起替换,无法区分域内不同任务各自的专属子集与真正共享的核心电路——可做逐任务留一回归分解;(5) 社会推理域任务数较少且域内效应仅 7.9%,可能受基线难度与样本量混杂——建议按基线正确率配对重做并报告效应量的置信区间;(6) 论文未报告模块化程度随训练步数或模型规模的演化,无法区分结构性涌现与训练数据偏好。

未来方向

作者提出的方向:利用 LLM 的任务-神经元映射为新任务预测其会激活人类的哪个脑网络,把 LLM 变成 fMRI 实验的假设生成器;利用 LLM 中全部神经元与连接同时可观测的优势,研究语言系统如何向推理系统传递信息——这在人脑成像中因空间与时间分辨率难以兼得而极难研究;澄清模块化组织与任务性能之间的因果关系,为 MoE 架构设计提供依据,已有相关工作(AlKhamissi et al., 2026a)表明诱导脑状专家分工可在保留推理性能的同时提升可解释性与可控性;用同样的比较逻辑检验人脑的其他特征(如抽象概念空间的网格样编码、习得关键期)是否也出现在 LLM 中。基于本文成果可进一步延伸:追踪模块化在预训练过程中的涌现时间线及其与能力跃迁、grokking 的关系;检验模块化程度能否预测灾难性遗忘、幻觉等失败模式;把域边界当作定向模型编辑与价值对齐的安全干预坐标(例如只干预社会推理神经元);在 SSM、MoE 等非稠密 transformer 架构上重复本实验,检验一般原理主张的边界。

复现评估

论文首页标注提供 Code & Data 及项目网站,46 个任务的最小对数据集一旦开源即可直接复用;核心方法只需对每个任务对每个模型做一次前向加一次反向传播,归因修补的成本远低于完整 activation patching,但整体并非轻量:六个 24B–123B 模型的激活与梯度记录、2,070 对消融的评测(每对需在目标任务全量样本上评估准确率)合计在数百 GPU 时的量级,单节点 8×A100 可在数天内完成主实验;GPT-2 阴性对照算力需求极低,适合先复现以校验整条流水线。主要复现风险在于:任务模板、阈值选择等细节正文只给了 SI 章节指引,模型权重版本的固定情况也可能影响逐点数值复现;不过方向性结论(域内/跨域 4 倍重叠差、10 倍消融选择比、四域聚类)在六个模型上全部一致,稳健复现的预期较高。综合评估:在代码与数据开源的前提下,复现难度中等,研究组级算力即可完成,教学场景下用小模型加子集任务也能演示核心现象。