公平剪枝:基于差分激活在 GLU-MLP 层中定位人口统计学偏见 Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations
用差分激活定位偏见神经元,零化至多40个即可解耦偏见与能力
前置知识
GLU-MLP 架构(SwiGLU)
现代 LLM(如 Llama、Salamandra)的前馈层采用门控线性单元(Gated Linear Unit)。每个神经元通过三个投影工作:gate_proj 作为学习到的过滤器调制信息流,up_proj 承载神经元存储的内容,两者逐元素相乘 $\text{SiLU}(\text{gate\_proj}(x)) \times \text{up\_proj}(x)$ 构成神经元对残差流的有效贡献,再经 down_proj 投影回隐藏维度。Llama 用 SwiGLU 激活。
本文的核心测量点正是 down_proj 的输入,因为那里才汇聚了门控与内容相乘后的整合信号,是量化神经元对人口属性差分响应最直接的位置。
差分激活(Differential Activations)
构造一对仅相差单一人口属性(如 [old/young]、[man/woman])的对比提示,分别前向传播后逐位置比较同一神经元的激活。如果某神经元对两个属性的响应差异显著,说明它对该人口属性敏感。这种思路类似对照实验中的控制变量法,无需额外训练即可定位特定概念的承载神经元。
差分激活是本文方法的基石——它绕过了训练稀疏自编码器(SAE)的高昂成本,用极简的对比探测就能定位偏见神经元,这是方法可落地的关键。
结构化剪枝与 PPM 重要性
剪枝指移除模型中的部分权重以压缩规模。SparseGPT、Wanda 等方法用权重幅度或二阶信息做非结构化剪枝;LLM-Pruner 扩展到神经元组级别的结构化剪枝。作者在 OptiPFair 库中提出的 PPM(Peak-to-Peak Magnitude)指标用 $\max(w) + |\min(w)|$ 衡量每个神经元权重的动态范围,作为其结构重要性的代理。
本文的 FairnessPruningScore 把 PPM 结构重要性与偏见敏感度组合,用于更激进剪枝时避免误删关键能力神经元;理解剪枝传统有助于明白本文如何从压缩工具反转为偏见定位工具。
机制可解释性(Mechanistic Interpretability)
试图从内部机制(电路、注意力子图、神经元特征)因果性地解释模型行为。Elhage 等提出电路分析框架,Bricken 等用稀疏自编码器(SAE)分解超叠加(superposition)现象,从多义神经元中提取可解释的单义特征;Geva 等的「键值记忆」范式认为前馈层存储知识。
本文的假设——偏见集中而非弥散分布、神经元有功能特化——直接建立在机制可解释性的成果之上。理解存储假说与调节假说的对立,才能读懂零化实验为何出现双向失稳。
BBQ / EsBBQ 偏见基准
BBQ 是基于选择题的英文偏见评测标准:在歧义情境下正确答案依赖上下文,模型若退回刻板印象则暴露偏见;在消歧情境下模型应忽略刻板印象。从中提取歧义准确率、消歧准确率、歧义偏见分数、消歧偏见分数四项指标。EsBBQ 是其西班牙语/加泰罗尼亚语版本,替换了美国本土类别。
BBQ/EsBBQ 是本文量化干预效果的核心标尺,歧义偏见分数是主要指标。读懂它的选择题格式局限,才能理解为何作者承认结果未必推广到开放式生成。
研究动机
大模型从海量语料中习得了社会历史不平等的表征,并在招聘、医疗、教育、金融等高影响场景中复现甚至放大人口统计偏见(性别、种族、年龄、宗教等)。现有的三类应对手段都存在结构性缺陷:第一类在预训练数据上做过滤或再平衡,但合成数据本身由带偏见的 LLM 生成,只是把问题上移一层;第二类依赖微调或后训练对齐(如 RLHF),它同时作用于所有权重,不区分哪些编码偏见、哪些支撑通用能力,因此既可能伤及非目标能力,又可能触发灾难性遗忘;第三类在嵌入空间做后处理(如 INLP 迭代投影),多次投影会连带抹除相关非目标信息,且对现代生成模型适用性有限。第四类基于稀疏自编码器(SAE)和激活引导的方法虽概念强大,但 SAE 需要在目标模型上额外训练,计算成本高昂,资源受限的研究团队几乎无法负担。这些方法共同的结构性短板是:没有一种能在不额外训练、且消费级算力可承受的前提下,精准定位编码偏见的权重并将其与通用能力权重区分开。
本文的目标是本文的目标是建立一种无需额外训练、可在消费级 GPU 上几分钟内运行的人口偏见定位与干预方法。具体而言,它要(1)在 GLU-MLP 架构中精确找到对人口属性产生差分响应的神经元;(2)验证这些神经元与模型通用能力运行在可解耦的回路上,使定点干预不引起可感知的能力退化;(3)在最大 3B 参数的模型(Llama-3.2-1B/3B、Salamandra-2B)上,结合标准化基准(BBQ、EsBBQ)与定性文本生成实验,量化干预对偏见和能力两轴的因果影响;(4)把方法封装进开源的 OptiPFair 库并公开中英双语对比提示数据集,为后续从盲目零化转向定向行为调制奠定方法论基础。
与已有工作不同的是,本文的独特切入角度在于:它没有像 SAE 那样去学习一个通用的特征分解,而是用最小对比提示对直接定位对人口属性差分响应的神经元——这是一种针对性的、训练免费、成本极低的定位手段。更关键的是,它选择在 GLU 架构的 down_proj 输入处测量激活,因为那里的逐元素相乘才整合了门控与内容信号,是量化神经元差分响应最直接的测量点。这个设计选择使其能复现一种此前未被系统报告的现象:SwiGLU 的逐元素相乘像一个「深度滤波器」,把原本分散在十余层的偏见信号压缩并汇聚到最后一层,从而为定点干预提供了清晰靶点。这与既有偏见缓解工作「整体干预、不加区分」的范式形成本质对照。
核心方法
可以打一个比方:如果模型是一座大楼,偏见是藏在某些办公室里的特定噪声源,传统方法要么整栋楼断电(微调全部权重),要么在外墙贴隔音层(后处理投影),而本文的方法是拿着两个几乎相同的访客名册(仅换一个身份标签)逐层监听,找出对身份变化反应最剧烈的办公室(神经元),然后只关掉那几间。技术路线是一条四阶段流水线:构建受控对比提示对→在 down_proj 输入处用前向钩子捕获逐神经元激活→用 BiasScore 给每个神经元打分并定位高响应者→对选中的神经元做对称零化并评测。整个流程不改架构、不加梯度更新,能与 lm_eval 及生产推理引擎直接兼容。
核心创新是把「对比差分激活」从概念探测工具升级为因果定位信号,并选在 GLU 架构特有的 down_proj 输入处测量,从而揭示了一个反直觉且高度可复现的结构性现象。与已有方法的本质区别有三:第一,与 SAE 相比,它不学通用特征分解,而是用最小对比对直接定位对单一属性敏感的神经元,训练免费、成本极低;第二,与 INLP 等嵌入空间后处理相比,它在权重空间定点操作而非迭代投影,不连带抹除相关非目标信息;第三,它把 BiasScore 设计为无符号的差分幅度,这带来了一个意外但富有洞察的发现——零化这些神经元不会单调地降低偏见,而是产生「双向失稳」,即在歧义与消歧两个指标上反向漂移,甚至在某些实验中翻转偏见符号。这一发现直接否定了「MLP 神经元是偏见的静态存储」这一键值记忆假说的简单版本,转而支持「这些神经元是偏见表达的调节器」这一更细致的图景,并为下一步转向有符号打分、定向激活引导指明了方向。
方法步骤详情
第一步,构建对比提示对数据集:每个对的两条提示仅在单一人口属性上不同(如 [old/young]),并强制要求两者在 Llama-3.2-1B 分词器下产生完全相同的 token 数,以保证激活可逐位置比较。每类属性配 5 个社会语境模板(职业、制度、医疗、社交、教育),以未完成句结尾诱导潜在偏见续写。英文版含 14 个属性对、70 个提示对,西班牙语版含 20 个属性对、100 个提示对。第二步,捕获激活:用 OptiPFair 库在每个 MLP 层的 down_proj 输入处注册 PyTorch 前向钩子,对每对提示推理后得到激活向量 $a^{(1)}$ 和 $a^{(2)}$。第三步,计算 BiasScore:对层 $l$ 中神经元 $i$,$$\text{BiasScore}_{i,l} = \frac{1}{|P|}\sum_{p \in P} \left| \mu(a^{(1)}_{i,l,p}) - \mu(a^{(2)}_{i,l,p}) \right|$$,其中 $\mu$ 为对序列位置取均值,$|P|$ 为该类提示对数。值越高表示该神经元对人口属性变化响应越强。第四步(可选),计算 FairnessPruningScore $= \alpha \cdot \text{BiasScore} + (1-\alpha)\cdot(1-\text{ImportanceScore})$,其中 ImportanceScore 由 PPM $= \max(w)+|\min(w)|$ 经全局 min-max 归一化得到,实验中取 $\alpha=0.8$。第五步,按 BiasScore 选 Top-K 神经元(1–40 个)。第六步,对称零化:对选中的神经元 $i$,同时置零 gate_proj.weight 第 $i$ 行、up_proj.weight 第 $i$ 行、down_proj.weight 第 $i$ 列,确保该神经元不通过任一投影贡献残差流。第七步,用 BBQ/EsBBQ 评测偏见轴、用 lm-eval-harness 评测能力轴,并用 $\Delta\text{Bias}$、$\Delta\text{Capability}$ 百分比量化干预影响。
技术新颖性
技术新颖性体现在三处相互呼应的设计上。其一是测量点的选择:此前差分激活分析多在 gate_proj 或 up_proj 上做,本文证明 SwiGLU 的逐元素相乘会把分散在多层的信号压缩到最后一层,只有在 down_proj 输入处测量才能稳定呈现「最后一层即偏见峰值」的可复现规律——这是定位精度上的关键改进。其二是评分函数的无符号性:BiasScore 用绝对值差分,不对哪个方向是偏见做先验假设,这虽导致零化干预是「盲目」的,却诚实地暴露了候选神经元集合中放大器与抑制器混杂的事实,这一观察本身就是方法论贡献。其三是与机制可解释性主流(SAE)的路线分叉:它用一次性对比探测替代持续的特征字典学习,把成本从「需在目标模型上额外训练」降到「消费级 GPU 几分钟」,并以作者自维护的 OptiPFair 库和公开双语数据集保证可复现性。
实验结果
结果分三块呈现,每块都有具体数字支撑。基线方面,三个模型在 BBQ 英文上呈现典型模式:歧义准确率低(Llama-1B 10.0%、Llama-3B 7.5%、Salamandra-2B 7.7%)、消歧准确率高(52.3%/73.5%/50.5%),Llama-1B 的 Religion 和 Age 歧义偏见分数最高(5.33% 和 7.50%),而 RaceEthnicity 为负值(−1.66%),表明该类已是反刻板倾向。在偏见定位上,最一致的发现在全部 30 个「模型×语言×类别」组合中无例外地成立:down_proj 输入处平均偏见信号最强的层永远是模型最后一层(Llama-3.2-1B 的 L15、Llama-3.2-3B 的 L27、Salamandra-2B 的 L23)。Salamandra-2B 把 79%–94% 的全局前 200 偏见神经元压缩进最后一层,Llama-1B 为 54%–80%(Religion 英文达 159/200),Llama-3B 最分散但也占 37.5%–69%。候选神经元在层内全宽度散布(非连续块),排除了基于索引区间的块剪枝策略。各类别电路高度特化:66%–88% 的候选神经元为该类独有,Gender 与其他类别的 Jaccard 重叠最低(0.02–0.11 点低于非 Gender 对均值)。跨语言一致性中等(Top-1% 的 EN-ES Jaccard 在 0.130–0.200)。零化实验给出最关键且反直觉的发现:干预产生「双向失稳」而非系统性降偏。Llama-1B 八个实验中歧义与消歧分数在六个里反向漂移,全局波动仅 0.80pp 和 0.50pp;类别级却有明显因果信号,Llama-3B 的 Religion·Top-20 把歧义偏见从 6.00% 拉到 1.50%(−4.50pp),并把消歧分数从 +3.84% 翻转到 −1.67%,构成全网格最直接的因果证据。Salamandra-2B 上同一类不同实验(Top-5 vs Top-40)甚至产生方向相反的 11pp 摆动。能力保留方面,Llama-1B 的 20 个保留值全落在 97.93%–101.34%,均值 99.49%,零化规模最大也仅占 MLP 总宽度的 0.031%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 通用能力保留(WikiText/MMLU/ARC/HellaSwag EN/ES 均值) | 干预后能力保留率 | 99.49% 均值(Llama-3.2-1B,零化≤40神经元) | 100%(未干预基线) | 仅损失约0.51pp,能力与偏见可在可解耦回路上分别操作 |
| BBQ Religion 歧义偏见(Llama-3.2-3B) | bias_ambig | Religion·Top-20 后 1.50% | 6.00% | −4.50pp,消歧分数还从+3.84%翻转为−1.67%(符号反转) |
| BBQ Religion 歧义偏见(Llama-3.2-1B) | bias_ambig | Religion·Top-5 后 3.67% | 5.33% | −1.66pp,但消歧分数同时+0.89pp,体现双向失稳 |
| 干预规模经济性 | 零化神经元占比 | 至多40个 / 131,072 个中间位置 | 传统微调动全部权重 | 0.031% 即可观测到5pp级别的偏见因果影响 |
局限与改进
作者明确承认的局限包括:评测结构性地依赖 BBQ/EsBBQ 的显式属性、选择题格式,既无法捕捉由间接信号(姓名、职业、文化行为)触发的偏见,也不保证观测到的失稳动态能直接外推到开放式生成;架构分析仅覆盖 4B 参数以下、基于 SwiGLU 的 MLP 模型,注意力机制被有意排除;定位方法本身要求对比对在分词后 token 数严格相等,这对高屈折语言(如西班牙语)极不友好,导致 Salamandra-2B 在多个类别-语言组合上有效对数大幅缩减;零化实验参数保守(每实验至多 40 神经元),更大干预尺度下的行为尚未探索。我额外观察到三点:其一,BBQ 上能力保留的「安全」结论可能部分源于基线本身就接近随机水平(如 GSM8K 5.5%),微小扰动无法被统计噪声之上的信号检出,因此「99.49% 保留」对接近随机的任务并不等价于「无伤害」;其二,零化的非单调、符号翻转效应说明当前 BiasScore 的无符号设计在「干预」语境下其实是一个缺陷而非特性,作者自己也承认这只能算「扰动」而非「受控缓解」;其三,跨语言候选神经元 Jaccard 仅 0.13–0.20,意味着用英文数据集定位的偏见神经元几乎不能直接迁移到西班牙语,多语言场景需各自重做定位,工程成本被低估。
独立分析的弱点
第一个弱点是评分函数的无符号性导致干预不可控:在实际的「消除招聘偏见」场景里,零化一组合并了放大器与抑制器的神经元,可能把某条提示的偏见从「肢体暴力」改成「制度性歧视」甚至引入原文没有的种族敌意(如论文示例 3),这使方法无法直接用于合规敏感的线上系统。改进方向正是作者点出的非对称语料 + 有符号 BiasScore,再结合逐神经元乘性缩放(activation steering)而非清零。第二个弱点是分词等长约束对屈折语言过于严苛,西班牙语的有效对数被腰斩,定位分辨率下降;改进方向是用软对齐(如动态时间规整 DTW 或对齐嵌入)放宽逐位置比较要求,或改用 token 级别的因果中介分析替代硬等长。第三个弱点是评测过度依赖选择题 BBQ,与真实开放式生成存在表示鸿沟;改进方向是引入开放生成的偏见探测(如用 LLM-as-judge 或人类标注的刻板印象评分)作为补充主指标。第四个弱点是规模验证止步于 3B,最后一层汇聚现象是否在 70B+ 生产模型上仍成立未知;改进方向是按层抽样做小规模差分激活扫描验证可扩展性。
未来方向
作者提出的三个延续方向:其一是引入非对称语料(预先知道哪条提示产生偏见响应、哪条中性),从而计算有符号 BiasScore,分离放大与抑制神经元,把当前的盲目零化升级为定向激活引导,无需梯度更新即可把电路响应推向期望的中性;其二是把同一流水线应用到超特定数据集(甚至单一具体就业歧视场景的提示对),定位并干预单个偏见行为而非宽泛类别;其三是把实验扩展到生产规模模型,验证定位规律是否在 4B 以上参数保持。基于成果可延伸的方向:探索注意力头在人口属性处理中的角色(需另设计捕获与分析流水线,作者明确将其列为独立工作);研究跨语言偏见神经元的迁移机制,判断是否可构造语言无关的偏见抑制向量;将 FairnessPruningScore 在更激进剪枝制度下激活,检验其能否在 5%–20% 神经元被移除时仍守住能力底线。
复现评估
复现门槛相当低,是本文的一大亮点。全部代码、数据集、实验结果公开在 github.com/peremartra/fairness-pruning,方法实现在作者自维护的开源库 OptiPFair 中;双语对比提示数据集发布在 HuggingFace(fairness-pruning-pairs-en / fairness-pruning-pairs-es)。实验全部在 Google Colab Pro 的单张 NVIDIA L4 GPU(算力 8.9)上以 bfloat16 完成,每个 notebook 起始固定全局种子 set_seed(42),所有文本生成用贪心解码(do_sample=False),仓库附 requirements.txt 把依赖钉到精确版本。复现者只需消费级 GPU 即可在分钟级完成偏见神经元定位,几小时内跑完零化评测网格。主要复现难点不在算力,而在严格重建 BBQ/EsBBQ 的歧义/消歧子集划分与偏见分数计算口径,以及保证对比对的分词等长约束在目标分词器下成立——这是论文反复强调的技术前提。
论文图表
展示五个类别(Age、Gender、RaceEthnicity、Religion、PhysicalAppearance)在社交、制度、劳动、医疗等语境下的对比对,用 [x/y] 标注两条提示中唯一不同的人口属性,每条以未完成句结尾诱导偏见续写。
让读者直观理解方法的最小输入单元——对比对的设计,是理解整个差分激活机制的入口。
八个实验的歧义偏见波动仅 0.80pp、消歧仅 0.50pp,且八个里有六个歧义与消歧反向漂移,无任何实验使两指标同时下降。
用聚合数据证实了「双向失稳」而非「系统性降偏」,是反驳简单存储假说、推动有符号打分这一核心论点的关键证据。
Llama-1B 的 Religion·Top-5 把歧义偏见从 5.33% 降到 3.67%(−1.66pp)但消歧升 0.89pp;Llama-3B 的 Religion·Top-20 把歧义偏见从 6.00% 降到 1.50%(−4.50pp),消歧从 +3.84% 翻转为 −1.67%。
提供全网格最强的因果信号与符号反转证据,同时显示零化的非单调性(Llama-1B 放大到 Top-40 反而两指标齐升),是理解方法能力与边界最关键的一张表。
四个实验在五个能力任务上的 20 个保留值全落在 97.93%–101.34%,均值 99.49%;HellaSwag 几乎不动,WikiText 系统性微升 perplexity,MMLU 波动最大但含 101.34% 的噪声性「提升」。
用量化数据支撑「偏见处理与通用能力运行在可解耦回路上」的核心结论,证明 0.031% 的定点零化不引发可感知能力退化。