← 返回 2026-09-10

基于参考模型与隐状态相对表示的大模型偏见检测 Reference-Based Bias Detection in LLMs via Relative Representations of Hidden States

Marek Jeliński, Jan Dubiński, Maciej Chrabaszcz, Sebastian Cygert 📅 2026-09-09 👍 3 2026-09-12 18:30
LLM安全 偏见审计 模型对比 相对表示 隐状态分析

用锚点句相似度把微调前后隐空间投到共享坐标系,ΔB 检测偏见漂移,快 3–50 倍。

前置知识

隐状态表示(Hidden States)

Transformer 对输入句子的每个 token 在每层都输出一个隐藏向量。把最后一层所有 token 的向量做平均池化,就得到句子的一个 $d$ 维嵌入,可粗略看作模型对这句话的内部语义编码。本文取 Llama/Mistral 第 32 层、Gemma 第 34 层的隐状态。

整个方法建立在'偏见漂移会体现在隐状态几何中'这一假设上,理解句子向量如何取得是读懂一切后续步骤的前提。

相对表示(Relative Representations)

Moschella 等人 2023 年提出的编码方式:不用句子嵌入向量本身,而用它对一组固定锚点句子的相似度组成向量 $r(x)=[\cos(e(x),e(a_i))]$。因为微调更多保留句间相对几何而非绝对坐标,这种'以相似性为坐标'的表示可在共享锚点的不同模型间直接比较。

它是打通'微调前后两个不可比隐空间'的核心机制,也是本文核心指标 ΔB 得以定义的基础。

SEAT / WEAT 关联检验

词嵌入关联检验 WEAT(2017)测量目标词与属性词在嵌入空间的关联是否带社会偏见;SEAT(2019)将其推广到句子编码器。本文以 SEAT 为单模型基线:对每个目标句算它与正面属性句的平均余弦相似度 $S^+$ 与负面属性句的 $S^-$,取差后对目标集平均得偏见分 $B$。

ΔB 本质上是把 SEAT 的关联逻辑搬到相对空间、再做模型间差分,理解 SEAT 才能明白 ΔB 比它多了什么。

全量微调与 LoRA

全量微调更新模型全部参数,会大幅重塑隐空间几何;LoRA 只训练注入注意力与 MLP 投影层的低秩增量矩阵(本文 $r=16, \alpha=32$),参数量和表示空间扰动都小得多。低秩约束限制了隐几何能移动的幅度,直接压缩了可测量的漂移信号。

两种微调 regime 下信号强弱差异(Gemma 在 LoRA 下信号消失)是论文最重要的边界条件之一。

模型合并(Model Merging)

把同一基座在两个数据集上微调的检查点按权重线性插值 $M_\lambda=\lambda M_{harmful}+(1-\lambda)M_{unharmful}$。本文取 10/90 至 90/10 五个比例加两端点,得每模型七档从安全到有害的梯度谱系,让偏见以渐进增量引入而非一次性跳变。

这个梯度谱系是验证'ΔB 与输出偏见共变'的实验设计核心,为相关性分析提供了连续分布的观测点。

ROC AUC

把连续分数做阈值二分类时的评测指标:ROC 曲线下面积为 1 表示完美分类,0.5 等于随机。本文把'ΔB 低于某个 cutoff 判为偏见加重'当分类器,用外部基准的固定操作点(WildGuardMix/DecodingTrust 取 0.1,ToxiGen 取 0.03)生成真值标签。

论文统一用 ROC AUC 回答'ΔB 到底能不能用',所有检测类结论(0.65–0.99)都以它报告。

Procrustes 对齐与 CKA

Procrustes 变换求解一个最优正交矩阵,把一组表示旋转对齐到另一组,是跨模型表示比较的经典做法;CKA(中心核对齐)是不依赖坐标系的表示相似度度量,对旋转缩放不变但没有方向性。本文把二者作为消融基线,证明增益来自相对表示本身而非'对齐'操作。

理解这两个基线为何失效(Procrustes 只能处理刚性变换差异、CKA 无方向),才能真正明白相对表示的优势所在。

研究动机

现有偏见审计几乎都盯着模型输出:要么跑精心策展的基准数据集(如 HELM、DecodingTrust),要么请另一个 LLM 当裁判。两条路都有硬伤——基准集构建昂贵、难以扩展到新出现的伤害类型,而 LLM 裁判会把自己的偏见带进评分(Lin et al., 2025)。更要害的是输出级审计存在结构性盲区:LLM 经历指令微调、安全微调、领域微调和系统提示之后,行为会以难以预料的方式漂移,Qi et al. (2024) 与 Betley et al. (2025) 证明即使在良性数据上微调也会损害安全属性。内部已经发生的群体-属性关联漂移,可能远早于行为变化、甚至始终不出现在生成文本里——只看输出的审计方法对此完全无感。

本文的目标是本文把宏大的'审计模型偏见'问题收敛为一个具体的经验问题:当微调改变了模型隐状态中的群体-属性关联时,这种内部偏移是否与输出层面的偏见变化共变?为此作者提出参考式审计框架:给定被审计模型(微调后)与参考模型(基座),不经任何文本生成与评分,直接在两者共享的表示空间中测量目标群体向正面/负面属性关联的偏移量 ΔB,并系统验证四件事:(1) ΔB 与三个输出级基准的偏见变化是否相关;(2) 简单阈值化 ΔB 能否区分偏见加重与减轻的检查点;(3) 结论对锚点集、属性措辞、句式模板是否稳健;(4) 相比输出级评测能省多少算力。

与已有工作不同的是,独特之处在于把两个已有想法拼成一个新工具。其一,跨模型表示比较此前要么拟合显式映射(正交 Procrustes 变换),要么用对齐不变的相似度(CKA):前者在两空间差异超出刚性变换时失效,后者没有方向性。本文改用相对表示(Moschella et al., 2023,原用于零样本潜空间通信)作为共享坐标系,不拟合任何映射。其二,表示级(intrinsic)与功能级(extrinsic)偏见度量是否相关在文献中高度争议——Goldfarb-Tarrant et al. (2021) 发现普遍不相关,Orgad et al. (2022) 却发现表示级指标更忠实。本文不急于站队,而是用模型合并构造从安全到有害的七档梯度谱系,把这场争论转化为一个可控的受控实证问题:偏见被连续注入时,内部信号是否跟外部行为同步移动。

核心方法

直觉:微调会重塑隐空间的绝对坐标,但更多保留了句子之间的相对几何——语义关系以相似性结构的形式存活下来。所以不要直接比较隐向量(绝对坐标不可比),而是把每个句子编码成它对一组固定锚点句子的相似度向量,让两个模型落进同一个'比较空间'。技术上:准备目标句集 $T$(如 '[某群体] 住在很多国家')、正面属性集 $P$('这个人值得信赖')、负面属性集 $N$('这个人不可靠')和 1000 条中性锚点句 $A$;被审计模型与参考模型分别把每个句子做一次前向,取最后一层隐状态平均池化得到嵌入 $e(x)\in\mathbb{R}^d$;再计算相对表示 $r(x)=[\cos(e(x),e(a_i))]_{i=1}^{m}\in\mathbb{R}^m$。在相对空间里用取负的欧氏距离衡量目标句与正/负属性集的平均关联,得到 $B_{rel}$,最后做模型间差分 $\Delta B = B_{aud} - B_{ref}$——负值表示该群体的编码整体向负面属性漂移,即偏见加重。

核心创新有三点。第一,用相对表示打通两个不能直接比较的隐空间:锚点句子作为共享参照系,两个模型各自用自己的参数编码锚点,$r(x)$ 的每个分量(对某锚点的余弦相似度)在两边含义相同,因此完全不需要拟合跨模型映射——这是与 Procrustes 对齐的本质区别。第二,'参考式'设计把偏见从绝对测量变成相对漂移:做差分 $\Delta B = B_{aud}-B_{ref}$ 后,微调带来的几何伪影和两个模型共有的基底偏见都被消掉,剩下的就是微调真正引入的偏移。第三,在相对空间刻意不用余弦而用取负的欧氏距离:$r(x)$ 的分量本身已是相似度,再做余弦就变成'相似性轮廓的相似性',丢掉了直接的距离解释。三者合起来,把 SEAT 从单模型度量升级成了跨模型审计工具。

方法步骤详情

完整流程五步。第一步,构建句子集:从 DecodingTrust 取社会群体填入模板生成目标句 $T$(每群体 50 句、均长 7 词),GPT-5 生成正/负属性句 $P$、$N$(各 100 句),同域取 1000 条中性句做锚点 $A$。第二步,算嵌入:句子过一遍前向,取最后一层(Llama/Mistral 第 32 层、Gemma 第 34 层)全部 token 隐状态做 mean 池化,得 $e(x)\in\mathbb{R}^d$。第三步,算相对表示 $r(x)=[\cos(e(x),e(a_i))]_{i=1}^{1000}$,被审计与参考模型各算一遍。第四步,算关联分:$S^+_{rel}(s)=-\frac{1}{|P|}\sum_{p\in P} d_E(r(s),r(p))$,$S^-_{rel}(s)$ 同理(取负使值越大越近),对 $T$ 平均得 $B_{rel}$。第五步,差分 $\Delta B=B_{aud}-B_{ref}$,每个(检查点, 群体)对一个观测;验证时与输出级 $\Delta$Bias Score 做 Pearson 相关、阈值化算 ROC AUC。全流程单卡 A100 约 3 分钟。

技术新颖性

技术新颖性在于组合与实证定位,而非单点发明。相对表示本身是 Moschella et al. (2023) 的成果,但原文用于零样本语义分割的潜空间通信,本文第一次把它用作 LLM 偏见审计的跨模型对齐层。实验里有个漂亮的证伪设计:Procrustes-SEAT 先用最优正交映射把被审计嵌入对齐到参考系再跑 SEAT,结果在两个基准上 ROC AUC 只有 0.567 和 0.513,接近随机——因为正交映射只保持角度,两空间差异超出刚性变换时就无能为力;这反证了增益确实来自相对表示的构造,而不是'对齐'这个操作本身。CKA 漂移能检测(AUC 0.864/0.753)但没有方向,分不清群体是变好还是变坏。与所有输出级方法的区别是:不生成、不评分、无需标注,新目标群体只需几十句模板即可接入。

Overview of our bias evaluation pipeline.
Figure 1: Overview of our bias evaluation pipeline.

实验结果

实验覆盖 Llama-3.1-8B、Mistral-7B、Gemma-3-4B 三个家族 × 全量/LoRA 两种微调(WildGuardMix 无害与合成有害 8k 子集训练,再按 10/90–90/10 五个比例合并成 7 档谱系)× 三个输出基准,18 个设置中 15 个显著相关。全量微调:WildGuardMix 上三家 Pearson r=−0.67/−0.68/−0.37(均显著),阈值检测 AUC 0.93/0.89/0.78;DecodingTrust 上 Llama 达全篇最强 r=−0.84(p<0.001)、AUC 0.91;ToxiGen 上 Llama r=−0.62、AUC 0.91,Mistral 因生成毒性饱和 r=−0.19 不显著。LoRA 下 Mistral/Llama 仍显著(DecodingTrust AUC 0.99/0.92),Gemma 信号消失(r=−0.04)。方法对比:RR 全面领先,WildGuardMix 上 AUC 0.964,超 SEAT 0.778、Procrustes-SEAT 0.567、CKA 0.864。消融稳健:中性锚点最好 0.892,属性集 0.863±0.030,模板 0.902±0.008,种子 std 0.003。成本约 3 分钟/模型,比输出级基准便宜 3–50 倍。

Representational bias shift against three external bias benchmarks.
Table 1: Representational bias shift against three external bias benchmarks.
Computational cost analysis (in minutes) across all evaluated models.
Table 3: Computational cost analysis (in minutes) across all evaluated models.
Robustness of ∆B to the token-to-vector pooling strategy for Llama (layer 32).
Table 6: Robustness of ∆B to the token-to-vector pooling strategy for Llama (layer 32).
RR versus alignment and representation-similarity baselines on Llama.
Table 7: RR versus alignment and representation-similarity baselines on Llama.
Llama under full fine-tuning against all three external bias benchmarks.
Figure 2: Llama under full fine-tuning against all three external bias benchmarks.
ROC AUC for detecting increased-bias models across bias-score thresholds on Llama.
Figure 3: ROC AUC for detecting increased-bias models across bias-score thresholds on Llama.
Effect of anchor set selection on ROC AUC for Llama.
Figure 4: Effect of anchor set selection on ROC AUC for Llama.
Stability of representational bias shift across fine-tuning runs.
Figure 5: Stability of representational bias shift across fine-tuning runs.
查看结构化数据
任务指标本文基线提升
有害性偏见漂移检测(WildGuardMix,Llama,全量微调) ROC AUC(ΔB 阈值分类) 0.964(RR) 0.778(SEAT);Procrustes-SEAT 仅 0.567(近随机) 比 SEAT 高 0.186,比 Procrustes-SEAT 高 0.397
刻板印象偏见相关性(DecodingTrust,Llama,全量微调) Pearson r(ΔBias Score vs ΔB) −0.84(p<0.001,全篇最强) −0.45(SEAT) 相关强度提升约 87%;对应 ROC AUC 0.949 vs 0.753
有害检查点检测(DecodingTrust,Mistral,LoRA) ROC AUC 0.99 同模型全量微调下为 0.75 LoRA 下反而最强,且全篇 AUC 区间覆盖至 0.99 上限
群体级毒性漂移(ToxiGen,Llama,全量微调,逐群体粒度) Pearson r / ROC AUC −0.62(p<0.001)/ 0.91 跨模型设置下 Procrustes-SEAT 相关不显著(WildGuardMix/DecodingTrust 上 AUC 0.567/0.513) 首个无需把群体聚合到粗主题、就能在群体粒度上与行为毒性共变的表示级指标
单模型审计计算成本 耗时(单张 A100 40GB) 约 3 分钟(2m51s–3m12s),无需标注 WildGuardMix 9–14 分钟;ToxiGen 33–76 分钟;DecodingTrust 44–156 分钟 快 3–50 倍,且新目标群体零数据收集成本

局限与改进

作者承认的局限:ΔB 继承了 SEAT 对上下文嵌入不稳定性的敏感,对表示强依赖提示设计与 token 位置的模型可能不可靠;ΔB 是相对量,只能说明'被审计模型相对参考移动了多少',不能单独认证某个检查点无偏见;句子集是英语模板、覆盖 DecodingTrust 的粗粒度单轴群体,其他语言、交叉性群体和未命名的伤害都在测量范围之外;只验证了 4B–8B 三个指令模型上的合成有害微调,Gemma 在 LoRA 下信号退化;池化固定为末层 mean,池化与层选择未经系统研究。我的补充观察:(1) Mistral 在 ToxiGen 上失效暴露了验证方法的软肋——输出端毒性饱和会人为压低相关性,这种天花板效应在真实场景同样存在;(2) 阈值化 ROC AUC 依赖外部基准的固定操作点(0.1/0.03),实际部署中并没有这样的真值标签可用;(3) 相关不等于因果,ΔB 小也可能是微调没触及相关回路,而非模型更安全——作者在伦理部分也明确警告了这一点。

独立分析的弱点

独立分析四个弱点。其一,参数高效适配下信号塌陷:Gemma 在 LoRA 下相关性归零,低秩更新约束了隐几何的移动幅度,且 Gemma-3-4B 只有另外两家约一半参数量;改进方向是在 LoRA 子空间或多层聚合上定义漂移,或直接分析适配器权重增量,而非只看末层隐状态。其二,验证谱系是人工合成的:模型合并构造的七档偏见是线性插值的理想化场景,真实世界的领域适配、RLHF 引发的偏见漂移分布可能完全不同,相关性未必迁移。其三,锚点与目标同域带来循环性风险:域内中性锚点效果最好(0.892 vs 域外更低),虽然作者证明域外锚点也能辨别,但'锚点定义投影框架'与'锚点与目标共享群体词'之间的耦合值得更细的因果消融。其四,缺少校准:ΔB 只给方向和相对幅度,没有'ΔB=−0.3 意味着什么'的概率解释,部署需要配合输出级抽查建立校准曲线,本文没有给出。

未来方向

作者提出的方向:把 ΔB 用作微调过程中的在线监控信号,例如作为早停准则——每几百步算一次仅秒级开销;参考模型与被审计模型不必同源, opens 跨独立训练检查点审计的可能;在更大规模与自然微调场景下验证;厘清表示偏移与行为偏见之间的因果关系。作者同时明确警告:把 ΔB 变成训练目标并不直接可行——针对它优化出来的模型未必输出更少偏见。基于本文成果可以延伸的工作:把同一框架搬到其他安全属性的表示级检测(越狱倾向、欺骗性、Betley 式紧急错位);沿层维度画漂移曲线,定位偏见被注入的深度;与激活转向、稀疏自编码器等可解释性工具结合,从'检测漂移'走到'定位并归因漂移';构建多语言与交叉性群体的锚点/属性集,检验方法的普适边界;以及探索把输出级抽查做成由 ΔB 触发的两级审计流程,把昂贵的基准评测只花在内部信号报警的检查点上。

复现评估

复现条件相当友好。代码已开源(github.com/NASK-AISafety/Reference-Based-Bias-Detection),目标句、属性句、锚点句集合一并发布;出于伦理考虑作者不发布故意降权的检查点,但训练配置完整给出(WildGuardMix 两个 8k 子集、3 epochs、有效批 32、AdamW、全量 lr 2e-5、LoRA r=16/α=32/lr 1e-4、bfloat16、五个合并比例)。所有实验在单张 A100 40GB 上完成,审计一个模型约 3 分钟,算力门槛是个人实验室可负担的。数据侧 WildGuardMix、DecodingTrust、ToxiGen 均公开。主要复现成本在三处:重训 42 个检查点(3 模型 × 2 regime × 7 档)、跑通三个输出级基准(DecodingTrust 代码库需要修补依赖才能支持新模型)、以及 WildGuardMix 24→9 群体映射依赖 ChatGPT 标注(需自己重做一遍)。总体难度中低,适合作为表示级安全审计方向的入门复现项目。