← 返回 2026-08-31

GGSS:生成式视觉语言模型推理时去偏的测地门控球面引导 GGSS: Geodesic-Gated Spherical Steering for Inference-Time Debiasing of Generative Vision-Language Models

Yiqun Sun, Junyu Chen, Pengfei Wei, Lawrence B. Hsieh 📅 2026-08-26 👍 3 2026-09-01 18:30
公平性与去偏 推理时干预 激活引导 球面几何 视觉语言模型

免重训地在单位球面上做偏差感知的测地引导,大幅降低生成式VLM人口学偏见且不损通用能力

前置知识

推理时干预(激活引导 / Activation Steering)

在不修改模型权重的前提下,用 forward hook 截获并改写中间层激活来改变模型行为,代表方法有 ActAdd、ITI、表征工程等。由于图像对应的视觉 token 在自回归解码过程中保持不变,这类干预通常只需在每张图的首个解码步前执行一次,之后可缓存复用,因此部署成本极低。

GGSS 正是挂在视觉-语言投影层上的激活引导器,理解 hook 与免重训机制是理解其『部署友好』卖点的前提。

线性概念擦除(INLP / LEACE)

通过迭代训练探针(INLP)或闭式最小二乘解(LEACE)求出编码受保护属性的线性子空间,再把表示向其零空间投影,使下游无法线性读出该属性。它们为静态词向量或 CLIP 式单向量表示设计,本质是硬投影:对所有输入一视同仁地清除坐标,容易过度破坏与任务相关的信息。

这类方法是本文十个移植基线的主力;GGSS 的球面插值与门控正是针对硬投影的范数破坏和过度矫正而设计的,是对比的参照系。

球面几何:Fréchet 均值、log/exp 映射与 Slerp

把激活归一化到单位球 $S^{D-1}$ 后,两点间最短路径是大圆弧。Fréchet 均值 $c=\arg\min_z \sum_a d(z,y_a)^2$ 用迭代归一化求解;$\mathrm{log}_p(q)$ 把 $q$ 映到 $p$ 处的切空间,$\exp_p$ 反向映回球面;Slerp $\mathrm{Slerp}(p,q;\beta)=\frac{\sin((1-\beta)\theta)}{\sin\theta}p+\frac{\sin(\beta\theta)}{\sin\theta}q$ 沿测地弧插值,全程范数为 1。

GGSS 的发现与推理全部定义在球面和切空间上,Slerp 是替代硬投影的核心原语,不懂这些几何工具就读不懂方法节。

反事实图像与偏差度量

反事实图像指仅受保护属性不同、其余视觉因素像素级对齐的图像组:同一个人像变换感知种族或性别,姿态、衣着、光照、背景不变。将其输入模型后,激活差异即可归因于该属性。常用度量包括跨种族答案分布的 Jensen–Shannon 散度(JSD)、pairwise 收入判断的种族间标准差、职业分类的性别正确率差距等。

本文的偏差子空间完全由反事实激活差估计,三个评测协议也全部建立在反事实探针上,这是全文的数据与度量基础。

生成式 VLM 的视觉 token 与投影层

与 CLIP 把整张图压缩为一个全局向量不同,Pixtral、LLaVA、Qwen3-VL 等生成式 VLM 把图像编码为大量视觉 token,经视觉-语言投影 MLP(如 LLaVA 的 mm_projector)映射到语言模型维度,再与文本 token 一起进入 decoder-only 语言模型。不同 token 携带的信息(人脸、衣着、背景、姿态)高度不均。

干预点就是这个投影层的输出;『偏差集中在少数 token』是设计逐 token 自适应门控的直接动机,也是 CLIP 时代方法失效的根源。

研究动机

生成式 VLM 正被用于招聘筛选、决策支持等高风险场景,而已有大量研究表明:即使两张图像只有感知种族或性别不同、其余视觉内容被严格控制,模型输出仍呈现系统性差异。现有推理时去偏方法大多为 CLIP 式『单全局嵌入』设计——INLP、R-LACE、LEACE 做线性子空间擦除,MeanDiff 做分类器引导的均值平移,BendVLM 在 CLIP 嵌入空间做检索均衡。现代生成式 VLM 却把图像编码为大量视觉 token 再与 decoder-only 语言模型融合,直接套用这些欧氏硬投影会过度破坏任务信息:本文实验中,移植后的基线平均降幅普遍不高,MeanDiff 系列在 Pixtral-12B 上几乎无效(+0%),BendVLM 球面版甚至使 LLaVA-Vicuna 的 MMStar 从 37.3 崩到 2.9、平均偏差不降反升 +45%,被『未去偏基线』反超;纯提示词层面的公平指令同样不可靠,可把 Vicuna 的 MCQ 种族偏差放大 85%。

本文的目标是本文目标是构造一个即插即用、免重训的生成式 VLM 去偏框架,并让它同时满足三个可检验的要求:一是几何保真——干预不得扭曲 token 的范数与方向结构;二是 token 级选择性——只对携带人口学信号的 token(如人脸、衣着 token)施加纠正,不误伤编码姿态、背景、文本线索的干净 token;三是子空间化——把种族这类多类属性建模为 $k=|\mathcal{A}|-1$ 维低维子空间而非单一方向。评测目标是:在四个骨干(Pixtral-12B、LLaVA-1.6-Vicuna-7B、LLaVA-1.6-Mistral-7B、Qwen3-VL-4B)与十个移植基线及提示词缓解的统一 best-avg-α 协议下取得全模型最低的平均偏差,同时 MMStar 与未干预基线的差异控制在 ±0.6 个百分点内,且降幅通过配对置换检验显著。

与已有工作不同的是,已有工作把去偏等价于『找一个偏差方向 + 欧氏投影/减法』。本文抓住了三个被忽视的点:其一,几何——视觉激活经投影层进入语言模型,欧氏减法同时扭曲方向与范数,且这种伤害随模型规模增大(12B 上欧氏形式使 MMStar 掉 6.3 p.p.,$p<10^{-8}$),而把激活约束在单位球面上、沿测地弧旋转可从数学上保证范数不变;其二,粒度——偏差信号在 token 层面高度异质,集中于人脸、衣着等少数 token,均匀投影必然过矫正干净 token,因此应当用发现集的偏差范数统计量 $\tilde b,\sigma_b$ 免训练地校准逐 token 门控;其三,结构——反事实激活的切空间位移天然张成多维属性子空间(5 类种族对应 4 维),SVD 一步即得,无需训练监督探针。三者组合,构成与 CLIP 时代方法的本质区隔。

核心方法

直觉上,GGSS 像一台『偏差感知的球面旋转手术』:离线先用反事实照片画出偏差坐标系,推理时把每个视觉 token 放到单位球面上,量出它在偏差坐标上的分量,分量大的 token 沿大圆弧被旋到干净方向,分量小的几乎不动,且旋转前后向量长度严格不变。技术路线分两阶段。离线发现:将 REFLECT/FOCUS 的 480 张像素对齐反事实照片(6 职业 × 8 身份 × 5 种族 × 2 性别)输入冻结 VLM,固定提示词 “Describe this image in detail.”,在视觉-语言投影层钩取激活,逐图池化并归一化得球面代表 $y_{u,a}$;对每个固定上下文求球面 Fréchet 均值 $c_u$,属性位移 $s_{u,a}=\mathrm{log}_{c_u}(y_{u,a})$ 堆叠成矩阵 $S$,SVD 取前 $k=4$ 个右奇异向量得 $V_{\mathrm{bias}}$,同时求全局参考点 $\mu$ 和门控统计量 $\tilde b,\sigma_b$。在线推理:新输入在同一层被钩取,每个视觉 token 依次经过归一化、切空间去偏投影、门控 Slerp 测地旋转、范数恢复四步后送回冻结模型,全程无梯度、无重训。

核心创新是把『硬、均匀、单方向的欧氏投影』替换为『软、逐 token、子空间化的球面引导』。首先是范数保持的测地更新:在切空间做正交投影 $t_i^{\mathrm{clean}}=(I-V_{\mathrm{bias}}V_{\mathrm{bias}}^\top)t_i$ 后,经 $\exp_\mu$ 映回球面得到目标方向,再用 Slerp 沿测地弧插值 $\hat h_i^{\mathrm{steered}}=\mathrm{Slerp}(\hat h_i,\hat h_i^{\mathrm{target}};\beta_i)$,Proposition 1 严格证明 $\|h_i^{\mathrm{steered}}\|_2=\|h_i\|_2$,从根上消除欧氏减法的范数塌缩与过冲失效。其次是免训练自适应门:$g_i=g_{\mathrm{floor}}+(1-g_{\mathrm{floor}})\,\mathrm{sigmoid}(\kappa z_i)$,其中 $z_i=(\|V_{\mathrm{bias}}^\top t_i\|_2-\tilde b)/(\sigma_b+\epsilon)$,用离线发现集的偏差范数中位数与标准差校准,让偏差分量大的 token 转得多、干净 token 基本不动,与硬投影『一刀切』形成本质区别。第三,$\beta_i=\alpha g_i$ 把硬投影变成连续可调的软算子:$\beta=0$ 不动、$\beta=1$ 到达去偏目标、更大则沿弧继续推进。消融证明两组件各有贡献:Qwen3-VL 的 MCQ 上,球面硬投影无门为 5.61 JSD,加门降至 4.53,门 + Slerp 全开达 2.41($-83.5\%$)。

方法步骤详情

第一步(离线·反事实激活提取):输入 REFLECT/FOCUS 中同一身份、像素对齐的 5 种族 × 2 性别共 10 张图,用固定提示跑冻结模型,在视觉-语言投影层注册 forward hook(LLaVA 为 mm_projector[2],Qwen3-VL 为 merger.linear_fc2,Pixtral 为投影器第二个线性层),得 $H_{u,a}\in\mathbb{R}^{T\times D}$,token 平均池化后归一化为 $y_{u,a}\in S^{D-1}$;种族任务在 {cook, doctor, lawyer, nurse, teacher} 上做发现,性别任务留出 nurse 与 doctor,保证评测职业不进发现集。第二步(离线·子空间与门校准):对每个上下文求 Fréchet 均值 $c_u$,把位移 $s_{u,a}$ 堆叠为 $S\in\mathbb{R}^{N_{\mathrm{shifts}}\times D}$,SVD 得 $V_{\mathrm{bias}}$($k=4$);对每个发现代表计算 $b(c)=\|V_{\mathrm{bias}}^\top\mathrm{log}_\mu(c)\|_2$,存中位数 $\tilde b$ 与标准差 $\sigma_b$,连同 $\mu$、$k$ 打包成一个 .pt checkpoint。第三步(在线·逐 token 引导):新图像前向到同一层钩取张量 $Z$;对每个非零 token 记半径 $r_i=\|h_i\|_2$、方向 $\hat h_i$、切向量 $t_i=\mathrm{log}_\mu(\hat h_i)$;投影出偏差分量 $p_i=V_{\mathrm{bias}}V_{\mathrm{bias}}^\top t_i$ 与干净分量 $t_i^{\mathrm{clean}}$,得目标方向 $\hat h_i^{\mathrm{target}}=\exp_\mu(t_i^{\mathrm{clean}})$;计算门 $g_i$,令 $\beta_i=\alpha g_i$ 做 Slerp,再以 $h_i^{\mathrm{steered}}=r_i\,\hat h_i^{\mathrm{steered}}$ 恢复范数,reshape 后交回解码器。超参固定 $\kappa=5$、$g_{\mathrm{floor}}=0.3$,$\alpha$ 按协议从 {0.25, 0.5, 0.75, 1.0, 1.5} 选一个操作点。

技术新颖性

技术新颖性有四层。第一,几何层面的替代原语:把方向统计的 Fréchet 均值、log/exp 映射与计算机图形学的 Slerp 组装成去偏算子,并给出带证明的范数保持与正交投影保证(Proposition 1),CLIP 时代方法均无此性质;匹配门控的几何消融进一步显示球面优势随规模显现——12B 的 Pixtral 上球面在两种门条件下都显著更优($p=0.031/0.015$),4B-7B 上则与欧氏相当。第二,门控机制:用发现集统计量做 sigmoid 校准、零训练地实现 token 级选择性,直接修正投影类方法『一视同仁』的范式;附录分析给出可解释的门行为(72% 的 token 门值高于 0.9,最低偏差的 14% 被压到 0.4 以下)。第三,把多类属性(5 类种族对应 4 维子空间)作为一等内容处理,摆脱二值属性假设。第四,评测学贡献:将十个 CLIP/LM 时代去偏器统一移植到同一干预层,形成可复用的生成式 VLM 去偏基准套件并开源。

Overview of the GGSS framework.
Figure 2: Overview of the GGSS framework.

实验结果

主实验(Table 1,best-avg-α 协议)中,GGSS 在全部四个模型上取得最低平均偏差降幅:Pixtral-12B 为 $-55\%$(最强外部基线 BendVLM 欧氏版 $-37\%$)、LLaVA-Vicuna $-90\%$(INLP 球面版 $-86\%$)、LLaVA-Mistral $-80\%$($-78\%$)、Qwen3-VL-4B $-60\%$($-49\%$);四模型均值 $-71.4\%$、最差情况 $-55.3\%$,均优于 INLP (sph.)($-61.1/-30.8\%$)与 LEACE (sph.)($-48.5/-26.4\%$)。单项最大降幅:Vicuna 的 Nurse/Doctor 性别差距 0.600→0.025($-96\%$,$p<10^{-4}$)、Vicuna 的 MCQ 8.70→1.36($-84\%$)、Pixtral 的 2AFC 0.243→0.096($-61\%$);配对符号翻转置换检验显示四个骨干中三个显著。能力保持:GGSS 的 MMStar 与基线差异全部在 ±0.6 p.p. 内(McNemar 全部 $p\ge0.09$),MME 感知/推理仅 $-0.4\%/-1.8\%$;反观基线,BendVLM (sph.) 在 Pixtral 崩掉 46.7 p.p.、Vicuna 崩掉 34.4 p.p.,INLP (sph.) 显著损伤 Pixtral MMStar($-6.1$ p.p.,$p<10^{-4}$)。消融(Table 3,Qwen3 MCQ,$\alpha=1.0$):完整 GGSS 达 2.41 JSD($-83.5\%$),去掉门退到 5.61,去掉 Slerp 只留门为 4.53,两组件组合再降 14 p.p.。敏感性:$\kappa=5, g_{\mathrm{floor}}=0.3$ 最佳,高 $\kappa$ 配零下限会过选(JSD 10.97)。留出 α 的交叉拟合中,8 折里 6 折选中与论文相同的 α,且每个留出折均保持降幅。提示词公平指令基线不一致甚至有害(Vicuna MCQ $+85\%$)。属性特异性检查(Table 12)表明引导种族基本不影响性别识别(Pixtral 88.7→88.7),且 $\alpha=0.5$ 时 MCQ 已降 55% 而种族识别仅 80.0→76.2。

Main results against external baselines.
Table 1: Main results against external baselines.
MMStar capability preservation at best-avg-α.
Table 2: MMStar capability preservation at best-avg-α.
Component ablation of GGSS on Qwen3-VL-4B, MCQ salary (race).
Table 3: Component ablation of GGSS on Qwen3-VL-4B, MCQ salary (race).
Sensitivity of GGSS to gate sharpness κ and floor g_floor.
Table 4: Sensitivity of GGSS to gate sharpness κ and floor g_floor.
Significance summary at the paper's operating points.
Table 5: Significance summary at the paper's operating points.
Added baselines: Avg Δ% at each method's best-avg-α.
Table 6: Added baselines: Avg Δ% at each method's best-avg-α.
Recognition accuracy (%) of the non-targeted attribute, unsteered → steered at the paper's α.
Table 12: Recognition accuracy (%) of the non-targeted attribute, unsteered → steered at the paper's α.
The α dial on Qwen3-VL-4B: recognition of the targeted attribute vs. bias reduction.
Table 13: The α dial on Qwen3-VL-4B: recognition of the targeted attribute vs. bias reduction.
Geometry toggled at matched gate condition, Avg Δ%.
Table 15: Geometry toggled at matched gate condition, Avg Δ%.
查看结构化数据
任务指标本文基线提升
推理时去偏(三任务综合) Avg Δ%(相对未干预基线的平均偏差降幅,越低越好) Pixtral −55% / Vicuna −90% / Mistral −80% / Qwen3 −60%;四模型均值 −71.4%,最差 −55.3% 最强外部基线逐模型:BendVLM(Eucl.) −37%(Pixtral)、INLP(sph.) −86%(Vicuna)、INLP(sph.) −78%(Mistral)、INLP(sph.) −49%(Qwen3);LEACE(sph.) 四模型均值 −48.5% 四个模型全部第一;均值领先最强基线约 10 p.p.,最差情况领先约 24 p.p.
Nurse/Doctor 职业分类(性别偏差) 分类正确率性别差距 |P(nurse|man)−P(nurse|woman)| Vicuna 0.600→0.025(−96%,p<10⁻⁴);Pixtral 0.425→0.125(−71%) Vicuna 上最强基线 INLP(sph.) 同为 0.025(−96%);Pixtral 上 INLP(sph.) 仅 0.350(−18%) Pixtral 上 −71% vs −18% 大幅领先;Vicuna 上与最强基线持平但整体更稳定
MCQ 薪资/教育多选(种族偏差) mean_race_jsd × 10³(跨种族答案分布的 Jensen–Shannon 散度) Vicuna 8.70→1.36(−84%);Qwen3-VL 14.65→5.10(−65%) INLP(sph.):Vicuna 2.05(−76%)、Qwen3-VL 6.49(−56%);MeanDiff 系列在 Pixtral 上几乎无效(+0%) 在这两个模型上均为最佳(−84% vs −76%;−65% vs −56%)
2AFC 收入二选一(种族偏差,pairwise) race_bias_std(种族配对判断的离散度) Pixtral 0.243→0.096(−61%) 最强外部基线普遍无效或恶化:INLP(sph.) +22%(0.297)、BendVLM(Eucl.) +10%(0.267) 在多数基线失效甚至恶化的任务上实现 −61%
通用多模态能力保持 MMStar 准确率变化(p.p.,1500 题,VLMEvalKit 精确匹配) 四模型变化全部在 ±0.6 p.p. 内(基线 53.6/37.3/38.5/61.5 → 53.2/37.8/38.9/61.6),McNemar 全部 p≥0.09 INLP(sph.) 在 Pixtral 掉 6.1 p.p.(p<10⁻⁴);BendVLM(sph.) 在 Pixtral/Vicuna 分别崩掉 46.7/34.4 p.p. 唯一在所有模型上能力无显著损失的强去偏方法

局限与改进

作者承认:评测只覆盖 4 个生成式 VLM、3 个偏差协议与 MMStar,未证明能泛化到其他架构、语言、领域和偏差类型;只处理感知种族与二值性别,标签来自数据策展人的『感知』标注,不涵盖自我认同与交叉性身份;每个(方法,模型)仍需选择 α 且最优值随模型变化,免调规则是开放问题;GGSS 只改推理时激活,不清除参数中的偏见知识,不保证分布偏移下的稳健性;在偏差最小化的 α 下目标属性在人脸特写上的可报告性大幅下降(Qwen3 种族识别 80.0→20.0),误配置会压制合法需要属性信息(如临床记录)的任务;降低基准偏差不等于公平,部署需人工监督与独立审计。我的补充观察:其一,Vicuna 在种族引导下性别识别从 93.8 掉到 81.2(Table 12),『交叉属性完全不受影响』并非在所有骨干上成立;其二,门统计量在图像级池化代表上校准,而真实 token 的偏差范数分布右移(中位数 0.196 vs 0.113),默认下 72% 的 token 门值高于 0.9,『选择性』在很多时候接近全 token 引导;其三,球面优势集中在 12B 规模,4B-7B 上几何差异处于噪声内;其四,两个 LLaVA 的 2AFC 基线为零,各模型参与平均的任务数不同,跨模型 Avg Δ% 严格来说不完全可比。

独立分析的弱点

独立分析五个弱点。其一,α 依赖与过引导风险:α=1.5 时 Qwen3 的目标属性识别崩到 20%(种族)/42.5%(性别),高 κ 配零下限时门控过选使 JSD 恶化到 10.97,说明超参在部分区域失稳;改进方向是把 α 与门统计量绑定、由 $\tilde b,\sigma_b$ 自动推导强度,或引入偏差指标的在线反馈控制。其二,属性泄漏:Vicuna 上种族引导使性别识别下降 12.6 p.p.,暗示 $V_{\mathrm{bias}}$ 在部分骨干上混入了相关属性方向;改进方向是在子空间发现时对其他属性的位移做残差化或加正交约束,并报告子空间的属性纯度诊断。其三,门校准的层级错位:统计量在图像级代表上估计、作用却在 token 级分布上,虽然逐 token 重校准可在更低 α(0.5 即 −91%)达到同等降幅,但默认配置仍偏『宽开门』;改进方向是默认逐 token 校准。其四,评测域窄:探针均为英文人脸特写类反事实照片,best-avg-α 又在同一探针上选 α,绝对降幅可能偏乐观;改进方向是在自然图像与多语言设置上复核并采用更保守的 α 选择。其五,双重用途:同一机制可反向放大偏差,代码与 checkpoint 完全开源却缺少使用侧防护(如引导子空间的访问审计与使用条款约束)。

未来方向

作者提出的方向:把子空间构造推广到非人口学偏差轴(如政治倾向,其文本嵌入结构已有研究);设计免调 α 规则——利用 $\tilde b,\sigma_b$ 直接设定 token 级强度;扩展到其他受保护属性、交叉性群体、多语言提示与开放式生成场景。基于本文成果可延伸的:把『几何 + 门控』封装成通用推理时干预原语,迁移到安全对齐(如拒绝引导)、幻觉抑制或隐私属性隐藏等任务并检验普适性;探索跨层多点位联合引导与干预层的自动化搜索;用核方法或稀疏字典替换 SVD,以刻画种族这类非线性属性流形;把能力回归测试扩展到推理、代码、多模态数学等 MMStar 之外的维度;并与 RLHF 式训练时公平性目标结合,系统比较参数级与激活级去偏的成本、收益与可逆性。

复现评估

复现条件相当好。代码、十个移植基线、配置文件、引导 checkpoint(含 $V_{\mathrm{bias}}$、$\mu$、$k$、$\tilde b$、$\sigma_b$ 及奇异值元数据)和聚合评测结果均已在 GitHub 开源(github.com/dukesun99/GGSS);数据全部使用公开集:REFLECT/FOCUS(GPL-3.0,480 张像素对齐人像)、SocialCounterfactuals(MIT),MMStar 经 VLMEvalKit(Apache-2.0)评测,不生成新人像。算力方面,离线发现只需对 480 张图各跑一次前向并缓存投影层激活;在线引导是逐 token 的小规模线性代数($k=4$ 维子空间、球面原语全部向量化、float32 计算),开销可忽略,4B-12B 模型以 bfloat16 单卡(48GB 级)即可加载。greedy 解码、seed 42、数值稳定性细节(arccos 截断、$10^{-8}$ 测地零阈值、dtype 转换)都写入附录。主要成本是多方法 × 多 α × MMStar 1500 题的评测吞吐。总体属于中低成本、高确定性的复现。