← 返回 2026-08-25

EXPL-FR:通过视觉-语言对齐解释人脸识别模型 EXPL-FR: Explaining Face Recognition Models via Vision-Language Alignment

Guray Ozgur, Mustafa Efe Tamyapar, Naser Damer, Fadi Boutros 📅 2026-08-21 👍 1 2026-08-30 18:30
事后对齐 人脸识别 可解释性 模型审计 视觉-语言模型

轻量适配器把冻结视觉-语言模型对齐到冻结人脸识别空间,提示词变语义锚点,无标注完成解释与审计。

前置知识

视觉-语言模型(VLM)与模态鸿沟

CLIP 这类视觉-语言模型用对比学习同时预训练图像编码器 $\phi_v$ 和文本编码器 $\phi_t$,使两者输出共享同一个 $d$ 维空间中的向量:匹配的图文对余弦相似度被拉大,因此一句“a photo of a person wearing glasses”这样的提示可以按语义给图像排序。但两个模态的嵌入分布并不完全重合,存在系统性偏移(modality gap),同概念的图文嵌入对齐是不完美的。

本文方法的转折点完全建立在“图像上训练的适配器可以直接用在文本嵌入上”这一假设之上;不理解 VLM 图文共享空间及其不完美耦合,就无法理解迁移为何可能(Eq.3)、又为何不完美(Table 1 第6行与第7行的差距)。

深度人脸识别(FR)嵌入空间

FR 编码器 $\psi$ 把人脸图像映射为 $\ell_2$ 归一化后的单位向量,用 margin 损失在 WebFace4M/MS1MV2 这类网络级身份数据上训练,使同身份对余弦距离小、异身份对大,在 LFW 等基准上准确率接近饱和(本文主模型 AdaFace 五基准均值 97.44%)。它是纯特征提取器,没有分类头和决策层。

EXPL-FR 的目标就是在这个黑盒特征空间内部命名方向:所有解释与审计统计量都定义在 FR 嵌入而非 VLM 嵌入上;必须知道这个空间被训练成什么样(身份判别、为不变性丢弃捕获因素),才能理解论文“保留/折扣”的核心叙事。

适配器(Adapter,事后对齐模块)

插在两个冻结预训练模型之间的小型可训练模块,本文中是一个约 1.05M 参数的 4 层 MLP,把 VLM 图像嵌入映射到 FR 嵌入,原模型参数完全不动,属于事后(post-hoc)技术。训练只用成对的冻结嵌入和余弦对齐损失,参数量比任一编码器小几个数量级。

适配器是整个框架唯一被学习的组件,它的训练数据(只有人脸图像、无文本)、损失(余弦方向对齐)与模型选择方式(held-out 1:1 验证)决定了方法“无需白盒访问、无需属性标注”的定位,也是它与概念瓶颈类解释方法的本质区别。

1:1 验证协议与 TAR@FAR、EER

人脸验证的标准评测:1:1 协议判断一对图像是否同身份,报告十折准确率(LFW、AgeDB-30、CFP-FP 等);TAR@FAR=1e-4 表示在极严假接受率下的真接受率(IJB-B/C 模板协议);EER 是等错误率,用于刻画“隔离单一属性的验证协议”的难度——某属性变化的真实代价越大,对应协议 EER 越高。

本文的验证哲学是“以真实验证行为为金标准”:对齐质量靠把流水线插进 1:1 验证来度量(Table 1),审计结论靠与真实分种族验证错误率和分属性 EER 的秩相关来检验(Fig.4);不熟悉这些指标就读不懂核心实验。

可检测性与均值差探测器(AUC)

衡量“某概念在某空间里是否仍可分离”:用 VLM 的中心化 grounding 分数 $r_k(\mathbf{x})=\langle \bar{\mathbf{e}}_v(\mathbf{x}),\,\bar{\mathbf{e}}_t^k-\mu_t\rangle$ 给每个概念的高低两端伪标注,在一半身份上拟合均值差探测器、在另一半上测试,报告 AUC。分别在 VLM 空间($\mathrm{AUC}^V$,结构性近饱和 0.976)与适配器映射后的空间($\mathrm{AUC}^F$)各算一次,两者之差即为该概念在 FR 空间的“折扣”上界。

这是论文无标注选择语义签名(top-100 提示词)的机制,也是审计框架的核心统计量;“保留 vs 折扣”的全部定量讨论都建立在这对 AUC 的对比上。

KS 统计量(双样本分布距离)

Kolmogorov–Smirnov 统计量是两条经验累积分布函数的最大垂直距离,取值 [0,1],越大说明两个分布差异越大。论文用它度量某属性对 FR 空间结构的强度(dependence 统计量):把图像按该概念分成两组,比较组内与组间 FR 余弦距离分布,差异越大说明该属性越强地塑造身份几何。

dependence 是四个审计统计量之一,直接对应 RFW 分种族模型选择与 CelebA 属性排序实验;其无标注版本与有标签版本 Spearman 0.64 的相关性,是“无监督审计可替代监督审计”结论的关键证据。

研究动机

深度人脸识别(FR)模型部署在边检、设备解锁、门禁等高风险场景,一次验证决策可能带来法律、金融或安全后果。现代模型用 margin 损失在网级身份数据上训练,标准基准已接近饱和(本文主模型 AdaFace ViT-B/WebFace4M 在 LFW、AgeDB-30 等五个基准的平均 1:1 验证准确率达 97.44%),但从业者拿到的只是一个相似度分数:无法追问“这个决策依赖了哪些语义属性”,与生物识别领域日益提高的透明度和监管要求相冲突。已有可解释 FR(XFR)工作大多停留在空间或几何层面——用 inpainting 打 saliency 分数、对余弦分数做 patch-pair 分解、把神经元绑定到人工标注的“Face Dictionary”——它们回答的是“模型看了哪里”,而不是“依赖了哪个具名概念”。语义化路线中最接近的 Leroy et al. 需要CelebA 每图 40 个标注、可控生成器 GAN-Control,且词表被标注覆盖面限死,成本高、也无法解释单张图像。

本文的目标是本文要构建一座严格事后(post-hoc)的桥,把开放的自然语言词表引入冻结、黑盒的 FR 嵌入空间,使“解释人脸识别模型”不需要触碰模型内部、不需要梯度或白盒访问、也不需要逐图属性标注。具体拆成四件事:第一,学习一个轻量适配器把冻结 VLM 的图像空间与 FR 空间对齐,并验证它能零成本迁移到文本,把任意提示词变成 FR 空间中的语义锚点;第二,提出无标注的可检测性度量,识别每个模型“保留的身份判别属性”,取前 100 个构成可读的语义签名(semantic signature);第三,提供逐图、身份级、真实/冒名者/变形图(genuine/imposter/morph)差分三种层面的解释;第四,构建三种监督水平(人工标注、VLM 伪标注、纯提示词)下的属性级审计基准,用真实验证行为检验,量化监督成本与审计质量的权衡。

与已有工作不同的是,此前连接 VLM 与可解释性的路径各有死角:概念瓶颈/探针方法要把分类器决策路由过具名概念,需要决策层,而部署中的 FR 编码器是纯特征提取器;adapter 类方法(CLIPface 等)在 CLIP 自己的空间内为任务性能改造 CLIP,不产生对目标模型的解释;基于 LLM 的 FR 解释让第二个模型去描述人脸,全部推理发生在 VLM 自己的空间里——描述的是脸,不是匹配器。机制上最接近的 LaVMD 依赖共享分类头和封闭标签集,FR 编码器两者都没有。真正缺失的是“从语言进入已经冻结的 FR 空间”的桥:独立训练的两个编码器先验上不可比(本文未对齐交叉验证只有 50.29%,等同随机)。本文的独特切入有二:其一,只训练图像侧适配器,利用 VLM 内部图文共享空间让文本方向“搭便车”;其二,把“FR 模型靠丢弃身份跨越因素挣得不变性”当作一等研究对象——保留/折扣结构本身就是解释应阅读的坐标系和审计要测量的对象。

核心方法

直觉上,VLM 知道“人脸长什么样”——它能按任何写出的概念给人脸排序;FR 模型知道“这是谁”——其嵌入编码了身份结构。若一个小适配器 $g_\theta$ 能把 VLM 图像嵌入映射到 FR 嵌入,那么由于 CLIP 图文编码器本就被对比预训练推入同一空间,同一个 $g_\theta$ 应能将文本提示嵌入也送进 FR 空间,使每条提示词成为一个语义锚点,任意词表由此可在 FR 空间内命名方向。技术路线四步:(1)冻结两个编码器,在 WebFace4M 成对冻结图像嵌入上以余弦对齐损失训练 4 层 MLP(约 1.05M 参数);(2)将 22 类共 978 条冻结提示词过同一适配器得到单位锚点;(3)用无标注可检测性 AUC 比较每个提示在 VLM 空间与映射后空间的表现,保留前 100;(4)人脸在锚点上的投影构成语义签名,支撑三级解释与模型审计。全程仅适配器被学习,FR 模型视为黑盒,无提示词参与训练。

核心创新落在两个经验发现上。其一,图像专用适配器零样本迁移到文本:$g_\theta$ 只见过成对图像嵌入、从未见过任何文本,但它只是 $\mathbb{R}^d$ 上的一个学到的函数,而提示词嵌入 $\bar{\mathbf{e}}_t^k$ 就住在同一空间;因为 VLM 的图文编码器在对比预训练中被推到一起,$g_\theta$ 会把概念的文本嵌入映射到与该概念图像一致的位置。Table 1 中同一 978 提示词词表在 VLM 原生空间投影只有 51.98% 的身份验证能力,经图像训练的适配器映射后达 71.66%(+19.68 个点),这一差距就是对从未被监督的跨模态迁移的最干净测量。其二,“FR 模型的不变性是挣来的”:为了跨姿态、表情、光照、采集条件验证身份,模型必须丢弃这些因素,于是映射后只有部分概念仍可检测——眼镜(0.955)、发色(0.947)几乎无损存活,距离(0.853)、光照、场景语境被折扣最多。与已有工作的本质区别:解释读的是 FR 模型自己的坐标,为匹配器本身作答;且保留/折扣结构不是要丢弃的噪声,而是可量化、可审计的研究对象。

方法步骤详情

第一步(对齐训练):取 WebFace4M 成对冻结嵌入(仅人脸图像,无标签无文本),损失 $\mathcal{L}=\frac{1}{N}\sum_i\langle\overline{g_\theta(\bar{\mathbf{e}}_v^i)},\bar{\mathbf{f}}_i\rangle$ 只对齐方向不罚幅度;适配器为 4 层 MLP(无偏置线性+BatchNorm+GELU 堆叠),约 1.05M 参数;Adam、学习率 $10^{-3}$ 余弦退火、batch 1024、50 epochs,每轮在身份不相交的 10% held-out 上做 1:1 验证选检查点。第二步(锚点生成):$\mathbf{p}_k=g_\theta(\bar{\mathbf{e}}_t^k)/\|g_\theta(\bar{\mathbf{e}}_t^k)\|$,978 条提示离线一次算完。第三步(签名选择):VLM grounding 分数伪标注概念两端,均值差探测器在身份两半上拟合/测试,得 $\mathrm{AUC}^V$ 与映射后的 $\mathrm{AUC}^F$,按后者取 top $m=100$ 为身份判别属性集 $K_\psi$。第四步(阅读与审计):签名 $s(\mathbf{x})=[\langle\bar{\mathbf{f}}(\mathbf{x}),\mathbf{p}_k\rangle]$,逐图按幅值排序、身份级取注册图均值、差分为 $\Delta_k=s_k(x_a)-s_k(x_b)$;审计以三种方式构造轴(标签均值差、伪标注分位数组均值差、有序提示集 PC1),计算 dependence(KS)、sensitivity $|\langle\Delta,\hat{\mathbf{a}}\rangle|$、attribution(八选一 top-1),并与真实错误率、EER 做条件化秩相关检验。

技术新颖性

技术新颖性有三层。第一层在机制:据作者所知,这是首个用图像侧适配器把冻结黑盒 FR 空间与冻结 VLM 对齐、且对齐零样本迁移到文本的框架——机制上最接近的 LaVMD 依赖封闭标签集上的共享分类头,FR 编码器没有;CLIPface 等 adapter 方法在 CLIP 自己的空间内改造,不产生解释。第二层在度量:无标注可检测性度量把“FR 模型丢弃了某些属性”的模糊直觉变成逐提示、逐模型可比的排序,$\mathrm{AUC}^V-\mathrm{AUC}^F$ 的落差给出概念折扣的上界;选出的 top-100 签名在身份区分上反优于全 978 词表(0.931 vs 0.910),说明“选择”本身有价值;作者还主动测出映射度量的美化(真实 FR 重打分 0.740 vs 0.894)并证明偏差方向保守、排序保持(ρ=0.63–0.97),这种自我审视在同类工作中少见。第三层在评测:首次把属性级审计放在三种监督设定下基准化,量化监督成本-审计质量曲线(RFW 选择 τ=0.92 三设定一致,CelebA 逐属性 τ 从 0.63 降到 0.45);而先前工作只有一种需标注与可控生成器的设定,新属性在此只需一句话。

EXPL-FR overview. The only learned component is the adapter gθ, mapping frozen VLM image embeddings onto frozen FR embeddings (Eq. 2), it never sees text. The same frozen gθ is then applied to the text encoder, turning each prompt into an FR-space anchor (Eq. 3). (b) Explanations at three levels.
Fig. 1: EXPL-FR overview. The only learned component is the adapter gθ, mapping frozen VLM image embeddings onto frozen FR embeddings (Eq. 2), it never sees text. The same frozen gθ is then applied to the text encoder, turning each prompt into an FR-space anchor (Eq. 3). (b) Explanations at three levels.

实验结果

Table 1(主模型 AdaFace ViT-B/WF4M + CLIP ViT-B/16):未对齐 FR×VLM 交叉验证仅 50.29%(随机水平,证明独立训练的两空间不可比);适配器对齐后混合配对达 94.56%,距 97.44% 的 FR 上界仅 2.88 点,在 IJB-B/C 模板协议上更反超 FR 参照(96.60/97.70 vs 95.58/97.18),唯一失败是低分辨率 TinyFace(rank-1 13.49 vs 73.77)。词表投影实验隔离出跨模态迁移:同一 978 提示词,VLM 空间投影仅 51.98%,经图像训练的适配器映射后达 71.66%(+19.68 点);对齐 VLM 自验证还把 CLIP 的身份信息从 82.33% 提到 92.58%。泛化上,四个 FR 目标的对齐自验证仅差 0.71 点,词表投影忠实性却差 5.61 点(R100:WF4M 75.18 vs MS1MV2 69.57),说明各模型暴露的可命名身份结构不同。可检测性(Fig.2):VLM 空间均值 0.976 vs FR 空间 0.79–0.98,眼镜 0.955、发色 0.947 存活,距离 0.853、光照被折扣;top-100 签名身份分离优于全词表(0.931 vs 0.910)。交叉验证(Fig.3):CelebA 40 属性锚点均值 AUC 0.64(金发 0.89 最高),dependence 排序对标签版 Spearman 0.64(p=1.0×10⁻⁵);GAN-Control 归因 35%(随机 12.5%),年龄达 82%。审计(Fig.4):三设定下 RFW 模型选择 Kendall τ 均为 0.92(联合 p=1.2×10⁻⁵),dependence 排名与真实错误率排名完全一致;纯提示诊断 ρ=0.95 反超有标签的 0.90;CelebA 替代监督审计逐属性 τ 为 0.63(伪标注)vs 0.45(纯提示)。

Faithfulness of the cross-modal alignment.
Table 1: Faithfulness of the cross-modal alignment.
Identity-discriminating attributes via label-free detectability (WebFace4M identity holdout, primary target).
Fig. 2: Identity-discriminating attributes via label-free detectability (WebFace4M identity holdout, primary target).
Labeled cross-checks on CelebA (primary model).
Fig. 3: Labeled cross-checks on CelebA (primary model).
Top (selection, RFW): label-free ethnicity dependence (x) vs. real ten-fold verification error (y). Bottom (diagnosis, GAN-Control, primary target): matched-axis sensitivity (x) vs. the real EER of the protocol varying exactly that attribute.
Fig. 4: Top (selection, RFW): label-free ethnicity dependence (x) vs. real ten-fold verification error (y). Bottom (diagnosis, GAN-Control, primary target): matched-axis sensitivity (x) vs. the real EER of the protocol varying exactly that attribute.
查看结构化数据
任务指标本文基线提升
词表投影身份验证(LFW 等五基准均值) 1:1 验证准确率 (%) 71.66(978 提示经图像训练的适配器映射到 FR 空间) 51.98(同一词表在 VLM 原生空间投影);FR 上界 97.44 +19.68 点,干净隔离出未被监督的跨模态迁移
对齐交叉编码器验证(g_θ(φ_v)↔ψ) 五基准平均准确率 (%) 94.56(IJB-B/C TAR 达 96.60/97.70,超过 FR 参照) 未对齐交叉编码器 50.29(随机);FR 自验证上界 97.44 较未对齐 +44.27 点,距上界仅 2.88 点
语义签名的身份可分性 genuine/imposter AUC 0.931(按 AUC^F 选 top-100 提示,主模型) 0.910(全 978 提示词表);同规模随机子集更低 +0.021,四个模型上均成立(如 0.958 vs 0.940)
RFW 无标注模型选择 Kendall τ(审计排名 vs 真实分种族验证错误率) 0.92(三种监督设定一致;非裔/高加索/印度裔 τ=1.0) 先前实践需人口统计学标注;单组 τ=1.0 的置换检验 p=0.042 首次零标注完成模型选择,联合 p=1.2×10⁻⁵
GAN-Control 模型诊断(哪类变化代价最大) Spearman ρ(敏感度 vs 真实分属性 EER,n=8) 0.95(纯提示词设定,主模型,p=5.7×10⁻⁴) 0.90(有标签的先前实践)、0.83(VLM 伪标注) 零标注设定反超监督设定,运行任何验证协议前即可诊断
CelebA 属性 dependence 排序 Spearman ρ(无标注 vs 有标签,n=40) 0.64(p=1.0×10⁻⁵;其余目标 0.65/0.70) Leroy et al. 需每图 40 个标注 + 可控生成器 仅用提示词与无标注图像复现了原本全监督的分析

局限与改进

作者承认的局限:其一,词表——FR 空间词表投影比 FR 上界低 25.78 点(97.44 vs 71.66),部分身份线索无法用语言命名;单概念提示词并不解耦(发型提示同时携带长度、体积、纹理),读数只是方向性的而非因果性的。其二,VLM——所有构造都继承 VLM 在对齐裁剪上能排序的内容,它理解不了的概念(头部姿态、光照、极端低分辨率)成为盲区,审计却仍返回看似有规律的值(姿态审计 τ=0.00/−1.0,无结论),双空间对比也只能不完整地标记它们(头部姿态 $\mathrm{AUC}^F\approx0.89$ 是伪阳性)。其三,度量——可检测性以 VLM 自己的伪标注为参照、再经适配器读取,存在系统性美化($\mathrm{AUC}^F$ 均值 0.894 vs 真实 FR 重打分 0.740),性别是唯一实质重排的属性(有标签得分仅 0.82)。我的补充:纯提示设定下 attribution 掉到 16–19%,接近 12.5% 随机水平;RFW 模型选择仅 4 个模型,统计功效偏弱;FR 目标全部是 AdaFace/ResNet 配 WebFace4M/MS1MV2,对其他训练管线的迁移未验证。

独立分析的弱点

弱点一:锚点质量瓶颈。词表投影距上界 25.78 点,相当一部分身份信息分布在语言无法瞄准的方向上;提示词不解耦,签名读数只能说“这张脸在长发方向分数高”,不能说“这是长发”。改进:对提示词库做正交化/去相关,或在适配器后加轻量文本侧精调,把方向性读数升级为可分离读数。弱点二:VLM 盲区可继承且难自查。头部姿态在 $\mathrm{AUC}^F\approx0.89$ 上伪阳性,光照被折扣却携带 0.13–0.29% 的真实 EER 代价,使用者可能把无意义的审计值当发现。改进:多 VLM 交叉验证(CLIP 与 SigLIP 分歧即报警),或要求“保留/折扣象限+小规模标注校准”双重确认后才输出该轴结论。弱点三:归因能力随监督骤降(82–90%/33–34%/16–19%,随机 12.5%),因后两者每属性只有单一伪标注轴,而 35% 的代理结果依赖 41 个组平均锚点;实践含义是审计可廉价扩展,但“是哪个属性造成的”在零标注下基本答不了。改进:对关键属性扩展提示词组(多措辞+多阶段词),逼近代理设定的组平均机制。弱点四:模型排名 n=4 统计功效弱,结论对更大模型池的外推性未知,应在更大模型动物园上复核 τ 稳定性。

未来方向

作者指出的方向是“扩展一次审计只需一句话”,由此自然延伸:第一,审计的广度——把 978 提示词的固定词表变成动态词表,监管方或部署方关心新属性(宗教头饰、口罩、医疗特征)时即写即测,立刻得到该轴的 dependence/sensitivity。第二,解释的深度——差分解释已展示 morph 的残差分歧能指认其继承自另一位贡献者的属性,可延伸到在线 morph 检测与生成式身份溯源。第三,审计闭环到训练——“被折扣却仍有代价”的轴(如光照)是模型改进的诊断信号,可反馈到训练数据增强或损失设计,把审计输出变成训练建议。第四,方法学扩展:用真实 FR 嵌入重校准可检测性以消除 0.236 的美化偏差;用多锚点组合或核化读取聚合散布在众多维度上的细粒度面部几何,缓解窄鼻梁、高颧骨这类在两个空间都处于随机水平(0.42–0.50)属性不可测的问题;把框架迁移到其他验证型生物特征模型(说话人识别、步态);以置信区间取代点秩相关,让审计结论带上统计保证;RFW 分种族选择 τ=0.92 的结果也暗示可直接接入公平性合规流水线。

复现评估

复现条件良好。代码已开源(github.com/gurayozgur/EXPL-FR);核心训练轻量:适配器约 1.05M 参数,输入输出都是冻结嵌入、不需处理图像像素,batch 1024、50 epochs、Adam 学习率 10⁻³,单张消费级 GPU 即可;978 提示词/22 类词表与全部验证提示词(CelebA 每属性 1 条、GAN-Control 41 条、RFW 每族裔 3 条)论文中完整给出。数据方面 CelebA、GAN-Control、RFW、DCMorph、LFW 系列基准均公开,AdaFace/ResNet 权重与 CLIP、SigLIP 检查点公开;唯一门槛是 WebFace4M 需申请,但按论文设定(任意身份标注人脸集+身份不相交 10% holdout)可替代。工程难点在审计侧:复现 KS dependence、GAN-Control 8 条遍历协议、RFW 分种族子集与条件化秩相关检验需要不少胶水代码,但论文对每步描述具体、显著性给精确值(如 n=4 置换 p=0.042、联合 p=1.2×10⁻⁵)。总体:复现主表(Table 1)难度低,完整复现审计基准难度中等,结果可信度较高。