EXPL-FR:通过视觉-语言对齐解释人脸识别模型 EXPL-FR: Explaining Face Recognition Models via Vision-Language Alignment
轻量适配器把冻结视觉-语言模型对齐到冻结人脸识别空间,提示词变语义锚点,无标注完成解释与审计。
前置知识
视觉-语言模型(VLM)与模态鸿沟
CLIP 这类视觉-语言模型用对比学习同时预训练图像编码器 $\phi_v$ 和文本编码器 $\phi_t$,使两者输出共享同一个 $d$ 维空间中的向量:匹配的图文对余弦相似度被拉大,因此一句“a photo of a person wearing glasses”这样的提示可以按语义给图像排序。但两个模态的嵌入分布并不完全重合,存在系统性偏移(modality gap),同概念的图文嵌入对齐是不完美的。
本文方法的转折点完全建立在“图像上训练的适配器可以直接用在文本嵌入上”这一假设之上;不理解 VLM 图文共享空间及其不完美耦合,就无法理解迁移为何可能(Eq.3)、又为何不完美(Table 1 第6行与第7行的差距)。
深度人脸识别(FR)嵌入空间
FR 编码器 $\psi$ 把人脸图像映射为 $\ell_2$ 归一化后的单位向量,用 margin 损失在 WebFace4M/MS1MV2 这类网络级身份数据上训练,使同身份对余弦距离小、异身份对大,在 LFW 等基准上准确率接近饱和(本文主模型 AdaFace 五基准均值 97.44%)。它是纯特征提取器,没有分类头和决策层。
EXPL-FR 的目标就是在这个黑盒特征空间内部命名方向:所有解释与审计统计量都定义在 FR 嵌入而非 VLM 嵌入上;必须知道这个空间被训练成什么样(身份判别、为不变性丢弃捕获因素),才能理解论文“保留/折扣”的核心叙事。
适配器(Adapter,事后对齐模块)
插在两个冻结预训练模型之间的小型可训练模块,本文中是一个约 1.05M 参数的 4 层 MLP,把 VLM 图像嵌入映射到 FR 嵌入,原模型参数完全不动,属于事后(post-hoc)技术。训练只用成对的冻结嵌入和余弦对齐损失,参数量比任一编码器小几个数量级。
适配器是整个框架唯一被学习的组件,它的训练数据(只有人脸图像、无文本)、损失(余弦方向对齐)与模型选择方式(held-out 1:1 验证)决定了方法“无需白盒访问、无需属性标注”的定位,也是它与概念瓶颈类解释方法的本质区别。
1:1 验证协议与 TAR@FAR、EER
人脸验证的标准评测:1:1 协议判断一对图像是否同身份,报告十折准确率(LFW、AgeDB-30、CFP-FP 等);TAR@FAR=1e-4 表示在极严假接受率下的真接受率(IJB-B/C 模板协议);EER 是等错误率,用于刻画“隔离单一属性的验证协议”的难度——某属性变化的真实代价越大,对应协议 EER 越高。
本文的验证哲学是“以真实验证行为为金标准”:对齐质量靠把流水线插进 1:1 验证来度量(Table 1),审计结论靠与真实分种族验证错误率和分属性 EER 的秩相关来检验(Fig.4);不熟悉这些指标就读不懂核心实验。
可检测性与均值差探测器(AUC)
衡量“某概念在某空间里是否仍可分离”:用 VLM 的中心化 grounding 分数 $r_k(\mathbf{x})=\langle \bar{\mathbf{e}}_v(\mathbf{x}),\,\bar{\mathbf{e}}_t^k-\mu_t\rangle$ 给每个概念的高低两端伪标注,在一半身份上拟合均值差探测器、在另一半上测试,报告 AUC。分别在 VLM 空间($\mathrm{AUC}^V$,结构性近饱和 0.976)与适配器映射后的空间($\mathrm{AUC}^F$)各算一次,两者之差即为该概念在 FR 空间的“折扣”上界。
这是论文无标注选择语义签名(top-100 提示词)的机制,也是审计框架的核心统计量;“保留 vs 折扣”的全部定量讨论都建立在这对 AUC 的对比上。
KS 统计量(双样本分布距离)
Kolmogorov–Smirnov 统计量是两条经验累积分布函数的最大垂直距离,取值 [0,1],越大说明两个分布差异越大。论文用它度量某属性对 FR 空间结构的强度(dependence 统计量):把图像按该概念分成两组,比较组内与组间 FR 余弦距离分布,差异越大说明该属性越强地塑造身份几何。
dependence 是四个审计统计量之一,直接对应 RFW 分种族模型选择与 CelebA 属性排序实验;其无标注版本与有标签版本 Spearman 0.64 的相关性,是“无监督审计可替代监督审计”结论的关键证据。
研究动机
深度人脸识别(FR)模型部署在边检、设备解锁、门禁等高风险场景,一次验证决策可能带来法律、金融或安全后果。现代模型用 margin 损失在网级身份数据上训练,标准基准已接近饱和(本文主模型 AdaFace ViT-B/WebFace4M 在 LFW、AgeDB-30 等五个基准的平均 1:1 验证准确率达 97.44%),但从业者拿到的只是一个相似度分数:无法追问“这个决策依赖了哪些语义属性”,与生物识别领域日益提高的透明度和监管要求相冲突。已有可解释 FR(XFR)工作大多停留在空间或几何层面——用 inpainting 打 saliency 分数、对余弦分数做 patch-pair 分解、把神经元绑定到人工标注的“Face Dictionary”——它们回答的是“模型看了哪里”,而不是“依赖了哪个具名概念”。语义化路线中最接近的 Leroy et al. 需要CelebA 每图 40 个标注、可控生成器 GAN-Control,且词表被标注覆盖面限死,成本高、也无法解释单张图像。
本文的目标是本文要构建一座严格事后(post-hoc)的桥,把开放的自然语言词表引入冻结、黑盒的 FR 嵌入空间,使“解释人脸识别模型”不需要触碰模型内部、不需要梯度或白盒访问、也不需要逐图属性标注。具体拆成四件事:第一,学习一个轻量适配器把冻结 VLM 的图像空间与 FR 空间对齐,并验证它能零成本迁移到文本,把任意提示词变成 FR 空间中的语义锚点;第二,提出无标注的可检测性度量,识别每个模型“保留的身份判别属性”,取前 100 个构成可读的语义签名(semantic signature);第三,提供逐图、身份级、真实/冒名者/变形图(genuine/imposter/morph)差分三种层面的解释;第四,构建三种监督水平(人工标注、VLM 伪标注、纯提示词)下的属性级审计基准,用真实验证行为检验,量化监督成本与审计质量的权衡。
与已有工作不同的是,此前连接 VLM 与可解释性的路径各有死角:概念瓶颈/探针方法要把分类器决策路由过具名概念,需要决策层,而部署中的 FR 编码器是纯特征提取器;adapter 类方法(CLIPface 等)在 CLIP 自己的空间内为任务性能改造 CLIP,不产生对目标模型的解释;基于 LLM 的 FR 解释让第二个模型去描述人脸,全部推理发生在 VLM 自己的空间里——描述的是脸,不是匹配器。机制上最接近的 LaVMD 依赖共享分类头和封闭标签集,FR 编码器两者都没有。真正缺失的是“从语言进入已经冻结的 FR 空间”的桥:独立训练的两个编码器先验上不可比(本文未对齐交叉验证只有 50.29%,等同随机)。本文的独特切入有二:其一,只训练图像侧适配器,利用 VLM 内部图文共享空间让文本方向“搭便车”;其二,把“FR 模型靠丢弃身份跨越因素挣得不变性”当作一等研究对象——保留/折扣结构本身就是解释应阅读的坐标系和审计要测量的对象。
核心方法
直觉上,VLM 知道“人脸长什么样”——它能按任何写出的概念给人脸排序;FR 模型知道“这是谁”——其嵌入编码了身份结构。若一个小适配器 $g_\theta$ 能把 VLM 图像嵌入映射到 FR 嵌入,那么由于 CLIP 图文编码器本就被对比预训练推入同一空间,同一个 $g_\theta$ 应能将文本提示嵌入也送进 FR 空间,使每条提示词成为一个语义锚点,任意词表由此可在 FR 空间内命名方向。技术路线四步:(1)冻结两个编码器,在 WebFace4M 成对冻结图像嵌入上以余弦对齐损失训练 4 层 MLP(约 1.05M 参数);(2)将 22 类共 978 条冻结提示词过同一适配器得到单位锚点;(3)用无标注可检测性 AUC 比较每个提示在 VLM 空间与映射后空间的表现,保留前 100;(4)人脸在锚点上的投影构成语义签名,支撑三级解释与模型审计。全程仅适配器被学习,FR 模型视为黑盒,无提示词参与训练。
核心创新落在两个经验发现上。其一,图像专用适配器零样本迁移到文本:$g_\theta$ 只见过成对图像嵌入、从未见过任何文本,但它只是 $\mathbb{R}^d$ 上的一个学到的函数,而提示词嵌入 $\bar{\mathbf{e}}_t^k$ 就住在同一空间;因为 VLM 的图文编码器在对比预训练中被推到一起,$g_\theta$ 会把概念的文本嵌入映射到与该概念图像一致的位置。Table 1 中同一 978 提示词词表在 VLM 原生空间投影只有 51.98% 的身份验证能力,经图像训练的适配器映射后达 71.66%(+19.68 个点),这一差距就是对从未被监督的跨模态迁移的最干净测量。其二,“FR 模型的不变性是挣来的”:为了跨姿态、表情、光照、采集条件验证身份,模型必须丢弃这些因素,于是映射后只有部分概念仍可检测——眼镜(0.955)、发色(0.947)几乎无损存活,距离(0.853)、光照、场景语境被折扣最多。与已有工作的本质区别:解释读的是 FR 模型自己的坐标,为匹配器本身作答;且保留/折扣结构不是要丢弃的噪声,而是可量化、可审计的研究对象。
方法步骤详情
第一步(对齐训练):取 WebFace4M 成对冻结嵌入(仅人脸图像,无标签无文本),损失 $\mathcal{L}=\frac{1}{N}\sum_i\langle\overline{g_\theta(\bar{\mathbf{e}}_v^i)},\bar{\mathbf{f}}_i\rangle$ 只对齐方向不罚幅度;适配器为 4 层 MLP(无偏置线性+BatchNorm+GELU 堆叠),约 1.05M 参数;Adam、学习率 $10^{-3}$ 余弦退火、batch 1024、50 epochs,每轮在身份不相交的 10% held-out 上做 1:1 验证选检查点。第二步(锚点生成):$\mathbf{p}_k=g_\theta(\bar{\mathbf{e}}_t^k)/\|g_\theta(\bar{\mathbf{e}}_t^k)\|$,978 条提示离线一次算完。第三步(签名选择):VLM grounding 分数伪标注概念两端,均值差探测器在身份两半上拟合/测试,得 $\mathrm{AUC}^V$ 与映射后的 $\mathrm{AUC}^F$,按后者取 top $m=100$ 为身份判别属性集 $K_\psi$。第四步(阅读与审计):签名 $s(\mathbf{x})=[\langle\bar{\mathbf{f}}(\mathbf{x}),\mathbf{p}_k\rangle]$,逐图按幅值排序、身份级取注册图均值、差分为 $\Delta_k=s_k(x_a)-s_k(x_b)$;审计以三种方式构造轴(标签均值差、伪标注分位数组均值差、有序提示集 PC1),计算 dependence(KS)、sensitivity $|\langle\Delta,\hat{\mathbf{a}}\rangle|$、attribution(八选一 top-1),并与真实错误率、EER 做条件化秩相关检验。
技术新颖性
技术新颖性有三层。第一层在机制:据作者所知,这是首个用图像侧适配器把冻结黑盒 FR 空间与冻结 VLM 对齐、且对齐零样本迁移到文本的框架——机制上最接近的 LaVMD 依赖封闭标签集上的共享分类头,FR 编码器没有;CLIPface 等 adapter 方法在 CLIP 自己的空间内改造,不产生解释。第二层在度量:无标注可检测性度量把“FR 模型丢弃了某些属性”的模糊直觉变成逐提示、逐模型可比的排序,$\mathrm{AUC}^V-\mathrm{AUC}^F$ 的落差给出概念折扣的上界;选出的 top-100 签名在身份区分上反优于全 978 词表(0.931 vs 0.910),说明“选择”本身有价值;作者还主动测出映射度量的美化(真实 FR 重打分 0.740 vs 0.894)并证明偏差方向保守、排序保持(ρ=0.63–0.97),这种自我审视在同类工作中少见。第三层在评测:首次把属性级审计放在三种监督设定下基准化,量化监督成本-审计质量曲线(RFW 选择 τ=0.92 三设定一致,CelebA 逐属性 τ 从 0.63 降到 0.45);而先前工作只有一种需标注与可控生成器的设定,新属性在此只需一句话。
实验结果
Table 1(主模型 AdaFace ViT-B/WF4M + CLIP ViT-B/16):未对齐 FR×VLM 交叉验证仅 50.29%(随机水平,证明独立训练的两空间不可比);适配器对齐后混合配对达 94.56%,距 97.44% 的 FR 上界仅 2.88 点,在 IJB-B/C 模板协议上更反超 FR 参照(96.60/97.70 vs 95.58/97.18),唯一失败是低分辨率 TinyFace(rank-1 13.49 vs 73.77)。词表投影实验隔离出跨模态迁移:同一 978 提示词,VLM 空间投影仅 51.98%,经图像训练的适配器映射后达 71.66%(+19.68 点);对齐 VLM 自验证还把 CLIP 的身份信息从 82.33% 提到 92.58%。泛化上,四个 FR 目标的对齐自验证仅差 0.71 点,词表投影忠实性却差 5.61 点(R100:WF4M 75.18 vs MS1MV2 69.57),说明各模型暴露的可命名身份结构不同。可检测性(Fig.2):VLM 空间均值 0.976 vs FR 空间 0.79–0.98,眼镜 0.955、发色 0.947 存活,距离 0.853、光照被折扣;top-100 签名身份分离优于全词表(0.931 vs 0.910)。交叉验证(Fig.3):CelebA 40 属性锚点均值 AUC 0.64(金发 0.89 最高),dependence 排序对标签版 Spearman 0.64(p=1.0×10⁻⁵);GAN-Control 归因 35%(随机 12.5%),年龄达 82%。审计(Fig.4):三设定下 RFW 模型选择 Kendall τ 均为 0.92(联合 p=1.2×10⁻⁵),dependence 排名与真实错误率排名完全一致;纯提示诊断 ρ=0.95 反超有标签的 0.90;CelebA 替代监督审计逐属性 τ 为 0.63(伪标注)vs 0.45(纯提示)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 词表投影身份验证(LFW 等五基准均值) | 1:1 验证准确率 (%) | 71.66(978 提示经图像训练的适配器映射到 FR 空间) | 51.98(同一词表在 VLM 原生空间投影);FR 上界 97.44 | +19.68 点,干净隔离出未被监督的跨模态迁移 |
| 对齐交叉编码器验证(g_θ(φ_v)↔ψ) | 五基准平均准确率 (%) | 94.56(IJB-B/C TAR 达 96.60/97.70,超过 FR 参照) | 未对齐交叉编码器 50.29(随机);FR 自验证上界 97.44 | 较未对齐 +44.27 点,距上界仅 2.88 点 |
| 语义签名的身份可分性 | genuine/imposter AUC | 0.931(按 AUC^F 选 top-100 提示,主模型) | 0.910(全 978 提示词表);同规模随机子集更低 | +0.021,四个模型上均成立(如 0.958 vs 0.940) |
| RFW 无标注模型选择 | Kendall τ(审计排名 vs 真实分种族验证错误率) | 0.92(三种监督设定一致;非裔/高加索/印度裔 τ=1.0) | 先前实践需人口统计学标注;单组 τ=1.0 的置换检验 p=0.042 | 首次零标注完成模型选择,联合 p=1.2×10⁻⁵ |
| GAN-Control 模型诊断(哪类变化代价最大) | Spearman ρ(敏感度 vs 真实分属性 EER,n=8) | 0.95(纯提示词设定,主模型,p=5.7×10⁻⁴) | 0.90(有标签的先前实践)、0.83(VLM 伪标注) | 零标注设定反超监督设定,运行任何验证协议前即可诊断 |
| CelebA 属性 dependence 排序 | Spearman ρ(无标注 vs 有标签,n=40) | 0.64(p=1.0×10⁻⁵;其余目标 0.65/0.70) | Leroy et al. 需每图 40 个标注 + 可控生成器 | 仅用提示词与无标注图像复现了原本全监督的分析 |
局限与改进
作者承认的局限:其一,词表——FR 空间词表投影比 FR 上界低 25.78 点(97.44 vs 71.66),部分身份线索无法用语言命名;单概念提示词并不解耦(发型提示同时携带长度、体积、纹理),读数只是方向性的而非因果性的。其二,VLM——所有构造都继承 VLM 在对齐裁剪上能排序的内容,它理解不了的概念(头部姿态、光照、极端低分辨率)成为盲区,审计却仍返回看似有规律的值(姿态审计 τ=0.00/−1.0,无结论),双空间对比也只能不完整地标记它们(头部姿态 $\mathrm{AUC}^F\approx0.89$ 是伪阳性)。其三,度量——可检测性以 VLM 自己的伪标注为参照、再经适配器读取,存在系统性美化($\mathrm{AUC}^F$ 均值 0.894 vs 真实 FR 重打分 0.740),性别是唯一实质重排的属性(有标签得分仅 0.82)。我的补充:纯提示设定下 attribution 掉到 16–19%,接近 12.5% 随机水平;RFW 模型选择仅 4 个模型,统计功效偏弱;FR 目标全部是 AdaFace/ResNet 配 WebFace4M/MS1MV2,对其他训练管线的迁移未验证。
独立分析的弱点
弱点一:锚点质量瓶颈。词表投影距上界 25.78 点,相当一部分身份信息分布在语言无法瞄准的方向上;提示词不解耦,签名读数只能说“这张脸在长发方向分数高”,不能说“这是长发”。改进:对提示词库做正交化/去相关,或在适配器后加轻量文本侧精调,把方向性读数升级为可分离读数。弱点二:VLM 盲区可继承且难自查。头部姿态在 $\mathrm{AUC}^F\approx0.89$ 上伪阳性,光照被折扣却携带 0.13–0.29% 的真实 EER 代价,使用者可能把无意义的审计值当发现。改进:多 VLM 交叉验证(CLIP 与 SigLIP 分歧即报警),或要求“保留/折扣象限+小规模标注校准”双重确认后才输出该轴结论。弱点三:归因能力随监督骤降(82–90%/33–34%/16–19%,随机 12.5%),因后两者每属性只有单一伪标注轴,而 35% 的代理结果依赖 41 个组平均锚点;实践含义是审计可廉价扩展,但“是哪个属性造成的”在零标注下基本答不了。改进:对关键属性扩展提示词组(多措辞+多阶段词),逼近代理设定的组平均机制。弱点四:模型排名 n=4 统计功效弱,结论对更大模型池的外推性未知,应在更大模型动物园上复核 τ 稳定性。
未来方向
作者指出的方向是“扩展一次审计只需一句话”,由此自然延伸:第一,审计的广度——把 978 提示词的固定词表变成动态词表,监管方或部署方关心新属性(宗教头饰、口罩、医疗特征)时即写即测,立刻得到该轴的 dependence/sensitivity。第二,解释的深度——差分解释已展示 morph 的残差分歧能指认其继承自另一位贡献者的属性,可延伸到在线 morph 检测与生成式身份溯源。第三,审计闭环到训练——“被折扣却仍有代价”的轴(如光照)是模型改进的诊断信号,可反馈到训练数据增强或损失设计,把审计输出变成训练建议。第四,方法学扩展:用真实 FR 嵌入重校准可检测性以消除 0.236 的美化偏差;用多锚点组合或核化读取聚合散布在众多维度上的细粒度面部几何,缓解窄鼻梁、高颧骨这类在两个空间都处于随机水平(0.42–0.50)属性不可测的问题;把框架迁移到其他验证型生物特征模型(说话人识别、步态);以置信区间取代点秩相关,让审计结论带上统计保证;RFW 分种族选择 τ=0.92 的结果也暗示可直接接入公平性合规流水线。
复现评估
复现条件良好。代码已开源(github.com/gurayozgur/EXPL-FR);核心训练轻量:适配器约 1.05M 参数,输入输出都是冻结嵌入、不需处理图像像素,batch 1024、50 epochs、Adam 学习率 10⁻³,单张消费级 GPU 即可;978 提示词/22 类词表与全部验证提示词(CelebA 每属性 1 条、GAN-Control 41 条、RFW 每族裔 3 条)论文中完整给出。数据方面 CelebA、GAN-Control、RFW、DCMorph、LFW 系列基准均公开,AdaFace/ResNet 权重与 CLIP、SigLIP 检查点公开;唯一门槛是 WebFace4M 需申请,但按论文设定(任意身份标注人脸集+身份不相交 10% holdout)可替代。工程难点在审计侧:复现 KS dependence、GAN-Control 8 条遍历协议、RFW 分种族子集与条件化秩相关检验需要不少胶水代码,但论文对每步描述具体、显著性给精确值(如 n=4 置换 p=0.042、联合 p=1.2×10⁻⁵)。总体:复现主表(Table 1)难度低,完整复现审计基准难度中等,结果可信度较高。
论文图表