番茄、土豆和洋葱:质疑人脸活体检测中对人脸的依赖 Tomatoes, Potatoes, and Onions: Questioning the Need for Faces in Face Presentation Attack Detection
仅用蔬菜训练的活体检测器在人脸基准达92.7% AUC,证明PAD学的是采集伪影而非人脸
前置知识
呈现攻击检测(PAD)
PAD(Presentation Attack Detection,又称人脸反欺骗 FAS)是判断摄像头前呈现的是真人还是攻击媒介(打印照片、屏幕回放视频、3D 面具等)的技术,是人脸识别系统的安全前置模块。模型输入人脸图像,输出 bona fide(真实呈现)或攻击的二分类分数。
本文质疑的核心正是:PAD 模型是否真的需要“人脸”才能学会区分真伪,理解 PAD 的任务定义是读懂全文的前提。
呈现攻击仪器(PAI)
PAI(Presentation Attack Instrument)指实施攻击所用的物理媒介与管线,如打印机(半调纹理、纸张质感)、显示器(摩尔纹、像素结构)以及二次拍摄引入的镜面高光、gamma 失真和重采样噪声。这些痕迹属于采集管线本身,而非被拍摄的物体。
本文的中心论点是 PAD 学到的主要是 PAI 痕迹,作者用蔬菜数据把这一直觉转化为可检验的实验。
跨数据集泛化与域偏移
指在数据集 A 上训练的检测器在数据集 B 上测试时性能大幅下降的现象。社区通常归因于人脸域偏移(受试者、传感器、光照、背景不同),并用域泛化、对抗对齐、元学习等方法应对。常用协议是在 MSU-MFSD、CASIA-FASD、Idiap Replay-Attack、OULU-NPU 四个基准间留一测试。
本文重新解释了跨数据集退化的根源:偏移的可能主要是 PAI 和采集管线而非人脸,这一立场贯穿所有实验设计。
LoRA 参数高效微调
LoRA 冻结预训练权重,在注意力层的投影矩阵旁注入低秩矩阵 $\Delta W = BA$(秩 $r$ 远小于原维度),只训练 $B$、$A$ 与任务头。秩稳定化 LoRA 还引入缩放与 dropout 以稳定训练。本文在 CLIP ViT-B/16 全部 12 个注意力块的 query/value 投影上加 $r=8$、$\alpha=8$ 的 LoRA,可训练参数仅约 0.30M。
本文检测器完全建立在 CLIP+LoRA 之上,低参数量也让统一优化预算的公平对比变得可行。
AUC 与 HTER 指标
AUC 是 ROC 曲线下面积,衡量分数对 bona fide 与攻击的排序判别力,与阈值无关。HTER 在目标集等错误率阈值处取 $\text{HTER} = (\text{APCER}+\text{BPCER})/2$,即攻击误通过率与真人误拒率的均值,是跨数据集 PAD 的常规报告指标。
论文所有结论以这两个指标量化,理解二者差异才能正确解读“校准不迁移但 AUC 有效”的辩护。
研究动机
人脸 PAD 长期被当作“人脸专属”问题:模型在人脸数据集上训练,在 MSU-MFSD、CASIA-FASD、Idiap Replay-Attack、OULU-NPU 四个基准间做跨数据集测试,性能骤降被归因于人脸域偏移(受试者、人口统计、光照、传感器、背景不同)。这一框架有实际后果:为缩小差距,社区不断收集更大的人脸语料,但真实人脸图像牵涉知情同意、GDPR 隐私负担与人口统计偏差,还催生了人脸专用架构以及面部深度、远程光电容积描记(rPPG)等辅助监督。更根本的问题在于,打印的半调纹理、屏幕的摩尔纹、重采集噪声等关键视觉伪影本来就不是人脸特有的属性,而整个研究生态(数据集、基准、公平性研究、专用架构)都建立在“人脸是核心”这一未经检验的前提上。
本文的目标是本文的目标是以“最强形式”检验一个可证伪命题:PAD 检测器是否必须见到人脸才能学会检测呈现攻击。具体拆解为三个问题:其一,只用完全无人脸的蔬菜数据集 TPO(番茄、土豆、洋葱)训练的检测器,能否在四个标准人脸跨数据集基准上取得有竞争力的性能;其二,方向反过来,用人脸数据训练的模型能否迁移到蔬菜呈现攻击上,以判断学到的表示究竟编码了呈现过程还是物体语义;其三,在固定优化预算下,把 TPO 混入常规人脸训练能否带来一致提升,以此区分无脸数据提供的是互补信息还是仅仅增加了训练样本。作者还希望量化迁移的边界条件:哪些攻击类型、物体类别与数据规模是必需的,从而为隐私友好、身份无关的 PAD 研究奠定实证基础。
与已有工作不同的是,已有两条减轻人脸数据负担的研究路线:一是合成人脸数据,SynthASpoof 用生成人脸替代真实受试者,证明身份对 PAD 训练非必需,甚至出现了完全基于合成数据的竞赛;二是基础模型,FoundPAD 表明 CLIP+LoRA 参数高效微调在低数据 PAD 场景泛化能力强,MMDA 等多模态方法领先跨域榜单。但这两条路线仍以“人脸外观”为载体。本文的独特切入在于再往前推一步:连人脸本身也去掉,用蔬菜作为呈现物体,把“PAD 本质是重采集伪影检测”从一种直觉转化为可量化、可证伪的立场主张。作者还通过架构匹配的 ImageNet 预训练对照分离“通用表示先验”与“预训练见过人脸”两个因素,并用嵌入可视化和频谱残差分析排除单频域捷径解释,这一系统性的跨物体迁移检验在此前文献中从未出现。
核心方法
直觉层面:打印、回放、重采集引入的伪影(摩尔纹与亚像素结构、半调与纸张纹理、镜面高光、gamma 失真、重采集噪声)属于采集管线的属性而非被拍摄物体的属性,因此任意物体经过同样的 bona fide 采集与攻击流程,都应能教会检测器同样的判别线索。技术上,作者构建 TPO 数据集并采用 FoundPAD 式架构:冻结的 CLIP ViT-B/16 骨干,在全部 12 个注意力块的 query/value 投影上加秩稳定化 LoRA($r=8$、$\alpha=8$、dropout 0.4),接 L2 归一化嵌入上的二分类线性头,可训练参数仅约 0.30M。所有实验统一约 11,000 步的先验固定优化预算(约 53 万采样视图、batch 48),按 $\text{clip}(\text{round}(530000/N), 2, 60)$ 个 epoch 实现,seed 777;并把 ImageNet 归一化修正为 CLIP 原生通道统计,所有基线包括人脸模型都在修正后重训。
核心创新是“跨物体迁移测试”这一实验设计:保持 bona fide 采集与打印/回放攻击流程完全不变,只把被摄物体从人脸换成蔬菜,若只学过蔬菜的检测器仍能在人脸基准上工作,则说明其编码的是呈现过程线索而非人脸语义。这与 SynthASpoof 的本质区别在于:合成人脸数据仍保留人脸外观,只是身份是假的;TPO 则彻底移除人脸内容,是首个完全无人脸的 PAD 训练集。第二层创新是对“跨数据集域偏移”的重新解释:偏移的主体可能是 PAI 与采集管线而非人脸本身,因此基准与域泛化方法应当区分“跨人脸泛化”与“跨打印机/传感器泛化”。第三层是先验知识轴的发现:迁移成功更依赖 CLIP 这类通用表示先验——架构匹配的 ImageNet ViT 在相同 TPO 数据上只有 67.81% AUC,而 CLIP+LoRA 达 92.70%,说明仅有“预训练见过人脸和屏幕”不足以解释结果。
方法步骤详情
数据构建:每种蔬菜 26 个实物、共 78 个物体身份;每身份在室内受控光下取约四个正交视角,用 Surface 平板与 Galaxy 手机在近/远两种尺度拍摄,每组合录至少 5 秒视频加一张静图,得到 1,248 条 bona fide 视频与 1,248 张静图。打印攻击把静图印在 A4 纸(Konica Minolta C450i,600×600 dpi)后重拍;回放攻击在一台设备上显示 bona fide 视频再用另一台设备在关灯房间录制,分割不重编码以保留压缩痕迹;两种 PAI 经设备×尺度×身份×视角全交叉各得 4,992 条攻击视频,共 12,480 个演示。帧构建:每条视频在中间 80% 时长均匀抽 5 帧,存 256×256,共 57,408 张训练图;输入缩放到 224×224,不做人脸检测,增广含水平翻转、高斯噪声、亮度与 RGB 偏移、$[0.5,1.5]$ gamma。训练用 AdamW($\beta_1=0.9$、$\beta_2=0.999$、权重衰减 $5\times10^{-5}$、梯度裁剪 5、batch 48),LoRA 学习率 $5\times10^{-6}$、头 $10^{-4}$,逆类频率采样。评估以视频级 AUC 与 $\text{HTER}=(\text{APCER}+\text{BPCER})/2$ 报告,MCIO 为四目标集均值,任何结果均不在同一数据集上训练加测试。
技术新颖性
技术新颖性体现在四个层面。数据集层面:TPO 是首个刻意完全无人脸的 PAD 语料(12,480 个演示),采集协议刻意镜像人脸 PAD 数据集的结构(bona fide 拍摄 + 打印/回放重采集),使跨物体迁移测试第一次成为可操作的实验。协议层面:所有对比在事先固定的统一优化预算(约 11,000 步、53 万采样视图)下进行,避免“数据量大者胜”的不公平比较,且完整公开训练、评估与跨数据集协议。对照设计层面:用架构匹配的 ImageNet-21k ViT-B/16 全量微调作为先验知识轴对照,把“CLIP 通用表示”与“预训练见过人脸”的贡献分离,并统一修正归一化统计后重训所有 FoundPAD 结果。分析层面:用 PCA(50 维)加固定种子 t-SNE 的嵌入可视化展示呈现状态跨物体域的一致分离;对每类 400 帧做灰度化、Hann 窗、径向平均对数幅度 FFT,展示攻击减 bona fide 的频谱残差在各数据集方向不一致,从而排除“单一全局频谱捷径”这一最简单的替代解释。这些设计共同把一个哲学立场转化为严格的实证工作。
实验结果
核心结果有六点。(1) 仅用 TPO 训练的 FoundPAD 在 MCIO 四个人脸基准上达平均 92.70% AUC、14.15% HTER(M/C/I/O 分别为 91.01/95.98/94.08/89.74),显著超过零样本 CLIP 的 67.72%,也超过 SynthASpoof 合成脸训练的 81.02%,与单源真实人脸训练相当或更好,尽管从未在训练中见过人脸。(2) 架构匹配的 ImageNet-21k ViT-B/16 在同一 TPO 数据上仅 67.81% AUC,凸显 CLIP 通用表示先验的决定性作用。(3) 反向迁移较弱但高于随机:单源人脸模型在 TPO 上为 58.89%–89.88% AUC(C→TPO 最差,O→TPO 最高 89.88%),几乎都高于零样本;多源人脸模型在 TPO 上为 71.19%–82.92%。(4) 固定预算下用 TPO 替换部分人脸采样:单源十二协议平均 AUC 89.33%→92.55%、HTER 17.54%→13.97%;双/三源设定下 92.11%→96.96%、HTER 14.72%→7.84%,说明无脸数据提供互补信息。(5) 消融显示攻击类型多样性比数据量更重要:仅打印 86.14%、仅回放 83.97%,单类蔬菜 82.90%–91.78%(洋葱最高),而仅用 10% 帧仍达 92.97%。(6) 嵌入分析显示 bona fide/攻击呈跨域一致分离,但各数据集频谱残差方向不一致,排除单一全局频率捷径。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 跨数据集人脸 PAD(仅用无脸数据训练,MCIO 平均) | 视频级 AUC / HTER | 92.70% AUC、14.15% HTER(TPO 训练 FoundPAD) | 零样本 CLIP ViT-B/16 67.72% AUC;ImageNet ViT-B/16 训练于 TPO 仅 67.81% | 较零样本与架构匹配对照提升约 25 个 AUC 点 |
| 无脸蔬菜数据 vs 合成人脸数据训练 | MCIO 平均 AUC | TPO 训练 92.70% | SynthASpoof 合成脸训练 81.02% | +11.68 个 AUC 点,表明保留真实呈现伪影比保留人脸外观更重要 |
| 单源人脸训练中替换部分预算为 TPO(12 个协议) | 平均 AUC / HTER | face+TPO 92.55% AUC、13.97% HTER | face only 89.33% AUC、17.54% HTER | +3.22 AUC、−3.57 HTER |
| 双/三源人脸训练中替换部分预算为 TPO(6 个协议) | 平均 AUC / HTER | face+TPO 96.96% AUC、7.84% HTER | face only 92.11% AUC、14.72% HTER | +4.85 AUC、−6.88 HTER |
局限与改进
作者明确承认的局限:结论仅覆盖可见光谱下的打印与回放攻击,对 3D 面具等依赖物体三维几何的攻击、以及深度/红外模态是否成立仍是开放问题;CLIP 预训练语料包含网络人脸图像,因此主张的是“减少敏感数据收集”而非完全无人脸系统;人口统计公平性只是理论推断(无脸数据无人口属性可失衡),文中未做实证分析。我补充的观察:其一,阈值校准不跨域,文中以 AUC 回避,但实际部署依赖的 HTER 在困难方向上很高(如 C→TPO 的 46.53% HTER);其二,TPO 物体基本静态,仅用 10% 帧即达 92.97%,说明模型没有利用微运动、rPPG 等动态线索,而这恰是部分人脸 PAD 方法的核心信号,结论未必外推到依赖时序信息的方法;其三,采集局限于同一房间、两种消费级设备、受控光照,PAI 与环境覆盖仍窄;其四,各项性能差距(如 89.33% vs 92.55%)未报告统计显著性检验,部分提升幅度较小。
独立分析的弱点
弱点一:预训练污染无法完全排除——CLIP 可能在网络图像中见过打印/屏幕/重采集伪影场景,虽然 ImageNet 对照较弱说明“仅见过”不够,但未证明 CLIP 表示与 TPO 攻击分布无重叠;改进方向是用 DINOv2、MAE 等不同预训练目标做系统消融,或构造预训练中不存在的伪影类型。弱点二:攻击面窄——真实移动端金融场景的威胁包括 3D 面具、化妆攻击与数字注入攻击,蔬菜训练对这些攻击的适用性完全未知;应在至少一种非 print/replay 攻击上做压力测试再下结论。弱点三:架构单一——所有结论建立在 CLIP+LoRA 上,未验证传统纹理/LBP 方法或监督 CNN 是否同样能跨物体迁移,存在“结论绑定于基础模型”的风险;应加入至少一个非基础模型基线。弱点四:数据域覆盖窄——单房间、两种设备、静态物体、受控光照,与真实部署的多传感器、多光照、多攻击者差距大;可扩展为多站点、多设备协作采集。弱点五:混合实验只测试了“等预算替换”策略,未探索人脸与 TPO 的最优配比、课程学习顺序或加权采样,互补性的机制(哪些伪影由无脸数据补充)仍停留在频谱分析的定性层面。
未来方向
作者提出的研究方向:构建刻意多样化、无人脸的“伪影”语料库,横跨多种物体、打印机、显示器与相机,并公开采集协议;刻画哪些物理重采集属性(摩尔纹、半调、镜面性、噪声)真正驱动迁移;检验该解释能否扩展到深度、红外等成像模态以及 3D 面具等物体几何起决定作用的攻击;研究成功的人脸无关 PAD 所需的最小表示先验。基于本文成果还可延伸:系统扫描人脸与 TPO 数据的混合比例与课程策略,寻找最优配比并解释收益来源;把 TPO 用作域泛化方法的审计基准,检验现有方法是否真的在解决“跨 PAI 泛化”而非“跨人脸泛化”;在无脸数据上实证人口统计公平性承诺;利用“呈现状态在嵌入空间跨物体可分”的发现做开放集攻击类型识别或 PAI 指纹溯源;以及在动态物体(如手持移动的物体、人手持物)数据上探索时序与运动线索对结论的补充或修正。
复现评估
复现条件较好。数据方面:TPO 数据集已在 GitHub(gurayozgur/TPO)公开,附完整训练、评估与跨数据集协议;对比用的人脸数据集与 SynthASpoof 均为公开资源,但人脸数据集需按各自许可申请,构成一定行政门槛。代码与方法方面:检测器基于公开的 FoundPAD(CLIP ViT-B/16 + 秩稳定化 LoRA),论文给出全部超参——$r=8$、$\alpha=8$、dropout 0.4、LoRA 学习率 $5\times10^{-6}$、AdamW、batch 48、seed 777、预算公式 $\text{clip}(\text{round}(530000/N),2,60)$,以及 CLIP 原生归一化修正的具体数值,透明度高。算力门槛低:仅约 0.30M 可训练参数、约 1.1 万步优化,单张消费级 GPU 数小时即可复现主要结果;作者还报告所有运行训练交叉熵低于 0.05,收敛充分。主要不确定性是若复刻 TPO 自采数据,设备与光照差异会引入变体。总体复现难度中低。
论文图表
上排展示 TPO 数据集样例(番茄、土豆、洋葱的 bona fide 拍摄及打印/回放攻击),下排展示 Idiap Replay-Attack 人脸数据集的对应样例。两类数据的 PAD 结构完全相同:bona fide 相机观察 + 经第二台相机重采集的打印或显示攻击,唯一区别是被摄物体从人脸换成了蔬菜。图注还给出数据集开源地址。
这张图直观呈现了论文的实验控制逻辑:物体改变而采集与攻击流程保持不变,正是“跨物体迁移测试”成立的视觉证据,读者一眼即可理解 TPO 与标准人脸 PAD 数据集的同构性。