← 返回 2026-08-12

AdvFD:用对抗式 Fréchet 距离损失增强视觉生成 AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss

Mingju Gao, Jingkai Zhou, Kun Gai, Changqian Yu, Hao Tang 📅 2026-08-11 👍 26 2026-08-17 18:30
Fréchet距离 一步生成 分布匹配 后训练 对抗训练 扩散模型

用对抗学习的动态表征补足静态Fréchet目标盲区,抑制Fréchet hacking

前置知识

Fréchet 距离(FD / FID)

把真实图像集和生成图像集分别通过一个特征编码器,对两组特征各估计均值 $\mu$ 和协方差 $\Sigma$,各自近似为高斯分布后计算 $W_2^2$ 距离:$D_{FD}=\|\mu_p-\mu_q\|^2+\mathrm{Tr}(\Sigma_p+\Sigma_q-2(\Sigma_p\Sigma_q)^{1/2})$。它有封闭解、无需逐对比较样本,FID(用 Inception 编码器)是图像生成最常用的评价指标。

本文研究的问题正是把 FD 从评价指标变成训练目标后产生的副作用,全文的损失函数、评测指标(FID、FD-r6、FD-r3)都建立在这个公式上。

一步生成器与后训练(1-NFE post-training)

扩散/流模型原本需要几十到上百步迭代采样(多 NFE)。一步生成器(如 JiT、pixel MeanFlow/pMF)通过预训练加后训练,把采样压缩到单次前向(1-NFE)。传统后训练目标是样本级的(预测噪声、score 或速度),并不直接约束生成分布与真实分布的整体差异。

AdvFD 是一种生成器后训练方法,实验对象就是 JiT-B/L/H 和 pMF-B/L/H 六个一步生成器,且全程保持 1-NFE 采样不变。

FD-Loss(分布级训练目标)

FD-Loss(Yang et al., 2026)把 Fréchet 距离直接作为后训练损失:在若干冻结的预训练编码器(SigLIP、MAE、Inception,简称 SIM)特征空间中最小化真实/生成特征分布的一、二阶统计量差异。相比样本级损失,它提供分布层面的监督信号,不需要配对目标或教师蒸馏。

AdvFD 是在 FD-Loss 基础上的改进:保留其静态 SIM 编码器项,只新增一条对抗表征分支,实验对比的基线就是 FD-Loss。

极小极大对抗博弈(GAN 式 min–max)

两个玩家交替优化同一目标的相反方向:一个最大化、一个最小化。经典 GAN 中判别器给样本打分以区分真假,生成器则骗过判别器;WGAN 用满足 1-Lipschitz 约束的 critic 逼近 Wasserstein 距离的 Kantorovich 对偶形式 $\sup_{\|f\|_{Lip\le1}}\mathbb{E}_p f-\mathbb{E}_q f$。

AdvFD 的 D-step/G-step 就是这种交替结构,但其内层学习的对象与 GAN 有本质区别(学比较几何而非打分函数),理解这一对照是读懂第 4.2 节和附录 C 的关键。

特征白化(whitening)

对特征做仿射变换 $\bar\psi(x)=(\psi(x)-\mu_p)(\Sigma_p+\epsilon I)^{-1/2}$,使其均值为 0、协方差近似单位阵,从而消除各方向的尺度和相关性差异。本文只对真实特征做白化,并以 EMA 统计量估计 $\mu_p,\Sigma_p$,用 $\epsilon=10^{-3}$ 防止病态方向被过度放大。

原始 FD 满足 $D_{FD}^{c\psi}=c^2D_{FD}^{\psi}$,对抗表征可以靠单纯放大特征范数作弊;白化正是 AdvFD 能够稳定进行 min–max 训练的核心保险,消融显示去掉它训练会完全崩溃。

研究动机

扩散和流匹配模型的常规训练目标(预测噪声、score 或速度)都是样本级的,并不直接最小化生成分布与真实分布之间的整体差异。FD-Loss 首次把 Fréchet 距离引入生成器后训练:在冻结的预训练编码器(Inception、SigLIP、MAE)特征空间中对齐两组特征的一、二阶统计量,效果显著。但作者发现训练指标可以持续下降而视觉质量不升反降,并将其命名为 Fréchet hacking。论文给出两个直接证据:其一,冻结一个 pMF-B 生成器、只学习一个通用扰动去压低 Inception FID,FID 从 3.31 降到 2.56,但图像出现了肉眼清晰可见的高频伪影,说明静态表征存在可利用的盲方向;其二,在 JiT-B 的 FD-Inception 后训练过程中,从 50k 到 75k 步,训练所用的 FD-r-Inception 下降 29.4%,而完全未参与训练的 FD-r-CLIP 反而恶化 8.5%。也就是说,生成器在刻意讨好被选定的特征空间,人眼和其他编码器能看到的缺陷始终没有被惩罚。

本文的目标是本文的目标是在保持一步生成(1-NFE)与 FD-Loss 训练范式简单性的前提下,根除静态表征目标带来的 Fréchet hacking。具体做法是:为静态冻结编码器集合(SIM,即 SigLIP+Inception+MAE)补充一个可学习的对抗表征,它随生成分布的演化而更新,持续暴露真实分布与生成分布之间尚未被固定编码器察觉的残差差异,并把它们放大进 Fréchet 目标迫使生成器修复;同时引入 real-feature whitening 校准这个自适应特征空间的尺度与协方差几何,防止对抗表征通过单纯放大特征范数来作弊,从而得到一个稳定可行的 min–max 训练流程。最终检验标准是:提升不仅要体现在训练所用表征上,还必须同步泛化到训练中未使用的 held-out 编码器(CLIP、ConvNeXt、DINOv2)上。

与已有工作不同的是,现有补救路线大致有三类:往静态集合里加更多冻结编码器(仍是静态,且计算和显存成本随编码器数量线性增长);引入外部评论家信号(如 PatchGAN 的 patch 级判别器、DMD 式分布匹配蒸馏的对抗反馈);或像 RLHF 一样直接优化学习到的奖励。本文实验表明前两类外部信号并不能稳定改善 held-out Fréchet 指标。与 WGAN 等经典对抗方法的区别则更根本:GAN 的 critic 学的是在固定样本几何下给样本打分的标量对偶势函数,而 AdvFD 学习的是比较几何本身——表征 $\psi_\omega$ 决定哪些图像差异会被反映到特征均值 $\mu$ 和协方差 $\Sigma$ 中,而比较两组统计量的高斯传输泛函 $W_2^2$ 始终保持封闭形式不变。一句话概括:WGAN 是固定几何学势函数,AdvFD 是学习几何、固定泛函,这个切入角度是本文独有的。

核心方法

直觉上,AdvFD 把静态考卷换成了考官也会升级的考卷:生成器一边在固定编码器集合上最小化 Fréchet 距离,一边面对一个可学习的对抗表征,后者专门寻找当前生成分布与真实分布之间残留的、静态编码器看不见的差异,并把它们放大到 Fréchet 目标里,迫使生成器逐轮修复。技术上,设 $p$ 为真实分布、$q_\theta$ 为生成器诱导的分布,静态项 $D_{\text{static}}(p,q_\theta)=\sum_{\phi\in\mathcal{F}}\lambda_\phi D^\phi_{FD}(p,q_\theta)$ 遍历冻结编码器集合 $\mathcal{F}$(SIM);自适应项 $D_{\text{adv}}(p,q_\theta;\omega)$ 是白化后对抗表征 $\bar\psi_\omega$ 下的 Fréchet 距离。训练在两类更新之间交替:G-step 中冻结全部表征,生成器最小化 $\mathcal{L}_t(\theta;\omega_t)=D_{\text{static}}+\lambda_{\text{adv}}D_{\text{adv}}$,把两族特征分布拉近;D-step 中冻结生成器并 detach 生成样本,对抗表征更新参数以最大化 $D_{\text{adv}}$,把分布推开以暴露残差差异。这构成特征空间里的 GAN 式博弈,但比较工具始终是封闭形式的 $W_2^2$。

核心创新有三点。第一,提出并系统实证 Fréchet hacking 现象:把静态预训练特征空间当作训练目标时,生成器会过拟合这些空间的统计量,而人眼与 held-out 编码器可见的缺陷不受惩罚——通用扰动实验(FID 从 3.31 降到 2.56 但画质明显崩坏)直接证明了静态表征存在可利用的盲方向。第二,与 GAN 的本质区别在内层优化学什么:WGAN 在固定传输几何下学习对偶势函数(critic 给每个样本打标量分),AdvFD 则学习特征几何本身——表征把样本映射为特征向量,改变了哪些差异会体现在 $\mu,\Sigma$ 中,而比较统计量的 $W_2^2$ 高斯传输公式固定不变。第三,real-feature whitening $\bar\psi_\omega(x)=(\psi_\omega(x)-\mu_p^\psi)(\Sigma_p^\psi+\epsilon I)^{-1/2}$ 消除了原始 FD 的平凡尺度简并 $D^{c\psi}_{FD}=c^2D^\psi_{FD}$:白化后真实特征均值为 0、协方差为 $I$,任何可逆仿射等价的表征白化后只差一个正交变换,而 FD 对公共正交变换不变,因此对抗表征无法再靠全局缩放增大差异,只能在真正有区分意义的方向上做文章。

方法步骤详情

完整流程见 Algorithm 1。(1) 初始化:从公开 checkpoint 加载 JiT/pMF 生成器;冻结 SIM 编码器(SigLIP、MAE、InceptionV3,各占权重 1);对抗表征从预训练 Inception 初始化并全量微调(若用 SigLIP/MAE 则因显存限制加 rank-16 LoRA)。(2) 每个迭代采样真实批次 $X_r\sim p$ 与噪声 $Z$,一步生成 $X_g=G_\theta(Z)$。(3) G-step:冻结所有表征,计算 $D_{\text{static}}$ 与白化后的 $D_{\text{adv}}$,按 $\theta_{t+1}=\theta_t-\eta_G\nabla_\theta[D_{\text{static}}+\lambda_{\text{adv}}D_{\text{adv}}]$ 更新生成器;全局 batch 1024、训练 125k 步,生成器 AdamW 学习率 $10^{-6}$(pMF)或 $10^{-5}$(JiT),EDM 式权重 EMA。(4) D-step:冻结生成器并对 $X_g$ 做 stop-gradient,用 detach 的 EMA($\beta=0.99$)真实特征统计做白化($\epsilon=10^{-3}$),计算 $g_t=\nabla_\omega D_{\text{adv}}$,按 $\omega_{t+1}=\omega_t+\eta_D\,\mathrm{clip}_\tau(g_t)$ 更新,其中 $\mathrm{clip}_\tau(g)=g\cdot\min(1,\tau/\|g\|_2)$;该更新等价于带范数约束的局部响应问题(式 5)的封闭解,用 AdamW 实现,裁剪阈值 $\tau=1.0$,学习率 $10^{-6}$ 至 $2\times10^{-6}$,每两个生成器步更新一次,从第 1000 步开始、4000 步线性 warmup 接入。附录 A 证明裁剪后的 AdamW 更新始终停留在初始化的有界邻域内。

技术新颖性

技术新颖性体现在四个层面。(1) 问题层:首次定义并实证 Fréchet hacking,把 objective hacking(奖励过优化、代理指标被钻空子)的研究视角引入分布级训练目标,揭示了 FD-Loss 这类新范式的系统性风险。(2) 机制层:把 GAN 式 min–max 从样本打分搬到特征统计对齐——不是学判别器,而是学比较空间本身;附录 C 从最优传输角度给出严格对照:原始 GAN 消元后等价于最小化 JS 散度、WGAN 固定 ground cost 学 Kantorovich 对偶势,而 AdvFD 学习决定 $W_2^2$ 评估对象的特征几何,且每个固定表征下的高斯传输问题都有封闭解。(3) 稳定化层:real-feature whitening 配有完整的仿射不变性推导(附录 B),说明白化如何把平凡缩放方向从优化问题中剔除,并给出正则化带来的 $O(\epsilon/\lambda_{\min})$ 误差界与 EMA 滞后的偏差分析。(4) 实证层:wall-clock 对齐实验(Table 5)证明收益来自表征的可学习性而非额外参数或算力——冻结对抗分支使所有指标全面恶化,单纯延长 FD-loss 训练也无效。诊断、机制、校准、验证四个环节构成完整闭环,在同类后训练工作中较为少见。

Overview of our adaptive training
Figure 3: Overview of our adaptive training
Effect of feature whitening on adversarial feature stability
Figure 5: Effect of feature whitening on adversarial feature stability

实验结果

主实验在 ImageNet-1K 256×256 类条件生成上进行一步后训练,每个模型生成 5 万张样本评测,报告 FID(Inception 空间)、FD-r6(六个编码器归一化 FD 的均值,编码器为 Inception/ConvNeXt/DINOv2/MAE/SigLIP/CLIP,归一化常数分别为 1.68/56.87/14.19/0.04/0.60/5.60)与 FD-r3(仅 ConvNeXt/DINOv2/CLIP 三个训练中未使用的 held-out 编码器)。JiT 系列上:JiT-B 从 FD-loss 的 FID/FD-r6/FD-r3 = 1.00/5.53/8.45 提升到 0.79/3.92/6.03,相对改善 21.0%/29.1%/28.6%;JiT-L 从 0.77/3.24/5.46 提升到 0.73/2.01/3.20(5.2%/38.0%/41.4%);JiT-H 从 0.75/2.65/4.44 提升到 0.72/1.80/2.93(4.0%/32.1%/34.0%)。pMF 系列全面占优:pMF-B 0.85/3.50/4.49→0.81/3.32/4.22,pMF-L 0.78/2.09/2.72→0.77/1.89/2.57,pMF-H 0.77/1.89/2.69→0.74/1.74/2.50。FD-r3 在两个骨干、三个规模上一致下降,说明收益泛化到了训练外表征,而非只在 SIM 空间刷分。消融方面:去掉白化训练直接崩溃(FID/FD-r6/FD-r3 = 10.69/58.50/40.54),只白化静态分支反而更差(13.49/28.32/21.66);外部 PatchGAN 使 FD-r6/r3 变差(5.57/8.90),DMD 使 FID 恶化到 1.77,均不及 AdvFD;对抗表征用预训练 Inception 全量微调最佳(0.79/3.92/6.03),随机初始化 Inception 为 0.85/5.69/7.63,SigLIP/MAE + LoRA 居中;$\lambda_{\text{adv}}$ 扫描中 0.10 最优,0.01 增益有限,0.20 全面回退(0.87/5.46/6.74)。wall-clock 对齐实验进一步排除了算力解释:FD-loss 多训 N 步追平算力后为 1.71/7.70/8.63,几乎无改善;冻结对抗分支为 1.62/11.02/8.71,反而大幅恶化;可训练的 AdvFD 保持 0.79/3.92/6.03。

Class-conditional generation on ImageNet 256×256
Table 1: Class-conditional generation on ImageNet 256×256
Alternative anti-hacking strategies and whitening ablation
Table 2: Alternative anti-hacking strategies and whitening ablation
Ablation on adversarial representation backbones and initialization
Table 3: Ablation on adversarial representation backbones and initialization
Wall-clock-aligned comparison
Table 5: Wall-clock-aligned comparison
Training hyperparameters for the 256×256 experiments
Table 6: Training hyperparameters for the 256×256 experiments
AdvFD mitigates Fréchet hacking in one-step generation
Figure 1: AdvFD mitigates Fréchet hacking in one-step generation
Qualitative comparison between FD-Loss and AdvFD on ImageNet 256×256
Figure 4: Qualitative comparison between FD-Loss and AdvFD on ImageNet 256×256
查看结构化数据
任务指标本文基线提升
ImageNet 256×256 类条件生成(JiT-B,1-NFE) FID 0.79 1.00(FD-loss) 相对降低 21.0%
ImageNet 256×256 类条件生成(JiT-B,1-NFE) FD-r6 3.92 5.53(FD-loss) 相对降低 29.1%
ImageNet 256×256 类条件生成(JiT-B,1-NFE) FD-r3(held-out) 6.03 8.45(FD-loss) 相对降低 28.6%
ImageNet 256×256 类条件生成(JiT-L,1-NFE) FD-r6 2.01 3.24(FD-loss) 相对降低 38.0%
ImageNet 256×256 类条件生成(JiT-L,1-NFE) FD-r3(held-out) 3.20 5.46(FD-loss) 相对降低 41.4%
ImageNet 256×256 类条件生成(JiT-H,1-NFE) FID 0.72 0.75(FD-loss) 相对降低 4.0%
ImageNet 256×256 类条件生成(JiT-H,1-NFE) FD-r3(held-out) 2.93 4.44(FD-loss) 相对降低 34.0%
ImageNet 256×256 类条件生成(pMF-H,1-NFE) FID / FD-r6 / FD-r3 0.74 / 1.74 / 2.50 0.77 / 1.89 / 2.69(FD-loss) 三项指标一致下降
白化消融(JiT-B,SIM 目标) FID / FD-r6 / FD-r3 0.79 / 3.92 / 6.03(白化自适应分支) 10.69 / 58.50 / 40.54(无白化) 无白化时训练完全崩溃
Wall-clock 对齐(JiT-B,同等算力) FID / FD-r6 / FD-r3 0.79 / 3.92 / 6.03(可训练对抗分支) 1.71 / 7.70 / 8.63(FD-loss 延长训练) 排除额外算力带来的解释

局限与改进

作者在附录 F 明确承认两点局限:其一,实验只覆盖 ImageNet 256×256 类条件生成,方法在高分辨率、文本条件生成和视频生成上的有效性尚未验证;其二,对抗表征更新与白化计算带来额外训练开销(推理架构和 1-NFE 采样成本不变)。我的补充观察:(1) min–max 博弈引入了 GAN 式的不稳定性,超参敏感——$\lambda_{\text{adv}}=0.20$ 时所有指标全面回退,D-step 学习率被压到 $10^{-6}$ 量级、还需裁剪、warmup 和隔步更新等多重保险,工程调参成本不低;(2) 白化只校准真实特征的几何,生成特征的协方差仍以原始坐标进入 FD,理论上对抗方向仍可能在生成统计的几何中寻找捷径;(3) 评测指标与训练目标同属 Fréchet 家族,JiT-H 的 FID 0.72 甚至低于 5 万张真实验证图的 1.68,提示有限样本下指标本身存在噪声,hacking 可能只是被推向更难测量的空间而非被根除;(4) 最优配置依赖 Inception 全量微调,而 SigLIP/MAE(仅 LoRA)效果一般,主干选择的普适规律尚不清楚;(5) 对比实验局限于 FD-loss 体系内部,未与 ADD、DMD 系列等主流一步蒸馏方法在相同预算下正面对比。

独立分析的弱点

第一,训练稳定性依赖多重手工保险丝(梯度裁剪 $\tau=1.0$、D-step 学习率 $\le2\times10^{-6}$、每两个生成器步更新一次、4000 步线性 warmup),这本身就说明对抗分支很脆弱; scaling 到更大模型或更高分辨率时,D-step 的更新尺度如何随规模缩放缺乏理论指导,改进方向是用谱归一化或信任域约束替代手工裁剪,并对更新幅度给出与模型规模关联的自动调节规则。第二,白化使用与 D-step 梯度解耦的 EMA 真实统计,表征的瞬时缩放在 EMA 追上之前不会被抵消,论文靠极小学习率掩盖了这个时间差;可以做在线白化,或直接对 $\psi$ 施加范数/谱约束使仿射不变性严格成立。第三,评测指标与训练目标同源(都是 Fréchet 家族),无法排除差异只是被赶进了更隐蔽的空间;应补充人工偏好评测或下游任务指标作为外部校验。第四,方法只在类条件 ImageNet 上验证,而文本到图像场景中真实分布高度多样,5 万样本队列加 EMA 的均值/协方差估计误差会直接污染白化矩阵,需要研究小样本下稳健的统计估计(如 Ledoit-Wolf 收缩估计、核化 Fréchet 距离)。第五,单一对抗表征分支每个时刻只能暴露一个方向上的残差差异,可以探索多表征并行对抗、或按训练进度课程式轮换对抗主干,让盲区暴露更系统化。

未来方向

作者展望把 AdvFD 推广到更大规模、多模态与视频生成,并探索自适应比较空间在可靠分布级训练中的更广泛应用。基于本文成果还能延伸出若干方向:(1) 理论侧,刻画该 min–max 博弈的局部收敛性与其 Nash 均衡的性质,回答对抗表征最终会收敛到什么样的比较几何,以及均衡解与感知质量之间的关系;(2) 与奖励模型结合——RLHF 中已有对抗更新奖励模型以缓解 reward hacking 的工作,可与 AdvFD 的表征校准统一为一个通用的代理目标防作弊框架;(3) 把 FD-r3 这类 held-out 指标的泛化行为用作训练过程中的早停与模型选择信号,实现无需人工评审的质量监控;(4) 在文本到图像或视频模型上用 LoRA 承载对抗表征(论文已证明 LoRA 可行但效果次优),研究如何让低秩更新在更大特征空间中依然有效;(5) 与 DMD、ADD、iMF 等主流一步生成范式正交组合,检验对抗 Fréchet 项与蒸馏损失的互补性;(6) 把白化推广为对真实与生成统计同时标准化,从理论上封死生成几何一侧的对抗捷径,并分析双白化下 $W_2^2$ 的性质。

复现评估

复现条件总体友好。生成器初始化直接使用公开的 JiT(Li & He, 2026)与 pMF(Lu et al., 2026)预训练 checkpoint,数据为公开的 ImageNet-1K,对抗表征主干(Inception/SigLIP/MAE)均为公开预训练模型。训练配置在 Table 6 中完整披露:全局 batch 1024、每 GPU 128(即 8 卡 A100 级别)、训练 125k 步;生成器 AdamW 学习率 $10^{-6}$(pMF)/$10^{-5}$(JiT),对抗分支学习率 $10^{-6}$–$2\times10^{-6}$、每两步更新一次、裁剪阈值 1.0、白化 $\epsilon=10^{-3}$;FD 特征队列 5 万样本,主目标统计 EMA $\beta=0.999$、对抗分支 $\beta=0.99$;评测协议(5 万样本、各编码器归一化常数、CFG 配置)也全部给出,消融实验用 50 epoch 的短程设置以降低成本。论文提供了项目主页 gasaiyu.github.io/AdvFD-page,但正文未明确说明代码已开源;若只能按论文复现,特征统计的队列维护、双 EMA、eigvalsh 协方差求解等工程细节需要对齐得非常仔细。主要成本是多卡数天的训练量,综合评估复现难度中等偏上,缺少官方代码会显著增加细节对齐成本。