用频谱先验降低扩散模型的曝光偏差 Spectral Prior for Reducing Exposure Bias in Diffusion Models
推理时用FFT频谱对齐校正扩散模型曝光偏差,开销仅3-4%
前置知识
曝光偏差(Exposure Bias)
曝光偏差最初在自回归序列生成中被识别:训练时模型基于真实的前序上下文预测,推理时却要基于自身预测的上下文,这种训练与推理的分布失配导致小误差逐步累积、放大,最终偏离目标分布。扩散模型存在结构上完全相同的问题——迭代采样中每一步的去噪预测都带有误差,多步 rollout 后这些误差累积,使中间变量 $x_t$ 的分布偏离训练时前向过程所对应的分布,通常表现为有效噪声水平(SNR)的偏移。
整篇论文都在围绕扩散模型的曝光偏差展开:先诊断它的频域结构,再设计校正方法。理解曝光偏差是把握论文动机和方法设计的基石。
功率谱与径向平均功率谱(Power Spectrum / RAPS)
功率谱衡量信号在不同空间频率上的能量分布。对二维信号做离散傅里叶变换得到 $\mathbf{Y}_t = |\mathcal{F}[\hat{x}_{0|t}]|^2$,再对各频率环带上的能量做径向平均(RAPS, Radially Averaged Power Spectrum),可把二维谱压缩成关于归一化频率 $f\in(0,0.5]$ 的一维表示。自然图像的功率谱近似服从幂律 $S(f)\propto f^{-q}$,因此低频能量远高于高频。本文用 RAPS 作为分析中间预测 $\hat{x}_{0|t}$ 频率特性的工具。
本文的全部观察和校正都建立在功率谱之上——它既用来揭示训练/推理之间的频域失配,也作为引导损失中的对齐目标。不理解功率谱就无法理解方法。
无分类器引导(Classifier-Free Guidance, CFG)
CFG 是条件生成中的标准技巧,通过外推条件预测与无条件预测之差来增强 prompt 遵循度:$\epsilon_\theta^{CFG}=\epsilon_\emptyset + w(\epsilon_c-\epsilon_\emptyset)$,其中 $w>1$ 是引导尺度、$\emptyset$ 是空条件。提高 $w$ 能改善文本对齐但常导致过饱和、对比度不自然和细节丢失。本文方法作用于 CFG 合并后的预测之后、去噪步之前,因此与各种 CFG 变体天然兼容。
本文方法必须与 CFG 协同工作,且大量实验(SD2.0/SDXL 用 $w=7.5$,FLUX 用 $w=2.5/3.5$)都在 CFG 下进行。理解 CFG 才能理解方法的兼容性和定位。
扩散后验采样(Diffusion Posterior Sampling, DPS)
DPS 是一种推理时引导框架,在去噪过程中的每一步计算一个关于 $\hat{x}_{0|t}$ 的损失,并通过对其梯度反向传播来修正 $x_t$,从而在无需重训练的情况下施加额外约束(如测量一致性)。本文借用 DPS 的思路,但损失定义为当前频谱与目标频谱之间的差异,且梯度只经过 FFT、RAPS 和 Tweedie 公式,不经过神经网络,因此开销极小。
频谱对齐的引导机制本质上是 DPS 的一种特化。理解 DPS 才能理解为什么本方法计算开销只有 3-4% 且无需反向传播穿过网络。
Tweedie 公式(Tweedie's Formula)
Tweedie 公式给出在给定带噪观测 $x_t$ 时对干净数据 $x_0$ 的后验均值估计 $\hat{x}_{0|t}$,用噪声预测网络表示为 $\hat{x}_{0|t}=(x_t-\sigma_t\epsilon_\theta(x_t,c,t))/\sqrt{\bar{\alpha}_t}$。它是把扩散模型噪声预测转化为对干净图像估计的桥梁,在 DDIM 采样、CFG 组合以及本文的频谱引导中都起核心作用。
本文在每一步都用 Tweedie 公式从 $x_t$ 得到 $\hat{x}_{0|t}$,再提取其频谱与目标对比。这是整个引导算法的关键中间量。
研究动机
扩散模型在迭代采样中存在严重的曝光偏差:每一步去噪预测的小误差不断累积,导致最终样本偏离目标分布。以往的方法尝试从'有效噪声水平失配'的角度校正,例如 $\epsilon$-重缩放(Ning 等,ImageNet 上系数取 1.004)、时间偏移采样(time-shift)、以及基于小波的频带重加权(Yu 等)。然而这些方法要么假设误差在所有频率上是均匀的,要么依赖人工设计的固定校正规则。作者通过实证发现:训练(前向过程单步预测)与推理(反向过程)的中间预测 $\hat{x}_{0|t}$ 在功率谱上存在系统性的频域失配,而且这种失配的方向和形态高度依赖模型与时间步——ADM 表现为高频衰减,Stable Diffusion 2.0 反而是低频衰减,而 SDXL、SD3.5、FLUX 则呈现复杂的、分通道的、随时间步变化的模式。这意味着'统一增强高频'之类的固定规则根本无法跨架构泛化。
本文的目标是作者的目标有三层。首先,定量地揭示并刻画扩散模型中频域曝光偏差的结构,证明它不是简单的标量噪声水平误差,而是带有空间结构的、随频率、时间步和模型而变的失配。其次,建立'减小频谱失配能直接改善样本质量'这一因果关系,证明该失配是质量退化的有意义来源。最后,提供一个轻量、通用、即插即用的推理时校正方法(Spectral Alignment, SPA),可无需重训练地套用到从 DDPM、ADM 到 SD2.0、SDXL 再到 SD3.5、FLUX 的各类架构上,并以极低开销(3-4%)与现有 CFG 流水线协同工作,在 FID、HPSv3、ImageReward 等指标上获得一致提升。
与已有工作不同的是,本文的独特切入角度在于把曝光偏差分析从标量层面的'噪声水平/SNR 误差'升级到完整的频域层面。它不再问'整体噪声水平偏了多少',而是逐频率、逐时间步、逐通道地比较训练与推理的功率谱,从而发现失配方向因模型而异这一关键事实。这直接否定了固定校正规则的合理性,并导向一个数据驱动的方案:为每个模型单独学习一个期望目标频谱作为先验。更重要的是,作者指出标量方差校正无法消除这种带空间结构的失配——只有数据驱动地学习每个模型合适的目标频谱才能解决,这是与以往工作的本质分野。
核心方法
SPA 的整体思路是'离线学一个目标频谱先验,在线用 FFT 梯度把采样轨迹往它靠拢'。直觉上:既然扩散模型在推理时中间预测的频率能量分布偏离了训练时该有的样子,那就先把'该有的样子'测出来存成先验,再在每一步去噪时用一个小梯度把当前预测的频谱拉回先验。技术上分两阶段。阶段一离线:用训练数据配合预训练模型,通过前向加噪 + 单步去噪得到大量 $\hat{x}_{0|t}^{\text{train}}$,提取其径向平均功率谱(RAPS),拟合一个参数化幂律模型 $S(t,f)$ 并对时间步做三次样条插值,整个流程每模型只做一次。阶段二在线:在每个反向去噪步里,对 CFG 合并后的预测用 Tweedie 公式算出 $\hat{x}_{0|t}$,做 FFT 取 RAPS 得到当前频谱 $y_t(f)$,与目标 $S(t,f)$ 在对数域比较算引导损失,再对 $x_t$ 做一步梯度下降即可。该方法作用于 CFG 之后、标准去噪更新之前,因此与大多数 CFG 变体和噪声预测修改方式天然兼容。
核心创新是把'数据驱动的逐模型目标频谱'与'FFT 梯度引导'结合成一个轻量校正器。与以往工作的本质区别有三。第一,以往方法($\epsilon$-重缩放、时间偏移、小波重加权)要么是标量校正要么是手工频带规则,而 SPA 为每个模型单独从训练数据学出随时间步变化的频谱目标,能适应 ADM 高频衰减、SD2.0 低频衰减、FLUX 复杂通道模式这种截然不同的失配形态。第二,它借用 DPS 的引导范式但在频域定义损失,关键在于梯度只流经 FFT、RAPS 和 Tweedie 公式而不经过神经网络,因此每步只增加约 3.86%(SDXL)到 0.08%(FLUX)的开销,且无需额外网络或对抗训练。第三,作者从训练数据频谱的对数分布存在正偏态这一观察出发,设计了非对称惩罚——当当前频谱低于目标时惩罚更强,这与过度衰减比略微过冲更有害的经验一致。
方法步骤详情
方法步骤完整如下。阶段一(离线,每模型一次):(1) 从训练集采样干净图像 $x_0^{(i)}$,按前向过程 $x_\tau=\sqrt{\bar{\alpha}_\tau}x_0+\sigma_\tau\epsilon$ 加噪;(2) 用预训练模型经 Tweedie 公式算单步预测 $\hat{x}_{0|\tau}^{(i)}$;(3) 对每通道做 2D FFT 取模平方得 $\mathbf{Y}_t=|\mathcal{F}[\hat{x}_{0|t}]|^2$,再径向平均得 RAPS $y_t(f)$,跨样本平均;(4) 对若干离散时间步 $\{t_1,\dots,t_K\}$ 用最小二乘拟合参数化幂律模型 $S(t,f)=p_t\cdot f^{-q_t}+r_t\cdot f+s_t$,其中 $p_t,q_t,r_t,s_t$ 是逐时间步参数($r_t$ 默认置零,仅在 SDXL/FLUX 显著改善拟合时启用);(5) 对每个参数用三次样条插值到连续时间,得到任意时间步都可查询的 $S(t,f)$。作者用 1 万样本拟合,$R^2$ 多数超 0.9。阶段二(在线推理):对每步 $t$,先算条件/无条件预测并做 CFG 得 $\epsilon^{CFG}$;用 Tweedie 得 $\hat{x}_{0|t}$;FFT 取 RAPS 得 $y_t(f)$;算引导损失 $\mathcal{L}_{spec}=\frac{1}{N}\sum_c\sum_k(\phi_a(\log_{10}y_t(f_k^c)-\log_{10}S(t,f_k^c)))^2$,其中非对称惩罚 $\phi_a(x)=x$(若 $x\geq0$)、$a\cdot x$(若 $x<0$),$a>1$ 控制惩罚强度;最后对 $x_t$ 做一步梯度下降 $x_t\leftarrow x_t-\eta\nabla_{x_t}\mathcal{L}_{spec}$(用 stop-gradient 阻断网络梯度),再执行标准去噪更新(DDIM/Euler 等)。
技术新颖性
技术新颖性体现在几个层面。首先是发现层面:作者首次系统揭示即便最先进的 flow-matching 模型(SD3.5、FLUX)仍存在频谱失配,且失配方向因模型而异,推翻了'固定增强高频'的通用假设。其次是建模层面:用径向平均功率谱 + 幂律参数模型 $S(t,f)=p_t f^{-q_t}+r_t f+s_t$ + 时间步样条插值,把复杂的多维频谱压缩成几条平滑参数曲线,既好可视化又使回归稳定($R^2>0.9$)。第三是引导层面:把 DPS 范式特化到频域且阻断网络梯度,使每步开销仅 3.86%(SDXL)、0.08%(FLUX),远低于 Discriminator Guidance、MPGD 等需要每步跑额外网络或反向传播穿过自编码器的方法。第四是非对称惩罚的引入,源于训练频谱对数分布正偏态这一细致经验观察。最后是通用性:同一套方法无需改动即可套用到像素空间(DDPM、ADM)、潜空间(SD2.0、SDXL)和 flow-matching(SD3.5、FLUX)模型上。
实验结果
核心发现可逐实验分析。在 ADM(ImageNet 256×256)上,SPA 把 FID 从 9.29 降到 7.81、KID 从 19.48 降到 10.25,Density 从 1.133 升到 1.226、Coverage 从 0.5939 升到 0.6184,全面优于 $\epsilon$-重缩放(FID 8.00)、小波重加权(8.35)和时间偏移(15.35,明显失败,作者归因于其仅在 128×128 验证)。值得注意的是 SPA 引导向平均频谱却仍改善多样性(Density/Coverage 双升)。在 DDPM(CelebA-HQ)上提升较小(FID 49.44→48.63),$\epsilon$-重缩放甚至略好(48.53),作者解释为目标频谱来自单步预测,而 DDPM 单步预测本身就差。在文生图上,SD2.0($w=7.5$)HPSv3 从 7.043 升到 7.238、ImageReward 从 0.393 升到 0.421;SDXL HPSv3 从 8.426 升到 8.829(约 4.5% 增益,最显著)、ImageReward 从 0.791 升到 0.829;SD3.5($w=5$)HPSv3 从 9.782 升到 9.975。CLIP Score 均饱和且不下降,说明文本对齐得以保持。对 FLUX.1[dev](引导蒸馏模型),在 $w=2.5$ 下 SPA 提升达统计显著(胜率 53.3±1.5%,$p=2.3\times10^{-5}$),在 $w=3.5$ 下效果减弱,作者推断引导蒸馏部分缓解了频谱失配。尤其值得关注的是 SPA 对低质样本帮助更大:HPSv3 后 20% 的样本在 $w=3.5$ 下胜率仍达 54.1±3.3%,后 5% 样本平均增益 0.70($w=2.5$)。开销方面 SDXL 仅 +3.86%(去噪步 2.47s vs SPA 0.0952s),FLUX 仅 +0.08%,因 FFT 成本随潜空间分辨率缩放。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ADM ImageNet 类条件生成 | FID↓ / KID×1000↓ | 7.81 / 10.25(SPA) | 9.29 / 19.48(vanilla);8.00 / 11.01(ε-重缩放);15.35 / 77.47(time-shift);8.35 / 12.80(wavelet) | FID 相对 vanilla 降低 15.9%,全面优于所有基线 |
| ADM ImageNet 多样性 | Density↑ / Coverage↑ | 1.226 / 0.6184 | 1.133 / 0.5939(vanilla) | Density +8.2%,Coverage +4.1% |
| DDPM CelebA 无条件生成 | FID↓ | 48.63(SPA) | 49.44(vanilla);48.53(ε-重缩放) | 相对 vanilla 改善 1.6%,但弱于 ε-重缩放 |
| SDXL 文生图(w=7.5) | HPSv3↑ / ImageReward↑ | 8.829 / 0.829 | 8.426 / 0.791(vanilla);8.576 / 0.807(wavelet) | HPSv3 约 +4.8%(最大增益) |
| SD3.5 文生图(w=5) | HPSv3↑ | 9.975 | 9.782(vanilla) | +1.98% |
| FLUX.1[dev] 真CFG(w=2.5) | 胜率(人类偏好) | 53.3±1.5% | 50%(vanilla 平局基准) | p=2.3e-5,统计显著 |
| 推理开销(SDXL) | 每步耗时 | +0.0952s(SPA 增量) | 2.47s(标准去噪步) | 仅 +3.86%;FLUX 仅 +0.08% |
局限与改进
作者明确承认若干局限。首先,当前方法假设单一目标频谱作为先验,但最优频谱可能随目标数据分布变化——插画、医学图像有不同的频率特性,单一全局先验未必最优;条件生成中也可能需要根据条件信息用不同目标频谱。其次,作者没有探索替代的引导方法或损失加权策略,采用的简单 DPS 引导和对数域无权重 MSE 还有改进空间,例如可设计跨频带和时间步的加权调度。DDPM 上的增益偏小(FID 仅 49.44→48.63)也暴露了方法的脆弱性:当单步预测本身不准时,目标频谱的拟合也会受拖累。此外,作者自述非对称惩罚来自经验偏态观察,其设计较启发式。从更广视角看,方法对每个模型需一次性离线计算(约 FID 计算量级,1 万样本)且需访问训练数据,对闭源模型或不公开训练集的场景不友好。
独立分析的弱点
独立分析有几个弱点。第一,目标频谱是全局/无条件的,忽略了同一模型内不同内容(风景 vs 人像、不同 prompt)频率特性的差异。改进方向是引入条件化目标频谱,按类别、prompt 嵌入或图像内容自适应选择先验。第二,非对称惩罚 $\phi_a$ 与引导强度 $\eta$ 是两个新超参,虽作者称同类模型(SD2.0/SDXL)收敛到相同值,但跨架构差异大(DDPM 的 $a=1.0$ vs SDXL 的 $a=5.0$),仍需逐模型搜索。改进方向是用更自动化的方式(如基于偏态自动定 $a$)减少手调。第三,径向平均功率谱丢失了方向性/各向异性信息,对具有明显方向结构的失配(如水平条纹伪影)可能建模不足,可考虑保留二维谱或方向性子带。第四,方法依赖能拿到训练数据来拟合先验,对完全闭源模型受限。改进方向是研究仅用生成样本反推先验。第五,DDPM 上效果弱于 $\epsilon$-重缩放,提示目标频谱对单步预测质量敏感,可考虑用多步 roll-out 估计替代单步估计。
未来方向
作者提出的方向包括:针对不同数据分布或条件信息使用不同的目标频谱先验;探索更精巧的引导方法替代简单 DPS;设计跨频带和时间步的损失加权调度。基于本文成果可延伸的方向更广。一是把频谱失配作为训练阶段的诊断工具:作者在结论中明确提出频谱失配可作为模型训练改进的透镜,可设计训练损失或正则项直接减小训练与推理的频谱差距。二是将 SPA 与 Discriminator Guidance、MPGD 等互补方法组合(作者指出技术上不互斥但未做实验验证)。三是把频谱对齐推广到视频生成(时间维频谱)、音频生成或 3D 生成。四是研究引导蒸馏与频谱失配的关系——FLUX 上 $w=2.5$ 有效而 $w=3.5$ 减弱的现象暗示蒸馏部分内化了 CFG 效应,可据此改进蒸馏流程。五是将非对称惩罚与加权推广到更 principled 的鲁棒损失。
复现评估
复现性较好。作者已开源完整实现(https://github.com/SonyResearch/SPA),且方法本身计算开销极低(SDXL +3.86%,FLUX +0.08%),所需算力与标准采样流水线接近,普通消费级 GPU 即可跑推理实验。论文给出了较详细的超参:ADM 用 $(\eta,a)=(0.05,2.0)$,SD2.0/SDXL 用 $(0.2,5.0)$,SD3.5 用 $(0.75,3.0)$,FLUX 用 $(0.2,2.0)$($w=2.5$)或 $(0.2,1.0)$($w=3.5$);采样器(DDPM/DDIM)、步数(50/100/30)、评估指标(clean-fid、HPSv3、ImageReward、CLIP ViT-G/14)和基线超参($\epsilon$-重缩放系数、小波系数等)均明确给出。主要门槛在于离线目标频谱拟合需访问训练数据(DDPM/ADM 用各自训练集,文生图用 LAION-Aesthetics V2,1 万样本),对仅持有模型权重的用户需自行准备近似数据。此外 FLUX 的 'de-distilled' 检查点来自另一工作,完整复现其 true-CFG 结果需额外获取该检查点。
论文图表
图由三部分组成。(a) 对比 ADM 与 SDXL 在不同时间步下,目标频谱先验(实线)与推理频谱(虚线)的逐通道功率谱:ADM 在 $t=908,151$ 处高频被衰减,SDXL 在 $t=925,133$ 处呈现被放大的复杂通道模式。(b) 给出 SDXL 的相对误差并叠加 SPA 结果(点线),显示 SPA 后各频率误差普遍减小。(c) 展示 ADM/SDXL 在 vanilla 与加 SPA 下的生成样例对照,同初始噪声同种子,可见 SPA 修复了缺陷物体形状并增强了边缘与细节。
这张图是论文动机的核心证据:它直观证明了频谱失配存在、其方向因模型而异(ADM 高频衰减 vs SDXL 复杂模式),以及 SPA 确实缩小了误差并改善了视觉质量。没有这张图就难以理解为什么固定校正规则不可行。