← 返回 2026-08-19

能量引导的流匹配 Energy-Guided Flow Matching

Haoyang Tong, Yu He, Fang Li, Lichen Ma, Jingling Fu, Dong Chen, Zhen Chen, Junshi Huang, Jie Cao 📅 2026-08-07 👍 11 2026-08-24 18:30
像素空间生成 图像生成 流匹配 粗到细生成 频谱先验

用随图像频谱演化的移动低通终点替换固定终点,让像素级流匹配按粗到细轨迹生成

前置知识

Flow Matching(流匹配)

一种生成建模范式:训练一个速度场网络 $v_\theta$ 回归条件概率路径的瞬时速度。标准流匹配用线性插值构造噪声样本 $z_t = t x + (1-t)\epsilon$($x$ 为干净图、$\epsilon \sim \mathcal{N}(0, I)$),回归目标为恒定速度 $x - \epsilon$;推理时从纯噪声出发积分 ODE $dz_t/dt = v_\theta(z_t, t)$ 生成图像。它比扩散模型训练更简洁,且天然允许任意合理的概率路径。

本文的全部改动就发生在流匹配的「路径」与「回归目标」上——把固定终点换成移动终点后,速度目标必须重新推导,读懂这一步是理解全文的前提。

热核低通滤波(Heat-kernel filtering)

热扩散方程在频域的解是一个高斯形衰减响应:频率 $\rho$ 的分量在「热时」$h$ 后按 $R(h,\rho) = \exp(-a h \rho^2)$ 衰减($a=(\pi\sigma_0)^2$)。$h$ 越大高频被抹除得越厉害,$h=0$ 时完全无损。对图像做傅里叶变换、逐频乘以该响应、再逆变换,就得到一张平滑的低通图;调节 $h$ 可以得到一族平滑嵌套、从模糊到清晰的金字塔图像。

EG-FM 正是用这族热核响应来构造随时间演化的移动终点,「热时」$h(x,t)$ 就是论文里被逐样本求解的核心变量。

Parseval 定理与谱能量

在酉离散傅里叶变换下,图像在像素域的 $\ell_2$ 能量严格等于频域各分量能量之和:$\|x\|_2^2 = \sum_\rho \|\hat{x}(\rho)\|_2^2$。因此两张图的 $\ell_2$ 距离可以精确改写为各频率分量之差的加权平方和,权重 $E(\rho) = \|\hat{x}(\rho)\|_2^2$ 就是该图在频率 $\rho$ 处的谱能量。

论文用 Parseval 定理把「当前终点还缺多少高频信息」变成可精确计算的谱域能量缺口 $\tilde{G}_x$,这是逐样本调度频率释放的数学基础。

粗到细频谱演化先验

自然图像的生成过程天然是分频的:负责整体布局的低频分量在早期建立,纹理、边缘等高频细节在后期涌现。已有工作(逆热扩散、模糊扩散、渐进式去模糊)利用这一先验来稳定训练,但它们通常给所有样本用同一条时间调度表。

这是本文方法设计的出发点——把该先验从「隐式让网络学」变成「显式编进概率路径」,并且比前人更进一步做到了逐样本自适应。

FID 与 ADM 评估协议

FID(Fréchet Inception Distance)衡量生成图像与真实图像在 Inception 特征空间中分布的距离,越低越好;ADM 评估套件(Dhariwal & Nichol 2021)是 ImageNet 生成论文的标准评测流程,同时报告 sFID、Inception Score(IS)、precision 与 recall。同一批样本用不同实现(如 torch-fidelity)算出的 FID 会有小幅系统性偏移。

论文所有核心结论都以 50K 样本的 ADM FID 为主指标,且附录专门讨论了评估器偏移,理解指标才能正确解读表格数字。

研究动机

像素空间生成模型直接在 RGB 像素上建模分布,避免了 VAE 潜在压缩的信息损失,但代价是模型必须在高维空间中同时协调全局结构与局部高频细节,优化困难。以 ImageNet 256×256 类条件生成为例,标准流匹配基线 PixelDiT-XL 训练 80 个 epoch 时 FID 仍高达 2.36,需要 800 epochs 才降到 1.54。收敛缓慢的根源之一在于路径设计:标准流匹配的插值 $z_t = t x + (1-t)\epsilon$ 在每个时刻都指向同一个固定的全谱终点 $x$,速度始终朝完整成品图推进,频谱从低频到高频的涌现顺序只能靠网络从数据中隐式猜测。而自然图像的生成天然分频——低频全局结构早期建立、高频纹理后期出现,把所有频段压在一条无差别路径上统一建模会显著增加学习难度。这一问题在像素空间尤其严重:潜空间模型里 VAE 压缩恰好预先丢弃了大部分高频,而像素模型必须自己面对完整频谱。已有改进集中在网络架构(PixelDiT、HyperDiT、DeCo)、patchify 策略和辅助损失(REPA 等),生成轨迹的设计仍是欠探索的方向。

本文的目标是本文的目标是为像素级流匹配设计一条显式的粗到细生成轨迹:把固定的干净终点替换为随时间演化的移动频谱终点 $y_t(x)$,它从初始低通图像平滑过渡到完整图像,且高频信息的释放速率由每张图像自身的谱能量分布决定。方法需满足三个工程约束:其一,保持流匹配的边界分布不变,即 $z_0 = \epsilon$、$z_1 = x$;其二,不修改骨干网络、不引入辅助损失、不改变采样器与推理计算量;其三,训练时目标构建开销可忽略(实测每样本 FLOPs 增幅仅约 0.026%)。量化目标是在 ImageNet 256×256 上以明显更少的训练 epoch 达到并超越各基线骨干的最终 FID(如 PixelDiT-XL 200 epochs 达 1.55、600 epochs 达 1.45),并能以极小的续训代价迁移到 512×512 高分辨率与文本到图像生成。

与已有工作不同的是,已有轨迹中心方法(逆热扩散、模糊扩散、拉普拉斯多尺度流匹配等)虽然把频谱先验嵌入了生成路径,却普遍使用跨样本共享的时间调度,忽略了图像间频谱成分的巨大差异:纹理丰富的图与构图平滑的图被迫按同一节奏释放频率,导致同一时刻 $t$ 在不同样本上对应完全不同的重建进度,时间变量失去「可比相对进度」的语义。EG-FM 抓住的正是这个被忽视的点:它利用 Parseval 定理为每张图定义谱能量缺口 $\tilde{G}_x$,再通过能量等式 $G_x(h(x,t)) = q(t)\,\tilde{G}_x$ 反解出逐样本的热时曲线,使所有样本在任意时刻 $t$ 都恰好恢复相同比例的缺失能量。这样「什么时候释放哪个频段」从手工设计的时间表变成了逐样本可解的方程,共享时间轴被重新赋予了跨样本一致的语义。

核心方法

直觉上,这像是教人临摹一幅画:不要一上来就给出完整成品让他一步到位,而是先展示一张模糊的轮廓图,随练习推进逐步「揭开」更多细节,且揭幕节奏应因图而异——细节繁密的画作要更快揭幕,简洁的构图可以放缓。技术上,EG-FM 把流匹配的插值路径改写为 $z_t = t\,y_t(x) + (1-t)\epsilon$,其中移动终点 $y_t(x) = \mathcal{F}^{-1}(R(h(x,t),\rho)\,\hat{x})$ 由热核频响 $R(h,\rho) = \exp(-a h \rho^2)$($a = (\pi\sigma_0)^2$,$\rho$ 为归一化径向频率)对频谱做低通滤波得到:$t=0$ 时 $h=1$,得到由 $\sigma_0 = 3.5$ 控制的低通图;$t=1$ 时 $h=0$,完整还原图像。热时 $h(x,t)$ 不是手工曲线,而是由能量匹配条件 $G_x(h(x,t)) = q(t)\,\tilde{G}_x$ 隐式定义——每张图在时刻 $t$ 恢复其总缺失高频能量的 $q(t)$ 比例,$q(t)$ 默认取 quintic smootherstep $6t^5 - 15t^4 + 10t^3$。由于终点本身在移动,回归目标变为路径的精确导数 $v_t = y_t(x) - \epsilon + t\,\partial_t y_t(x)$:第一项是从噪声指向当前终点的传输速度,第二项是终点自身运动的位移贡献,系数 $t$ 让其影响随生成推进逐渐增强。

核心创新是把「逐样本自适应的频率释放」直接编码进概率路径本身,而不是依赖骨干网络在优化中隐式发现这一顺序。与标准流匹配的本质区别在终点:$z_t$ 不再指向静态的全谱图像 $x$,而是指向一个由热核滤波生成、随时间逐渐「对焦」的移动终点序列,模型每一步都被监督去预测当下理应出现的那部分频率内容。与已有粗到细方法的本质区别在调度粒度:模糊扩散、多尺度流匹配等使用跨样本共享的频谱时间表,EG-FM 则先用 Parseval 定理把「终点相对低通起点恢复了多少信息」严格写成谱域能量 $G_x(h) = \sum_\rho E(\rho)\,[R(h,\rho) - R(1,\rho)]^2$(其中 $E(\rho) = \|\hat{x}(\rho)\|_2^2$ 为该图的谱能量),再令其等于全局释放时钟与该图总缺失能量 $\tilde{G}_x$ 的乘积,隐式解出每张图自己的热时曲线。于是纹理繁密的图像自动获得更陡的热时下降(更快的频率释放),平滑图像则更缓,而能量恢复比例全程同步。由于所有中间状态都由解析公式定义,训练无需任何迭代轨迹模拟;推理则与标准流匹配完全一致,零额外开销。

方法步骤详情

第一步,对训练图像 $x$ 做傅里叶变换,计算谱能量 $E(\rho) = \|\hat{x}(\rho)\|_2^2$,并用 $h=1$ 的热核构造初始低通终点 $y_0(x) = \mathcal{F}^{-1}(R'(\rho)\,\hat{x})$,$R'(\rho) = \exp(-(\pi\sigma_0)^2 \rho^2)$。第二步,按 Parseval 定理计算总缺失能量 $\tilde{G}_x = \sum_\rho E(\rho)\,[1 - R(1,\rho)]^2$。第三步,对每个时刻 $t \in (0,1)$,在 $[0,1]$ 上用二分法(16 次迭代)求解单调方程 $G_x(h) = q(t)\,\tilde{G}_x$,得到样本自适应热时 $h(x,t)$——$G_x(h)$ 连续且严格单调,根唯一。第四步,隐式微分得 $\partial_t h(x,t) = \frac{\partial_t q(t)\,\tilde{G}_x}{\partial_h G_x(h(x,t))}$,避免对迭代求解器求导,再经链式法则得 $\partial_t y_t(x) = \mathcal{F}^{-1}(-a \rho^2 R(h,\rho)\,\partial_t h\,\hat{x})$。第五步,构造噪声样本 $z_t = t\,y_t(x) + (1-t)\epsilon$ 与回归目标 $v_t = y_t(x) - \epsilon + t\,\partial_t y_t(x)$。第六步,训练速度网络最小化 $\mathcal{L}_{\mathrm{FM}} = \mathbb{E}_{x,\epsilon,t}\,\|v_\theta(z_t, t) - v_t\|_2^2$。工程细节:端点区域($t \le 10^{-5}$ 或 $1-t \le 10^{-5}$)直接用解析值 $(h, \partial_t h) = (1,0)$ 与 $(0,0)$,谱计算全程 FP32 以避免浮点 $0/0$ 与速度尖峰;推理阶段不做任何 FFT、滤波或二分,直接积分 $v_\theta$,与标准流匹配开销完全相同。

技术新颖性

EG-FM 的新颖性在于「改路径不改机器」:它不触碰骨干架构(对比 PixelDiT、HyperDiT、DeCo 的结构创新),不引入辅助损失(对比 REPA 的表示对齐),不改变采样器与采样步数,仅通过解析定义的移动终点和导出的速度目标改变监督信号,因此能即插即用地叠加到任意速度预测型流匹配骨干上。技术上的独特组合有三点:一是把逆热扩散的经典热核作为终点插值族,其平滑嵌套性保证路径连续、边界分布不变;二是用能量等式而非手工时间表定义样本级调度,并证明该隐式方程有唯一根、端点速度有界(Proposition 1:$\partial_t y_t(x) \to 0$,概率流 ODE 无终点奇点);三是给出隐式微分公式使终点运动项 $t\,\partial_t y_t(x)$ 可精确计算,并附带走 x-prediction 参数化时的路径一致转换(Eq. 46)与端点数值稳定方案。相较之下,FREPix、FrequencyBooster、频率感知流匹配等同期方法仍停留在共享调度或频率相关损失层面,均未做到逐样本的能量对齐。

Overview of Energy-Guided Flow Matching
Figure 2: Overview of Energy-Guided Flow Matching
Visualization of sample-adaptive heat-time
Figure 3: Visualization of sample-adaptive heat-time
Initial-endpoint sensitivity after 80 epochs
Figure 5: Initial-endpoint sensitivity after 80 epochs

实验结果

ImageNet 256×256(Table 1):三个骨干上一致有效。PixelDiT-XL 80 epochs 时 FID 从基线 2.36 降至 1.99,200 epochs 达 1.55(超过基线 320 epochs 的 1.61),600 epochs 达 1.45(基线 800 epochs 仅 1.54);DeCo-XL/16 用 440 epochs 达 1.63(基线 600 epochs 1.69);HyperDiT-H 仅 220 epochs 达 1.51(基线 600 epochs 1.56),训练轮数减少约 63%。骨干、采样器、NFE 与评估协议全部固定,提升可直接归因于概率路径。ImageNet 512×512(Table 2):从 256 检查点仅续训 40 epochs,PixelDiT+EG-FM 达 FID 1.68、IS 295.5(基线多训 530 epochs 才 1.81、278.6),HyperDiT+EG-FM 达 1.58,为对比方法最佳。文生图(Table 3):基于 BLIP3o 数据与 Gemma-2 文本编码器三阶段训练,EG-FM-T2I 取得 GenEval 0.85(PixelDiT-T2I 为 0.78)与 DPG-Bench 83.9(全场最佳),GenEval 仅以 0.01 之差次于 DeCo-XXL/16 的 0.86。消融:热时调度从共享线性→数据集级→类级→样本级,FID 依次 2.48→2.11→2.03→1.99,证明逐样本自适应是关键;四种释放时钟中 quintic smootherstep 最佳(1.99 vs linear 2.08),说明「何时释放」与「释放什么」同样重要。敏感性:$\sigma_0$ 呈 U 形,3.5 最优,过强滤波使 FID 崩溃($\sigma_0 = 40$ 时 4.20,DC-only 66.08);CFG 扫描同样 U 形,最优 2.55 低于常规设置,对应最小 FID 1.45。效率(Table 10):目标构建每样本仅增约 0.026% FLOPs,每步墙钟时间 +0.41%–4.81%,推理零额外开销。torch-fidelity 评估下同批检查点 FID 为 1.39(与 ADM 存在 0.02–0.06 偏移)。唯一的受限迁移是 x-prediction:JiT 骨干上仅 2.37→2.33,归因于早期干净图预测不可靠导致热时估计失准。

Class-conditional generation on ImageNet 256×256
Table 1: Class-conditional generation on ImageNet 256×256
Quantitative comparison for class-conditional generation on ImageNet 512×512
Table 2: Quantitative comparison for class-conditional generation on ImageNet 512×512
Quantitative comparison for text-to-image generation at 512×512 on GenEval and DPG-Bench
Table 3: Quantitative comparison for text-to-image generation at 512×512 on GenEval and DPG-Bench
Ablation on the granularity of heat-time
Table 4: Ablation on the granularity of heat-time
Ablation on the release-clock function
Table 5: Ablation on the release-clock function
Matched training compute and wall time
Table 10: Matched training compute and wall time
Qualitative results produced by PixelDiT-XL with EG-FM
Figure 4: Qualitative results produced by PixelDiT-XL with EG-FM
Sweep on CFG scale
Figure 7: Sweep on CFG scale
查看结构化数据
任务指标本文基线提升
ImageNet 256×256 类条件生成(PixelDiT-XL) FID-50K (ADM) 1.45(600 epochs) PixelDiT-XL 1.54(800 epochs) FID 降低 0.09,训练轮数减少 25%;200 epochs 即达 1.55,反超基线 320 epochs 的 1.61
ImageNet 256×256 类条件生成(HyperDiT-H) FID-50K (ADM) 1.51(220 epochs) HyperDiT-H 1.56(600 epochs) FID 降低 0.05,训练轮数减少约 63%
ImageNet 256×256 类条件生成(DeCo-XL/16) FID-50K (ADM) 1.63(440 epochs) DeCo-XL/16 1.69(600 epochs) FID 降低 0.06,训练轮数减少约 27%
ImageNet 512×512 类条件生成 FID-50K (ADM) 1.58(HyperDiT-H+EG-FM,260 epochs);PixelDiT+EG-FM 1.68(240 epochs) PixelDiT-XL 1.81(850 epochs) FID 降低 0.13–0.23,其中 256 检查点仅续训 40 epochs
文本到图像生成 512×512 GenEval 0.85(EG-FM-T2I,1.3B) PixelDiT-T2I 0.78;最佳 DeCo-XXL/16 0.86 较同骨干 +0.07,距全场最佳仅 0.01
文本到图像生成 512×512 DPG-Bench 83.9 PixelDiT-T2I 83.7 +0.2,为全部对比方法最佳
训练开销(PixelDiT-XL/16,256²) 每样本 GFLOPs / 每步墙钟时间 +0.06 GFLOPs(+0.01%);每步 +0.99% Standard FM 933.58 GFLOPs 推理零额外开销,训练开销可忽略

局限与改进

作者在附录 D 中承认两点局限:其一,EG-FM 尚未在异构或时间扩展信号上验证,包括文图联合建模、视频生成与具身决策——这些场景中终点引导需要同时协调空间结构与时间动态乃至动作序列;其二,其行为尚未在 Flux、Qwen-Image 规模的最大基础骨干上测试,可扩展性缺乏直接证据。我的补充观察:第一,x-prediction 参数化下提升仅 0.04 FID(2.37→2.33),说明收益强烈依赖速度预测骨干,泛化到其他参数化时机制受损;第二,FID 绝对值依赖评估器实现(torch-fidelity 比 ADM 低 0.02–0.06),跨论文比较需谨慎;第三,方法引入两个需要逐数据集调节的超参($\sigma_0$ 与时钟曲率),且 CFG 最优值从常规设置移到 2.55,接入现有流程需要额外调参成本;第四,热核是各向同性的径向频率滤波,无法表达方向性纹理(条纹、栅格)在释放顺序上的差异;第五,并非所有指标全面占优——DeCo 的 IS 从 304.0 略降至 300.1,precision/recall 基本持平,收益集中体现在 FID/分布保真度上,且论文未提供人类评测。

独立分析的弱点

第一,训练侧每个样本、每个时刻都要做 FFT、谱归约与 16 步二分求根。当前开销虽只有 0.026% FLOPs,但那是在 256×256 单图上测得的;若扩展到视频(多帧 × 时序维),频谱计算与逐帧求根可能使数据管线成为瓶颈。改进方向:预计算并缓存每图的 $E(\rho)$ 与 $\tilde{G}_x$,或训练小网络拟合 $h(x,t)$ 的解析近似替代在线二分。第二,各向同性热核假设频率重要性只由径向频率决定,对方向性纹理(条纹、栅格)不成立,可扩展为各向异性热核 $\exp(-a h\,\rho^\top \Sigma \rho)$ 或可学习频响族。第三,$\sigma_0 = 3.5$ 与 smootherstep 时钟都是在 ImageNet 上调出的全局常数,理论上可把 $q(t)$ 参数化、在满足端点稳定性条件(Eq. 33)的约束下端到端学习。第四,样本级调度依赖干净图的谱,x-prediction 推理时只能用带噪估计 $\hat{x}_\theta$ 替代,早期时刻误差大——这正是 JiT 上仅 +0.04 的原因;改进可在早期退化为数据集级时钟,随预测置信度上升切换到样本级。第五,全部证据来自 FID/IS 等自动指标,缺少人评与下游任务(编辑、超分)验证,补充小规模人评成本低且说服力强。

未来方向

作者明确提出的方向包括:把终点引导推广到文图联合建模、视频生成与具身决策,此时移动终点需同时编码空间结构、时间动态与动作;在 Flux、Qwen-Image 规模的基础骨干上验证可扩展性;以及更宏大的目标——为感知、生成与控制构建统一的自适应路径构造框架。基于本文成果可自然延伸的方向:将能量匹配思想移植到潜空间模型,尽管 VAE 已丢弃部分高频,仍可在潜谱上定义缺失能量并做逐样本调度;把各向同性热核换成数据驱动学出的滤波器族;与 REPA 类表示对齐方法正交叠加,检验「路径先验」与「损失先验」的收益是否互补;针对弯曲概率路径设计专用的高阶 ODE 求解器,在保持质量的同时进一步压缩 NFE;以及研究释放时钟与噪声调度的联合设计,理论上二者共同决定了信噪比沿路径的分布。

复现评估

复现条件相当友好。代码已开源(GitHub: ysng123/EG-FM),主实验基于公开的 DeCo-XL/16 与 PixelDiT-XL 官方实现及原始超参,HyperDiT-H 为作者按论文复现;数据为公开的 ImageNet-1K 与 BLIP3o(含 BLIP3o-60K SFT 集),无私有数据依赖。附录 A 给出完整数学推导(含 Proposition 1 的端点稳定性证明),附录 C.5 给出热时求解器与训练流程伪代码(Algorithm 1/2),关键实现要点——FP32 谱计算、端点特判 $t \le 10^{-5}$、16 次二分、$\sigma_0 = 3.5$、smootherstep 时钟——均已写明。算力方面,主实验在 8×B200 上进行,ImageNet 256 训练需 200–800 epochs,这是复现的主要门槛;但方法本质是「换路径 + 换目标」,在现有 FM 训练脚本中插入 FFT/二分模块即可,无新增网络参数,工程改动量小。综合评估:推导与代码完整,复现难度中等,瓶颈在训练算力而非方法理解;若只想验证思想,可在 CIFAR 或 ImageNet 子集上快速实验。