MeanFlowNFT:将前向过程强化学习引入平均速度生成器 MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators
首个MeanFlow前向过程强化学习,用诱导瞬时速度预测器优化平均速度生成器。
前置知识
MeanFlow 平均速度生成器
MeanFlow是一种少步生成的流映射模型。与传统Flow Matching沿ODE逐积分瞬时速度不同,它直接预测时间区间 $[s,t]$ 上的平均速度 $u(x_t,s,t)=\frac{1}{t-s}\int_s^t v(x_\tau,\tau)d\tau$。由于平均速度给出区间端点的精确位移 $x_s=x_t-(t-s)u(x_t,s,t)$,一步或几步即可完成采样,大幅减少网络评估次数。其训练依赖MeanFlow恒等式 $v=u+(t-s)?rac{d}{dt}u$,把不可计算的平均速度回归目标转化为可训练形式,并以s→t时 $u$ 退化为瞬时速度为极限。
本文全部方法建立在MeanFlow的平均速度参数化之上,理解平均速度与瞬时速度的转换关系是读懂诱导预测器 $V_ heta$ 及其策略改进保证的前提。
DiffusionNFT 前向过程强化学习
DiffusionNFT是一种基于前向加噪过程的扩散/流模型在线RL方法。它对每个提示采样K张图、用奖励 $r\in[0,1]$ 打分,按奖励高低把旧策略切分为正负后验 $\pi^+\propto r\pi_{old}$、$\pi^-\propto(1-r)\pi_{old}$,再通过共享的强化引导方向 $\Delta=?lpha v^+-v^{old}$ 与CFG式目标 $v^*=v^{old}+\frac{1}{\beta}\Delta$ 优化瞬时速度。它无需反向过程轨迹、无需似然估计,比GRPO式逐步策略梯度高效得多。
MeanFlowNFT就是把DiffusionNFT的目标迁移到MeanFlow上,理解其正负策略分解和隐式参数化是看懂目标函数 $\mathcal{L}_{MFNFT}$ 的关键。
Flow Matching 流匹配
Flow Matching学习一个概率流ODE,把高斯噪声传输到数据分布。给定调度 $(\alpha_t,\sigma_t)$,前向过程 $x_t=\alpha_t x_0+\sigma_t\epsilon$,对固定 $(x_0,\epsilon)$ 求导得条件速度 $v_t=\dot\alpha_t x_0+\dot\sigma_t\epsilon$。在平方损失下最优预测器是后验边际瞬时速度 $v(x_t,t)=\mathbb{E}[v_t\mid x_t,c,t]$。rectified flow取 $\alpha_t=1-t,\sigma_t=t$ 故 $v_t=\epsilon-x_0$。推理时需对 $dx_t/dt=v$ 积分,通常需要很多步。
Flow Matching是MeanFlow与DiffusionNFT的共同基础,瞬时速度的后验均值性质正是DiffusionNFT线性分解 $v^{old}=\alpha v^+ + (1-\alpha)v^-$ 与策略改进保证的数学根源。
EMA参考网络与CFG隐式引导
本文沿用DiffusionNFT做法,用冻结的参考网络 $u^{old}$ 作旧策略,并通过对可训练 $u_\theta$ 做指数移动平均(EMA)更新 $u^{old}$,步长 $\eta_i=\min(0.001\,i,0.5)$。隐式正负预测器采用分类器自由引导式构造:$V_\theta^+=(1-\beta)V^{old}+\beta V_\theta$、$V_\theta^-=(1+\beta)V^{old}-\beta V_\theta$,引导强度 $\beta$ 控制偏离参考模型的幅度。
EMA参考网络与CFG式隐式参数化是MeanFlowNFT目标与稳定训练的核心组件,理解它们才能看懂为何需要共享总导数项来抑制参考漂移。
研究动机
MeanFlow因预测时间区间上的平均速度而支持一步或少步高效采样,已成为越来越实际的部署目标,但针对它的强化学习对齐几乎空白。现有高效的DiffusionNFT是一种基于前向加噪过程的在线RL,无需反向轨迹、无需似然估计,但它优化的是瞬时速度 $v(x_t,t)$,而MeanFlow采样用的是平均速度 $u(x_t,s,t)$,二者存在本质错配。直接把DiffusionNFT套到少步生成器上会失败:AnyFlow训练的是平均速度网络,DMD、CDM由分布匹配训练而非流匹配,它们都不把瞬时速度作为后验均值预测,于是DiffusionNFT策略改进所依赖的线性性 $v^{old}=\alpha v^+ +(1-\alpha)v^-$ 不复存在,无法导出任何改进保证。实验上CDM+DiffusionNFT在约400步内就发散崩溃,AnyFlow+DiffusionNFT与DMD+DiffusionNFT也远不及预期且极不稳定。
本文的目标是本文的目标是为MeanFlow构建首个前向过程RL框架MeanFlowNFT,使其能被奖励信号高效微调,同时严格保留三方面特性:训练仍是likelihood-free且只走前向加噪过程(区别于需离散化反向采样器、逐步估计似然的GRPO式策略梯度);推理仍使用MeanFlow原生的少步平均速度采样器,享受一步或几步的效率;并在理想化设定下具备与DiffusionNFT相同的严格策略改进保证,即最终策略期望奖励 $J(\pi_{\theta^*})=J(\pi_+)>J(\pi_{old})$。作者希望在文本到图像(SD3.5-M)和文本到视频(Wan2.1 1.3B)两类任务上全面验证,并以远少于多步RL的采样次数超越多步RL基线。
与已有工作不同的是,本文的独特切入角度是:让网络继续停留在平均速度空间(保住少步采样),但把RL优化搬到瞬时速度空间(让DiffusionNFT可用),两套空间用MeanFlow恒等式桥接。具体地,作者从平均速度网络 $u_\theta$ 出发,借助恒等式 $v=u+(t-s)\frac{d}{dt}u$ 构造一个诱导瞬时速度预测器 $V_\theta$,再对 $V_\theta$ 施加DiffusionNFT目标。这样优化作用在瞬时速度上、采样仍用平均速度,二者被解耦;而且由于 $V_\theta$ 由全区间预测 $u_\theta(x_t,s,t)$ 构造,优化 $V_\theta$ 实际仍在强化底层平均速度,而非退化成只在 $s=t$ 上的普通Flow Matching。这一桥接此前无人提出。
核心方法
MeanFlowNFT的整体思路可一句话概括:保持网络在平均速度空间、把优化搬到瞬时速度空间,用MeanFlow恒等式做桥。DiffusionNFT之所以高效,是因为它在前向加噪过程上对比正负样本、把奖励折叠进流匹配目标,而这些推导全部建立在瞬时速度作为后验均值的线性性上;MeanFlow不预测瞬时速度,直接套用就破坏了这一线性性。作者利用MeanFlow恒等式 $v(x_t,t)=u(x_t,s,t)+(t-s)\frac{d}{dt}u(x_t,s,t)$,把 $u_\theta$ 代入得到诱导瞬时速度预测器 $V_\theta(x_t,s,t)=u_\theta+(t-s)[\partial_t u_\theta+(\partial_x u_\theta)\hat v_\theta]$,其中 $\hat v_\theta(x_t,t)=u_\theta(x_t,t,t)$,再对 $V_\theta$ 施加DiffusionNFT式的正负隐式参数化与奖励加权目标。由于 $V_\theta$ 由全区间预测构造,优化它仍强化平均速度 $u_\theta$,而推理沿用原生少步采样器 $x_{t_{i-1}}=x_{t_i}-(t_i-t_{i-1})u_\theta(x_{t_i},t_{i-1},t_i)$。
核心创新是诱导瞬时速度预测器 $V_\theta$ 及其配套目标函数。与已有方法的本质区别在于:它不直接把DiffusionNFT作用在 $u_\theta$(那样丢掉后验均值的线性性),也不只优化 $s=t$ 处的瞬时速度 $u_\theta(x_t,t,t)$(那样退化成普通Flow Matching、失去少步采样),而是通过恒等式构造一个从全区间平均速度导出的瞬时速度预测器,使优化目标落在瞬时速度空间、可调用的DiffusionNFT改进保证得以保留,同时因为构造来自 $u_\theta(x_t,s,t)$,改进会迁移回平均速度。理论侧,作者证明理想点最优 $V_\theta^*=V^{old}+\frac{\beta}{2}\hat\Delta$(命题3.1),当 $\beta=2\alpha$ 时 $V_\theta^*=v^+(x_t,t)$(推论3.2),再借助MeanFlow一致性引理得到平均速度网络的最优解恰是 $v^+$ 诱导ODE的精确平均速度,因而 $J(\pi_{\theta^*})=J(\pi_+)>J(\pi_{old})$(定理3.4)。
方法步骤详情
Algorithm 1给出单步更新。采样阶段:取提示 $c$,用冻结参考 $u^{old}$ 经4步MeanFlow采样器生成 $x_0$,奖励模型打分 $r(x_0,c)\in[0,1]$;随机抽区间 $s\le t$ 与噪声 $\epsilon\sim\mathcal N(0,I)$,构造 $x_t=\alpha_t x_0+\sigma_t\epsilon$ 与条件速度 $v_t=\dot\alpha_t x_0+\dot\sigma_t\epsilon$。训练阶段:沿 $v_t$ 位移得 $x_{t\pm\Delta t}=x_t\pm\Delta t\,v_t$;用中心有限差分估总导数 $d=[u^{old}(x_{t+\Delta t},s,t+\Delta t)-u^{old}(x_{t-\Delta t},s,t-\Delta t)]/(2\Delta t)$,仅对EMA参考 $u^{old}$ 估一次(共享导数);构造 $V_\theta=u_\theta(x_t,s,t)+(t-s)d$ 与 $V^{old}=u^{old}(x_t,s,t)+(t-s)d$;CFG式合成正负 $V_\theta^\pm=(1\mp\beta)V^{old}\pm\beta V_\theta$;算损失 $\mathcal L_{MFNFT}=r\|V_\theta^+-v_t\|^2+(1-r)\|V_\theta^- -v_t\|^2$(外加 $10^{-4}$ 权重KL正则),对 $\theta$ 反传更新,并按 $\eta_i=\min(0.001\,i,0.5)$ 更新EMA。
技术新颖性
技术新颖性体现在三点。第一,首次提出面向MeanFlow的前向过程RL:通过MeanFlow恒等式构造诱导瞬时速度预测器 $V_\theta$,使DiffusionNFT目标在瞬时速度空间生效,同时把改进迁移回平均速度网络,既likelihood-free又不动少步采样器。第二,给出从诱导预测器到平均速度网络的完整策略改进理论链(命题3.1→推论3.2→引理3.3→定理3.4),证明在 $\beta=2\alpha$ 时诱导最优恰等于改进策略 $\pi_+$ 的边际速度,其平均速度恰是 $v^+$ 诱导ODE的精确平均速度,从而 $J(\pi_{\theta^*})=J(\pi_+)>J(\pi_{old})$。第三,工程上三项关键设计:用中心有限差分替代昂贵的JVP以兼容FSDP;让可训练与参考预测器共享同一个 $du^{old}/dt$,使诱导偏差 $\|V_\theta-V^{old}\|^2$ 仅由EMA可控的 $u_\theta-u^{old}$ 决定(否则崩溃,图8);用模型无关的条件速度 $v_t=\epsilon-x_0$ 而非 $\hat v_\theta$ 作有限差分方向,省一次网络评估且更稳定(图9)。
实验结果
图像生成(SD3.5-M,4步,1024×1024)上MeanFlowNFT在8项指标中6项最佳(表1):ImageReward 1.4504、CLIPScore 0.2967、PickScore 23.5019、HPSv2 0.3269、HPSv3 13.8826、OCR 0.6534,明显超过少步蒸馏DMD/CDM/AnyFlow及少步RL方法Rdm、RTDMD(OCR 0.6534对RTDMD的0.2965)。更值得关注的是,仅用4步就在多项奖励指标上追平或超过40步DiffusionNFT(ImageReward 1.4504对1.4066、CLIPScore 0.2967对0.2889),函数评估次数减少约10倍;而直接套用DiffusionNFT到少步生成器极不稳定,CDM+DiffusionNFT约400步内发散(图4)。视频生成(Wan2.1 1.3B,4步,表2)在7项指标中5项最佳,VBench总分84.33、质量分85.99、HPSv3-G 6.5959、运动质量MQ 0.9535,全面超过50步LongCat-Video RL(VBench 82.57、MQ 0.5493)。测试时扩展(图5)显示步数 $N\in\{2,4,8,16,32\}$ 增加时多数指标持续提升,且步间一致性优于AnyFlow(图6、7)。消融(图8-10)证明共享导数、用 $v_t$ 作方向、保留 $s<t$ 区间三者缺一不可。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 文本到图像生成(SD3.5-M,4步 vs 40步) | ImageReward | 1.4504(4步) | 1.4066(DiffusionNFT,40步) | 4步反超40步,函数评估次数减少约10倍 |
| 文本到图像生成(SD3.5-M,4步少步RL对比) | OCR | 0.6534 | 0.2965(RTDMD) | +0.3569,约2.2倍 |
| 文本到图像生成(SD3.5-M) | CLIPScore | 0.2967(4步) | 0.2889(DiffusionNFT,40步) | 4步反超40步 |
| 文本到视频生成(Wan2.1 1.3B,4步 vs 50步) | VBench Total | 84.33(4步) | 82.57(LongCat-Video RL,50步) | 4步超50步,+1.76 |
| 文本到视频生成(Wan2.1 1.3B,4步少步对比) | 运动质量MQ(VideoAlign) | 0.9535 | 0.7504(AnyFlow) | +0.2031 |
局限与改进
作者承认:本文只探索了DiffusionNFT这一种前向过程RL目标,未涉及RAM、AWM等其他前向目标;只考虑了MeanFlow这一种流映射模型,未覆盖shortcut模型、一致性轨迹模型(CTM)等其他实例。我补充观察:理论保证仅在最优诱导预测器对一切区间 $s\le t$ 都达到的“理想化设定”下成立,实际靠有限差分近似存在截断误差;少步下OCR 0.6534仍远低于40步DiffusionNFT的0.9098,说明文本渲染等需高精度的指标在4步下仍是短板;奖励主要按单目标分别训练(图像分别用CLIPScore/PickScore/HPSv2),未深入多奖励Pareto权衡;诱导预测器需在 $s<t$ 上额外构造,相对纯DiffusionNFT每步多两次EMA网络评估做有限差分,开销略增。
独立分析的弱点
第一,有限差分近似误差:理论保证依赖 $V_\theta$ 严格等于 $v^+$ 对所有 $s\le t$,实际中心差分引入截断误差,步长 $\Delta t$ 大时偏差大。改进方向:自适应步长或高阶差分,或用兼容FSDP的JVP实现消除近似。第二,OCR短板:4步下OCR 0.6534对比40步DiffusionNFT的0.9098差距明显,文本/细节类任务受益于更多步;可结合测试时扩展用更多步,或在文本密集提示上做针对性奖励微调。第三,单奖励训练:图像三类奖励分别训练,未给出多奖励联合的最优权衡;可引入多目标奖励加权或奖励模型集成。第四,参考漂移风险:共享导数依赖EMA与可训练模型接近,若奖励剧烈漂移可能再次失稳;可监控诱导偏差 $\|V_\theta-V^{old}\|^2$ 做自适应 $\beta$。第五,计算门槛高:需8–32块H20;可提供小规模蒸馏复现脚本降低门槛。
未来方向
作者提出:把诱导瞬时速度构造推广到其他前向过程目标如RAM、AWM(它们同样作用在瞬时速度、同样依赖冻结参考,预计可迁移);推广到更广的流映射模型族——shortcut模型、一致性轨迹模型(CTM)等,因为诱导预测器构造式 $V_\theta=u_\theta+(t-s)\frac{d}{dt}u_\theta$ 并非MeanFlow特有。基于成果可延伸:研究多奖励Pareto对齐与人类偏好对齐;结合测试时扩展做自适应步数选择;把策略改进保证扩展到非理想化设定(给出有限差分误差界);探索该框架在音频、3D等连续生成模态的迁移。
复现评估
复现评估:开源方面论文提供了项目主页、GitHub和HuggingFace链接(代码与checkpoint将发布),AnyFlow视频checkpoint为公开版本,奖励模型CLIPScore/PickScore/HPSv2/HPSv3/VideoAlign均可获取,复现路径较清晰。关键超参数齐备:LoRA rank 32、scaling 64作用于注意力所有线性层,引导强度 $\beta=0.1$,EMA步长 $\eta_i=\min(0.001\,i,0.5)$,KL权重 $10^{-4}$,AdamW恒定学习率 $3\times10^{-6}$,4步rollout;SD3.5-M用8块H20、group size 24、每次48组更新;Wan2.1用32块H20、group size 16、每epoch 8组。主要障碍是算力(数十块H20)与视频训练时长,图像路径相对可复现。有限差分步长 $\Delta t$、采样步数调度等细节需查附录D。整体难度中高,算力是最大门槛。
论文图表