← 返回 2026-07-29

面向快速图像与视频生成的并行解码蒸馏 Parallel Decoding Distillation for Fast Image and Video Generation

Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner 📅 2026-07-28 👍 14 2026-08-03 18:30
图像生成 少步采样 扩散蒸馏 流匹配 视频生成 轨迹蒸馏

训练并行解码器,用单次前向同时预测多个去噪步的速度,实现少步、高质、高多样性的扩散与流模型蒸馏。

前置知识

Flow Matching 与扩散模型

它们把生成建模成一个由速度场 $v_t$ 驱动的常微分方程(ODE)$\frac{d}{dt}X_t=v_t(X_t)$,$X_0\sim p_0$(如高斯噪声),$X_1\sim p_1$(数据分布)。训练时通过线性插值过程 $X_t=(1-t)X_0+tX_1$ 拟合 $v_t$,采样时用数值 ODE 求解器从噪声积分到数据。扩散模型是它的随机/分数版本,本文只关心确定性过程,统一当作 flow 处理。

本文的全部方法都建立在 flow 的速度场、概率路径和时间区间积分之上;不理解 ODE 采样就无法理解什么叫预测多个区间的平均速度。

NFE(网络前向评估次数)与蒸馏

NFE(Number of Function Evaluations)指生成一张图/一段视频需要调用神经网络多少次。原始扩散/流模型动辄需要几十到上百次 NFE(如本文 LTX-2.3 教师需要 $4\times30=120$ NFE)。蒸馏(distillation)就是用一个多步的教师模型去训练一个少步的学生模型,把 NFE 压到 1~8 步以降低延迟,本文目标是 4~8 NFE。

PDD 的所有评估都围绕 NFE 与质量/多样性的权衡展开,理解 NFE 才能看懂表格中 2/4/8 NFE 的对比与论文反复出现的少步目标。

平均速度(mean velocity)与 Runge-Kutta 求解

在一个时间区间 $[t_n,t_{n+1}]$ 内,平均速度定义为 $u_n(X_n)=\frac{1}{t_{n+1}-t_n}\int_{t_n}^{t_{n+1}}v_t(X_t)dt$,状态更新为 $X_{n+1}=X_n+(t_{n+1}-t_n)u_n(X_n)$。Euler 法用单次求值 $u_n\approx v_{t_n}(X_n)$ 近似,Midpoint 法用两次求值在区间中点近似,精度更高。本文用这些数值方法从教师模型构造蒸馏目标。

PDD 的核心就是让学生在一次前向里预测一个 block 内所有区间的平均速度 $u_k$,这是理解其方法与损失公式 $\mathcal{L}_{PD}$ 的钥匙。

分布蒸馏与 VSD/对抗损失(DMD/DMD2)

分布类蒸馏(distribution-based)不要求学生逐轨迹跟随教师,只需对齐两者的边缘分布 $p_t$。代表方法包括 ADD/LADD(对抗损失)、DMD/DMD2(引入变分分数蒸馏 VSD 损失)、$f$-distill、SiD 等。它们在大规模视频蒸馏中占主导,但优化困难、易发生模式崩溃(mode collapse),导致生成多样性下降、视频缺乏运动、画面静止。

这些正是 PDD 要克服的痛点:论文反复用 DMD2、AnyFlow 等做基线,证明自己在多样性/运动上更优而无需 VSD 或 GAN 损失。

Classifier-Free Guidance(CFG)

CFG 通过同时跑条件 $v_t(x|c)$ 与无条件 $v_t(x)$ 两条前向,再用引导速度 $v^w_t(x|c)=v_t(x)+w\bigl(v_t(x|c)-v_t(x)\bigr)$ 增强条件遵从,$w$ 是引导尺度。本文沿用此做法,并发现对 Wan 的无条件分支跳过一层(1.3B 跳第 10 层、14B 跳第 12 层)能提升 PDD 性能。

实验里大量涉及引导尺度 $w$ 的选择,且 PDD 把多种引导(CFG、跨模态、时空跳层)都融进教师速度以避免额外 NFE,理解 CFG 才能看懂这些设置。

On-policy 训练与 stop-gradient

On-policy 指在学生自己生成的轨迹上估计监督信号。PDD 先用学生速度从 $X_n$ 推进到 $\bar{X}_k$,再在 $\bar{X}_k$ 处用教师求平均速度作为目标,对 $\bar{X}_k$ 施加 stop-gradient($\text{sg}(\cdot)$)切断反传,避免额外显存与计算开销。数据无关版本还会把状态逐步携带到下一迭代。

这是 PD 损失可扩展到大模型的关键技巧,也是 Algorithm 2/3 与损失公式 $\mathcal{L}_{PD}$ 的核心机制。

研究动机

大规模扩散与流模型(文生图、文生视频、多模态)生成质量极高,但其采样本质是迭代式 ODE 求解,动辄需要几十到上百次网络前向(NFE)。例如本文使用的 LTX-2.3 教师生成 10s 720p 视频需要 $4\times30=120$ NFE,这种延迟和算力成本成为内容编辑、实时视频、交互式世界模型等应用的主要瓶颈。当前加速路线主要分两类:轨迹类(progressive distillation、consistency model、mean flow、flow map distillation)在图像上效果不错,但放到大规模视频模型上往往质量塌缩、训练算法昂贵,且依赖 Jacobian-vector product(JVP)或有限差分,在大模型上代价高昂、训练不稳;分布类(ADD、LADD、DMD/DMD2、APT、$f$-distill 等)用 VSD 或对抗损失把模型蒸馏成少步生成器,是目前视频蒸馏的主流,但这类损失以优化困难、易模式崩溃著称,直接后果是视频多样性丧失、缺乏运动、画面近乎静止。即便近期工作用轨迹损失去正则化分布损失,仍然存在交替优化目标、显存需求高、模式崩溃等问题。

本文的目标是作者想要设计一种既简单又可扩展的轨迹类蒸馏方法,在不牺牲质量的前提下,把扩散/流模型的推理 NFE 压到 4~8 步,同时保住生成的多样性与运动。具体目标包括:(1) 与任意预训练模型兼容,不需要重新设计骨干网络,能直接挂载到现成的 SiT、Qwen-Image、Wan、LTX 等大模型上;(2) 使用单一的、基于回归的训练目标,完全避开 VSD、对抗(GAN)损失、Jacobian-vector product(JVP)、有限差分以及多阶段训练流程,从而规避这些机制带来的优化困难与训练不稳;(3) 训练一个模型即可在推理时灵活选择不同 NFE(变 NFE),无需引入第二个时间坐标或额外的时间条件嵌入;(4) 在 LTX-2.3 文生视频/音频、Wan2.1 14B 文生视频、Qwen-Image 文生图等大规模任务上达到 4~8 NFE 的 SOTA 性能;(5) 相比 DMD2、AnyFlow 等分布类基线,在视频多样性、运动幅度、对教师轨迹的忠实度上取得明显改善,缓解模式崩溃导致的画面静止问题。

与已有工作不同的是,PDD 的独特切入角度在于重新定义『少步』的实现方式。以往轨迹类方法的直觉是把多个去噪步合并成一个更大的步(如 progressive distillation 逐步放大步长、consistency model 学任意中间态到终态的映射),本质是『一步走更远』。PDD 反其道:不合并步,而是训练一个并行解码器,让它看一眼初始状态 $X_n$,就同时输出一个 block 内 $L$ 个区间的平均速度。其理论依据是一个被多数方法忽略的事实——给定初始状态 $X_n$,该 block 内的离散流过程完全被确定,因此完全可以用单次前向预测全部 $L$ 个平均速度。更进一步,PDD 用 $N$ 个可学习线性层(而非 $L$ 个、也非 flow map 的连续时间条件)把『整段区间平均速度』分解为并行子区间预测,通过对共享骨干的梯度在期望意义下恢复完整区间的训练信号,从而优雅地避开 flow map/Lagrangian 公式所需的 JVP 或有限差分。

核心方法

整体思路先讲直觉:经典 ODE 求解每推进一步都要调用一次教师网络,而 PDD 训练一个学生(并行解码器),让它看一眼初始状态 $X_n$,就同时输出一个 block 内 $L$ 个区间的平均速度,从而用一次前向顶替 $L$ 次串行求解。技术路线上,先把时间域 $[0,1]$ 离散成 $N$ 个区间 $0=t_0<t_1<\cdots<t_N=1$,再把它切成大小为 $L$ 的 block(图 2)。并行解码器 $\bar{u}^{\theta}_n(\cdot|X_n)\in\mathcal{X}^L$ 用单次前向预测 block 内所有区间的平均速度 $\bar{u}^{\theta}_n(k|X_n)\approx u_k(X_k)$。训练时目标是教师模型用 Runge-Kutta(Euler 或 Midpoint)算出的平均速度,并采用 on-policy 策略:在学生自己推进出的状态 $\bar{X}_k$ 上估计教师的平均速度,并对 $\bar{X}_k$ 施加 stop-gradient 切断反传。推理时把 block-step 规则 $\bar{X}_{n+L}=X_n+\sum_{k=n}^{n+L-1}(t_{k+1}-t_k)\bar{u}^{\theta}_n(k|X_n)$ 重复 $N/L$ 次即可,从而以 $N/L$ 次 NFE 完成采样。训练时在 $[L_{\min},L_{\max}]$ 范围内随机采样 block 大小,使一个模型同时支持多种 NFE;再配合层融合,推理时每个 block 只持有一个融合线性层,开销与原模型相当,没有额外计算负担。

核心创新点是与已有轨迹方法的本质区别:不是把多步塌缩成一大步,而是『并行预测多个区间的平均速度』。这建立在一个关键观察上——block 内的离散流过程由初始状态 $X_n$ 完全决定,所以单次前向就能给出全部 $L$ 个平均速度。这与最相关的 Pi-Flow 形成鲜明对比:Pi-Flow 蒸馏连续时间的瞬时速度 $v$,用一个高斯混合策略头、且只能固定 NFE;PDD 则离散化时间、蒸馏数值近似的平均速度 $u$、用融合线性层、并支持变 NFE。另一个本质区别在于架构:PDD 复用教师骨干,把最后一层线性层复制 $N$ 份($\bar{u}^{\theta}_n(k|x_n)=W^{\theta}_k H^{\theta}_{t_n}(x_n)$,教师为 $v_t(x)=WH_t(x)$),每份对应网格里的一个时间步,因此一个模型即可覆盖任意 block 大小,无需像 flow map 那样引入第二个时间坐标。再配合层融合,推理时一个 block 只需一个融合线性层,零额外开销。

方法步骤详情

完整步骤如下。(1) 设定时间网格:图像用 $N=128$(Euler)/$N=64$(Midpoint),文生图/视频用 $N=256/128$,文生视频采用 shift 变换 $t_n=\text{shift}_s(n/N)$ 重参数化(Qwen $s=5$、Wan $s=6$、LTX $s=10$)。(2) 初始化并行解码器:复制教师骨干,把最后一层线性层在正确 reshape 后复制 $N$ 份,保证每个并行步都从教师最后一层初始化;LTX 的视频塔和音频塔都这么做。(3) 训练(Algorithm 2,on-policy):以 $L_{\min}$ 的倍数采样 block 起点 $n$,用插值过程采初始态 $X_n\sim p_{t_n}$;学生前向 $u=\text{student}(X_n,t_n)$ 给出全部 $N$ 个预测;在 $[n,n+L_{\max})$ 内采样 $k$,用学生速度从 $n$ 推进到 $\bar{X}_k$;教师在 $\bar{X}_k$ 处做一次 Runge-Kutta 得到目标 $u_k$;损失 $\mathcal{L}_{PD}(\theta)=\mathbb{E}\bigl[\lVert\bar{u}^{\theta}_n(k|X_n)-u_k(\text{sg}(\bar{X}_k))\rVert^2\bigr]$。(4) 数据无关版本(Algorithm 3):跨迭代携带状态,用 $L_{\min}$ 步加 stop-gradient 推进,到 $n==N$ 时重置为高斯噪声。(5) 推理(Algorithm 1):初始化噪声,按 $L$ 步循环,每次一次前向 + 一次 block 推进;配合层融合每个 block 只持有一个融合线性层。(6) CFG/跨模态/时空引导都直接融进教师速度,不增加 NFE。

技术新颖性

技术新颖性体现在几个互相支撑的设计上。第一,『并行预测』范式本身来自『block 由初始态完全确定』的观察,使单次前向预测多步成为可能,这是与 progressive distillation/consistency model『合并成大步』的根本不同。第二,用 $N$(网格大小)而非 $L$(block 大小)个线性层,让单一模型支持任意 block 大小而无需第二个时间坐标——这把 PDD 与 flow map 类方法(Align Your Flow、Mean Flow、Terminal Velocity Matching 等)区分开。第三,层融合($W^{\theta}_{n:n+L}=\sum_{k=n}^{n+L-1}\Delta_k W^{\theta}_k$,$\Delta_k=(t_{k+1}-t_k)/(t_{n+L}-t_n)$)把多个子区间线性层在推理时融合成一个输出『块平均速度』的层,使推理零额外开销,并澄清了与 flow map 的联系:flow map 回归位移的导数(需要 JVP),PDD 用可学习线性层把平均速度预测分解为并行子区间预测,靠骨干梯度在期望下恢复整段信号。第四,Proposition 1 形式化证明了 PD 损失的极小化器(在 Runge-Kutta 近似误差之内)精确采样教师轨迹 $\bar{X}_n=X_n$。Table 1 把 flow-map 蒸馏、Pi-Flow、PDD 在 NFE 可变性、是否需要 JVP/有限差分、推理头形式上做了清晰对比。

采样轨迹被离散为 N 个区间,按大小 L 分组成 block;并行解码器用单次前向预测一个 block 内所有区间的平均速度。
Figure 2: 采样轨迹被离散为 N 个区间,按大小 L 分组成 block;并行解码器用单次前向预测一个 block 内所有区间的平均速度。
PDD 学生用单次评估近似多个连续区间的平均速度;右侧以 block 大小 L=4 演示 PD 损失的估计流程。
Figure 3: PDD 学生用单次评估近似多个连续区间的平均速度;右侧以 block 大小 L=4 演示 PD 损失的估计流程。
并行解码器架构(b)与预训练流模型(a)对比;生成时可把多层融合成单层(c)。
Figure 4: 并行解码器架构(b)与预训练流模型(a)对比;生成时可把多层融合成单层(c)。
ImageNet-256 上 PDD 在 NFE=1/2/4/8 下 FID 随训练迭代的变化。
Figure 9: ImageNet-256 上 PDD 在 NFE=1/2/4/8 下 FID 随训练迭代的变化。
PDD 与 Wan2.1 14B 教师在 10 条轨迹上的平均曲率对比(仅统计块内曲率)。
Figure 17: PDD 与 Wan2.1 14B 教师在 10 条轨迹上的平均曲率对比(仅统计块内曲率)。

实验结果

在四类任务上验证。(1) ImageNet-256(SiT-XL+REPA 教师,引导 $w=2.9$):NFE=1 时 PDD-Midpoint FID 2.69、PDD-Euler 2.73,优于 Pi-Flow 的 2.85(FreeFlow 1.45 最低但它固定 NFE 且需额外网络);FID 随 NFE 下降,Midpoint 全程优于 Euler;8 NFE 时 FID 略升,可用更低引导尺度缓解。(2) Qwen-Image 文生图:PDD 在 OneIG-EN/DPG-Bench/GenEval 三个基准的总分上于 NFE=2/4/8 均最佳,NFE=4 时 OneIG 0.538(Midpoint)对 DMD2 0.524、Pi-Flow 0.533,DPG 88.66 对 DMD2 88.25,GenEval 0.86。在人类偏好(HPSv2/PickScore)上 DMD2 略高(HPSv2 32.34 对 31.33),但 DMD2 严重模式崩溃——NFE=4 时 OneIG 多样性仅 0.095,PDD 达 0.192。(3) Wan2.1 文生视频(VBench):1.3B 上 PDD-Midpoint 总分 84.94(第一)、质量分 86.45(第一)、V-JEPA2 余弦多样性 0.1032(第一,对 DMD2 0.0833、AnyFlow 0.0704);14B 上 PDD-short(200 迭代)总分 84.92、质量 85.71,仅次 AnyFlow(84.95),且运动与多样性更高,8 NFE 时 PDD-short 84.96 对 AnyFlow 85.08。(4) LTX-2.3 22B 文生视频/音频(720p、10s):PDD 仅训 250 迭代、8 NFE 即与官方蒸馏模型持平或更优;Gemini 3.1 Pro 评判 300 组配对中,四轴平均 PDD 胜 142、平 35、负 123(均分 2.62 对 2.59)。整体看,PDD 在四个任务的少步设定下均达到或接近 SOTA,且在不引入 VSD/对抗损失的前提下显著改善了多样性与运动,作者称这是首个用于少步高分辨率视频的纯轨迹类蒸馏方法。

flow-map 蒸馏、Pi-Flow 与 PDD 的高层差异(NFE 可变性、是否需 JVP/有限差分、推理头形式)。
Table 1: flow-map 蒸馏、Pi-Flow 与 PDD 的高层差异(NFE 可变性、是否需 JVP/有限差分、推理头形式)。
ImageNet-256 上 NFE=1 的 FID(引导 2.9)。
Table 2: ImageNet-256 上 NFE=1 的 FID(引导 2.9)。
Qwen-Image 在 OneIG-EN、DPG-Bench、GenEval 上的总分(NFE=2/4/8)。
Table 3: Qwen-Image 在 OneIG-EN、DPG-Bench、GenEval 上的总分(NFE=2/4/8)。
Qwen-Image 在 HPSv2、PickScore 与 OneIG 多样性上的表现。
Table 4: Qwen-Image 在 HPSv2、PickScore 与 OneIG 多样性上的表现。
Wan2.1 1.3B 与 14B 在 VBench 上的表现及多样性(V-JEPA2/VideoMAE V2)。
Table 5: Wan2.1 1.3B 与 14B 在 VBench 上的表现及多样性(V-JEPA2/VideoMAE V2)。
LTX-2.3 教师(4×30 NFE)、PDD(8 NFE)与官方蒸馏模型(8 NFE)的 10s 720p 带音频视频对比;以及 Wan2.1 14B 上 PDD vs DMD2、AnyFlow(4 NFE)在两个噪声种子下的多样性对比。
Figure 1: LTX-2.3 教师(4×30 NFE)、PDD(8 NFE)与官方蒸馏模型(8 NFE)的 10s 720p 带音频视频对比;以及 Wan2.1 14B 上 PDD vs DMD2、AnyFlow(4 NFE)在两个噪声种子下的多样性对比。
Wan2.1 14B 上 PDD-Midpoint 与 DMD2、AnyFlow(均 4 NFE)在多组提示下的定性对比。
Figure 5: Wan2.1 14B 上 PDD-Midpoint 与 DMD2、AnyFlow(均 4 NFE)在多组提示下的定性对比。
ImageNet-256(SiT-XL+REPA 教师,引导 2.9)上 PDD 的 Euler 与 Midpoint 在不同 NFE 下的 FID。
Figure 6: ImageNet-256(SiT-XL+REPA 教师,引导 2.9)上 PDD 的 Euler 与 Midpoint 在不同 NFE 下的 FID。
LTX-2.3 教师(4×30 NFE)与 PDD、官方蒸馏模型(均 8 NFE)在森林、动画等提示下的对比。
Figure 7: LTX-2.3 教师(4×30 NFE)与 PDD、官方蒸馏模型(均 8 NFE)在森林、动画等提示下的对比。
Wan2.1 1.3B 与 14B 上 VBench 全维度(质量/语义/时序/动态等)雷达对比。
Figure 18: Wan2.1 1.3B 与 14B 上 VBench 全维度(质量/语义/时序/动态等)雷达对比。
由 Gemini 3.1 Pro Preview 评判的 PDD 与官方蒸馏 LTX-2.3(均 8 NFE)逐轴偏好(提示对齐/视觉/运动/音频)。
Figure 22: 由 Gemini 3.1 Pro Preview 评判的 PDD 与官方蒸馏 LTX-2.3(均 8 NFE)逐轴偏好(提示对齐/视觉/运动/音频)。
查看结构化数据
任务指标本文基线提升
ImageNet-256 类条件图像生成(NFE=1,FID↓) FID PDD-Midpoint 2.69 / PDD-Euler 2.73 Pi-Flow 2.85;FreeFlow 1.45 优于 Pi-Flow;FreeFlow 更低但固定 NFE 且需额外网络
Qwen-Image 文生图 OneIG-EN(NFE=4,Overall↑) OneIG-EN Overall PDD-Midpoint 0.538 / Euler 0.535 DMD2 0.524;Pi-Flow 0.533;TwinFlow 0.502 PDD 取得最佳总分,+0.014 对 DMD2
Qwen-Image 文生图 DPG-Bench(NFE=4,Overall↑) DPG-Bench Overall PDD-Midpoint 88.66 / Euler 88.45 DMD2 88.25;Pi-Flow 88.11 PDD 最佳,+0.41 对 DMD2
Qwen-Image 文生图多样性 OneIG diversity(NFE=4↑) OneIG diversity PDD-Euler 0.192 / Midpoint 0.174 DMD2 0.095;Pi-Flow 0.182 PDD 多样性约为 DMD2 的 2 倍,印证抗模式崩溃
Wan2.1 1.3B 文生视频 VBench Overall(NFE=4↑) VBench Overall PDD-Midpoint 84.94 / Euler 84.44 DMD2 84.69;AnyFlow 84.45;rCM 84.43 PDD 总分第一,质量分 86.45 亦第一
Wan2.1 1.3B 视频多样性 V-JEPA2 余弦(NFE=4↑) V-JEPA2 Cosine PDD-Midpoint 0.1032 / Euler 0.1018 DMD2 0.0833;AnyFlow 0.0704 PDD 多样性最高,运动更丰富
LTX-2.3 文生视频/音频 720p 10s(8 NFE,Gemini 评判) 四轴平均胜/平/负 PDD 胜 142 / 平 35 / 负 123,均分 2.62 官方 distilled 8 步,均分 2.59 PDD 仅训 250 迭代即持平或优于官方蒸馏

局限与改进

作者承认的局限:(1) 大规模文生图/视频实验全部依赖数据无关训练,数据相关设定(除 ImageNet-256 外)尚未探索;(2) ImageNet 上 8 NFE 时 FID 反而上升,需要靠降低引导尺度来缓解,存在 NFE 与引导尺度的耦合权衡;(3) LTX-2.3 因算力只跑了 Euler、单区间,未能验证 Midpoint 的潜在增益。我自己观察到的局限:在人类偏好指标(HPSv2/PickScore)上 DMD2 仍略胜,说明 PDD 的样本在美学打磨上可能略逊于分布类方法;Wan 14B 上长训(3k 迭代)的总分(84.69)反而低于短训(200 迭代,84.92),训练动力学需要更细致的监控/早停策略;多样性指标用的是 V-JEPA2/VideoMAE 特征距离这一代理量,并非真正的语义多样性;论文未给出与基线在训练算力/显存上的正面对比表;方法强依赖一个高质量教师,教师不佳时效果上限受限。

独立分析的弱点

第一,美学偏好略弱:在 HPSv2/PickScore 上 DMD2 略高(32.34 对 31.33),改进方向是叠加轻量分布类精修或奖励微调,把 PDD 的多样性与分布类的美学结合。第二,训练迭代敏感性:Wan 14B 长训反不如短训,说明需要更稳健的停止准则、EMA 调度或课程式 block 大小策略。第三,数据无关仅在大规模验证:未在有标注高质量数据上验证,可尝试用精选数据进一步提升质量。第四,强教师依赖:尚未实现自蒸馏/从零训练(作者提到需不同流水线与更多算力),可作为延伸。第五,block 大小在推理时仍从训练好的离散集合里选:可做成按样本自适应(作者列为未来工作)。第六,LTX 仅用 Euler:算力允许时应补 Midpoint 以提精度。每个弱点都有明确改进路径,且大多不触碰 PDD 的核心公式,工程上可落地。

未来方向

作者明确提出的方向:(1) 在数据相关设定(ImageNet-256 之外)下研究 PDD;(2) 自适应 block 大小选择——用一个验证器或置信度准则在生成时动态决定跨多少区间;(3) 把并行解码原理推广到离散自回归模型,拓宽 PDD 在扩散/流之外的适用面。基于成果可延伸的方向:把 PDD 改造为自蒸馏/从零训练框架(作者指出需要更大数据集与算力,但理论可行);将 PDD 与分布类损失混合,兼得质量与多样性;面向 3D 生成、纯音频等其他模态;结合自适应算力分配实现质量-延迟可调。此外,可探索把 PDD 用于实时内容生成、交互式世界模型等对延迟敏感的场景,借助其变 NFE 特性在不同硬件上动态调节步数;也可研究更细的 block 内置信度估计,判断何时该信任大 block、何时退回小 block,从而在质量与速度间取得更精细的平衡。

复现评估

可复现性较强。论文提供项目页 research.nvidia.com/labs/genair/pdd2026,并给出三份 PyTorch 伪代码:采样(Algorithm 1)、PD 损失(Algorithm 2)、数据无关损失(Algorithm 3)。训练超参详尽:AdamW、常数学习率(ImageNet 5e-5、文生图/视频 1e-5)、批大小(T2I/LTX 2048、Wan 256)、EMA(ImageNet 0.99995、Wan-long 0.99)、网格 $N=128/256$(Euler)与 $64/128$(Midpoint)、shift 尺度 $s=5/6/10$、CFG 尺度(Wan $w=5$、LTX 视频 4.5/音频 7 等)、以及层跳过细节(1.3B 跳第 10 层、14B 跳第 12 层)。所用教师(SiT-XL+REPA、Qwen-Image、Wan2.1、LTX-2.3)与数据集(ImageNet、Pi-Flow 提示集、ViMix-14M、VidProm)均为公开资源。核心算法简单,在小规模(ImageNet)上较易自行复现。但全规模视频训练(22B LTX、14B Wan)未明确披露算力规模,需要大量 GPU,普通团队难以完整复现;此外基线指标由作者自行重评(标 *),存在轻微评测偏差风险;代码/权重正式发布时间以项目页为准。PD 损失只有一个 MSE 项、无需判别器或额外网络,工程上比分布类方法更易调参,作者也强调其对超参选择更鲁棒、各次评估结果一致,综合来看算法层面的复现门槛较低,瓶颈主要在于大规模视频蒸馏的算力需求。