← 返回 2026-08-18

像素空间文生图扩散模型训练的实证研究 An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

Dengyang Jiang, Ruoyi Du, Zhennan Chen, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Xiangpeng Yang, Huanqia Cai, Aiming Hao, Yuming Jiang, Peng Gao, Harry Yang, Steven Hoi 📅 2026-08-17 👍 31 2026-08-23 18:30
像素空间生成 实证研究 扩散模型 文生图 步数蒸馏 流匹配 潜空间到像素迁移

潜空间预训练再迁移像素空间后训练的实证配方,质量持平潜空间模型且推理快3.18–4.75倍

前置知识

潜空间扩散模型(LDM)与 VAE

先用变分自编码器(VAE)把 RGB 图像压缩成低分辨率潜特征(如 8× 空间下采样,配合 latent patch 得到 16× 等效压缩),再在潜空间训练扩散模型做去噪或流匹配生成。潜空间抑制高频冗余、大幅降低计算与显存开销,但潜变量只是原信息的有损压缩,生成质量被 VAE 的重建上限封顶。

本文的核心对比对象与出发点:只有理解「潜空间为何训练快但受 VAE 瓶颈限制」,才能理解作者为什么提出先潜空间预训练、再切换到像素空间的混合路线。

流匹配与预测目标(v-prediction / x-prediction)

流匹配用线性插值路径 $x_t = t x_0 + (1-t)\epsilon$ 定义生成过程,训练网络预测速度场 $v = x_0 - \epsilon$(v-prediction),或直接预测干净样本 $x_0$(x-prediction)。两种参数化可以通过速度场相互转换,但优化难度、训练稳定性与采样行为不同。

论文 4.3 节专门研究:从 v-prediction 潜空间模型初始化的像素模型,后训练时应保留 v-prediction 还是切换为 x-prediction。不懂两种参数化就无法理解这个消融的动机与结论。

信噪比(SNR)与噪声调度

噪声调度决定每个时间步 $t$ 下信号与噪声的相对强度(SNR)。从潜空间换到像素空间时,空间分辨率和数据分布都改变了,同一步骤对应的 SNR 随之变化。论文引入噪声尺度因子 $\gamma$,按 $x_t = t x_0 + (1-t)\gamma\epsilon$、$\epsilon \sim \mathcal{N}(0, I)$ 缩放注入噪声的幅度。

4.5 节的核心内容:按分辨率推导出 $\gamma = r = 8$,但实验发现 $\gamma = 2$ 才是最优,这一反直觉结果说明潜到像素的分布偏移不只是分辨率问题。

Patch 化与 token 预算

DiT 类 Transformer 把图像切成 $p \times p$ 的小块(patch),每个 patch 映射为一个 token,注意力计算量随 token 数近似平方增长。1024² 图像在 16× 等效压缩下是 64×64 = 4096 个 token;patch 边长加倍,token 数就降为 1/4,是推理加速最直接的杠杆。

5.1 节的渐进式 patch 适配(ps16→ps32)把 token 数从 4096 降到 1024 而质量几乎不掉,是实现 4.41× 端到端加速的主要来源之一,也是理解论文效率贡献的基础。

分布匹配蒸馏(DMD)

蒸馏技术让少步(4 步甚至 1 步)学生模型逼近多步教师模型的输出分布。经典 DMD 用「假样本评分与真实分布评分之差」作为分布匹配梯度,再配合对教师样本的回归损失;Decoupled-DMD 和 DMDR 是其改进变体,可分阶段稳定训练。

5.2 节把蒸馏从潜空间搬到像素空间:像素空间没有 VAE 解码的固定延迟,NFE 的减少能直接转化为端到端加速,最终 4 NFE 出图仅需 0.20 秒。

GenEval 与 DPG 自动评测

GenEval 是基于目标检测的文生图对象级正确性评分(0–1),检查生成图是否包含 prompt 要求的物体、数量与属性;DPG 基于 LLaVA 类多模态大模型逐条评估生成图对 prompt 细粒度描述的符合度(0–100 分)。两者是文生图社区最常用的快速自动评测。

论文几乎所有的消融曲线(Figure 2/4/6/8/11)和主表(Table 3)都以 GenEval 与 DPG 作为主要量化指标,不知道它们衡量什么,就无法解读实验结论的含义与局限。

研究动机

主流文生图系统(Stable Diffusion、FLUX、Seedream 等)几乎都建立在潜空间扩散(LDM)之上:先用 VAE 把图像压缩到低维潜空间,再在潜空间做扩散。这条路线的代价是生成质量被 VAE 的重建上限封顶——激进的潜空间压缩会丢弃细粒度纹理与细节;训练一个大规模自动编码器本身就需要海量数据、算力与经验性调参;VAE 的重建目标与扩散的生成目标错配,还会引入潜空间分布偏移,造成纹理平滑、颜色失真等伪影;推理时额外的 VAE 解码阶段也增加了时延。另一方面,像素空间扩散理论上能绕开这些瓶颈——直接从 RGB 学习、直接输出像素、还能用更大 patch 灵活权衡效率与质量而不用提高 VAE 压缩率——但现有研究几乎都停留在类条件 ImageNet 或小规模文生图上,数据与模型规模有限(论文引用的 PixArt 类小规模工作、PixelDiT 等),训练配方与扩展行为无人系统研究。因此在真实的大规模文生图设定下,两个根本问题始终没有答案:同等预训练条件下,像素空间与潜空间扩散的训练效率到底差多少?以及是否存在一套训练配方,能让像素空间模型在生成质量与推理效率上都和成熟的潜空间模型抗衡?

本文的目标是本文的目标是在大规模文生图设定下系统回答上述两个问题,并给出可直接落地的像素空间训练配方。具体分三步:第一,在完全受控的条件下做对照实验——同一 Z-Image 6B Transformer 骨干、同一 Qwen-3-4B 文本条件模块、同一份超过 200 亿(20B+)图文对的训练语料、同样的渐进分辨率计划(256²→512²)、批大小、学习率与优化器,只改变预测空间(潜空间 vs 像素空间),量化两种范式在收敛速度与最终性能上的差异;第二,如果直接像素预训练不划算,就验证一条替代路径——在潜空间高效获取生成先验,再在后训练阶段迁移到像素空间——并把这次「潜到像素」转换中的五个关键设计(权重初始化、训练数据、预测目标、解码器结构、噪声调度)逐一做成受控消融,总结出可复用的实践准则(Takeaway 1–6);第三,在此基础上叠加渐进式 patch 大小适配(ps16→ps32)与少步蒸馏(4 NFE),把像素空间「无需 VAE 解码」的结构优势转化为实际可测的端到端推理加速,目标是在 GenEval/DPG/OneIG/LongText 等基准不落后的前提下大幅降低时延,并在 Z-Image 与 FLUX2-klein 两个模型家族上验证配方的普适性。

与已有工作不同的是,本文的独特之处在于「先诊断、再开方」的实证路线。此前的 latent-to-pixel 方法(L2P、AsymFlow 等)直接给出单一配方,但从未解释为什么必须两阶段、为什么不能直接做像素预训练。本文第一次用严格受控的大规模对照实验(20B+ 图文对、同一骨干、同算力、仅改预测空间)证明:像素空间预训练收敛显著更慢且在同预算下性能更低,从而为「潜空间预训练 + 像素空间后训练」提供了因果依据,而不只是经验选择。其次,它把迁移过程分解为五个相对正交的设计维度逐一消融,得到多条与直觉相悖的结论:按分辨率推导的噪声尺度 $\gamma = r = 8$ 并非最优(实测 $\gamma = 2$ 最好);从 v-prediction 潜空间模型初始化后应切换为 x-prediction;用源模型自生成数据比真实数据收敛更快但会继承排版伪影,两者按 1:1 混合才是最优。第三,它把「像素解码器结构」这个在文生图设定下几乎未被系统比较过的维度纳入研究,横向对比 JiT/DiP/PiT/Deco/VAE 五种设计;最后把 patch 适配与蒸馏组合,指出潜空间蒸馏在超少步区间的加速上限恰是被 VAE 解码的固定开销封顶的,而像素空间天然解除这一上限——这一系统视角是先前 latent-to-pixel 工作所不具备的。

核心方法

直觉上,这项工作把 VAE 潜空间重新定位为「高效的知识获取媒介」而非最终生成空间:VAE 在大规模图像上学到的紧凑潜表征滤除了局部冗余与高频变化、保留了与语义和外观相关的信息,使扩散模型能快速学会物体结构、布局与图文对齐;而像素空间保留全部视觉信息、免去解码开销,适合作为最终输出空间。于是采取「各取所长」的两阶段路线。技术路线是一条五步流水线:(1)以 Z-Image 为基座(6B DiT 骨干 + Qwen-3-4B 文本编码器 + Flux-AE,8× 空间下采样、latent patch 2,等效 16× 压缩,1024² 图像对应 64×64 token 网格),在 200 亿+ 图文对上做潜空间预训练;(2)把 Transformer 与文本条件权重加载进像素空间模型(ps16,每 16×16 像素一个 token,直接从 RGB 得到同样的 64×64 网格,序列长度与潜空间版完全一致),像素专用的输入输出模块从头初始化;(3)在源模型自生成样本与高质量真实图像 1:1 混合的数据上以后训练配置训练(全局 batch 128、学习率 5e-5、直接 1K 分辨率);(4)采用 x-prediction 目标、DiP 轻量卷积 U-Net 解码头、噪声尺度 $\gamma = 2$;(5)先做 ps16→ps32 渐进 patch 适配把 token 数砍到 1/4,再用 Decoupled-DMD + DMDR 两阶段蒸馏到 4 NFE、免 CFG,最终 1024² 出图仅需约 0.20 秒(H800)。整条流水线在 Z-Image 和 FLUX2-klein 上用同一配方复现,证明其通用性。

核心创新是「空间分工」:让潜空间承担它擅长的(大规模预训练下高效学习视觉知识与图文对齐),让像素空间承担它擅长的(端到端输出、绕开 VAE 重建上限与解码延迟)。与已有方法的本质区别有三点。第一,与直接像素预训练相比,本文用受控实验把「潜空间是否只是加速器」的模糊争论变成可检验命题:潜空间收敛更快的原因在于 VAE 提供了一个学到的紧凑视觉表征,它预先滤除高频冗余、显著降低扩散模型需要学习的分布复杂度;像素模型则必须同时学习全局结构、局部统计与去噪,负担更重,因此 20B+ 数据的同预算训练也追不平。第二,在迁移阶段,「数据层面」的迁移与「权重层面」的迁移相配合:源模型自生成样本与其条件分布对齐,构成一座低分布偏移桥梁,约束像素模型在快速适应新输出表示的同时保住已有生成先验;纯真实数据虽是直接的像素级监督,但分布偏移大、收敛慢。第三,在效率层面,渐进 patch 适配把「预测空间切换」与「token 粒度变粗」两件事解耦——先在 ps16 完成潜到像素的迁移,再扩到 ps32——配合权重复制初始化 $W' = \frac{1}{2}[W, W, W, W]$ 保持激活方差,使 token 数降为 1/4 而质量几乎不掉;同时像素空间蒸馏免除了 VAE 解码的固定开销,使 NFE 的减少第一次能近乎线性地转化为端到端时延下降,patch 适配与蒸馏叠加后相对原始潜空间管线实现 100.6× 加速。

方法步骤详情

完整流程分七步。第 1 步,潜空间预训练:按 Z-Image 原配方在 20B+ 图文对上训练 6B DiT,渐进分辨率 256²→512²,文本条件用预训练 Qwen-3-4B,VAE 用 Flux-AE(8× 下采样 + latent patch 2),得到潜空间基座检查点。第 2 步,像素化改造:输入改为 16×16 的 RGB patch(ps16),1024² 下仍是 64×64 token 网格,加载预训练 Transformer 与条件模块权重(像素专用输入投影与解码头随机初始化),序列长度与潜空间版一致,保证对照公平。第 3 步,构建训练数据:用提供初始化的同一潜空间 Z-Image 检查点按默认采样设置对 prompt 池离线生成「自生成」图像,与 Z-Image 最新 SFT 真实图像按 1:1 混合。第 4 步,后训练:全局 batch 128、学习率 5e-5、直接在 1K 分辨率训练、时间步从 logit-normal 分布采样;目标为 x-prediction——直接预测干净 RGB 图像 $x_0$,计算损失与采样前把预测转换为对应速度场,从而与 v-prediction 共享同一优化加权、数值求解器和采样调度。第 5 步,解码与噪声:DiP 解码头(10.09M 参数轻量卷积 U-Net)把 token 特征合成像素;噪声按 $x_t = t x_0 + (1-t)\gamma\epsilon$ 注入(RGB 归一化到 [-1,1]),$\gamma$ 在 {1,2,4,8} 中经验校准为 2。第 6 步,patch 适配:ps16 收敛后扩到 ps32(token 网格 32×32),每个新 patch 由四个不重叠的 16×16 子块组成,输入投影按 $W' = \frac{1}{2}[W, W, W, W]$ 复制初始化(1/2 补偿 fan-in 的四倍增长、保持激活方差),原 Transformer 与解码器参数做 5000 步线性学习率 warmup,新投影层免 warmup 以快速适应。第 7 步,蒸馏:从收敛的 ps32-adapt16 模型出发,阶段 1 用 Decoupled-DMD,阶段 2 用 DMDR 配 Z-Reward,损失系数与更新频率沿用 DMD2/Decoupled-DMD 原文,得到 4 NFE、无 CFG 的 ODE 采样模型。

技术新颖性

技术新颖性体现在四个层面。其一,诊断层面:首次在大规模文生图下量化「像素预训练 vs 潜空间预训练」,把社区里「像素空间是否可行」的模糊印象变成明确结论(同预算下像素更慢更差),这与 JiT 等在小规模设定下支持像素空间的乐观结论形成重要互补。其二,配方层面:五维消融给出多条反直觉且可操作的准则——分辨率 SNR 推导给出的 $\gamma = r = 8$ 不是最优($\gamma = 2$ 的 GenEval 0.7545 / DPG 87.54 显著高于 $\gamma = 8$ 的 0.7316 / 85.64),说明潜到像素的分布偏移远不止空间分辨率一个因素;v-prediction 初始化的模型应切换为 x-prediction,且潜空间初始化恰好消除了从头训练 x-prediction 的发散风险,相当于「迁移」反过来降低了切换预测目标的门槛;预测目标的切换在统一的速度空间目标下实现,保证对照公平。其三,结构层面:第一次在受控文生图设定下横向比较五种像素解码器,揭示 PiT(2.25B 参数、19731.88 GFLOPs、74.96ms)虽 GenEval 最高(0.7697)但解码器就占 6B 骨干的 37.5%,完全不实用;DiP(10.09M、834.03 GFLOPs、6.02ms)靠卷积的局部归纳偏压让相邻 patch 特征在像素合成前交互,消除 patch 边界网格伪影,达到最佳质量-效率平衡。其四,系统层面:指出潜空间蒸馏在超少步区间的端到端加速被固定的 VAE 解码开销封顶,而像素空间蒸馏解除这一上限,配合渐进 patch 适配实现 100.6× 端到端加速——这一系统性视角与「迁移配方在两个模型家族上可复用」的验证,是 L2P、AsymFlow 等先前工作没有的。

Pixel-space training that initialized from a pre-trained latent-space model yields remarkable faster convergence than training from scratch.
Figure 4: Pixel-space training that initialized from a pre-trained latent-space model yields remarkable faster convergence than training from scratch.
Pixel-Space trained with latent-weight initialization enables earlier formation of coherent image structures and improves final image quality compared with training from scratch.
Figure 5: Pixel-Space trained with latent-weight initialization enables earlier formation of coherent image structures and improves final image quality compared with training from scratch.
Effect of training data source. Source-latent-model-generated data enables substantially faster convergence than real data alone, while mixing real and self-generated data achieves the best overall trade-off.
Figure 6: Effect of training data source. Source-latent-model-generated data enables substantially faster convergence than real data alone, while mixing real and self-generated data achieves the best overall trade-off.
Qualitative comparison of training data choices.
Figure 7: Qualitative comparison of training data choices.
Training with x-prediction achieves overall better performance and faster convergence than v-prediction.
Figure 8: Training with x-prediction achieves overall better performance and faster convergence than v-prediction.
The JiT head exhibits visible grid-like artifacts at patch boundaries, whereas the DiP head produces smoother spatial transitions.
Figure 9: The JiT head exhibits visible grid-like artifacts at patch boundaries, whereas the DiP head produces smoother spatial transitions.
Qualitative comparison of different noise scales.
Figure 10: Qualitative comparison of different noise scales.
Progressive patch-size adaptation improves convergence and final performance.
Figure 11: Progressive patch-size adaptation improves convergence and final performance.
Qualitative comparison of patch-size adaptation.
Figure 12: Qualitative comparison of patch-size adaptation.

实验结果

论文的核心发现按实验逐一展开。(1)大规模预训练对照(Sec. 3 / Figure 2、3):同架构、同 20B+ 图文对、同算力下,潜空间模型在 GenEval 与 DPG 曲线上全程领先像素模型,早期差距最大——潜空间约 2K 迭代即学会基本物体结构与图文对齐,而像素空间在 150K 迭代后仍未追平,定性样本(消防栓+网球拍、长椅等 prompt)呈现同样趋势,直接像素预训练被证伪。(2)权重初始化(Sec. 4.1 / Figure 4、5):从潜空间检查点初始化的像素模型在 5K/10K/20K/50K 迭代的 GenEval/DPG 全程高于从头训练者,后者长时间只能产出严重退化、不稳定的样本,证明潜空间知识高度可迁移。(3)训练数据(Sec. 4.2 / Figure 6、7):自生成数据收敛远快于纯真实数据(低分布偏移桥梁),但单独使用会继承源模型的排版伪影(如畸形英文文字);1:1 混合真实数据既保住收敛速度又能修正伪影;用别的模型(FLUX2-klein-9B)生成的数据明显更差,证明与源模型分布对齐才是关键。(4)预测目标(Sec. 4.3 / Figure 8):x-prediction 一致优于 v-prediction,收敛更快、最终分数更高。(5)解码器(Table 1 / Figure 9):DiP 以 10.09M 参数、6.02ms、834.03 GFLOPs 拿到最高的 DPG 87.54 与次高的 GenEval 0.7545;PiT 的 GenEval 0.7697 虽最高,但解码器 2.25B 参数(相当于 6B 骨干的 37.5%)、74.96ms、19731.88 GFLOPs,不实用;JiT 最快(0.07ms)但有 patch 边界网格伪影且 GenEval 只有 0.7380。(6)噪声尺度(Table 2 / Figure 10):$\gamma = 2$ 最优(GenEval 0.7545 / DPG 87.54),理论推导值 $\gamma = 8$ 只有 0.7316 / 85.64,$\gamma = 1$ 最差(0.6811 / 84.03),定性上 $\gamma \in \{1, 4, 8\}$ 都有色偏。(7)patch 适配(Figure 11、12):ps32-adapt16 性能接近 ps16、token 数降为 1/4、消除直接 ps32 训练的局部伪影;ps64-adapt32 再降 4× 但细节与基准退化。(8)系统级对比(Table 3 / Figure 13):Z-Image 100 NFE 下像素版延迟 4.56s(4.41× 加速)、GenEval 0.7644 vs 潜空间 0.7510、DPG 87.60 vs 86.91,且四个基准全面超越 L2P(GenEval 0.7612、DPG 86.00、OneIG 0.499、LongText 0.7798);4 NFE 蒸馏后 0.20s vs 0.95s(4.75×)、GenEval 0.7698 vs 0.7625;FLUX2-klein 上 100 NFE 6.38s(3.18×)、GenEval 0.8096 vs 0.8027、DPG 86.88 vs 84.89、LongText 0.6632 vs 0.5456,4 NFE 0.28s(3.29×)、GenEval 0.8185 vs 0.8142;仅潜空间迁移一步就有 1.10× 加速,patch 适配把时延降到 4.56s,蒸馏后再到 0.20s,合计相对原始潜空间管线 100.6× 端到端加速。

Decoder design comparison. Inference latency and GFLOPs are measured with decoder-only inference for obtaining a 1024 × 1024 image on a single H800 GPU.
Table 1: Decoder design comparison. Inference latency and GFLOPs are measured with decoder-only inference for obtaining a 1024 × 1024 image on a single H800 GPU.
Ablation on noise scale γ.
Table 2: Ablation on noise scale γ.
Performance comparison of pixel and latent models across benchmarks. Inference latency is measured for a 1024 × 1024 image on a single H800 GPU without any system-level optimizations.
Table 3: Performance comparison of pixel and latent models across benchmarks. Inference latency is measured for a 1024 × 1024 image on a single H800 GPU without any system-level optimizations.
Hyperparameter settings for component-wise analysis (I).
Table 4: Hyperparameter settings for component-wise analysis (I).
Hyperparameter settings for component-wise analysis (II).
Table 5: Hyperparameter settings for component-wise analysis (II).
End-to-end inference latency (S) per 1024 × 1024 image on a single NVIDIA H100 GPU without any system-level optimizations such as FlashAttention.
Figure 13: End-to-end inference latency (S) per 1024 × 1024 image on a single NVIDIA H100 GPU without any system-level optimizations such as FlashAttention.
查看结构化数据
任务指标本文基线提升
文生图综合质量(Z-Image,100 NFE,1024×1024) GenEval 0.7644 Z-Image 潜空间 0.7510;L2P 0.7612 超潜空间基线 +0.0134、超 L2P +0.0032,同时延迟从 20.12s 降到 4.56s(4.41×)
Prompt 细粒度符合度(Z-Image,100 NFE) DPG 87.60 潜空间 86.91;L2P 86.00 +0.69 / +1.60
综合生成质量(Z-Image,100 NFE) OneIG 0.564 潜空间 0.566 基本持平(-0.002),但远高于 L2P 的 0.499
长文本渲染(Z-Image,100 NFE) LongText 0.9252 潜空间 0.9332;L2P 0.7798 略低于潜空间 0.008,但远超 L2P +0.1454
少步推理(Z-Image-Turbo,4 NFE,免 CFG) GenEval / 延迟 0.7698 / 0.20s Z-Image-Turbo 潜空间 0.7625 / 0.95s GenEval +0.0073,延迟加速 4.75×;DPG 86.85 vs 85.31
文生图(FLUX2-klein-Base,100 NFE) GenEval 0.8096 FLUX2-klein-Base 潜空间 0.8027;AsymFlow 0.8181 超潜空间 +0.0069(略低于 AsymFlow),延迟 20.25s→6.38s(3.18×),而 AsymFlow 需 21.42s 反而更慢
Prompt 符合度(FLUX2-klein,100 NFE) DPG 86.88 潜空间 84.89;AsymFlow 86.70 +1.99 / +0.18
长文本渲染(FLUX2-klein,100 NFE) LongText 0.6632 潜空间 0.5456;AsymFlow 0.4498 +0.1176 / +0.2134,是该设定下提升最大的基准
少步推理(FLUX2-klein,4 NFE) GenEval / DPG / 延迟 0.8185 / 86.00 / 0.28s FLUX2-klein 潜空间 0.8142 / 84.36 / 0.92s 三项全面占优(+0.0043 / +1.64),延迟加速 3.29×
像素解码器消融(Z-Image,1024²,单张 H800) GenEval / 参数量 / GFLOPs DiP:0.7545 / 10.09M / 834.03 PiT:0.7697 / 2249.82M / 19731.88;JiT:0.7380 / 2.95M / 24.16;VAE:49.55M / 10472.20 DiP 拿到最高 DPG 87.54,计算量仅为 PiT 的约 4.2%、VAE 的约 8%,质量-效率最佳平衡

局限与改进

作者承认的局限:其一,ps64-adapt32 虽然把 token 再减 4×,但局部细节与基准性能退化,说明极端 token 压缩下保留细粒度细节仍是开放问题(Takeaway 7 明确将其列为未来方向);其二,基于分辨率的 SNR 分析只能作为参考,最优噪声尺度必须经验校准——$\gamma = r = 8$ 的理论值被 $\gamma = 2$ 的实测最优推翻,论文未给出解释为何是 2;其三,在 Z-Image 上 OneIG(0.564 vs 0.566)与 LongText(0.9252 vs 0.9332)略低于潜空间基线,说明像素迁移在个别指标上仍有细微损失。我自己的观察:第一,总训练成本问题——配方包含一次完整的大规模潜空间预训练(20B+ 对)加一次像素后训练,论文只比较推理效率,从未报告两阶段的总训练 FLOPs 与「潜空间单阶段直训」的对比,训练侧的总账可能并不省;第二,评测局限于自动基准(GenEval/DPG/OneIG/LongText),没有人类偏好评估、没有 FID 类分布级指标,「质量持平」的结论在感知层面证据有限;第三,自生成数据本质是自我蒸馏,可能放大源模型的事实性错误、审美偏见与版权问题,论文仅用 FLUX2-klein-9B 做对照,未量化偏见继承程度;第四,基座(Z-Image、FLUX2-klein)与 20B 级数据都是工业界资产,Sec. 3 的核心对照实验外部几乎无法独立复现;第五,只在 1024² 文生图上验证,未涉及更高分辨率、视频生成或统一多模态模型中的像素建模,配方泛化边界不明。

独立分析的弱点

独立分析的弱点与改进方向:(1)两阶段总成本偏高——潜空间预训练加像素后训练的累计开销可能超过直接潜空间训练,论文未给出训练侧账本;改进方向是研究「早切换」策略(预训练中段即转入像素空间)、或用低分辨率像素预训练加潜空间知识注入来压缩第一阶段。(2)自生成数据的回声风险——1:1 混合中一半梯度来自源模型自己的样本,长期训练容易造成模式收缩、伪影自我强化与偏见固化;改进方向是引入多样性度量与课程加权(早期高自生成比例、后期提高真实数据占比),或用奖励模型对自生成样本做质量过滤。(3)$\gamma$ 校准缺乏可迁移理论——每个新模型家族都要重新在 {1, 2, 4, 8} 里扫一遍,成本不小且不可解释;改进方向是从频谱分析或最优传输角度建立潜/像素 SNR 的解析映射,让 $\gamma$ 可预测而无需网格搜索。(4)ps64 细节崩坏——每 token 覆盖 64×64 像素,高频信息超出单 token 的表达与解码能力;改进方向是为大 patch 配分层(粗到细)解码器或局部超分模块,把「压缩」与「渲染」解耦,或借鉴频域损失显式保护高频。(5)评测盲区——缺少人类评估、开放域 prompt 鲁棒性测试与分项失败分析(手部、文字、计数等);改进方向是补充 ImageReward/Arena 类人类偏好评测,并对 GenEval 各子项分别报告。(6)蒸馏超参沿用 DMD2/Decoupled-DMD 原文设置,未针对像素空间的分布特性重新调优,4 NFE 下的质量可能仍有未榨取的空间。

未来方向

作者明确提出方向:在更激进的 token 压缩(ps64 及以上)下保留细粒度细节是首要未来工作。基于本文成果还可延伸:(1)把「潜空间预训练→像素空间后训练」配方推广到视频像素扩散与统一多模态模型(UMM),视频上「免 VAE 解码」的时延红利可能更大,且像素空间对时序一致性的影响值得研究;(2)研究 $\gamma$ 随分辨率与 patch 大小的自适应调度,替代全局标量,并用理论解释为何 2 最优;(3)蒸馏侧继续压榨——论文已引入 Z-Reward,可进一步结合对抗微调或更现代的奖励模型,把 4 NFE 推向 1–2 NFE;(4)系统层面与 FlashAttention、量化、编译优化叠加——论文特意在无系统优化的 H100/H800 上测量以隔离算法收益,工程叠加后 0.2s 的时延还有下降空间;(5)解码器设计空间仍较粗糙,可探索频域解码、扩散式解码或与 patch 大小做联合神经架构搜索;(6)理论层面,为「潜空间为何是有利的预训练表征」建立信息论或频谱解释,并刻画该结论在何种压缩率、数据规模下成立;(7)数据层面,用教师强度、真实-合成混合比例的自动化搜索取代手工 1:1 设定,并研究自生成数据的多样性保障机制。

复现评估

复现难度:中高。有利条件:论文的实现细节披露相当充分——附录 Tables 4/5 完整列出每个消融固定与变化的配置,附录 A.2 给出后训练超参(全局 batch 128、学习率 5e-5、1K 分辨率直训、合成:真实 = 1:1、$\gamma = 2$、RGB 归一化 [-1,1]、logit-normal 时间步)、x-prediction 与速度场的相互转换方式、patch 扩展的权重初始化公式 $W' = \frac{1}{2}[W, W, W, W]$、5000 步 warmup 及新投影层免 warmup 的细节、蒸馏两阶段(Decoupled-DMD + DMDR/Z-Reward)及其超参来源;基座 Z-Image 与 FLUX2-klein 有开源生态,评测基准 GenEval/DPG/OneIG/LongText 均公开可算。若只是把该配方应用到一个已有的开源潜空间检查点上做后训练+适配+蒸馏,数十张 A100/H800 量级的算力即可尝试。不利条件:Sec. 3 的核心结论(20B+ 对的大规模像素 vs 潜空间预训练对照)依赖工业级数据与集群,外部几乎不可复现,只能选择信任作者;截至论文版本未见代码或权重开源的说明,DiP/Deco 等解码器需要从各自原论文复刻;时延数字依赖具体 H800/H100 硬件与软件栈,复测会有偏差。总体判断:工程配方的可复现性较好(细节完整),但科学主张的独立验证门槛很高,小团队现实的做法是在开源 Z-Image 权重上按配方做后训练复现 Table 3 的推理侧结果。