Abra:扩散图像训练的规模化定律研究 Abra: Scaling Diffusion Image Training
扩散文生图模型需约200图像token/参数才达计算最优,是LLM的10倍,且过训练几乎无代价。
前置知识
计算最优缩放定律与 Chinchilla 法则
缩放定律描述模型损失如何随参数量 $N$、数据量 $D$ 和训练算力 $C \approx 6ND$ 变化,通常拟合为幂律 $L(C)=AC^{-\alpha}+\beta$。计算最优指固定 $C$ 下选择 $(N, D)$ 使损失最小。Hoffmann et al. (2022) 发现 LLM 的最优分配是 $N \propto C^{1/2}$、$D \propto C^{1/2}$,即每参数约 20 个训练 token(20 TPP),这就是 Chinchilla 法则。
本文的全部问题意识都来自这条法则:同样的问题在文生图扩散模型上答案是什么?全文的核心结论(200 TPP)就是相对 Chinchilla 的 20 TPP 而言的。
TPP(每参数 token 数)与 iso-FLOP 曲线
TPP = D/N,衡量每个参数摊到多少训练 token。iso-FLOP 曲线是固定算力预算 $C$ 时,损失随 TPP 变化的切片曲线;其最低点就是该算力下的计算最优 TPP。把不同算力下这些最低点连起来,就得到最优分配律 $N_{opt}(C)$ 与 $D_{opt}(C)$。
iso-FLOP 分析是本文的主实验方法,200 TPP 正是从一族 iso-FLOP 切片的最小值中读出来的,不掌握这个工具就看不懂第 4 节的所有图。
流匹配与 v-prediction
流匹配(flow matching)把扩散生成建模为从高斯噪声到图像潜变量的线性插值路径,网络 $v_\theta(x_t, t; \text{text})$ 回归该路径上的速度场;采样时从 $t=1$ 的纯噪声出发反向积分 ODE。v-prediction 是其实践变体,训练目标是速度而非噪声本身,训练更稳定。
ABRA 家族全部用 v-prediction 流匹配目标训练,理解损失定义和时间步 $t$ 的角色(附录 C 按时间步分桶分析损失)都需要这个基础。
µP(最大更新参数化)
µP 是一种网络参数化方式,使模型的最优超参数(尤其学习率)在宽度/深度变化时保持可迁移:在小模型上网格搜索出的最优学习率,可以零样本迁移到大模型。本文使用其 CompleteP 变体,并用谱坐标检验验证实现正确性。
缩放定律研究的可信度取决于每个规模的模型是否都在各自最优超参下训练。ABRA 用 µP 把最优学习率 $4\times10^{-4}$ 从小模型迁移到全家族,排除了欠调参污染拟合的混淆因素,这是其结论比前人更可信的关键。
FID / KID / CLIPScore / CMMD 等生成指标
扩散损失的降低不必然带来生成质量提升,因此社区用分布层面指标评估采样输出:FID/KID 在 Inception 特征空间比较生成分布与真实分布的距离,CLIPScore 衡量图文对齐度,CMMD 用 CLIP 特征算 MMD 距离。这些指标都受 CFG 引导强度的强烈影响。
本文把计算最优分析从训练损失推广到这些指标,发现不同指标给出互相冲突的最优数据/模型配比,这是全文最有实操冲击力的发现之一。
CFG(无分类器引导)
训练时以一定概率(本文 0.1)丢弃文本条件,使模型同时学会条件与无条件生成;推理时用 $\tilde{v} = v_{uncond} + w \cdot (v_{cond} - v_{uncond})$ 外推,引导强度 $w$ 越高越贴合提示词但越偏离数据分布。
生成指标的最优 CFG 随模型规模和训练步数系统性下降(模型越强所需引导越弱),这直接影响指标拟合方法:必须对每个模型逐指标搜索最优 CFG,否则会错误排名。
缩放坍缩(scaling collapse)
Qiu et al. (2025) 发现:把计算最优训练的各模型损失曲线按 $\ell(x,p;\theta)=(L(xt^*(p),p)-\hat L)/(L(t^*(p),p)-\hat L)$ 归一化后($x$ 为训练进度百分比),所有规模的曲线坍缩到同一条普适曲线上,跨规模偏差降到随机种子噪声以下。可作为训练中的健康诊断工具。
本文首次证明该现象在扩散模型中同样成立,这既是理论上'普适动力学'的延伸证据,也给了从业者一个判断自己训练是否偏离计算最优的实用仪表。
研究动机
在语言模型领域,计算最优缩放定律已是训练前沿模型的标准工业工具:Chinchilla 法则指出固定算力 $C$ 下应让参数量 $N$ 与数据量 $D$ 各按 $N \propto C^{1/2}$、$D \propto C^{1/2}$ 增长,即每参数约 20 个 token(20 TPP),这一分析直接指导了 Llama、GPT-4、DeepSeek 等模型的训练。但视觉生成领域几乎没有人做过同等系统的研究,而图像领域存在 LLM 没有的困难:内容是二维高维信号、每个 patch 携带的信息量随分辨率变化、训练目标与生成过程范式分离、训练曲线噪声极大。此前唯一的相关工作 Liang et al. (2024) 只在 $10^{19}$ FLOPs 以下拟合 iso-FLOP 剖面再外推两个数量级,并得出'模型应比数据增长更快'($N_{opt} \propto C^{0.568}$)的结论——按这个配比训练的前沿模型实际上会被系统性欠训练。从业者因此缺少一个可执行的答案:给定算力预算,到底该训多大的模型、喂多少图像?
本文的目标是本文的目标是为文本到图像扩散模型建立一套与 LLM 同样可靠、可操作的计算最优缩放定律。具体拆解为四件事:其一,构建受控模型家族 ABRA(60M 到 2B 参数的密集流匹配 Transformer),在 $10^{19}$ 至 $10^{22}$ FLOPs 跨三个数量级的算力上系统训练,用比 Liang et al. (2024) 多一个数量级的算力获得更精确的经验拟合;其二,给出可执行的'每参数配多少图像 token'规则;其三,精确量化过训练与欠训练两个方向的代价,回答从业者该偏向更大模型还是更多数据;其四,检验损失之外的量——FID 等生成指标、最优 CFG、线性探测的表征质量、图像分辨率、训练曲线形状——是否同样可预测地缩放,把缩放分析从单一标量损失扩展成一套完整的诊断体系。
与已有工作不同的是,本文的独特切入角度体现在三个层面。第一是规模与受控性并重:使用比此前工作高一个数量级的算力上限(至 $10^{22}$ FLOPs),且整个家族用 µP 做超参数迁移(在 60M/120M/250M 上验证后零样本迁移最优学习率 $4\times10^{-4}$),保证每个规模的模型都在各自最优学习率下训练,避免了'欠调参污染缩放拟合'这一常见缺陷。第二是故意把所有模型训练到 400 TPP 的大幅过训练状态,使计算最优点 $(N_{opt}, D_{opt})$ 落在搜索区间内部而非边界上,从而能精确定位最小值。第三是把分析对象从训练损失推广开:逐指标搜索最优 CFG 后拟合 FID/KID/CLIPScore/CMMD 的缩放律,用 ImageNet 线性探测度量表征质量的缩放,消融分辨率的影响,并首次把 LLM 领域的缩放坍缩诊断(Qiu et al., 2025)移植到扩散模型,同时与四组公开 LLM 数据(Gemstones、Gadre、Chinchilla、Porian)对照量化扩散训练的过训练宽容性。
核心方法
整体思路是'训练一个受控缩放阶梯,把损失拟合成算力与 TPP 的二元函数,再从每个固定算力切片的最小值读出计算最优配比'。作者构建了 ABRA 家族:六个架构配方完全一致的密集流匹配 Transformer(60M/120M/250M/500M/1B/2B 参数,深度从 19 增至 33 个块,宽度从 384 增至 1792),全部以 v-prediction 流匹配目标在 512×512 分辨率的隐空间上训练,文本条件来自冻结的 Qwen3-4B 编码器(其参数不计入 $N$ 与 FLOPs)。每个模型以恒定学习率训练到 400 TPP(故意过训练,训练步数固定在约 18–20 万步,batch 随参数量翻倍从 128 到 4032 张图),使最优解落在搜索范围内。拟合时,先对每个模型的大量评估 checkpoint 做 PCHIP 保形插值,得到连续的'损失 vs TPP'轨迹;再在每个 TPP 值 $T$ 上对算力拟合幂律 $L(C;T)=A_T C^{-\alpha_T}+\beta_T$;固定 $C$ 的切片即 iso-FLOP 剖面,其最小值给出该算力下的最优 TPP。全程用 EMA 模型权重评估而非对原始损失做滑动平均,因为扩散训练的逐步损失被批次噪声主导——ABRA-250M 上批次间噪声是 10,000 步内可约简损失改善量的 4 到 7 倍。
核心创新有三层。第一,得出并多方法交叉验证了 200 TPP 规则:扩散模型的计算最优数据量约为每参数 200 个图像 token,是 LLM Chinchilla 规则(20 TPP)的 10 倍;iso-FLOP、Kaplan 包络、支撑超平面、Hoffmann 三种配方等 8 种估计器给出的估计全部落在 183–202 的窄带内(约 ±17 TPP),说明结论对拟合方法不敏感。第二,揭示了扩散训练在过训练维度上的不对称性:过训练几乎免费(2× 过训练的损失惩罚不到 0.5%),而欠训练则是灾难性的,与 LLM 的表现截然相反,由此导出实操准则——算力受限时应宁可训练更小的模型、喂更多的数据。这直接修正了 Liang et al. (2024) '参数应增长更快'的结论(本文测得 $a \approx 0.495$、$b \approx 0.505$,接近完美均衡)。第三,技术路线上用恒定学习率调度 + EMA 模型损失 + PCHIP 插值,仅用 6 个模型就重构出经典上需要训练数百个模型才能得到的 iso-FLOP 分析,大幅压缩了缩放实验的算力成本。
方法步骤详情
第一步,架构设计:每个模型用 4 个 double-stream MMDiT 块加若干 single-stream 块(深度随规模从 19 加到 33),宽度 384 到 1792,FFN 扩展率 6,head 维度固定 128 并通过头数增长宽度,QK 归一化用参数化 RMSNorm,全部块共享单个 AdaLN 层,去除所有偏置项、不用权重衰减;宽度/深度比单调不减以保证 iso-FLOP 曲线平滑。第二步,训练配置:图像经冻结的 FLUX VAE($f=8$)编码为 64×64 隐变量,再用无参数的 2×2 折叠降为 32×32 网格供 Transformer 消费;v-prediction 流匹配目标,logit-normal 时间步采样($p\mu=1.9$,$p\sigma=1.0$),训练时 10% 概率丢弃文本条件以支持 CFG,EMA 衰减率 0.9999;推理用 50 步 Euler 求解器从 $t=1$ 反向积分 ODE。第三步,数据:DataComp-1B(约 1 亿图文对),用多个开源视觉语言模型重新打标,混合稠密/中等/稀疏/原始网络 caption;评估在比训练分布更多样的保留集上进行。第四步,超参数:µP(CompleteP 参数化)+ Adam,在 60M/120M/250M 三个小模型上用谱坐标检验验证迁移成立后,将最优学习率 $4\times10^{-4}$ 零样本迁移到全家族,初始化尺度统一取 $\sigma=0.01$。第五步,拟合与稳健性验证:在评估集上采 10 万样本、按 logit-normal 时间步分布平均 EMA 损失,PCHIP 插值成损失-TPP 轨迹,拟合逐 TPP 幂律后读 iso-FLOP 最小值;剔除明显离群的 ABRA-60M,再用 8 种替代估计器(换拟合目标、换插值方式、换损失函数、删阶梯两端模型等)交叉验证。
技术新颖性
技术新颖性体现在四个方面。(1) 规模与受控度的双重提升:这是首个在受控模型家族上覆盖三个数量级算力($10^{19}$–$10^{22}$ FLOPs)的文生图计算最优研究,直接修正了 Liang et al. (2024) 的分配律结论——本文测得 $N_{opt}=0.0301\,C^{0.4951}$、$D_{opt}=3.776\,C^{0.5049}$(均衡分配),而 Liang et al. 给出 $N_{opt} \propto C^{0.5681}$、$D_{opt} \propto C^{0.4319}$(偏向大模型),按后者训练会在前沿规模系统性欠训练。(2) 首次证明扩散模型存在缩放坍缩:把每个模型的训练曲线按 $\ell(x,p;\theta)=(L(xt^*(p),p)-\hat L)/(L(t^*(p),p)-\hat L)$ 归一化后,不同规模模型间的偏差 $\Delta$ 在前 15% 训练内即降到多种子噪声底 $\sigma$ 以下,说明该现象跨越了损失函数与数据范式,具有普适性。(3) 首次系统量化扩散训练的过训练宽容性,定义损失惩罚 $\Delta L(N,C) = L(N,C) - L(N_{opt}(C), C)$ 并与四组 LLM 数据对照。(4) 首次给出分辨率与最优 TPP 的定量关系曲线,并指出高分辨率训练是算力受限而非数据受限。
实验结果
全文有五组核心发现。(1) 200 TPP 规则:主估计为 199(剔除离群的 60M 模型),8 种估计器全部落在 183–202 区间,68% 评估噪声区间为 [180, 270];分配律为 $N_{opt}=0.0301C^{0.4951}$、$D_{opt}=3.776C^{0.5049}$;各 iso-FLOP 剖面在最优点附近异常平坦。(2) 过训练宽容性:ABRA 过训练 2× 的损失惩罚小于 0.5%,而对照的 Gadre et al. LLM 网格中最大模型 2× 过训练惩罚约 4%(相差约 20 倍),Chinchilla、Porian、Gemstones 数据同样显示 LLM 惩罚显著;但扩散模型欠训练方向的惩罚非常陡峭,由此给出'宁小勿大'的实操准则。(3) 生成指标全部服从幂律 $M(C)=AC^{-\alpha}+F_M$(如 KID 纯幂律拟合 $\alpha \approx 0.11$,$R^2=0.90$),但最优配比互相冲突:FID(TPP*=182,趋势指数 p=+0.12)与 KID(257,+0.12)要求算力更多投向数据,CLIPScore(153,p=−0.05)与 CMMD(294,−0.14)偏向更大模型;最优 CFG 随模型规模和训练步数系统性下降。(4) 线性探测:中间层、时间步 $t \approx 0.7$ 的特征最优,ImageNet top-1 精度服从缩放律(iTPP 200 时 $\alpha=0.071$,$R^2=0.999$;计算最优前沿 $\alpha=0.061$),且'理解'的最优 TPP 远低于'生成'并持续上升,两者的联合双最优点估计在约 $5\times10^{22}$ FLOPs、6B 参数处。(5) 缩放坍缩:60M/120M/250M 各 4 个种子的归一化损失曲线在前 15% 训练内坍缩,跨规模偏差 $\Delta$ 全程保持在噪声底 $\sigma$ 之下。附加的分辨率实验给出:最优 TPP 从 256px 的 165 升至 384px 的 202、512px 的 235、768px 的 247,但所需图像张数反而下降,高分辨率训练是算力受限而非数据受限。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 文生图扩散预训练的计算最优数据配比 | 最优图像 token/参数(TPP*) | ≈200(8 种估计器 183–202,68% 区间 [180,270]) | LLM Chinchilla 规则:20 TPP | 数据需求为同算力 LLM 的 10 倍,确立扩散领域新基准 |
| 计算最优分配律 | 分配指数 $N_{opt} \propto C^a$ | a≈0.495 / b≈0.505(均衡分配) | Liang et al. 2024:a≈0.568 / b≈0.432(偏向模型) | 修正系统性欠训练风险;Liang 的 1B 模型 287 总 TPP 估计被指出偏高 |
| 2× 过训练的损失代价 | 相对 iso-FLOP 惩罚 $\Delta L/L^*$ | <0.5%(扩散,全家族一致) | Gadre et al. LLM 最大模型:≈4%;Porian/Chinchilla 数据同样显著 | 扩散模型对过训练的宽容度约为 LLM 的 20 倍 |
| FID 缩放律 | TPP* 与趋势指数 p | TPP*=182,p=+0.12(数据应增长更快) | 无此前工作给出 FID 的计算最优配比 | 首次量化 FID 的最优分配,方向与损失相反 |
| CMMD / CLIPScore 缩放律 | TPP* 与趋势指数 p | CMMD:TPP*=294,p=−0.14;CLIPScore:TPP*=153,p=−0.05(模型应增长更快) | 无此前工作 | 揭示不同生成指标的最优配比互相冲突,无法用单一指标定义计算最优 |
| 线性探测 ImageNet top-1(表征质量) | 缩放指数 α 与拟合优度 | iTPP 200:α=0.071,R²=0.999;计算最优前沿 α=0.061 | iTPP 400:α=0.091,MF=0.929 | 表征质量同样可预测缩放,且其最优 TPP 远低于生成任务 |
| 不同分辨率下的计算最优训练 | 最优 TPP | 768px 需 247 TPP、512px 需 235、384px 需 202、256px 需 165 | 基础分辨率 512px 的 200 TPP 主结论 | 给出分辨率-数据量定量换算:分辨率越高越算力受限,所需图像张数反而减少 |
局限与改进
作者在附录 B 中明确承认四点局限:只试了 Adam 优化器,Muon/Shampoo/SOAP 等新优化器可能改变缩放律(虽然 LLM 证据显示只动截距不动最优 TPP);只用单一冻结文本编码器 Qwen3-4B,未消融文本/视觉编码器对缩放行为的影响;未研究计算最优 batch size 缩放律;分辨率实验只在 120M–500M 梯度上进行,模型太小导致拟合不干净,且必须假设 $a=b=0.5$ 才能得出 165→247 的结论。我自己的观察补充六点:其一,'200 图像 token/参数'强烈依赖 tokenizer 的定义——本文用 $f=8$ VAE 加 2×2 折叠,一张 512×512 图对应 1024 个 token,换用不同压缩率的 VAE 或 patch 方案,TPP 数值会等比例漂移,这个'单位'并不天然;其二,训练只用 DataComp-1B 且未做任何中后期训练(mid/post-training),结论对精选高质量数据或对齐训练的适用性未知;其三,缩放坍缩只在 250M 以下用 4 种子验证,1B/2B 只有单种子,坍缩在最需要诊断的大规模上缺乏噪声底估计;其四,68% 噪声区间 [180,270] 说明单点估计 200 的精度有限,好在 iso-FLOP 剖面平坦、偏离最优的代价本来就小;其五,6B/$5\times10^{22}$ FLOPs 的双最优点是外推而非实测;其六,所有生成指标基于 Inception/CLIP/DINOv2 特征空间,作者也承认其与人类偏好的相关性仍待研究,'哪个指标该信'悬而未决。
独立分析的弱点
独立分析的弱点与改进方向:(1) TPP 规则的 tokenizer 依赖性——建议以'每参数像素数'或'每参数有效信息量'重新归一化数据量,并在 2–3 种 VAE/patch 方案下重复实验,否则 200 这个数字难以跨系统移植;(2) 单一数据集且 caption 混合策略未消融——DataComp-1B 只占评估集约 20%,训练/评估分布差异会影响损失拟合的截距 $\beta_T$,而斜率被认为主要由数据分布决定,应换数据族重复拟合以确认 200 TPP 的普适性;(3) 大模型无多种子——坍缩诊断在最需要的 1B/2B 规模上没有噪声底,建议至少在 500M 上补 2–3 个种子;(4) 生成指标的最优配比互相矛盾(FID/KID 要数据、CMMD/CLIPScore 要模型)却未提供仲裁标准——应引入人类偏好评估或奖励模型作为统一目标函数,否则'计算最优'在指标层面无法定义;(5) 恒定学习率 + batch 随参数翻倍的调度未必代表工业界常用的 cosine 衰减配方,建议补训练调度消融,确认最优 TPP 对调度不敏感;(6) 分辨率结论建立在 500M 以下的弱拟合和 $a=b=0.5$ 强假设上,768px 的 247 TPP 置信度较低,应扩大该实验的模型阶梯;(7) 论文只关心预训练算力,推理成本(蒸馏、少步采样)与训练配比的联合优化完全空白。
未来方向
作者明确提出的方向包括:研究生成指标与人类偏好的相关性,解决'没有单一指标能定义计算最优'的困境;建立扩散模型的计算最优 batch size 缩放律;消融优化器(Muon/Shampoo/SOAP)、文本编码器、视觉编码器对最优 TPP 的影响。基于本文成果可以自然延伸的方向还有:(1) 把 200 TPP 规则与推理成本联合建模,推导'训练+推理总成本最优'的过训练倍数——本文只证明了 2× 过训练近乎免费,但没回答过多少倍最划算;(2) 在 6B/$5\times10^{22}$ FLOPs 的双最优点附近实测验证理解与生成的联合最优训练,或反过来调整架构让双最优点前移;(3) 把缩放坍缩发展为在线训练监控工具并推广到视频扩散(现有视频缩放研究如 Yin et al. 只到 250M 参数);(4) 研究数据重复与缩放律的交互——2B 模型在 400 TPP 时重复了近 8 个 epoch,扩散模型对重复的容忍度(Prabhudesai et al.)如何改变数据受限下的最优策略值得量化;(5) 将缩放律扩展到 MoE 架构与原生高分辨率训练;(6) 从理论上刻画流匹配损失与感知质量之间的错位,解释低损失为何不保证高生成质量。
复现评估
这是 Luma AI 的预印本,文中未提及开源代码、模型权重或 ABRA 家族的发布计划,完整复现门槛很高:六个模型各训练约 18–20 万步,batch 从 128 到 4032 张图,最大 2B 模型训到 $7.9\times10^{11}$ 图像 token($10^{22}$ FLOPs 量级,约 8 个 epoch),全家族总算力保守估计为数倍于 $10^{22}$ FLOPs,需要数百张高端 GPU 运行数周,普通学术实验室难以负担。有利条件是所有关键组件都公开:DataComp-1B 数据集、FLUX VAE、Qwen3-4B 文本编码器、µP/CompleteP 参数化均有开源实现,LLM 对照数据也可获得(Gemstones 与 Gadre、Porian 的数据公开,Chinchilla 数据由 Besiroglu et al. 从论文图数字化重建)。想验证核心结论的研究者可以用 µP 训一个 60M–500M 的小阶梯,复现 200 TPP 附近的 iso-FLOP 最小值,算力需求可控;但生成指标部分需要对每个模型做 CFG 网格搜索并采样 5 万张图算 FID,工程量仍不小。整体而言:结论可信度因多估计器交叉验证而较高,但严格复现属于大厂级任务,社区层面的验证大概率只能覆盖小模型段。
论文图表
首页主图:展示 ABRA 家族的训练损失随算力呈幂律下降,并标注核心结论——扩散 Transformer 的计算最优点在约 200 图像 token/参数,是同等规模 LLM(20 TPP)的 10 倍。
一图概括全文最重要的结论(200 TPP、10 倍数据),是理解本文贡献的入口。
示意图:在 (FLOPs, Loss) 平面上,计算最优点对应单模型损失轨迹与缩放律曲线相切之处;过训练(更小模型更多数据)或欠训练(更大模型更少数据)在固定算力下都会偏离缩放律、付出额外损失,但偏离的代价不对称。
给出理解第 4.2 节过训练分析的几何直觉:ΔL 定义、切点条件、为何过训练'几乎免费'。看懂这张示意图才能看懂 Figure 6。
左图 ABRA(67M–2B):各模型在 2× 过训练处的损失惩罚低于 0.5%(浅色区为 ≤0.2% 阈值),欠训练方向惩罚陡峭;右图 Gemstones LLM(117M–2B):即使轻微过训练惩罚也迅速超过 0.2% 阈值并持续攀升。
全文最具实操价值的图:直接对比扩散与 LLM 的过训练代价,支撑'宁可用小模型多喂数据'的实践准则。
上排:120M–500M 梯度在 256/384/512/768px 下的损失缩放曲线(假设 a=b=0.5 拟合);下排:最优 TPP 随分辨率从 165(256px)升至 202/235/247(768px),但所需图像张数随分辨率下降,所需图像 token 数上升。
量化分辨率对缩放律的影响,导出'高分辨率训练是算力受限而非数据受限'的反直觉结论,提示 200 TPP 数值本身依赖分辨率。
与正文 Figure 6 同构的对照图:Gadre et al. 的 LLM 网格(5.7M–360M)显示最大模型过训练 2× 惩罚约 4%,比扩散模型高近 20 倍;ABRA 侧惩罚 ≤0.2%。
用第二组独立 LLM 数据(Gadre et al.)加固'扩散过训练宽容'的结论,排除 Gemstones 数据集选择的偶然性。
右图为从 Chinchilla 论文图数字化重建的损失惩罚曲线(111M–6.1B,分对数-N 桶),显示 LLM 在偏离 20 TPP 后惩罚快速上升;数据比逐 run 记录更噪。
与最经典的 Chinchilla 原始数据对照,把扩散/LLM 的过训练不对称性追溯到该领域的奠基性实验。
Porian et al. 在 RefinedWeb 上的 LLM 逐步验证损失惩罚曲线(0.3M–814M):轻微过训练即显著惩罚,且各规模表现一致。
第三组独立 LLM 数据的交叉验证,使'扩散模型过训练近乎免费、LLM 不然'的对比具备三重外部效度。
六种指标(CLIPScore、CMMD、DMMD、FID、KDD、KID)各自随 CFG 的 U 形(或倒 U 形)曲线:最优点随模型规模移动,例如小模型的最优 CFG 偏高、大模型偏低;固定单一 CFG 会错误排名模型。
方法层面的关键辩护:解释为什么全文所有指标拟合都要先做逐模型 CFG 优化,并证明缩放指数 α 对 CFG 选择稳健。
每个指标一个面板,画出所有被扫 checkpoint(不只是终点)的最优 CFG 随算力 C=6ND 的变化:分布类指标的最优 CFG 随模型规模与训练进度持续下移,模型越强所需引导越弱。
Mei et al. (2025) 只发现最优 CFG 随模型规模下降,本文首次展示它也随训练步数下降——对生产环境选择推理 CFG 有直接指导意义。
六个模型的完整配置:参数量(60.1M–1.97B)、double/single 块数(4+15 到 4+29)、宽度(384–1792)、头数(3–14)、全局 batch(128–4032 张图)、训练步数(180k–200k)、总图像 token 数(2.4×10¹⁰–7.9×10¹¹)。
复现与理解缩放阶梯的基础:batch 随参数翻倍、步数恒定的设计直接决定了'每模型一条 0–400 TPP 轨迹'的实验结构。
各模型在约 1 亿样本混合集上的 epoch 数:60M 在 400 TPP 只重复 0.23 epoch,而 2B 达 7.70 epoch(200 TPP 时 3.85)。
说明大模型最优训练必然涉及数据重复,结合扩散模型对重复的容忍性(Prabhudesai et al.),这是 200 TPP 规则在数据受限场景下是否可行的重要参考。
Kaplan 式包络拟合的分配指数:约束 a+b=1 时 a≈0.467–0.470;自由拟合时 a+b≈1.033–1.035(偏差源于实际 FLOP 数随规模超过 6ND 估计),包含/剔除 60M 结果一致。
从另一条技术路线(Kaplan 包络而非 iso-FLOP)确认均衡分配 a≈b≈0.5,是 200 TPP 结论稳健性的组成部分。
与 Liang et al. 的分配律对比(均约束 a+b=1):本文 $N_{opt}=0.0301C^{0.4951}$、$D_{opt}=3.776C^{0.5049}$;Liang et al. $N_{opt}=0.0009C^{0.5681}$、$D_{opt}=186.85C^{0.4319}$。注:本文计图像 token、Liang 计总 token,截距不可比、指数可比。
与唯一前作的直接定量对比:本文把分配指数从'偏向模型'(0.568)修正为均衡(0.495),并论证 Liang 对 1B 模型 287 总 TPP 的估计因 256px 设置而偏高。