视觉生成中文本条件化的缩放特性 Scaling Properties of Text Conditioning in Visual Generation
信息量而非长度才是文本-图像的缩放轴:结构化提示预测扩散损失
前置知识
缩放定律(Scaling Laws)
缩放定律刻画模型性能随规模(参数、数据、算力)的幂律变化,如 Kaplan 2020 与 Hoffmann 2022 的 compute-optimal 工作。其本质是把训练目标(通常是对数损失)表达为可控变量的经验函数,使研究者能在投入大规模训练前预测结果。本文沿用这一思想,但把可控变量从『算力/参数』换成『caption 的信息量』,从而把 caption 表征本身变成可被定量校准的训练变量。
本文标题与核心贡献就是对文本条件的缩放特性做经验测量,理解线性/幂律与相关系数的形式是读懂后续 GPG/ED 拟合的前提。
扩散模型与流匹配(Diffusion / Flow Matching)
扩散模型通过逐步加噪与反向去噪学习数据分布,是文生图主流范式。流匹配(flow matching / rectified flow)是其变体,用线性插值 $x_t=(1-t)x_0+t\epsilon$ 连接数据与噪声,网络预测速度场 $v=\epsilon-x_0$,训练目标是逐 token 的 MSE。本文的训练侧读出量『收敛扩散损失』指的就是这个 flow-matching 速度 MSE,在固定预算(如 $2.84\!\times\!10^{10}$ 累计图像 token)下取尾部窗口均值。
论文全部缩放关系都建立在『收敛扩散 MSE』这个读出量上,两个骨干(BAGEL 与 Qwen-Image)都用 flow matching,理解这点才能看懂图 7 的拟合。
提示增强(Prompt Enhancement / Recaptioning)
提示增强指在生成前用一个 LLM 把用户的短请求改写成更详细的条件。DALL-E 3 的 recaptioning、各类 prompt rewriter、RPG、PromptEnhancer 等都属此类,动机是用户描述通常过短而扩散模型依赖丰富 caption。本文把 prompter 视作独立的『可提示性(promptability)』因子,在固定 schema 与 diffuser 的前提下系统比较不同 prompter 后端与训练方法。
本文把端到端质量分解为 Diffusability × Promptability 两因子,提示增强是其中 LLM 侧的可控变量,理解它与训练侧 caption 表征的区别是把握论文框架的关键。
结构化提示(Structured Prompt, SP)与 JSON 条件化
结构化提示用 JSON 把图像相关变量组织成命名字段,区别于自由散文(natural language, NL)。本文 SP 在三层组织信息:全局字段(intent、scene、atmosphere、photography、style、lighting)、逐元素字段(每个前景对象的 caption、属性、动作、bbox、depth)、跨元素 relationships。坐标用归一化到 0–999 的 x_min y_min x_max y_max 书写,并按 L5–L10 字段阶梯递进暴露信息。
SP 是论文的核心接口:训练侧用它提升 diffusability、推理侧由 prompter 生成它。看懂 SP 字段结构与阶梯(Table 1)才能理解所有消融与缩放实验。
强化学习微调与策略蒸馏(RFT / GRPO / OPSD)
强化学习微调(RFT)指用奖励信号进一步训练已 SFT 过的策略;GRPO(Group Relative Policy Optimization)是 DeepSeekMath 提出的无需独立 value 网络的策略梯度法。策略蒸馏用更强的『教师』策略的 token 分布约束『学生』。本文 OPSD(On-Policy Self-Distillation)在 prompter 自己采样的 rollout 上,用图像条件教师 $\pi^\star$ 的下一 token 分布监督图像无关学生 $\pi_\theta$,损失为逐 token 的 KL 散度 $D_{\mathrm{KL}}(\pi^\star\|\pi_\theta)$,且仅在 verifier 接受的 rollout 上应用。
OPSD 是 prompter 训练流水线的最后一步,也是 Table 4 消融里结构分从 6.753 涨到 7.600 的关键,理解它才能看懂训练侧全部增益来源。
研究动机
文生图主要沿『更大的扩散骨干、更重的训练、更大的 caption 语料』这条与 LLM 类似的规模路线推进,但作者指出这里隐藏一个根本的不对称:LLM 的训练信号直接来自文本流,而文生图模型是通过『图像-caption 对』学习条件化生成。caption 模糊绑定的视觉内容只能以很弱的监督到达模型,caption 完全省略的内容则根本到不了模型——尽管这些内容都真实存在于像素中。多个长 prompt 基准印证了这一点:DetailMaster 报告 prompt 越长,角色属性、位置、关系准确率反而越低;LongT2IBench 显示实体-属性-关系对齐随词数稳步下降。Figure 1 更直接量化:在 Qwen-Image、HunyuanImage 3.0、BAGEL、FLUX.1 Dev、Emu3 上,把 caption 越拉越长,每个系统的 GSB 净偏好最终都掉到自己最短 caption 以下,作者用同一 prose 梯度训练的对照也只略微改善就饱和——prose 不缩放,无论只是输入更长还是被训练得更长。
本文的目标是作者的目标是把『caption 中的图像落地信息』从一个描述性属性提升为可测量、可校准、可缩放的训练变量,并据此系统提升文生图。具体地:(1) 用两个互补指标(白盒 GPG、黑盒 ED)量化 caption 信息量,在固定架构、固定图像、固定算力的受控训练扫描里证明二者能预测收敛扩散损失;(2) 提出结构化提示 SP 作为更有效的 caption 表征,用图像到 SP 标注流水线提升训练侧『diffusability』;(3) 通过 SFT、冷启动、verifier-gated RFT 训练 LLM prompter,提升推理侧『promptability』;(4) 把二者拼成端到端系统,在 GenEval/GenEval2/DPG/TIIF/WISE/CoReBench 等覆盖组合、推理、世界知识的基准上,超越所有受评开权重模型并追平或超越最强闭源系统。
与已有工作不同的是,已有工作大多在『模型侧』做缩放(更大 DiT、更大 text encoder、更长 dense caption 语料),或在 diffuser 上做干预(GLIGEN 的布局条件、Attend-and-Excite 的注意力操纵)。DALL-E 3、PixArt-Σ、CogView3、FIBO、Cosmos 3、Reve 2.0 等虽已证明结构化/长 caption 有用,但都把它当设计选择,从未在『固定预算、固定骨干、固定算力』下把信息量本身当作受控变量来测量。本文的独特切入是:用 GPG(caption–图像互信息的可操作估计)与 ED(黑盒属性精度/召回的 $F_{0.5}$)这两把独立尺子,把 NL 不同长度、SP 不同字段层级、空间坐标变体、字段消融共 15 种 caption 配置放到同一根『信息量→收敛 MSE』的轴上,从而把『信息量』从口号变成可被一次校准就能筛选候选配置的工程变量,并据此严格隔离出 diffusability 与 promptability 两个独立因子。
核心方法
caption 像给画师的指令:若只是把同一意思说得更啰嗦(NL 加长),画师不会画出更多东西;若在结构上新增独立字段(哪个对象、在哪、什么材质、和谁相邻),画师才真正获得新的可执行信息。技术路线三步:(1) 用固定骨干重建探针(Figure 3)与两个信息量指标 GPG/ED 证明『信息量而非长度』决定 diffuser 能恢复什么;(2) 在 15 种 caption 配置上跑受控训练扫描,得到 MSE 对 GPG 的线性律 $\mathrm{MSE}=0.4549-8.45\!\times\!10^{-5}\cdot\mathrm{GPG}$ 与对 ED 的幂律 $\mathrm{MSE}=0.4200\cdot\mathrm{ED}^{-0.2073}$;(3) 把端到端质量写成 Quality=Diffusability×Promptability,分别用『图像到 SP 标注』提升训练侧、用『prompter 缩放+训练』提升推理侧,再用 refine–render–judge 循环榨取推理收益。关键是始终固定 schema、diffuser、算力,单独扰动一个因子做归因。
全文最核心的创新是把『caption 信息量』从口号变成可测、可校准、可预测损失的变量,并据此分离出两个正交能力轴。具体两点。第一,GPG 用一个冻结 VLM 的『揭示图像 vs 不揭示图像』对数似然增益之和估计 caption 与图像的互信息:$\mathrm{GPG}(y,I)=\sum_t m_t[\log p_M(y_t|I,y_{<t})-\log p_M(y_t|\varnothing,y_{<t})]$;ED 用图像侧与 caption 侧各自抽取的『对象-属性-关系』元组做对称匹配,输出 $F_{0.5}(P_A,R_A)$,故意偏重精度以惩罚 caption 中不受图像支持的字段。两个指标一个白盒一个黑盒,却给出几乎一致的配置排序(Spearman $\rho=0.96$)。第二,作者据此把 caption 表征从自由散文换成结构化 JSON 字段(SP),在固定预算下证明让 NL 加长几乎不降损失,而逐级恢复 SP 字段则沿校准曲线稳步降损失——把『结构化所以有效』从经验直觉提升为可量化的缩放特性。
方法步骤详情
方法分三块。(1) 受控缩放扫描:从同一份全量标注派生 15 种 caption 配置(NL 长度、SP 层级 L5–L10、空间网格、字段消融),每种单独训练 BAGEL 到 $2.84\!\times\!10^{10}$ token 共同预算,固定图像/架构使配置成唯一变量,用 GPG/ED 拟合收敛 MSE。(2) 提升 diffusability:VLM+Sapiens(姿态)+DepthAnything V2(深度)+SAM 2.1(分割)五阶段流水线生成 L10 SP,再 mask 派生 L5–L9,训练 Qwen-Image 在 SP/NL 混合上。(3) 提升 promptability:0.8B→397B 零样本缩放后训练 prompter——SFT(33 万样本)学 SP 分布,Cold-start 蒸馏教师的『prompt→thinking→SP』链并用 Gemini 过滤(接受率 34.2%),RFT 做 verifier-gated OPSD(三轴都 ≥6/10)。推理再套 refine–render–judge 循环,最多 $T_{\max}=8$ 轮。
技术新颖性
与已有工作的本质区别集中在四点。其一,相比 LongT2IBench、DetailMaster、TIIF 只观察到『prompt 越长效果越差』,作者首次归因到『信息平台期而非长度本身』,用 GPG/ED 量化成可校准训练变量。其二,相比 GLIGEN、Attend-and-Excite 在 diffuser 上加布局条件或注意力干预,作者把 box、depth、relation 放进普通文本字段,与自由 caption 同在 GPG/ED 轴上打分,目标从『布局控制』转向『caption 信息』。其三,相比 FIBO、Cosmos 3、Reve 2.0 把结构化 caption 当设计选择,作者在固定预算、固定骨干下做匹配 NL 对照,证明收益来自表征本身。其四,相比 RPG、PromptEnhancer、Diffusion-DPO 只优化 generator 或改 prompt,作者固定 schema 与 SP 训练过的 diffuser,把 prompter 规模、推理模式、训练阶段做成可控变量,并用 gated OPSD 把教师/学生条件不对称做成训练信号。
实验结果
结果分三条主线。(1) 缩放特性成立:15 配置上收敛 MSE 对 GPG 近似线性($r=-0.984$)、对 ED 近似幂律($r=-0.971$),两指标排序一致(Spearman $\rho=0.96$);反例是 NL 加长几乎不动 ED 与 MSE($\Delta<3\!\times\!10^{-4}$),恢复 SP 字段才降损失,且能外推到未见的 6 种变体。(2) 端到端系统在 Table 2 几乎全面领先:GenEval 0.94、GenEval2 90.6/72.5、DPG 90.71、WISE 0.89、CoReBench 85.2;相比 Qwen-Image∗,GenEval2 GM 52.8→72.5、CoReBench 74.7→85.2;matched NL 对照只到 56.2/76.1,证明收益来自表征而非额外训练;WISE 追平闭源 Nano Banana 的 0.89。(3) promptability 可独立缩放:零样本 0.8B→397B 时 GenEval++ 46.4%→86.8%;训练让结构分从 Base 4.860 到 gated OPSD 7.600(GSB +42.0%);agentic 在 $T_{\max}=8$ 达 54.7% GSB、平均 2.31 轮,超最强 coding agent 的 44.7%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 结构化 caption 是否提升组合生成(GenEval2) | GenEval2 Soft-TIFA GM | 90.6(Ours, Qwen-Image + SP) | 52.8(Qwen-Image 官方 PE);56.2(matched NL + Qwen-Image) | GM 相对官方 PE +19.7 分,相对 matched NL +16.4 分 |
| 推理与组合密集生成(T2I-CoReBench) | Overall(12 维均分) | 85.2(Ours) | 74.7(Qwen-Image∗);75.9(Nano Banana,闭源 SOTA) | 相对 Qwen-Image∗ +10.5 分,并超过闭源最强模型 |
| 世界知识条件生成(WISE, WiScore) | WiScore(0–1) | 0.89(Ours) | 0.83(Qwen-Image∗);0.89(Nano Banana 闭源 SOTA) | 追平闭源 SOTA,超 Qwen-Image∗ +0.06 |
| 对象/组合对齐(GenEval) | Overall accuracy | 0.94(Ours) | 0.91(Qwen-Image∗);0.89(Nano Banana) | +0.03,单/双物体、计数、颜色、位置全面领先 |
| 密集 prompt 跟随(DPG-Bench) | Overall | 90.71(Ours) | 88.32(Qwen-Image 无 PE);87.20(Qwen-Image∗) | +2.39 / +3.51 |
| caption 信息量预测损失(缩放特性) | Pearson r / 残差 SD | GPG: r=−0.984, SD≈6e−4;ED: r=−0.971, SD≈7.8e−4;ρ=0.96 | 长度不预测:NL 的 MSE Δ<3e−4 | 信息量给出跨 caption 族共同的单调轴 |
| prompter 训练增益(结构/偏好) | Structure(0–10)/ GSB% | 7.600 / +42.0%(SFT+Cold-start+gated OPSD) | 4.860 / —(Base 零样本 397B) | 结构分 +2.74,GSB 从无到 +42% |
局限与改进
作者自列的局限有三。其一,两个指标都依赖图像条件测量:GPG 需打分时调用 VLM 判官,ED 需一次性离线抽取每张图的属性元组;拟合会随判官/抽取器漂移(跨判官表 6 显示 r 在 −0.91 到 −0.99 间,跨抽取器表 9 绝对 ED 不变但排序稳定,绝对一致性 ICC 仅 0.11)。其二,schema 是手工设计的,自动 schema 发现、扩展到视频与三维生成仍是开放问题。其三,SP 路径会带来额外 prompter 延迟(agentic 循环每轮约 20–35 秒),部署需权衡收益与成本。我另观察到两点:所有缩放拟合都在 BAGEL 上做,而端到端用 Qwen-Image,作者明确说『GPG–loss 关系没在 Qwen-Image 上重新拟合』,故幂律/线性律的定量形式能否跨骨干迁移未验证;其次 15 个配置每个只训练一次,作者诚实声明重采样区间反映 sweep 设置敏感性而非种子级置信区间,这意味着 $\Delta\mathrm{MSE}\le 2\!\times\!10^{-4}$ 量级的差异其实落在尾部窗口读出噪声里,不该被过度解读。
独立分析的弱点
第一个弱点是缩放律的骨干泛化性未验证。拟合全在 BAGEL(7B MoT)上做,端到端用 Qwen-Image(60 层 DiT),二者容量与架构差距大;改进方向是把 GPG/ED 重拟到 Qwen-Image 与更多骨干家族并报告幂律指数是否稳定。第二个弱点是 GPG 对判官空间坐标格式高度敏感——表 6 显示 Qwen2.5-VL-7B 不做 bbox 适配时排序直接反转($r=+0.23$),说明测的其实是『判官能读到的信息量』;改进方向是引入判官无关的纯图像侧估计(基于重建或检索的代理)或显式建模判官-格式耦合。第三个弱点是 schema 手工且静态:L10 字段固定,无法随任务自适应(海报的排版字段、医学图像的解剖字段在通用 SP 里无位置);改进方向是把 schema 发现做成可学习过程,或引入层次化、可插拔字段模块。第四个弱点是 OPSD 的样本效率与延迟:agentic 8 轮才多换约 13 个 GSB 点(42.0→54.7),每轮三次 Gemini 调用开销大;改进方向是把 verifier 蒸馏成轻量本地判官、用拒绝采样+DPO 替代多轮在线循环。
未来方向
作者明确提出的方向包括:自动 schema 发现、扩展到视频与三维生成,以及在部署侧权衡 prompter 延迟。基于成果可延伸的方向我认为有四:一是把 GPG/ED 当成通用『caption 质量尺』用于数据筛选与课程学习——既然信息量能预测损失,就可在线地为信息贫乏样本重写或上采样;二是把 Diffusability × Promptability 的分解推广到其他模态条件(音频驱动生成、文本到视频、布局到场景),验证两因子框架是否普适;三是研究 OPSD 的不对称条件蒸馏能否移植到任何『特权教师 vs 无特权学生』场景,如工具增强 vs 无工具、有检索 vs 无检索的推理;四是把 agentic refine–render–judge 与 SP 可寻址字段结合,发展更强的可解释编辑接口——Figure 2 底部已展示改一个字段就能局部编辑,进一步可做交互式、增量式的可控生成。
复现评估
复现性较好但工程门槛高。作者公开了代码、模型权重与 Demo,并列出依赖(Table 14)。附录给出大量细节:BAGEL/Qwen-Image 超参(Table 11/12)、prompter 三阶段超参(Table 13,rank-128 LoRA on Qwen3.5-397B-A17B)、agentic 6/10 阈值、完整 15 配置 GPG/ED/MSE 数据(Table 7)和全部 system prompt(附录 E)。但完整复现受三限制:算力极高——单 BAGEL 配置就需 192 GPU 跑到 $2.84\!\times\!10^{10}$ token,15 配置加 Qwen-Image 500k 步总开销巨大;依赖大量闭源/付费 API(Gemini 3 Pro、GPT-5.4/5.5、Claude Opus 4.8),ED 抽取与 offline 评判都依赖它们;Seed-VL 标 Internal 未公开,Sapiens 与 DepthAnything V2 是 CC-BY-NC 非商用。核心缩放拟合在小骨干上部分可复现,端到端系统基本只能用其发布权重。
论文图表
左图把每个系统对它自己的最短 caption 输出做 GSB 净偏好比较,衡量的是『加长的增益』而非绝对质量。所有现有系统的曲线都过早见顶并最终掉到自己最短 caption 以下,作者自训的 prose 对照也只略微改善就饱和;只有结构化 prompt(zero-shot 与 finetuned)的 GSB 随 caption 长度单调上升。右图给出原因:上方两曲线显示 prose 在信息量上很快饱和而 SP 持续上升;下方散点显示在『信息量匹配』时 NL 与 SP 落在同一条 loss 拟合上。
这张图是全文的『论点预告』,用最直观的对比说明『信息量而非长度』才是缩放轴,是理解论文动机与后续全部实验的入口。