← 返回 2026-08-03

视觉生成中文本条件化的缩放特性 Scaling Properties of Text Conditioning in Visual Generation

Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan 📅 2026-07-31 👍 37 2026-08-08 18:30
强化学习微调 扩散模型 提示增强 文本到图像生成 结构化提示 缩放定律

信息量而非长度才是文本-图像的缩放轴:结构化提示预测扩散损失

前置知识

缩放定律(Scaling Laws)

缩放定律刻画模型性能随规模(参数、数据、算力)的幂律变化,如 Kaplan 2020 与 Hoffmann 2022 的 compute-optimal 工作。其本质是把训练目标(通常是对数损失)表达为可控变量的经验函数,使研究者能在投入大规模训练前预测结果。本文沿用这一思想,但把可控变量从『算力/参数』换成『caption 的信息量』,从而把 caption 表征本身变成可被定量校准的训练变量。

本文标题与核心贡献就是对文本条件的缩放特性做经验测量,理解线性/幂律与相关系数的形式是读懂后续 GPG/ED 拟合的前提。

扩散模型与流匹配(Diffusion / Flow Matching)

扩散模型通过逐步加噪与反向去噪学习数据分布,是文生图主流范式。流匹配(flow matching / rectified flow)是其变体,用线性插值 $x_t=(1-t)x_0+t\epsilon$ 连接数据与噪声,网络预测速度场 $v=\epsilon-x_0$,训练目标是逐 token 的 MSE。本文的训练侧读出量『收敛扩散损失』指的就是这个 flow-matching 速度 MSE,在固定预算(如 $2.84\!\times\!10^{10}$ 累计图像 token)下取尾部窗口均值。

论文全部缩放关系都建立在『收敛扩散 MSE』这个读出量上,两个骨干(BAGEL 与 Qwen-Image)都用 flow matching,理解这点才能看懂图 7 的拟合。

提示增强(Prompt Enhancement / Recaptioning)

提示增强指在生成前用一个 LLM 把用户的短请求改写成更详细的条件。DALL-E 3 的 recaptioning、各类 prompt rewriter、RPG、PromptEnhancer 等都属此类,动机是用户描述通常过短而扩散模型依赖丰富 caption。本文把 prompter 视作独立的『可提示性(promptability)』因子,在固定 schema 与 diffuser 的前提下系统比较不同 prompter 后端与训练方法。

本文把端到端质量分解为 Diffusability × Promptability 两因子,提示增强是其中 LLM 侧的可控变量,理解它与训练侧 caption 表征的区别是把握论文框架的关键。

结构化提示(Structured Prompt, SP)与 JSON 条件化

结构化提示用 JSON 把图像相关变量组织成命名字段,区别于自由散文(natural language, NL)。本文 SP 在三层组织信息:全局字段(intent、scene、atmosphere、photography、style、lighting)、逐元素字段(每个前景对象的 caption、属性、动作、bbox、depth)、跨元素 relationships。坐标用归一化到 0–999 的 x_min y_min x_max y_max 书写,并按 L5–L10 字段阶梯递进暴露信息。

SP 是论文的核心接口:训练侧用它提升 diffusability、推理侧由 prompter 生成它。看懂 SP 字段结构与阶梯(Table 1)才能理解所有消融与缩放实验。

强化学习微调与策略蒸馏(RFT / GRPO / OPSD)

强化学习微调(RFT)指用奖励信号进一步训练已 SFT 过的策略;GRPO(Group Relative Policy Optimization)是 DeepSeekMath 提出的无需独立 value 网络的策略梯度法。策略蒸馏用更强的『教师』策略的 token 分布约束『学生』。本文 OPSD(On-Policy Self-Distillation)在 prompter 自己采样的 rollout 上,用图像条件教师 $\pi^\star$ 的下一 token 分布监督图像无关学生 $\pi_\theta$,损失为逐 token 的 KL 散度 $D_{\mathrm{KL}}(\pi^\star\|\pi_\theta)$,且仅在 verifier 接受的 rollout 上应用。

OPSD 是 prompter 训练流水线的最后一步,也是 Table 4 消融里结构分从 6.753 涨到 7.600 的关键,理解它才能看懂训练侧全部增益来源。

研究动机

文生图主要沿『更大的扩散骨干、更重的训练、更大的 caption 语料』这条与 LLM 类似的规模路线推进,但作者指出这里隐藏一个根本的不对称:LLM 的训练信号直接来自文本流,而文生图模型是通过『图像-caption 对』学习条件化生成。caption 模糊绑定的视觉内容只能以很弱的监督到达模型,caption 完全省略的内容则根本到不了模型——尽管这些内容都真实存在于像素中。多个长 prompt 基准印证了这一点:DetailMaster 报告 prompt 越长,角色属性、位置、关系准确率反而越低;LongT2IBench 显示实体-属性-关系对齐随词数稳步下降。Figure 1 更直接量化:在 Qwen-Image、HunyuanImage 3.0、BAGEL、FLUX.1 Dev、Emu3 上,把 caption 越拉越长,每个系统的 GSB 净偏好最终都掉到自己最短 caption 以下,作者用同一 prose 梯度训练的对照也只略微改善就饱和——prose 不缩放,无论只是输入更长还是被训练得更长。

本文的目标是作者的目标是把『caption 中的图像落地信息』从一个描述性属性提升为可测量、可校准、可缩放的训练变量,并据此系统提升文生图。具体地:(1) 用两个互补指标(白盒 GPG、黑盒 ED)量化 caption 信息量,在固定架构、固定图像、固定算力的受控训练扫描里证明二者能预测收敛扩散损失;(2) 提出结构化提示 SP 作为更有效的 caption 表征,用图像到 SP 标注流水线提升训练侧『diffusability』;(3) 通过 SFT、冷启动、verifier-gated RFT 训练 LLM prompter,提升推理侧『promptability』;(4) 把二者拼成端到端系统,在 GenEval/GenEval2/DPG/TIIF/WISE/CoReBench 等覆盖组合、推理、世界知识的基准上,超越所有受评开权重模型并追平或超越最强闭源系统。

与已有工作不同的是,已有工作大多在『模型侧』做缩放(更大 DiT、更大 text encoder、更长 dense caption 语料),或在 diffuser 上做干预(GLIGEN 的布局条件、Attend-and-Excite 的注意力操纵)。DALL-E 3、PixArt-Σ、CogView3、FIBO、Cosmos 3、Reve 2.0 等虽已证明结构化/长 caption 有用,但都把它当设计选择,从未在『固定预算、固定骨干、固定算力』下把信息量本身当作受控变量来测量。本文的独特切入是:用 GPG(caption–图像互信息的可操作估计)与 ED(黑盒属性精度/召回的 $F_{0.5}$)这两把独立尺子,把 NL 不同长度、SP 不同字段层级、空间坐标变体、字段消融共 15 种 caption 配置放到同一根『信息量→收敛 MSE』的轴上,从而把『信息量』从口号变成可被一次校准就能筛选候选配置的工程变量,并据此严格隔离出 diffusability 与 promptability 两个独立因子。

核心方法

caption 像给画师的指令:若只是把同一意思说得更啰嗦(NL 加长),画师不会画出更多东西;若在结构上新增独立字段(哪个对象、在哪、什么材质、和谁相邻),画师才真正获得新的可执行信息。技术路线三步:(1) 用固定骨干重建探针(Figure 3)与两个信息量指标 GPG/ED 证明『信息量而非长度』决定 diffuser 能恢复什么;(2) 在 15 种 caption 配置上跑受控训练扫描,得到 MSE 对 GPG 的线性律 $\mathrm{MSE}=0.4549-8.45\!\times\!10^{-5}\cdot\mathrm{GPG}$ 与对 ED 的幂律 $\mathrm{MSE}=0.4200\cdot\mathrm{ED}^{-0.2073}$;(3) 把端到端质量写成 Quality=Diffusability×Promptability,分别用『图像到 SP 标注』提升训练侧、用『prompter 缩放+训练』提升推理侧,再用 refine–render–judge 循环榨取推理收益。关键是始终固定 schema、diffuser、算力,单独扰动一个因子做归因。

全文最核心的创新是把『caption 信息量』从口号变成可测、可校准、可预测损失的变量,并据此分离出两个正交能力轴。具体两点。第一,GPG 用一个冻结 VLM 的『揭示图像 vs 不揭示图像』对数似然增益之和估计 caption 与图像的互信息:$\mathrm{GPG}(y,I)=\sum_t m_t[\log p_M(y_t|I,y_{<t})-\log p_M(y_t|\varnothing,y_{<t})]$;ED 用图像侧与 caption 侧各自抽取的『对象-属性-关系』元组做对称匹配,输出 $F_{0.5}(P_A,R_A)$,故意偏重精度以惩罚 caption 中不受图像支持的字段。两个指标一个白盒一个黑盒,却给出几乎一致的配置排序(Spearman $\rho=0.96$)。第二,作者据此把 caption 表征从自由散文换成结构化 JSON 字段(SP),在固定预算下证明让 NL 加长几乎不降损失,而逐级恢复 SP 字段则沿校准曲线稳步降损失——把『结构化所以有效』从经验直觉提升为可量化的缩放特性。

方法步骤详情

方法分三块。(1) 受控缩放扫描:从同一份全量标注派生 15 种 caption 配置(NL 长度、SP 层级 L5–L10、空间网格、字段消融),每种单独训练 BAGEL 到 $2.84\!\times\!10^{10}$ token 共同预算,固定图像/架构使配置成唯一变量,用 GPG/ED 拟合收敛 MSE。(2) 提升 diffusability:VLM+Sapiens(姿态)+DepthAnything V2(深度)+SAM 2.1(分割)五阶段流水线生成 L10 SP,再 mask 派生 L5–L9,训练 Qwen-Image 在 SP/NL 混合上。(3) 提升 promptability:0.8B→397B 零样本缩放后训练 prompter——SFT(33 万样本)学 SP 分布,Cold-start 蒸馏教师的『prompt→thinking→SP』链并用 Gemini 过滤(接受率 34.2%),RFT 做 verifier-gated OPSD(三轴都 ≥6/10)。推理再套 refine–render–judge 循环,最多 $T_{\max}=8$ 轮。

技术新颖性

与已有工作的本质区别集中在四点。其一,相比 LongT2IBench、DetailMaster、TIIF 只观察到『prompt 越长效果越差』,作者首次归因到『信息平台期而非长度本身』,用 GPG/ED 量化成可校准训练变量。其二,相比 GLIGEN、Attend-and-Excite 在 diffuser 上加布局条件或注意力干预,作者把 box、depth、relation 放进普通文本字段,与自由 caption 同在 GPG/ED 轴上打分,目标从『布局控制』转向『caption 信息』。其三,相比 FIBO、Cosmos 3、Reve 2.0 把结构化 caption 当设计选择,作者在固定预算、固定骨干下做匹配 NL 对照,证明收益来自表征本身。其四,相比 RPG、PromptEnhancer、Diffusion-DPO 只优化 generator 或改 prompt,作者固定 schema 与 SP 训练过的 diffuser,把 prompter 规模、推理模式、训练阶段做成可控变量,并用 gated OPSD 把教师/学生条件不对称做成训练信号。

A fixed-backbone probe separates caption information from caption length.
Figure 3: A fixed-backbone probe separates caption information from caption length.
Structured-prompt schema by example.
Figure 5: Structured-prompt schema by example.
Image-to-SP annotation with domain experts.
Figure 8: Image-to-SP annotation with domain experts.
The three-stage prompter-training pipeline.
Figure 10: The three-stage prompter-training pipeline.

实验结果

结果分三条主线。(1) 缩放特性成立:15 配置上收敛 MSE 对 GPG 近似线性($r=-0.984$)、对 ED 近似幂律($r=-0.971$),两指标排序一致(Spearman $\rho=0.96$);反例是 NL 加长几乎不动 ED 与 MSE($\Delta<3\!\times\!10^{-4}$),恢复 SP 字段才降损失,且能外推到未见的 6 种变体。(2) 端到端系统在 Table 2 几乎全面领先:GenEval 0.94、GenEval2 90.6/72.5、DPG 90.71、WISE 0.89、CoReBench 85.2;相比 Qwen-Image∗,GenEval2 GM 52.8→72.5、CoReBench 74.7→85.2;matched NL 对照只到 56.2/76.1,证明收益来自表征而非额外训练;WISE 追平闭源 Nano Banana 的 0.89。(3) promptability 可独立缩放:零样本 0.8B→397B 时 GenEval++ 46.4%→86.8%;训练让结构分从 Base 4.860 到 gated OPSD 7.600(GSB +42.0%);agentic 在 $T_{\max}=8$ 达 54.7% GSB、平均 2.31 轮,超最强 coding agent 的 44.7%。

Comparison with representative text-to-image systems.
Table 2: Comparison with representative text-to-image systems.
Prompter training-pipeline ablation.
Table 4: Prompter training-pipeline ablation.
Agentic inference-time scaling.
Table 5: Agentic inference-time scaling.
The scaling properties of text conditioning: loss follows information.
Figure 7: The scaling properties of text conditioning: loss follows information.
Schema field ablation (BAGEL backbone).
Figure 19: Schema field ablation (BAGEL backbone).
查看结构化数据
任务指标本文基线提升
结构化 caption 是否提升组合生成(GenEval2) GenEval2 Soft-TIFA GM 90.6(Ours, Qwen-Image + SP) 52.8(Qwen-Image 官方 PE);56.2(matched NL + Qwen-Image) GM 相对官方 PE +19.7 分,相对 matched NL +16.4 分
推理与组合密集生成(T2I-CoReBench) Overall(12 维均分) 85.2(Ours) 74.7(Qwen-Image∗);75.9(Nano Banana,闭源 SOTA) 相对 Qwen-Image∗ +10.5 分,并超过闭源最强模型
世界知识条件生成(WISE, WiScore) WiScore(0–1) 0.89(Ours) 0.83(Qwen-Image∗);0.89(Nano Banana 闭源 SOTA) 追平闭源 SOTA,超 Qwen-Image∗ +0.06
对象/组合对齐(GenEval) Overall accuracy 0.94(Ours) 0.91(Qwen-Image∗);0.89(Nano Banana) +0.03,单/双物体、计数、颜色、位置全面领先
密集 prompt 跟随(DPG-Bench) Overall 90.71(Ours) 88.32(Qwen-Image 无 PE);87.20(Qwen-Image∗) +2.39 / +3.51
caption 信息量预测损失(缩放特性) Pearson r / 残差 SD GPG: r=−0.984, SD≈6e−4;ED: r=−0.971, SD≈7.8e−4;ρ=0.96 长度不预测:NL 的 MSE Δ<3e−4 信息量给出跨 caption 族共同的单调轴
prompter 训练增益(结构/偏好) Structure(0–10)/ GSB% 7.600 / +42.0%(SFT+Cold-start+gated OPSD) 4.860 / —(Base 零样本 397B) 结构分 +2.74,GSB 从无到 +42%

局限与改进

作者自列的局限有三。其一,两个指标都依赖图像条件测量:GPG 需打分时调用 VLM 判官,ED 需一次性离线抽取每张图的属性元组;拟合会随判官/抽取器漂移(跨判官表 6 显示 r 在 −0.91 到 −0.99 间,跨抽取器表 9 绝对 ED 不变但排序稳定,绝对一致性 ICC 仅 0.11)。其二,schema 是手工设计的,自动 schema 发现、扩展到视频与三维生成仍是开放问题。其三,SP 路径会带来额外 prompter 延迟(agentic 循环每轮约 20–35 秒),部署需权衡收益与成本。我另观察到两点:所有缩放拟合都在 BAGEL 上做,而端到端用 Qwen-Image,作者明确说『GPG–loss 关系没在 Qwen-Image 上重新拟合』,故幂律/线性律的定量形式能否跨骨干迁移未验证;其次 15 个配置每个只训练一次,作者诚实声明重采样区间反映 sweep 设置敏感性而非种子级置信区间,这意味着 $\Delta\mathrm{MSE}\le 2\!\times\!10^{-4}$ 量级的差异其实落在尾部窗口读出噪声里,不该被过度解读。

独立分析的弱点

第一个弱点是缩放律的骨干泛化性未验证。拟合全在 BAGEL(7B MoT)上做,端到端用 Qwen-Image(60 层 DiT),二者容量与架构差距大;改进方向是把 GPG/ED 重拟到 Qwen-Image 与更多骨干家族并报告幂律指数是否稳定。第二个弱点是 GPG 对判官空间坐标格式高度敏感——表 6 显示 Qwen2.5-VL-7B 不做 bbox 适配时排序直接反转($r=+0.23$),说明测的其实是『判官能读到的信息量』;改进方向是引入判官无关的纯图像侧估计(基于重建或检索的代理)或显式建模判官-格式耦合。第三个弱点是 schema 手工且静态:L10 字段固定,无法随任务自适应(海报的排版字段、医学图像的解剖字段在通用 SP 里无位置);改进方向是把 schema 发现做成可学习过程,或引入层次化、可插拔字段模块。第四个弱点是 OPSD 的样本效率与延迟:agentic 8 轮才多换约 13 个 GSB 点(42.0→54.7),每轮三次 Gemini 调用开销大;改进方向是把 verifier 蒸馏成轻量本地判官、用拒绝采样+DPO 替代多轮在线循环。

未来方向

作者明确提出的方向包括:自动 schema 发现、扩展到视频与三维生成,以及在部署侧权衡 prompter 延迟。基于成果可延伸的方向我认为有四:一是把 GPG/ED 当成通用『caption 质量尺』用于数据筛选与课程学习——既然信息量能预测损失,就可在线地为信息贫乏样本重写或上采样;二是把 Diffusability × Promptability 的分解推广到其他模态条件(音频驱动生成、文本到视频、布局到场景),验证两因子框架是否普适;三是研究 OPSD 的不对称条件蒸馏能否移植到任何『特权教师 vs 无特权学生』场景,如工具增强 vs 无工具、有检索 vs 无检索的推理;四是把 agentic refine–render–judge 与 SP 可寻址字段结合,发展更强的可解释编辑接口——Figure 2 底部已展示改一个字段就能局部编辑,进一步可做交互式、增量式的可控生成。

复现评估

复现性较好但工程门槛高。作者公开了代码、模型权重与 Demo,并列出依赖(Table 14)。附录给出大量细节:BAGEL/Qwen-Image 超参(Table 11/12)、prompter 三阶段超参(Table 13,rank-128 LoRA on Qwen3.5-397B-A17B)、agentic 6/10 阈值、完整 15 配置 GPG/ED/MSE 数据(Table 7)和全部 system prompt(附录 E)。但完整复现受三限制:算力极高——单 BAGEL 配置就需 192 GPU 跑到 $2.84\!\times\!10^{10}$ token,15 配置加 Qwen-Image 500k 步总开销巨大;依赖大量闭源/付费 API(Gemini 3 Pro、GPT-5.4/5.5、Claude Opus 4.8),ED 抽取与 offline 评判都依赖它们;Seed-VL 标 Internal 未公开,Sapiens 与 DepthAnything V2 是 CC-BY-NC 非商用。核心缩放拟合在小骨干上部分可复现,端到端系统基本只能用其发布权重。