← 返回 2026-07-28

TILT:用模型内在奖励改进扩散模型的组合生成 TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward

Debottam Dutta, Jaehoon Hahm, Jianchong Chen, Romit Roy Choudhury 📅 2026-05-16 👍 3 2026-08-02 18:30
总相关性 扩散模型 文本到图像生成 测试时对齐 组合生成

将组合生成建模为内在奖励对齐,导出闭式倾斜分布与原则性扩散引导

前置知识

分类器自由引导 CFG 与 CFG++

CFG是扩散模型推理时提升文本对齐的标准技巧:把条件分数与无条件分数做凸组合 $\epsilon_t^{\lambda,c}=\lambda\epsilon_\theta(x_t,t|c)+(1-\lambda)\epsilon_\theta(x_t,t|\varnothing)$,引导强度 $\lambda$ 越大越忠实于提示却越易脱离数据流形。CFG++保留引导后的Tweedie均值估计、但用无条件噪声重噪,缓解歧离问题。本文TILT的引导完全建立在CFG/CFG++之上,所有修正只在Tweedie空间进行。

TILT的引导是在CFG/CFG++的去噪预测之上叠加的,理解CFG与CFG++的Tweedie均值差异,才能看清TILT修正方向如何作用、为何能避免脱离流形。

Tweedie公式与DDIM采样

给定噪声潜变量 $x_t$,Tweedie公式给出干净样本估计 $\hat{x}_0=(x_t-\sqrt{1-\bar\alpha_t}\epsilon_\theta(x_t,t|c))/\sqrt{\bar\alpha_t}$;DDIM在此估计下确定性演化到 $x_{t-1}=\sqrt{\bar\alpha_{t-1}}\hat{x}_0+\sqrt{1-\bar\alpha_{t-1}}\epsilon_\theta(x_t,t|c)$,无需重采噪声。TILT所有组合与修正操作都发生在Tweedie均值 $\hat{x}_0$ 空间,再经DDIM步进传播。

TILT的奖励梯度引导全部作用在Tweedie均值上,不掌握Tweedie/DDIM就无法理解修正方向如何改变最终样本,也无法理解TILT-S与TILT-C在Jacobian上的差别。

总相关性 Total Correlation

总相关性TC衡量一组变量的联合依赖程度,定义为 $TC(c_1;\dots;c_K|X)=\sum_i H(c_i|X)-H(c_1,\dots,c_K|X)$,是互信息在多变量情形下的推广。当概念给定图像后条件独立时TC恒为零;TC越大说明这些概念在该条件下耦合越强。其逐点形式pcTC即 $\iota_C(x)=\log\frac{p_\theta(C|x)}{\prod_i p_\theta(c_i|x)}$。

论文核心证明TILT的逐点奖励恰好等于pcTC、跨提示聚合恢复条件TC,这是奖励原则性的信息论根基,也是理解'对齐该奖励为何能改善组合'的关键。

可组合扩散与CO3修正器

Composable Diffusion直接相加各概念的条件分数 $\tilde\epsilon_t=\epsilon_t^\varnothing+\sum_i\lambda_i(\epsilon_t^{c_i}-\epsilon_t^\varnothing)$,但Du等(2024)指出朴素分数组合不存在对应前向分布的合法分数、会把样本推离学习流形。CO3改在Tweedie空间对 $\hat{x}_0^C$ 与 $\{\hat{x}_0^{c_i}\}$ 做凸组合修正,能有效缓解概念支配,但修正步是启发式的,未指明最终采样分布或优化目标。

CO3是TILT最主要的对比方法,论文严格证明CO3是TILT-S在'单位阵Jacobian+时间冻结分数'两个近似下的特例;不理解CO3的Tweedie空间凸组合,就读不出TILT到底改进了什么。

研究动机

以SDXL为代表的T2I扩散模型在处理复杂组合提示时频繁失败——例如'A blue backpack and a brown cow'常常只画出其中一个对象。论文用图1的DINOv2对齐分数直方图给出直接证据:在'A [Animal] and a [Object]'类提示下,经验密度集中在坐标轴附近($x\approx0$或$y\approx0$),即样本不成比例地只保留两个概念之一,这被称为'概念支配'。已有路线各有缺陷:Attend-and-Excite与Structured Diffusion依赖架构特定的注意力图,换底模即失效;Composable Diffusion直接相加条件分数,但Du等(2024)指出这种朴素组合不存在对应前向分布的合法分数、会把样本推离学习流形;CO3虽提出Tweedie空间的'概念对比'修正器、经验有效,但修正步本身是启发式的,既未从原则性目标导出,也不清楚它最终针对哪个终端分布、最小化什么目标。这些空白使方法的可解释性、可扩展性与跨模态迁移性都受限。

本文的目标是本文要把组合生成从'启发式轨迹修补'提升为'原则性的测试时奖励对齐'。具体目标有四:(1)形式化地把'纯模式采样'(pure-mode sampling)——即联合条件分布质量集中、各概念均衡共存、远离单概念重叠模式——定义为一个完全内在的奖励 $R(x)$,不依赖任何外部监督或奖励模型;(2)在'最大化期望奖励'与'和预训练联合条件保持KL接近'的双目标下,求出该对齐问题的闭式'倾斜'目标分布 $p^*$;(3)从该闭式目标严格导出每个扩散时间步 $t>0$ 上的中间引导目标,取代CO3式的启发式修正;(4)整套流程训练无关、模型无关,仅消费预训练模型自身的条件概率,做到不改权重、不加数据、不调外部模型。

与已有工作不同的是,独特切入角度是把组合失败重新解读为'模式重叠'(mode overlap),并把它和经典信息论里的总相关性TC联系起来。本文不引入新模型或新数据,而是发现一个自然构造——把联合分布按各边际分布乘积的倒数重新加权 $\tilde{p}(x_0|C)\propto p_\theta(x_0|C)/\prod_i p_\theta(x_0|c_i)$——恰好压低了任一单概念条件过大的重叠区,而这个重加权在对数尺度上就是一个对模型自身概率定义的奖励 $R(x)=\log\frac{p_\theta(x|C)}{\prod_i p_\theta(x|c_i)}$。论文进一步严格证明该奖励的逐点量等于逐点条件总相关性pcTC、跨提示聚合则等于群体级条件TC,把'组合好坏'这个语义问题落到了干净的信息论泛函上。与CO3只提供修正公式不同,TILT同时给出了目标分布与导出路径,并反过来把CO3收纳为框架在两种近似下的特例,从理论上解释了CO3经验有效的根源,也为设计新的Jacobian近似留出了原则性接口。

核心方法

直觉上,组合失败发生在联合条件 $p_\theta(x|C)$ 与某个单概念条件 $p_\theta(x|c_i)$ 大量重叠的区域——样本看似满足联合提示,实则被单一概念主导。自然的做法是把联合分布按各边际分布乘积的倒数重新加权 $\tilde{p}\propto p_\theta(x_0|C)/\prod_i p_\theta(x_0|c_i)$,压低重叠区、保留所有概念同时支撑的'纯模式'区。技术路线三步:先把该重加权解读为内在奖励 $R(x)=\log\frac{p_\theta(x|C)}{\prod_i p_\theta(x|c_i)}$;再放入'最大化期望奖励、同时与预训练联合条件保持KL接近'的对齐问题,得到闭式倾斜目标 $p^*(x_0)\propto p_\theta(x_0|C)\exp(\frac{1}{\beta}R(x_0))$;最后借用扩散后验采样(DPS)思想,把不可解的 $t>0$ 目标化为对 $\hat{x}_0$ 奖励梯度的Jacobian-vector积引导,并把'Jacobian近似的选择'留作统一两种算法的设计旋钮。整个过程不改权重、不需外部模型,只在推理的前若干去噪步施加修正。

核心创新有三点。第一,首次把'纯模式采样'严格定义为对模型自身概率的内在奖励对齐问题,奖励 $R(x)=\log\frac{p_\theta(x|C)}{\prod_i p_\theta(x|c_i)}$ 与CO3的'概念对比分布'动机一致,但被放入带KL约束的优化框架,从而得到闭式倾斜目标 $p^*(x_0)=\frac{1}{Z}p_\theta(x_0|C)\exp(\frac{1}{\beta}R(x_0))$,明确回答了'最终采自什么分布、最小化什么'两个CO3回避的问题。第二,信息论上证明该奖励的逐点量pcTC在跨提示平均下恢复条件总相关性TC,给奖励一个可解释的群体级含义——TC在概念条件独立时为0、仅在概念被共享视觉结构耦合时非0,正是组合推理非平凡的区间。第三,把DPS式引导里的Jacobian近似选为显式设计旋钮,统一导出两个互补算法TILT-S(共享Jacobian)与TILT-C(逐概念Jacobian),并严格证明CO3是TILT-S在'单位阵Jacobian+时间冻结分数'两个近似下的特例,既统一历史方法、又为新近似提供原则性接口。

方法步骤详情

完整流程见算法1 TILT-H:(1)用Stanza名词解析把提示 $C$ 拆成概念子提示 $\{c_1,\dots,c_K\}$,去冠词与形容词后取名词为概念;(2)从 $x_T\sim\mathcal{N}(0,I)$ 按DDIM反向采样;(3)每个 $t_n$ 用CFG(5.0)或CFG++(0.8)算出联合Tweedie均值 $\hat{x}_0^C$ 与各概念 $\hat{x}_0^{c_i}$;(4)按噪声分流:$t_n>\tau$(高噪声早期)走TILT-S——单一共享Jacobian做一次反向传播得到引导 $\nabla L\approx J^\top\beta\sum_i s_\theta(\hat{x}_0^C,0,c_i)$,效率高;$t_n\le\tau$(低噪声后期)走TILT-C——每概念沿各自Tweedie路径求Jacobian、做 $K+1$ 次反向传播,近似更紧;(5)用修正后的 $\hat{x}_0$ 经DDIM步进到 $x_{t_{n-1}}$;(6)默认只修正前5个去噪步,初始步10次迭代、其余每步5次,超参 $\beta_{\mathrm{S}}=0.05$、$\beta_{\mathrm{C}}=0.004$。

技术新颖性

新颖性体现在三方面。理论层面:首次用条件总相关性这一标准信息论量来刻画组合生成的奖励,使得'为什么对齐该奖励就能改善组合'有了严格依据——TC在概念条件独立时为0、仅在概念被共享视觉结构耦合时非0,正是组合推理非平凡的区间,因此奖励只在真正需要时起作用。方法层面:把DPS式引导的Jacobian当成显式设计旋钮,既导出高效的单Jacobian版TILT-S(每步一次反向)、又导出高保真的多Jacobian版TILT-C(每步 $K+1$ 次反向),再用噪声阈值 $\tau$ 混合,避免了单一近似在高/低噪声区各自的短板——高噪声区各概念分数接近、TILT-S足矣;低噪声区概念方向分化、需TILT-C保真。统一性层面:严格证明CO3是TILT-S在两个具体近似(单位阵Jacobian、时间冻结分数)下的特例,从而把先前工作纳入框架并指出其在高噪声区近似误差的根源。整套方法训练无关、模型无关、奖励完全内在,且作者强调它对模态无关,只依赖可分解的条件变量与条件分数估计。

Comparison of different test-time correction methods.
Figure 2: Comparison of different test-time correction methods.
TILT-H: Hybrid pure-mode sampling
Algorithm 1: TILT-H: Hybrid pure-mode sampling

实验结果

在T2ICompBench上以SDXL底模、DDIM 50步、$1024\times1024$、CFG 5.0(或CFG++ 0.8)评测,结果四种子平均见表1。TILT在ImageReward的Shape(0.4338)与Complex(0.4804)两类取得最佳,分别超过次优CO3的0.4245与CFG++的0.4467;Complex最考验多对象/属性/关系同时满足,提升最大(对比R2F 0.3561、CFG 0.3073),说明原则性引导在最困难组合上收益最明显。Color上TILT为0.8569,低于CO3的0.9648但显著高于CFG的0.6235。CLIP/DINO上整体接近或略超CFG++(如DINO Texture 0.2493最佳)。BLIP-VQA上CO3在Color(0.6326)、Texture(0.5476)领先,TILT(0.5770/0.5665)与CFG++互有胜负,作者归因于Jacobian-vector项可能影响单个概念成形。整体上TILT在最具挑战的Complex类别综合最优,定性图3/图4也显示它更好保留了颜色、形状、纹理与空间关系的绑定。

Quantitative comparison on multi-concept prompts from T2ICompBench.
Table 1: Quantitative comparison on multi-concept prompts from T2ICompBench.
Qualitative comparison of text-to-image compositional generation methods on T2ICompBench prompts.
Figure 3: Qualitative comparison of text-to-image compositional generation methods on T2ICompBench prompts.
查看结构化数据
任务指标本文基线提升
T2ICompBench Complex(多对象/多属性/多关系) ImageReward 0.4804(最佳) CO3 0.4406 / CFG++ 0.4467 / CFG 0.3073 / R2F 0.3561 较CO3 +0.0398,较CFG +0.1731,为所有方法最高
T2ICompBench Shape ImageReward 0.4338(最佳) CO3 0.4245 / CFG++ 0.3567 较CO3 +0.0093,列第一
T2ICompBench Color BLIP-VQA 0.5770 CO3 0.6326 / CFG 0.5661 略低于CO3但优于CFG,整体处于第一梯队
T2ICompBench Texture DINO 0.2493(最佳) CO3 0.2470 / CFG 0.2073 较CO3 +0.0023,列第一

局限与改进

作者坦承:TILT依赖基于梯度的更新,相比无梯度修正器有额外计算开销,TILT-C每步需 $K+1$ 次反向传播、开销随概念数线性放大;其次,对模型似然梯度的优化不如优化外部奖励稳定,Jacobian-vector项可能不稳定、影响单个概念成形,这已反映在部分类别BLIP-VQA偏低(如Color 0.5770低于CO3的0.6326)。补充观察:评测仅限SDXL+T2ICompBench,缺Stable Diffusion 3/Flux等新底模与大规模人工评测;切换阈值 $\tau$、$\beta$ 与修正步数均靠经验设置,文中无敏感性分析或自适应调度;子提示解析靠Stanza名词分块、会丢弃形容词等属性信息('blue backpack'被压成'backpack'),对含关系/数量/空间约束的Complex提示可能丢信息,而这恰是TILT最想攻克的类别;T2ICompBench类别有限,对长尾组合、稀有概念的鲁棒性未验证,图5也只给定性失败例而无失败类型统计。

独立分析的弱点

独立来看有五个弱点及对应改进方向。(1)计算成本:TILT-C的 $K+1$ 反向传播使大概念数场景难承受,可借鉴LoRA式低秩Jacobian近似或仅对Top-k概念做精细引导,并设计噪声自适应调度让TILT-C只用在真正低噪声的若干步。(2)数值稳定性:Jacobian-vector项在高噪声区易发散,可引入梯度裁剪、信赖域或对 $\beta$ 做时间表退火,并把奖励做归一化以抑制量纲差异。(3)提示解析脆弱:名词分块丢弃形容词会损失属性绑定信息,可改用依存句法或LLM做'概念+属性'的结构化拆分,把属性级奖励也纳入。(4)评测覆盖窄:仅在SDXL与四类T2ICompBench上验证,未触及其他底模(PixArt、Flux)或其他模态,跨模型超参迁移性未知,建议补大规模跨底模实验。(5)缺人工评估与失败模式定量:仅给定性失败样例(图5),建议补大规模人类偏好对比与按失败类型(漏对象、属性错绑、空间错位)的定量归因,明确TILT在何种提示分布上不适用。

未来方向

作者明确指出TILT模态无关,只需可分解的条件变量与条件分数估计,因此最直接的未来方向是迁移到文本到音频合成、分子生成、多属性编辑等其他组合生成场景,用内在奖励结构替代任务特定监督或重训练;作者还提到可把奖励对齐推广为通用的测试时可控生成目标。基于本文成果可延伸的方向包括:把pcTC/条件TC的群体级身份用于设计数据集层面的奖励加权或课程;探索更优的Jacobian近似族(如流匹配、伴随状态法adjoint)以兼顾TILT-S的效率与TILT-C的保真;将框架与布局/注意力类方法正交组合,先用结构化解析解决关系与空间约束、再用TILT强化属性绑定;研究奖励与CFG++流形的协同,是否能在更小 $\beta$ 下达到同等组合增益,从而进一步降低算力。

复现评估

复现细节披露较充分:底模为公开SDXL base(无额外训练)、DDIM 50步、$1024\times1024$、CFG 5.0或CFG++ 0.8;修正仅作用于前5个去噪步(首步TILT-S、其后4步TILT-C),初始步10次优化迭代、其余每步5次,关键超参 $\beta_{\mathrm{S}}=0.05$、$\beta_{\mathrm{C}}=0.004$;提示拆解用公开Stanza名词解析。评测基准T2ICompBench、指标(ImageReward/CLIP/DINO/BLIP-VQA)与四种子平均均有说明,对照方法CFG、Composable Diffusion、R2F、CFG++、CO3均在同底模同设置复跑。主要挑战:论文未给官方代码仓库链接,需自行实现Jacobian-vector引导与CFG++整合;ImageReward/BLIP-VQA等评估模型需较大算力与下载;TILT-C的多反向传播对显存与单步时间有要求,全基准四种子评估计算量不小。整体属'算法清晰、工程量中等'的复现难度。