← 返回 2026-08-05

UniWorld-Design:从像素生成到图层原生设计 UniWorld-Design: From Pixel Generation to Layer-Native Design

Zongjian Li, Zhiyuan Yan, Chenxu Bai, Chen Chen, Haoxiang Sun, Shaodong Wang, Feize Wu, Shenghai Yuan, Bin Lin, Zheyuan Liu, Yuwei Niu, Li Yuan 📅 2026-08-04 👍 21 2026-08-10 18:30
DiffusionNFT后训练 Flow Matching Image-to-Layer MMDiT PSD文档 RGBA图层生成 Text-to-RGBA 可编辑设计 图像分解

用语义RGBA图层作为生成、理解与编辑的原子单元。

前置知识

RGBA图层 (Semantic RGBA Layer)

RGBA指红、绿、蓝三个颜色通道加上一个alpha透明度通道。在Photoshop等设计软件中,一张成品海报由多个有序图层(背景、主体、装饰、文字)从下到上叠加而成,每个图层都带自己的RGBA像素与透明度。本文把这样的语义图层当作模型生成、理解和编辑的最小单位——每个图层是一个完整、可独立寻址的视觉对象,可被移动、删除、改色或重新合成,alpha-compositing从后往前合成近似还原原图。

整篇论文的立论基础就是"像素定义图像如何渲染,而图层定义图像如何被创作、理解和编辑"。不掌握RGBA图层与可见像素分块(visible-pixel partition)的区别,就无法理解作者为何强调"保留被遮挡的内容",也无法看懂I2L模型为何要在共享画布上生成有序的完整语义层。

Flow Matching (流匹配) 与Rectified Flow

流匹配是一种生成式建模方法,通过学习一个时变速度场把数据与噪声连成一条路径。本文采用Rectified Flow,定义 $z_t = (1-t)z_0 + t z_1,\ t\in[0,1]$,其中 $t=0$ 是干净数据 $z_0$(自编码器latent),$t=1$ 是高斯噪声 $z_1$。模型以均方回归学习速度 $z_1 - z_0$,推理时从噪声积分到数据。所有 $z$ 变量都是autoencoder latent而非像素。

T2RGBA和I2L两个模型、渐进蒸馏和DiffusionNFT后训练都以flow matching为基础。看懂公式 $z_t=(1-t)z_0+t z_1$ 与蒸馏中"老师多步、学生一步到同一时刻"的目标,才能理解为什么作者放弃了分布匹配蒸馏(DMD)而改用渐进对抗蒸馏。

DiffusionNFT 后训练

DiffusionNFT是在同一条件 $y$ 下采样的输出上做奖励驱动后训练的方法。设 $r_b\in[0,1]$ 是候选样本的组归一化最优性分数,$v_b$ 是其目标速度,$v_{old}$ 是EMA更新的数据收集策略预测的速度。核心目标为 $\mathcal{L}_{NFT} = \mathbb{E}_b[r_b\|v^+_\theta - v_b\|_2^2 + (1-r_b)\|v^-_\theta - v_b\|_2^2]$,其中 $v^+_\theta = v_\theta$,$v^-_\theta = 2v_{old} - v_\theta$。高奖励拉向目标,低奖励推开,两支共享同一流场。

本文两模型都用DiffusionNFT做后训练并定义了各自的任务奖励(见Equation 6)。不理解这个implicit-policy参数化,就无法看懂I2L如何用RGBA L1+LPIPS、T2RGBA如何用alpha门控+CLIP/MLLM评分来优化图层质量。

MMDiT 与 RoPE 旋转位置编码

MMDiT(Multimodal Diffusion Transformer)是文生图/文生视频常用的Transformer主干,把文本token和图像token放在同一序列里做联合注意力去噪。RoPE(Rotary Position Embedding)旋转位置编码通过把query和key按位置旋转,使注意力只依赖相对位置。基础transformer给每个图像token三个旋转坐标 $(0, h, w)$:第一维常数,后两维是空间行列。本文复用第一维常数来编码图层身份,而不是新增一个位置轴。

I2L的核心架构LIB-MMDiT的两大机制——图层-指令绑定注意力和图层索引3D旋转位置——都直接建立在MMDiT+RoPE之上。理解基础RoPE的三维坐标分配,才能看懂作者如何"零新增参数"地用第一维区分图层顺序、用 $(h,w)$ 对齐同一画布位置。

Crello基准与Stable-Layers协议

Crello是一个大规模设计海报数据集,含真实的图层栈结构。本文用512个固定种子的Crello设计,每个渲染成品与源图层栈配对,但Crello不参与训练。LayerD提供栈对齐(动态时间规整)和逐层RGB/alpha指标;Stable-Layers提供参考无关的可编辑性指标(空白层、釉化层、特征分布)和VLM五维打分协议(语义分离、alpha洁净度、背景补全、内容分布、内容有效性,每维0-5,总分25)。

论文I2L几乎全部核心数字(37% RGB L1下降、34% Alpha Soft IoU提升、VLM 20.43)都在Crello+LayerD+Stable-Layers协议下测得。必须先分清"逐层保真"(Table 1)、"参考无关可编辑性"(Table 2)和"VLM评分"(Table 3)三类指标的含义,才能正确评估I2L相对Qwen-Image-Layered的提升。

研究动机

文生图模型近年来在视觉吸引力上取得了长足进步,但它们本质上仍只合成一张扁平的RGB画布——像素只决定图像如何渲染,并不显式描述图像由哪些语义元素组成、这些元素该如何被操控。而人类设计师在做海报、插画、社媒图时,是从有序图层(背景、主体、装饰、文字)出发,每个图层都能被独立选中、移动、改色、替换或删除。一旦分层设计被栅格化成一张光栅图,其可编辑结构就丢失了:单个对象、图层顺序与层级、被遮挡的内容都不再显式存储。此后的任何编辑(改一个人、一个文字块、背景)都得先从像素重建结构,而这种重建普遍是不完整的。整图指令编辑可能误改本应保持不变的内容;掩码编辑能局部化但无法恢复原始图层栈;前景分割只能提取可见区域,无法还原被遮挡的内容。问题的根源不仅在于分割精度,更在于光栅表示本身从一开始就缺失可编辑结构。

本文的目标是本文目标是在多模态生成模型中引入一个"图层原生(layer-native)"的设计空间:把语义RGBA图层作为生成、理解和编辑的原子单位。具体而言,作者提出UniWorld-Design框架,包含两个模型——Text-to-RGBA (T2RGBA) 直接从文本生成独立可复用的透明RGBA资产;Image-to-Layer (I2L) 接收一张成品图、一个全局指令和逐层prompt,联合产出有序、完整的语义RGBA图层栈。希望让"分解"成为一个可被指令寻址的操作:顶层分解、递归分解、定向提取三种粒度都能用语言控制,从而把生成与分解统一在同一表示下,让视觉内容能在语言、成品图和可编辑结构之间自由流动,为外部设计Agent提供持久、可语言寻址的对象状态接口。

与已有工作不同的是,现有方法的共同盲点是"把分层当作后处理或局部补丁"。Qwen-Image-Layered虽能联合生成语义解耦的RGBA层并支持递归再分解,但既不暴露逐层语义prompt也不支持由文本指令控制的定向提取;OmniPSD聚焦text-to-PSD生成与image-to-PSD恢复;LayerD则是从光栅设计图中顺序提取元素。Agent类编辑器(Banana、ReDesign)虽然引入了层级感知执行,但其"层"要么是局部执行补丁、要么是异构工具拼出的JSON层级,仍属于"规划-执行"系统而非模型原生能力。本文的独特切入角度是:在模型层面直接定义一个图层原生的视觉空间,让语言控制"该分离什么、用什么粒度、承担什么语义角色",并坚持学习完整语义对象而非可见像素分区,使图层在被移动或删除后依然可用。

核心方法

整体思路可以概括为"两个模型、一套RGBA原生表示、一条生成-分解闭环"。直觉上:图层就像Photoshop里的对象,应该是可寻址的最小单位。技术路线分四块。首先是RGBA自编码器:在预训练RGB自编码器基础上把编码器首层和解码器末层卷积从3通道扩到4通道,新alpha滤波器零初始化、解码器alpha偏置置1,使模型起始等价于原始RGB自编码器加不透明alpha;训练时混合透明RGBA图和不透明RGB图(alpha=1),损失含RGB与alpha重建、感知(LPIPS)、KL、对抗(GAN)以及一项RGB-latent对齐项,仅对RGB来源样本施加冻结老师的latent约束,鼓励其编码贴近预训练隐空间。其次是T2RGBA:在内部策划的"文本+透明RGBA"数据上微调(512等价面积起步再续训到1024),采用渐进蒸馏+DiffusionNFT后训练两阶段管线。然后是I2L:把成品图作共享视觉条件,绑定每个有序输出到对应语义prompt,学习完整语义对象。最后两者都通过渐进对抗蒸馏把采样压缩到8步,再用任务特定奖励做DiffusionNFT后训练。

核心创新在于I2L的架构LIB-MMDiT(Layer–Instruction Binding MMDiT),它用两套机制同时解决两个对应难题。第一个难题是"每条语义描述必须只控制它对应的输出层而非整个栈",作者引入"图层-指令绑定注意力":给全局指令与合成条件打tag $\tau=-1$,给目标层 $i$ 的prompt和图像token打tag $\tau=i$;图像query只能读全局文本和与自己匹配的prompt,读不到其他层的prompt;而图像-图像注意力不受限制,让条件和所有目标能联合解决遮挡与叠放。第二个难题是"不同层的token必须既对齐同一画布又保留各自的层身份与顺序",作者用"图层索引3D旋转位置":合成层用 $p=(-1,h,w)$,目标层 $i$ 用 $p=(i,h,w)$,$i=0$ 是最底层;相等的 $(h,w)$ 对齐同一画布位置,第一维区分层序。这套设计的本质区别在于:相对Qwen-Image-Layered不暴露逐层prompt、不支持定向提取,I2L把分解做成指令可寻址的操作,且零新增RoPE参数。

方法步骤详情

方法步骤可拆为六段。第一步是RGBA自编码器训练:扩展通道→零初始化alpha→在RGBA+RGB混合数据上用 $\mathcal{L}_{VAE} = \mathcal{L}^1_{RGB} + \lambda_\alpha\mathcal{L}^1_\alpha + \lambda_{PL}^{white}\mathcal{L}_{PIPS} + \lambda_{KL}\mathcal{L}_{KL} + \mathbb{1}_{m\ge m_{GAN}}\lambda_{GAN}\rho\mathcal{L}_{adv} + \lambda_{tea}\mathbb{E}_{x\in X_{RGB}}\|mode\ q_S(z|[x,1]) - mode\ q_T(z|x)\|_2^2$ 训练,其中 $\rho$ 是自适应梯度范数比,自编码器用直通alpha保留透明下的颜色,扩散训练则在白底合成后表示RGB。第二步是T2RGBA监督微调:从文本生成透明资产,512等价面积起步再到1024。第三步是I2L数据构造:从设计师手写的PSD文档渲染图层,用VLM只辅助分组,把相关创作单元合并成语义对象并组织成层级树;构造目标层时即使被上层遮挡也保留其源像素,移动/删除遮挡层会露出底层内容而非透明洞;根节点给顶层分解样本、内部节点给递归分解样本、选中节点加未选余项给定向提取样本。第四步是LIB-MMDiT训练:全局指令、逐层prompt、编码的合成条件与目标层latent进入同一序列,合成层保持 $t=0$ 干净并在每步去噪时重新注入、不计入损失,只对目标层加噪并监督,每个样本共享一个时间步。第五步是渐进对抗蒸馏:从粗学生调度里采样区间 $[t_{k+1},t_k]$,冻结老师走 $r$ 步Euler得到 $\hat Z^T_{t_{k+1}} = \Phi_T^{(r)}(Z_{t_k};c)$,学生一步走到同时刻 $\hat Z^S_{t_{k+1}} = Z_{t_k} + (t_{k+1}-t_k)v_\theta(Z_{t_k},t_k;c)$,损失 $\mathcal{L}_{distill} = \frac{1}{N}\sum_{i=0}^{N-1}\|\hat Z^S_{i,t_{k+1}} - \hat Z^T_{i,t_{k+1}}\|_1 + \lambda_{adv}\mathcal{L}_{adv}$,判别器从transformer主干初始化,得到8步学生。第六步是DiffusionNFT后训练:T2RGBA奖励 $R_{T2RGBA} = a(\hat x,y)[\lambda_Q s_Q + \lambda_M s_M]$,$a$ 是alpha跟随门控,$s_Q$ 是Qwen3-VL的CLIP式相似度,$s_M = \frac{1}{5}\sum_{k=0}^5 k\,softmax(\ell)_k$ 是Qwen3.5-9B的logit期望分;I2L奖励 $R_{I2L} = -\frac{1}{N}\sum_i \frac{\lambda_1 d^{(i)}_1 + \lambda_P d^{(i)}_P}{\lambda_1 + \lambda_P}$,其中 $d^{(i)}_1$ 是四通道RGBA的逐像素MAE,$d^{(i)}_P$ 是只对RGB三通道(不加alpha掩码)算的AlexNet LPIPS,层间等权平均、不在层间相乘、不对重组图施加奖励。

技术新颖性

技术新颖性可归纳为五点。第一,图层-指令绑定注意力首次把"全局指令广播+逐层prompt绑定"做进MMDiT的注意力掩码(图像query读文本key时生效,文本-文本与图像-图像注意力不受限),相对Qwen-Image-Layered不暴露逐层语义prompt是一本质升级。第二,图层索引3D旋转位置"复用"基础RoPE第一维常数坐标来编码层身份,零新增参数即实现层序区分与画布对齐,工程上极为优雅。第三,坚持从设计师PSD构造完整语义对象(保留被遮挡内容)而非可见像素分区,使图层在被移动/删除后仍可用——这是"可编辑性"的物理保证,而非仅靠分割精度。第四,用一棵语义层级树同时派生顶层分解、递归分解、定向提取三种任务并混合微调,把分解做成指令可寻址的统一操作。第五,后训练奖励设计上I2L显式把alpha误差排除在LPIPS感知网络之外(只进RGBA L1头),且外层alpha门控在T2RGBA上保证"错误的透明度无法靠高CLIP/MLLM分补偿",这种奖励工程对图层任务很有针对性。

LIB-MMDiT overview.
Figure 3: LIB-MMDiT overview.
From one PSD document to three training tasks.
Figure 4: From one PSD document to three training tasks.

实验结果

实验在Crello(512个固定种子设计)和内部保留集上评测,核心发现分三层。第一层是逐层保真(Table 1):在4层对齐设置下,UniWorld-I2L的逐层RGB L1降到0.1264(相对Qwen-Image-Layered的0.2014下降37%),Alpha Soft IoU升到0.7325(相对0.5454提升34%),说明经栈对齐后本文图层在RGB内容和alpha支撑上都更贴近参考。第二层是参考无关可编辑性(Table 2):空白层从0.35降到0.13(下降63%),釉化层从1.34降到1.19,Bad Layers从1.69(42.3%)降到1.32(33.0%),特征分布从0.658升到0.690,说明冗余内容更少。第三层是VLM评分(Table 3):UniWorld-I2L总分20.43±2.91(归一化0.817)对Qwen-Image-Layered的17.60±4.97(0.704),其中内容分布+0.95、内容有效性+0.93、语义分离+0.83贡献最大,背景补全+0.56;唯一下降的是alpha洁净度(2.90对3.33)。第四层是T2RGBA(Table 4):本文CLIP Score 33.03最高(对LayerDiffuse 29.22、OmniAlpha 31.00,比OmniAlpha高6.5%),对LayerDiffuse的FID下降45%(214.47→本文虽117.14)、配对LPIPS改善15-26%;但OmniAlpha在FID(87.86对117.14)和白底合成LPIPS(0.462对0.537)上更优,Alpha MSE与SAD也略低(0.406对0.413、1049631对1083441)。作者解释这些指标回答不同问题:CLIP Score度量文本对齐,FID/LPIPS度量分布与实例级参考相似度,OmniAlpha更贴参考外观分布而本文更贴合文本。

Per-layer quality on 512 Crello designs.
Table 1: Per-layer quality on 512 Crello designs.
Editability on 512 Crello designs.
Table 2: Editability on 512 Crello designs.
VLM-based evaluation of four-layer decomposition following the Stable-Layers protocol.
Table 3: VLM-based evaluation of four-layer decomposition following the Stable-Layers protocol.
Text-to-RGBA generation on 512 design-element prompts.
Table 4: Text-to-RGBA generation on 512 design-element prompts.
Qualitative comparison of per-layer decomposition with Qwen-Image-Layered on two Crello designs.
Figure 5: Qualitative comparison of per-layer decomposition with Qwen-Image-Layered on two Crello designs.
Qualitative analysis of instruction-controlled I2L decomposition.
Figure 6: Qualitative analysis of instruction-controlled I2L decomposition.
Text-to-RGBA against LayerDiffuse and OmniAlpha.
Figure 7: Text-to-RGBA against LayerDiffuse and OmniAlpha.
查看结构化数据
任务指标本文基线提升
Crello逐层RGB保真(4层对齐) per-layer RGB L1 (用二值参考alpha支撑, 越低越好) 0.1264±0.0980 Qwen-Image-Layered 0.2014±0.0937 相对下降37%
Crello逐层alpha质量(4层对齐) Alpha Soft IoU (越高越好) 0.7325±0.1622 Qwen-Image-Layered 0.5454±0.1577 相对提升34%
Crello空白层生成(可编辑性) Blank layers per sample (越低越好) 0.13 Qwen-Image-Layered 0.35 相对下降63%
Crello VLM五维评分(总分25) Stable-Layers VLM total score 20.43±2.91 (归一化0.817) Qwen-Image-Layered 17.60±4.97 (归一化0.704) 总分+2.83,内容分布/有效性/语义分离是主要增益,alpha洁净度略降
Text-to-RGBA 文本对齐 CLIP Score (越高越好) 33.03±5.29 LayerDiffuse 29.22±4.51, OmniAlpha 31.00±7.02 三模型中最高,比OmniAlpha高6.5%
Text-to-RGBA 分布相似度 FID (对1000真实图层, 越低越好) 117.14 OmniAlpha 87.86 (最优), LayerDiffuse 214.47 优于LayerDiffuse 45%,但逊于OmniAlpha

局限与改进

作者明确承认两点局限。其一是alpha边缘:Table 3中alpha洁净度2.90低于Qwen-Image-Layered的3.33,精细alpha边界仍是未来工作。其二是密集排版尤其中文:复杂字形和长段落会产生缺笔画、错字、布局不稳定,排版密集的设计需要底层模型更强的文字生成能力。除作者自述外,可观察到三点:第一,T2RGBA在FID(117.14)和配对LPIPS(0.537)上逊于OmniAlpha,说明在"贴参考外观分布"维度上并非全面领先;第二,VLM评分唯一倒退项恰是alpha洁净度,与作者主推的"透明RGBA"叙事存在张力,可能源于完整语义对象策略在边缘处的trade-off;第三,评测基准Crello虽512个固定种子、但训练数据为内部策划集,复现门槛高,且评测层固定为4层,更深层级/异构粒度的鲁棒性未充分展示。

独立分析的弱点

独立分析有三处弱点及对应改进方向。第一,alpha边界质量是已知短板(VLM洁净度2.90<3.33),在毛发、半透明玻璃、抗锯齿文字等区域会直接影响抠图可用性;改进方向是引入边缘感知的alpha奖励(如将matting精度作为DiffusionNFT的显式奖励头)或在自编码器训练中加权边界重建。第二,密集与中文排版生成不稳定,限制了在真实海报(尤其中文市场)的落地;改进方向是把更强文本渲染能力(如token级字形监督或专用文字生成头)并入RGBA主干,或训练后用OCR反馈做奖励。第三,I2L训练依赖设计师手写PSD且VLM参与分组,数据规模与多样性受限于商业设计资源,跨域(插画、3D合成、自然照片)泛化未在论文中验证;改进方向是把PSD解析自动化并扩展到更多设计来源,同时公开评测协议以便社区复现。第四,从T2RGBA看FID与LPIPS逊于OmniAlpha,提示在"参考分布匹配"上训练数据或奖励权重需重新平衡,可考虑加入分布级(FID近似)奖励。

未来方向

作者明确提出的未来方向是:扩大数据规模、模型容量与算力,预训练一个统一的native RGBA生成与理解模型,把能力从RGBA资产生成与图像分解扩展到图层插入与替换、布局约束合成以及迭代多轮编辑。基于本文成果可延伸的方向包括:把I2L的递归分解与定向提取正式接入外部设计Agent的规划-执行循环(论文Figure 2已勾勒接口),实现"语言寻址对象状态"的闭环设计系统;将LIB-MMDiT的图层绑定机制迁移到视频层(分层视频生成/编辑)和3D场景(分层NeRF/Gaussian);用DiffusionNFT的多奖励头框架引入可编辑性、版权安全、品牌合规等更丰富的人类偏好奖励;针对alpha边界与中文排版短板,发展专门的边缘奖励与字形感知扩散头。

复现评估

复现难度整体偏高。有利因素:训练管线两阶段(渐进蒸馏+DiffusionNFT后训练)描述清晰,关键损失(自编码器Equation 3、蒸馏Equation 5、奖励Equation 6)和超参(8步采样、512等价面积、Crello 512种子、LayerD对齐、Stable-Layers五维协议、seed 42)给出较完整;与Qwen-Image-Layered、LayerDiffuse、OmniAlpha的对比均注明了官方脚本与推荐设置(640像素、可选全局caption)。不利因素:T2RGBA训练数据为"内部策划"集(文本+透明RGBA、设计资产/抠图主体/矢量插画)且未开源;I2L依赖设计师手写PSD文档,数据获取门槛高且VLM分组流程未公开具体prompt;模型权重与代码未明确开源声明(论文仅给项目网站链接);算力需求大(自编码器+两模型蒸馏+后训练+多奖励头需多卡长周期训练)。因此算法可参照复刻,但数据与权重层面的完全复现存在实质障碍,社区只能依赖Crello评测与公开基线做横向比较。