← 返回 2026-08-24

UniSpace:统一视觉表示与可扩展多模态建模 UniSpace: Unified Visual Representation and Scalable Multimodal Modeling

Jinbo Yan, Limeng Qiao, Jie Qin, Junyan He, Feize Wu, Guanglu Wan 📅 2026-08-09 👍 14 2026-08-29 18:30
图像生成 图像编辑 流匹配 统一多模态模型 视觉tokenizer 视觉表示 语义ViT

补丁重参数化让冻结语义ViT兼得理解与重建,单一视觉空间支撑生成与编辑

前置知识

语义视觉编码器(SigLIP / CLIP / DINOv2)

在大规模图文对或自监督数据上预训练的 ViT,输出 token 经对比学习或自蒸馏目标优化,与文本语义空间对齐,擅长判断「图里是什么」。但其训练目标不含像素级还原,最终层特征会主动丢弃与语义无关的低层变化(纹理、精确颜色、局部结构),因此深层特征几乎无法解码回原图。

本文的核心命题就是这类编码器能否被改造成兼顾重建的统一表示。理解其「语义抽象」倾向,以及作者如何用诊断实验推翻「语义 ViT 天然丢细节」的定论,是读懂全文的前提。

统一视觉 Tokenizer

指同一套视觉特征要同时服务三种用途:接入 LLM 做多模态理解、作为可解码回像素的重建表示、作为生成模型可建模的潜变量。现有做法要么训练全新骨干(UniTok、TokenFlow),要么语义蒸馏(UniFlow),要么多层特征堆叠(RAEv2),通常在语义、重建保真、可生成性三者之间被迫取舍。

本文的贡献正是给出第四条路线:不重训骨干、仅重参数化输入端。要知道现有路线各自的取舍,才能体会「冻结 + 最小干预」设计的价值。

流匹配(Flow Matching)

一类生成建模范式:定义从高斯噪声 $Z_0$ 到数据 $Z_1$ 的线性概率路径 $Z_t=(1-t)Z_0+tZ_1$,训练网络 $v_\theta$ 预测目标速度 $V_t=Z_1-Z_0$,推理时从噪声出发积分常微分方程得到样本。相比扩散模型训练更简洁,是 RAE、FLUX 及本文潜空间生成的训练目标。

本文的平衡流匹配(BFM)损失是在标准流匹配上按语义/重建分量拆分加权得到的,理解基础公式 $V_t=Z_1-Z_0$ 才能看懂 $\mathcal{L}_{BFM}$ 的设计动机。

MoT(Mixture-of-Transformer-Experts)

BAGEL 提出的统一多模态架构:同一主干内设理解专家与生成专家两套参数,token 按类型硬路由——文本与条件图 token 走理解专家,待预测的加噪视觉 token 走生成专家;每一层通过共享自注意力让两路 token 直接交互,兼顾任务特化与上下文融合。

UniSpace 直接沿用 Qwen3-8B 的 MoT 设计,其与 BAGEL 的唯一关键差别就在视觉接口(单一统一空间 vs 语义+VAE 双空间),理解 MoT 才能看懂这一对比。

重建—生成权衡与核心评测指标

rFID 衡量 tokenizer 的重建保真度,gFID/FID 衡量生成图像质量,PSNR/SSIM 衡量像素级重建误差;ImgEdit/GEdit 评测指令编辑,GenEval/DPG-Bench/OneIG-Bench 评测文生图对齐。经验规律是重建分量维度越高、细节越多,潜分布越难被生成先验建模,gFID 越差,统一 tokenizer 必须在两者间找到合适的工作点。

本文大量论证围绕「工作点」展开:PR 系列把 rFID 压到 0.14-0.18 的同时保住可接受的 gFID,看懂各指标含义才能理解其贡献与局限。

研究动机

语义视觉编码器(SigLIP、CLIP 等)已成为多模态理解与生成系统的核心视觉接口,但其最终 token 为语义抽象优化、丢弃细粒度视觉信息,像素级可恢复性极差——SigLIP2 最后层 token 经相同探针只能重建到约 20.96 dB PSNR,无法单独支撑对细节敏感的图像生成与保参考编辑。这导致现有系统依赖割裂的视觉表示:文生图模型在 VAE 潜空间生成,需要语义时再外挂语义编码器;编辑任务更尴尬,参考图既要提供物体身份与布局等语义信息,又要提供纹理、颜色、局部结构等细节,于是 BAGEL 这类 MoT 统一模型不得不同时使用 SigLIP2 + FLUX-VAE 两个视觉空间(Table 1)——架构上统一了,表示层面依然分裂,带来两套 tokenizer 的训练维护成本,也限制了两路信息的深度融合。

本文的目标是本文追问:视觉理解、生成、编辑能否在同一个基于预训练语义 ViT 的视觉表示空间中建模?具体拆成两个挑战:其一,构造一个既保留预训练语义能力、又能高保真重建、还对生成模型友好的统一表示,且不重训、不破坏预训练 Transformer 块;其二,把该表示扩展到 LLM 规模的统一多模态系统。最终产物是 UniSpace——基于 Qwen3-8B 的 MoT 模型,用同一个补丁重参数化的 ViT 编码-解码器作为唯一视觉接口,同时完成视觉理解、文生图与指令编辑,彻底去掉 VAE 通路。

与已有工作不同的是,独特切入在于「先诊断、再最小干预」。此前分析认为语义 ViT 深层特征天然丢失细节,主流路线要么训练新 tokenizer(UniTok、VA-VAE),要么语义蒸馏(UniFlow),要么堆多层特征(RAEv2),要么像 SenseNova-U1 那样端到端学原生像素接口。本文用控制变量实验证明:冻结的 Transformer 块并非瓶颈,真正的瓶颈是语义补丁嵌入——只把 $P_s$ 换成随机投影、其余全部冻结,最后层 PSNR 就从 20.96 提升到 24.66。据此提出「补丁重参数化」:不动任何预训练权重,只新增一个重建感知的补丁嵌入,把细节经同一骨干注入;再用显式通道分解 + 平衡流匹配解决「纠缠表示不可生成」的问题(Fig 5 诊断),这与所有已有统一 tokenizer 路线在方法论上本质不同。

核心方法

直觉:语义 ViT 的 token 表示全程保持高维、没有显式低维瓶颈,结构上具备携带像素细节的能力,只是原始输入参数化激活了「语义处理轨迹」,与语义无关的低层变化被逐层抑制。技术路线分三级:第一级(表示层),对冻结 ViT 做补丁重参数化——保留原语义通路 $T_s=F_\phi(P_s(I))$,新增一个由 $P_s$ 初始化、面向重建训练的嵌入 $P_r$ 得到 $T_r=F_\phi(P_r(I))$;经线性投影 $\tilde{T}_r=W_r T_r$ 压缩到 128 通道后按通道维拼接为统一表示 $T_u=\mathrm{Concat}(T_s,\tilde{T}_r)$,接 ViT-XL 解码器以 L2+LPIPS+GAN 训练重建。第二级(生成层),在 $T_u$ 上用按维度归一化、以 $\lambda_r=0.75$ 加权重建分量的平衡流匹配训练 DiT 先验。第三级(系统层),把 PR-Qwen-ViT 接入 Qwen3-8B MoT 主干构成 UniSpace:理解用交叉熵 NTP 损失、生成与编辑共享同一 BFM 目标,经四阶段课程从 256 到 1024 分辨率训练,全程冻结视觉 tokenizer。

核心创新有三点。其一,瓶颈重定位:通过「只换补丁嵌入、其余全冻结」的干预实验证明,同一批冻结块在不同输入参数化下会激活不同的信息通路——预训练嵌入激活语义抽象轨迹,随机嵌入则暴露残差流中保留下来的细节通路(最后层 +3.70 dB),把「语义 ViT 不能重建」的定论改写为「输入参数化决定信息路由」。其二,结构上保证语义不损:与用 MLP 把两路特征纠缠融合不同,显式按通道拼接让语义分量 $T_s$ 保持原值、重建分量 $\tilde{T}_r$ 独立可寻址,生成训练时可直接对两分量分别控制权重。其三,平衡流匹配目标 $\mathcal{L}_{BFM}$:把预测速度按语义/重建分量拆开($\hat{V}_t=\mathrm{Concat}(\hat{V}_t^s,\hat{V}_t^r)$),各按维度数归一化后以 $\lambda_r$ 加权,显式指定目标中「解码器关键信息」的份额,避免了朴素 MSE 被维度规模支配、重建信息欠拟合的问题。

方法步骤详情

第一步,诊断:在 SigLIP2 上逐层训练相同重建探针,语义准确率随深度从 0.93% 升至 81.29% 而像素可恢复性崩塌;仅把补丁嵌入 $P_s$ 换成随机投影、其余全部冻结,最后层 PSNR 即从 20.96 升至 24.66,证明抑制发生在前向传播中。第二步,构造统一表示:新增由 $P_s$ 初始化的重建感知嵌入 $P_r$,得 $T_r=F_\phi(P_r(I))$,经 $W_r$ 压缩到 128 通道后与冻结的 $T_s$ 沿通道拼接为 $T_u$(SigLIP2/DINOv2 为 896 维,Qwen-ViT 为 1280 维)。第三步,重建训练:ViT-XL 解码器先用 L2+LPIPS 训练 $P_r$、$W_r$ 与解码器(AdamW 2e-4、batch 512),再冻结编码侧、加 GAN 损失精调解码器 20 epochs。第四步,生成训练:以 $Z_1=T_u$、$Z_t=(1-t)Z_0+tZ_1$、目标速度 $V_t=Z_1-Z_0$ 做流匹配,损失按分量维度归一化并以 $\lambda_r=0.75$ 加权重建分量。第五步,系统化:UniSpace 基于 Qwen3-8B MoT,文本与条件图 token 走理解专家、加噪视觉 token 走生成专家;理解样本优化 $\mathcal{L}_{NTP}$,生成与编辑共享同一 BFM 目标,tokenizer 全程冻结;四阶段课程(256→512→1024→SFT)共约 510M 样本实例、470B token,用 256 张昇腾 910B 训练约 142K NPU 时。

技术新颖性

与已有路线逐一对比:RAE 直接拿冻结语义特征当生成潜变量,但受制于原始语义补丁嵌入,DINOv2-B 上 rFID 仅 0.57、PSNR 仅 18.86;UniFlow 靠蒸馏训练「理解感知的重建表示」,RAEv2 堆多层 DINO 特征,VA-VAE 把语义对齐塞进 autoencoder——三者都要改动或重训编码侧。UniTok/TokenFlow 等统一 tokenizer 需从头训练骨干;SenseNova-U1 反向去掉外部编码器、端到端学原生像素接口。本文证明存在一条更省的路:完全不修改预训练权重,仅重参数化输入端就让同一骨干服务理解与重建,预训练语义先验被结构性保留(Table 4 中理解分数不降反升)。此外,Fig 5 的纠缠表示诊断(真实潜变量上 rFID 0.069、PSNR 33.83、zero-shot 78.53,但生成潜变量用重建解码器解码 FID 高达 120.9,且约 95% 方差由语义通路解释,$\rho_s\approx 95\%$)首次系统揭示了「理解好 + 重建好 ≠ 可生成」的表示质量与可建模性鸿沟,并给出显式分解 + 平衡流匹配的解法,这一洞察对整个统一 tokenizer 方向都有方法论价值。

Overview of Patch Reparameterization.
Figure 2: Overview of Patch Reparameterization.
UniSpace pipeline built on the proposed unified visual representation.
Figure 3: UniSpace pipeline built on the proposed unified visual representation.
Diagnostic study of an entangled unified representation.
Figure 5: Diagnostic study of an entangled unified representation.

实验结果

诊断层面:随机补丁嵌入使冻结 SigLIP2 最后层 PSNR 从 20.96 升至 24.66(+3.70 dB),证明瓶颈在输入参数化而非 Transformer 块。重建(ImageNet-1K 256×256,Table 3):PR-DINOv2 达 rFID 0.14、PSNR 30.84、SSIM 0.90,较 RAE(DINOv2-B) 的 0.57/18.86/0.48 相对降低 75.4%,PR-SigLIP2 降低 66.0%(0.53→0.18),PR-Qwen-ViT 在网络数据上 rFID 0.17;均超过 VA-VAE(0.28)与 SD-VAE 3(0.20)。理解(LLaVA-v1.5 七基准平均,Table 4):PR-SigLIP2 64.37>SigLIP2-B 63.39,PR-Qwen-ViT 68.94>Qwen-ViT 68.29,语义无损。ImageNet 生成(Table 5):PR-DINOv2 gFID 2.10(无 CFG)/1.87(CFG 1.2),换取 rFID 0.14 高保真工作点,但仍逊于 RAE(1.13)/RAEv2(1.06)。纠缠诊断(Fig 5):MLP 纠缠表示真实潜变量上 rFID 0.069、zero-shot 78.53,但生成潜变量经重建解码器 FID 120.9、语义解码器 8.07。系统级(8B):ImgEdit 4.28 超同规模 SenseNova-U1(3.90)、BAGEL(3.20),逼近 32B Emu3.5(4.41);GEdit 双语均值 7.395 超 BAGEL 6.51;GenEval 0.84;OneIG 中英均值 0.547 为统一模型最高;DPG 86.49、关系分 94.97 全场最高。

Comparison of visual interfaces in representative MoT-based unified models.
Table 1: Comparison of visual interfaces in representative MoT-based unified models.
Progressive training curriculum of UniSpace.
Table 2: Progressive training curriculum of UniSpace.
Multimodal understanding performance of unified visual tokenizers.
Table 4: Multimodal understanding performance of unified visual tokenizers.
Additional image-editing evaluation on GEdit.
Table 7: Additional image-editing evaluation on GEdit.
Text-to-image generation on GenEval.
Table 8: Text-to-image generation on GenEval.
Text-to-image generation on OneIG-Bench (English).
Table 9: Text-to-image generation on OneIG-Bench (English).
Text-to-image generation on OneIG-Bench (Chinese).
Table 10: Text-to-image generation on OneIG-Bench (Chinese).
Ablation of reconstruction-component weighting in balanced flow matching.
Table 12: Ablation of reconstruction-component weighting in balanced flow matching.
Ablation of reconstruction-component compression.
Table 13: Ablation of reconstruction-component compression.
Qualitative reconstruction comparison.
Figure 4: Qualitative reconstruction comparison.
Qualitative image editing comparison.
Figure 6: Qualitative image editing comparison.
Qualitative comparison on human-centric image editing.
Figure 7: Qualitative comparison on human-centric image editing.
Qualitative text-to-image comparison.
Figure 8: Qualitative text-to-image comparison.
Additional qualitative text-to-image comparison.
Figure 9: Additional qualitative text-to-image comparison.
查看结构化数据
任务指标本文基线提升
ImageNet-1K 256×256 图像重建 rFID↓ 0.14(PR-DINOv2) 0.57(RAE, DINOv2-B) 相对降低 75.4%
ImageNet-1K 256×256 图像重建 PSNR↑ 30.84(PR-DINOv2,SSIM 0.90) 18.86(RAE, DINOv2-B,SSIM 0.48) +11.98 dB
多模态理解(LLaVA-v1.5 七基准平均) Avg↑ 68.94(PR-Qwen-ViT) 68.29(Qwen-ViT 原始编码器) +0.65,证明语义能力无损
ImageNet 256×256 类条件生成(DiTDH-XL,CFG 1.2) gFID↓ 1.87(tokenizer rFID 0.14) 1.06(RAEv2,tokenizer rFID 0.29) 略逊于基线,但重建 rFID 优 51.7%,定位为高保真工作点
指令图像编辑 ImgEdit Overall↑ 4.28(8B) 3.90(SenseNova-U1, 8B)/ 3.20(BAGEL, 7B) +0.38 / +1.08,逼近 32B Emu3.5 的 4.41
指令图像编辑(中英双语) GEdit Overall 均值↑ 7.395(EN 7.41 / CN 7.38) 6.51(BAGEL 双语均值) +0.885
文生图组合对齐 GenEval Overall↑ 0.84 0.82(BAGEL) +0.02(同规模 SenseNova-U1 达 0.91,本文仍逊于其)
文生图细粒度评测(中英平均) OneIG-Bench Overall↑ 0.547(EN 0.561 / CN 0.533) 0.542(SenseNova-U1, 8B)/ 0.546(Emu3.5, 32B) 统一模型中最高,风格分 0.467/0.455 双语最高
密集提示跟随 DPG-Bench Overall↑ 86.49(关系分 94.97 全场最高) 85.07(BAGEL)/ 87.78(SenseNova-U1) 超 BAGEL +1.42,整体仍略低于 SenseNova-U1

局限与改进

作者承认两点:其一,UniSpace 系统级理解仍落后专用 VLM,因为后训练配方主要优化生成与编辑,并未针对标准 VLM 基准;其二,编码器是理解与生成共享的统一表示,在理解数据上自由更新会危及生成能力,这一架构约束限制了理解上限。结果也不均匀:GenEval 计数 0.69、颜色绑定 0.88 低于 SenseNova-U1 的 0.92/0.91;GEdit 感知质量 PQ 7.06 明显弱于语义一致性 SC 8.29;DPG 全局 84.80、属性 90.00 均低于最强文生图系统。我的观察:第一,ImageNet 生成 gFID 1.87 的绝对水平仍逊于 RAE/RAEv2/VTP-L(1.13/1.06/1.11),说明统一空间的可建模性确有代价,「重建-生成权衡」的叙述部分淡化了这个差距;第二,ImgEdit 的 Style 类目仅 2.70、Hybrid 类目 2.70,明显弱于其 4.28 的总分;第三,128 通道压缩与 $\lambda_r=0.75$ 均为经验选择,压缩会不可逆丢弃细节(PSNR 33.61→29.79);第四,Table 6-11 中大量基线数值直接引自 SenseNova-U1 的评测报告,跨来源数值的对齐性存疑。

独立分析的弱点

弱点一,生成保真度天花板:统一空间必须同时「易解码」与「易建模」,128 维压缩牺牲细节(Table 13:768 维时 rFID 0.085、PSNR 33.61,但 40 epochs 的 FID 从 6.92 恶化到 11.07)。改进方向:对重建分量引入自适应噪声调度或分量级时间步,让生成先验逐步适应更高维细节分布。弱点二,冻结编码器使理解能力无法随下游数据进化(作者已承认),可探索低秩适配(LoRA 仅作用于语义通路)或交替冻结的双速率训练,在不破坏生成的前提下微调理解分支。弱点三,细粒度风格与组合编辑偏弱(ImgEdit Style 2.70、GEdit PQ 7.06),可加大感知损失权重、引入高分辨率区域级编辑监督。弱点四,计数(0.69)与颜色绑定(0.88)落后,属数据与后训练层面问题,可用针对性合成数据与偏好优化纠偏。弱点五,训练需约 142K NPU 时、256 张昇腾 910B,且依赖内部策划数据,社区难以复现完整训练动力学,限制了结论的外部验证。

未来方向

作者提出的方向是探索统一表示与 UniSpace 模型的联合优化,在保持生成能力的同时提升理解。基于本文成果还可延伸:其一,把补丁重参数化推广到视频 ViT,构建时空统一表示支持视频理解与生成;其二,将显式通道分解思想引入自回归范式,对 $\tilde{T}_r$ 做离散化以兼容 LLM 式 next-token 预测;其三,从理论上解释「随机嵌入暴露细节残差通路」的现象——残差流中的语义无关信息为何会被语义参数化逐层抑制,这关系到表示几何与信息流守恒的基本问题;其四,把 decoder calibration(用早期 DiT 检查点采样潜变量微调解码器)推广为 tokenizer 与生成先验的交替协同训练,进一步收窄生成-重建差距;其五,在更大 LLM(>8B)与更强生成专家上验证统一表示的 scaling 行为,检验其在更大规模下是否仍保持权衡优势。

复现评估

开源情况较好:项目页(yjb6.github.io/UniSpace)、GitHub 与 HuggingFace(yjb6/UniSpace)均已公开,作者称发布完整 UniSpace 系统,权重可下载推理。Tokenizer 层复现门槛中等:PR-SigLIP2/PR-DINOv2 只需 ImageNet-1K 与单机多卡即可,训练协议在 3.4 节交代得非常细(AdamW lr 2e-4、$\beta=(0.9,0.95)$、batch 512、EMA 0.9978、ViT-XL 解码器配置、两阶段 L2+LPIPS→GAN),DiT 先验遵循公开的 RAE 配方;Fig 5 与附录 C 的诊断实验协议也完整,适合学术复现与消融。8B 系统层复现困难:需约 142K NPU 时(256 张昇腾 910B、64GB),预训练数据为内部策划的生成/编辑/理解数据集,仅公开规模(约 510M 样本实例、470B token)与采样配比;训练用 PyTorch FSDP(SHARD GRAD OP)+ BF16,基于昇腾平台,对 CUDA 用户需额外适配。总体判断:思路与 tokenizer 代码可复现,完整系统适合下载权重做推理与微调,而非从零复训。