SenseNova-U1.5:迈向原生统一视觉智能 SenseNova-U1.5: Towards Native Unified Visual Intelligence
8B-MoT 无编码器无VAE统一模型,靠空间联合重建与多专家RL蒸馏兼顾理解、生成与编辑
前置知识
原生统一多模态建模(Encoder-free & VAE-free)
主流多模态系统理解图像用预训练视觉编码器(VE)、生成图像用变分自编码器(VAE),两套表示空间割裂。原生统一建模则让模型直接从像素和文本学习:视觉输入经卷积下采样成token,生成直接在RGB像素空间做扩散/流匹配,没有外部编码器也没有VAE潜空间,感知、推理、生成共用同一套紧凑视觉token。
本文的全部贡献都建立在「单一原生表示同时支撑看与画」这一前提上,理解该范式才能明白为什么32×32像素一个token就够、为什么空间解码器是关键补全。
Mixture-of-Transformers(MoT)
一种双流Transformer架构:理解与生成分开保留各自的注意力投影、归一化层和前馈模块,按token类型在每层动态路由,但通过共享的自注意力接口跨流通信。注意力模式非对称:文本token因果关注,图像块内双向交互,噪声生成token可见全部前置干净上下文,但干净表示被屏蔽不能看到随机生成状态。
SenseNova-U1.5 的 8B 参数就是 8.2B 理解分支 + 8.2B 生成分支的 MoT 结构,理解分支冻结来训练生成分支、后期联合训练的策略都依赖这一架构。
像素空间流匹配(x-prediction Flow Matching)
一种生成式训练目标:构造从噪声到图像的连续速度场并回归它。本文按 $z_t = tx + (1-t)\sigma_R(H,W)\epsilon$ 构造轨迹,其中 $\sigma_R(H,W)$ 是随分辨率自适应的噪声尺度,模型预测干净端点 $\hat{x}_\theta$,速度 $v_\theta = (\hat{x}_\theta - z_t)/(1-t)$,损失为 $\mathcal{L}_{Flow} = \mathbb{E}\|v_\theta - v^*\|_2^2$。
U1.5 的生成训练、RL 采样(CPS/Precise)和 OPD 蒸馏的监督信号(速度场差)全部定义在流匹配框架上,不懂速度场就看不懂后训练。
GRPO 与扩散模型强化学习
GRPO(组相对策略优化)对同一提示采样一组候选,用组内相对优势代替价值模型来更新策略,是LLM后训练主流方法。把它搬到流匹配模型需要随机性探索:Flow-GRPO 用 SDE 采样引入噪声,而本文采用的 CPS(系数保持采样)和 Precise 采样能在有限步ODE推理中更好地保持流的动态特性,兼顾探索与分布保真。
论文第四阶段训练美学/OCR/信息图/编辑四个专家时,不同专家分别选用 CPS(η=0.7)、Precise(η=1.5)或纯噪声扰动采样,并配合 GRPO-Guard 防奖励过优化,这是理解专家训练细节的基础。
在线策略蒸馏(On-Policy Distillation, OPD)
传统知识蒸馏让学生模仿老师的固定输出,分布不匹配严重。OPD 让学生先自己生成轨迹,老师在学生轨迹的每个状态上给出密集监督,从而消除分布漂移。本文扩展为多专家版本:每个能力域硬路由到对应的冻结专家,在学生生成的状态 $(\text{sg}(\hat{x}_{\theta,t}), t, c)$ 上对齐师生速度场。
「先专精后统一」的后半段就是靠多专家 OPD 把四个RL专家的能力合并进单一模型,这是全文最重要的训练创新之一。
Pixel Shuffle
一种上采样算子:把形状为 $(B, r^2 C, H, W)$ 的特征张量重排为 $(B, C, rH, rW)$,即把通道维度的信息重排到空间维度,实现无参数的可学习上采样。常与卷积级联构成轻量解码器。
U1.5 用上采样因子 2、2、8 的三级 Pixel Shuffle 配合 3×3 卷积把 32×32 一格的 token 特征场重建为全分辨率图像,是取代 U1 逐patch MLP 头的核心组件。
研究动机
视觉生成正从普通图像合成扩展为通用视觉创作媒介,覆盖多语言排版、信息密集设计、高分辨率渲染、多参考合成、细粒度对象-背景编辑和交错图文生成。但绝大多数系统存在根本性的架构割裂:理解靠预训练视觉编码器(VE),生成靠变分自编码器(VAE),语义抽象空间与像素保真空间互相隔离,感知、推理与生成难以在同一框架内无缝协同。即使是走原生路线的前作 SenseNova-U1,其轻量视觉接口把每个视觉token独立重建为一个RGB patch——这种因式分解让相邻patch在图像成形的最后阶段无法交换信息,在2K/4K高分辨率下接缝、纹理断裂和几何不一致会被显著放大,成为原生范式迈向高保真创作的瓶颈。
本文的目标是本文目标是构建 SenseNova-U1.5:一个 8B-MoT 规模的原生统一多模态模型,在无编码器、无VAE的单一端到端框架内同时完成视觉理解、推理、生成与编辑。具体拆成三个子目标:其一,在不放弃紧凑 32×32 像素/token 表示效率的前提下,解决高分辨率下的空间连续性问题,并把原生生成能力扩展到 4096×4096;其二,把美学、中英双语文字渲染、信息图设计、图像编辑这四类奖励信号、采样动态、优化难点各异的创作能力同时做强;其三,验证理解与推理中习得的结构化知识能否迁移到视觉规划与创作(如长而复杂的结构化指令、知识密集型生成),而不需要依赖固定生成模板。
与已有工作不同的是,本文的独特切入有两点。架构上,从「独立patch预测」转向「空间联合重建」:不再用MLP把每个视觉token孤立地映射为像素,而是把token投影到二维特征场,经空间卷积与Pixel Shuffle逐级上采样重建图像,让相邻区域在像素最终确定前交换信息,颜色、纹理与几何被联合求解而非逐patch拼凑——这保住了紧凑序列的效率又补上了局部连续性。训练上,从「联合奖励优化」转向「先专精后统一」:先为四种能力各训练一个带定制数据、奖励、采样策略与正则化的RL专家,再通过沿学生自身生成轨迹的多专家在线策略蒸馏把互补能力合并进单一策略,避免多目标在同一策略中互相纠缠、稀释各自的收益。
核心方法
核心直觉:理解和生成可以共享同一套紧凑的原生视觉token表示——每 32×32 像素压缩为一个token,理解时它承载语义,生成时它作为去噪状态直接在RGB像素空间做流匹配,中间没有VE特征与VAE潜空间之间的反复转换。技术路线上,模型基于 NEO-unify 架构:42层Transformer、隐藏维4096、MoT双流各8.2B参数(配置见原文Table 1),理解与生成分开参数但共享自注意力接口,噪声生成token可见全部干净图文上下文而反向被掩蔽。训练共五个阶段(Table 2):生成预训练(随机初始化生成分支、冻结理解分支,纯像素流匹配)、统一中期训练与统一SFT(双分支联合,数据为30%理解+40%文生图+20%编辑+10%交错)、多专家强化学习、多专家在线策略蒸馏。统一目标为 $\mathcal{L} = \lambda_{AR}\mathcal{L}_{AR} + \lambda_{Flow}\mathcal{L}_{Flow} + \lambda_{Perc}\mathcal{L}_{Perc}$,权重 0.1 : 1 : 0.1,其中 $\mathcal{L}_{Perc}$ 是LPIPS感知损失,为RGB空间流目标补充特征空间的结构一致性监督。
创新一是空间耦合解码器。把骨干隐状态 $H \in \mathbb{R}^{B \times hw \times d}$ 恢复二维拓扑为 $H_{2D} \in \mathbb{R}^{B \times d \times h \times w}$,用上采样因子 2、2、8 的Pixel Shuffle级联逐步重建全分辨率RGB,级间3×3卷积使相邻patch边界处的像素被联合决定,从机制上消除独立patch预测固有的接缝与网格伪影;该解码器与骨干在流匹配目标下端到端联合训练。同时引入分辨率感知噪声条件:$\bar{\sigma}_R = \sigma_R(H,W)/\sigma_{max}$($\sigma_{max}$ 对应 4096×4096 参考分辨率,U1 只标定到 2048×2048),经正弦MLP嵌入后与扩散时间步相加 $s_t = \tau_t + \mathrm{NSEmb}(\bar{\sigma}_R)$,让去噪器同时感知扩散时间与分辨率相关的噪声统计。创新二是「先专精后统一」:美学、OCR、信息图、编辑四个RL专家各配专属数据、奖励、采样与正则(该冻结的冻结、该加KL的加KL),最后用多专家OPD蒸馏 $\mathcal{L}_{OPD} = \mathbb{E}\|v_\theta(\mathrm{sg}(\hat{x}_{\theta,t}),t,c) - v_m(\mathrm{sg}(\hat{x}_{\theta,t}),t,c)\|_2^2$ 硬路由合并,专家的条件、引导与分辨率策略原样保留。
方法步骤详情
第一阶段生成预训练分三相:Phase I 用 256²–1024² 文生图数据训 180K 步(恒定学习率 $2\times10^{-4}$,序列长 8196);Phase II 升到 512²–4096² 训 100K 步($1\times10^{-4}$,序列长 20480),专攻原生4K;Phase III 加入编辑与交错数据(配比60/30/10)再训 185K 步,从本相起给流匹配目标加0.1权重的LPIPS感知损失。第二阶段统一中期训练 80K 步($2\times10^{-5}$,序列长 32768),双分支联合,理解/生成分支损失权重 0.1/1.0。第三阶段统一SFT 10.5K 步,余弦退火到 0。第四阶段多专家RL:美学专家按epoch交错美学与排版数据、分别路由 HPSv3++ 与 PaddleOCR 双语OCR奖励,每提示16候选、30步轨迹、引导4.0、CPS采样 η=0.7、从前10步中均匀取连续5步窗口优化,KL系数0.01,冻结最后生成Transformer块与输出头;OCR专家用 Precise 采样(η=1.5)加 GRPO-Guard,奖励为多集IoU $R_{ocr} = \sum_t \min(g_t,o_t) / \sum_t \max(g_t,o_t)$(英文按词、中文按字),KL 0.02;编辑专家学习率 $4\times10^{-5}$、rollout 24、VLM五维奖励取min瓶颈聚合 $R_{edit} = \min(\{R_{inst}, R_{exec}, R_{visual}, R_{pres}\} \cup \{R_{text}\})$,配渐进滑窗从语义阶段移向纹理阶段;信息图专家先做信息图中训,再三阶段精炼:OCR GRPO热身→DPO($\beta=10$,$5\times10^{-6}$,12万Linear-DPO偏好对)→GRPO按分区交替路由OCR/美学奖励。第五阶段OPD蒸馏 800 步、每域25600样本、全局batch 128,查询时间步按 $t_e \sim \mathrm{Beta}(2+3n/N, 5-3n/N)$ 从 Beta(2,5)(高噪声、定全局结构)平滑移向 Beta(5,2)(低噪声、精修细节与文字),CFG=4(编辑专家为1),冻结理解分支、最后3层生成层与输出头。
技术新颖性
与模块化统一模型(VE理解+VAE生成,如Qwen-Image系)相比,U1.5 用同一token表示服务看与画,消除并行视觉通路与跨空间转换;与离散原生模型(VQ token自回归)不同,它走连续像素流匹配路线,无tokenizer瓶颈。相比NEO/U1的逐patch MLP解码,空间解码器在像素合成前恢复局部交互,是「近无损视觉接口」在解码端的关键补全,使32×32高压缩比首次在4K下不出网格伪影。相比把所有任务塞进共享RL配方(会导致目标纠缠),本文保留四个任务专家并硬路由其监督,保留各自的条件、引导、分辨率策略——与MOPD等软整合多教师不同,专家能力不被平均化。奖励设计同样有新意:分级多集IoU的OCR奖励能容忍部分正确又对漏字、重字敏感;编辑奖励用min瓶颈聚合防止「一维强势掩盖另一维致命失败」。数据上约59M新增文图对(88.2%有效训练量超1024²、64.4%超2048²)、38M编辑样本、最多10张参考图的多参考数据支撑了以上方法的发挥空间。
实验结果
理解能力未因生成扩张而受损:MMMU 73.86、MathVista-mini 85.85、MMBench-EN 90.47、AI2D 92.03、OCRBench 82.46、HallusionBench 68.53(Table 3),与U1基本持平且多项与Qwen3-VL-8B互有胜负;语言侧 MMLU-Pro 86.67、C-Eval 90.41,指令跟随 IFEval 从U1的91.13升至93.35、IFBench从67.01升至69.00。通用生成:Qwen-Image-Bench 英/中子集总分 60.22/60.13(带提示增强),开源第一,把U1的48.28/45.99大幅拉开并逼近 GPT-Image-2(65.23/64.69);GenEval 0.92 为开源最佳(计数0.93、属性绑定0.81、位置0.92);GenEval2 带PE 0.71(U1仅0.43),动词子项0.55对0.38;DPG-Bench 88.11。文字渲染:CVTG-2K 平均0.948、NED 0.977,4/5区域词准确率0.955/0.954居首;LongText-Bench 中英 0.988/0.989 开源领先。信息图:IGenBench Q-ACC 带PE 0.76(U1 0.51)、I-ACC 0.17(U1 0.04);BizGenEval 硬/易 72.2/88.4(U1 39.7/61.7),知识维从4.8/23.4跃升至72.0/87.9。知识推理生成 WISE 从0.70升至带CoT的0.81,开源第一。编辑:ImgEdit 4.59 超过20B的FireRed-Image-Edit(4.56);GEdit-Bench 英/中 8.26/8.24 最佳;WeEdit 7.46、OmniRef-Bench(目标0.68/MLLM 8.15)均为开源最佳。推理编辑 RISEBench 从不带CoT的33.6升至带CoT的38.6(U1-SFT 为23.9/26.9),因果、逻辑与时序类编辑增益最大。交错生成 OpenING 带CoT 9.18 总分领先;VBVR-Pro-Bench 域内68.2/域外68.9,显著超过闭源 Nano-Banana-Pro(56.4/64.8)与 GPT-Image-2(50.7/58.7);RealUnify-GEU 56.3 对 U1-SFT 47.5,说明生成可作为支撑推理的中间表示。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 多模态/语言理解(多基准) | 各基准准确率 | MMMU 73.86 / AI2D 92.03 / C-Eval 90.41 / IFEval 93.35 | SenseNova-U1(74.78 / 91.74 / 84.40 / 91.13) | 理解持平,IFEval +2.22,IFBench 67.01→69.00 |
| 通用文生图 Qwen-Image-Bench-EN | 六维加权 Overall | 60.22(带PE,开源第一) | SenseNova-U1 48.28;闭源最高 GPT-Image-2 65.23 | 较U1 +11.94,逼近闭源SOTA |
| 组合生成 GenEval | Overall | 0.92 | SenseNova-U1 0.91;Qwen-Image(20B) 0.87 | 开源最佳,计数0.93、属性绑定0.81 |
| 复杂组合 GenEval2 | Overall | 0.71(带PE) | SenseNova-U1 0.43 | +0.28,动词0.38→0.55 |
| 密集文字渲染 CVTG-2K | NED / 平均词准确率 | 0.977 / 0.948 | SenseNova-U1 0.972 / 0.940;Qwen-Image 0.912 / 0.829 | 5区域词准确率0.954,全场最佳 |
| 信息图生成 BizGenEval | hard / easy 分数 | 72.2 / 88.4(带PE) | SenseNova-U1 39.7 / 61.7 | 知识维 4.8→72.0(hard) |
| 图像编辑 ImgEdit | 九类编辑 Overall | 4.59 | FireRed-Image-Edit(20B) 4.56;SenseNova-U1 3.90 | 8B胜20B,+0.69 |
| 推理编辑 RISEBench | Overall | 38.6(带CoT) | SenseNova-U1-SFT 26.9(带CoT) | +11.7,因果/逻辑/时序类提升最大 |
| 交错生成 VBVR-Pro-Bench | ID / OOD Overall | 68.2 / 68.9 | Nano-Banana-Pro 56.4 / 64.8;GPT-Image-2 50.7 / 58.7 | 超过最强闭源系统 |
局限与改进
作者承认的局限:其一,复杂信息图与最强闭源系统仍有明显差距——IGenBench 上 U1.5(带PE)Q-ACC 0.76、I-ACC 0.17,而 Nano-Banana-Pro 分别为 0.90 与 0.49;其二,成绩对提示增强(PE)和思维链(CoT)依赖较重,BizGenEval 知识维不带PE仅4.8/23.4,RISEBench 不带CoT为33.6,说明结构化规划尚未完全内化;其三,WeEdit 中翻译类(Overall 2.19)与推理类编辑(4.17)仍显著弱于 Gemini-3-Pro-Image(8.85/9.42);其四,Uni-MMMU-GaU 上 29.6 略低于 U1-SFT 的 35.0,滑块任务得0.0。我的补充观察:32×32像素压缩为单token存在信息论上限,极细纹理与最小字号文字可能受损;奖励依赖 HPSv3++、PaddleOCR 与 VLM 裁判,多级代理奖励存在被策略钻空子的持续风险;四专家×多阶段的后训练流水线(DPO+GRPO+OPD交替)工程复杂度和算力门槛极高,且编辑专家回避SDE采样意味着其RL探索机制与另三个专家不一致,统一性打了折扣;论文也未报告4K生成的推理步数/延迟成本。
独立分析的弱点
弱点一:结构化规划靠外挂。PE把BizGenEval知识维从4.8拉到72.0,说明模型自身倾向不生成布局/结构约束,一旦用户提示朴素,信息图质量会骤降;改进方向是把提示增强器蒸馏进策略本身,或在SFT中显式加入「朴素提示→结构化中间规划→图像」的三段式轨迹。弱点二:空间定位类编辑薄弱。WeEdit的Translate Overall仅2.19、RISEBench空间类带CoT反而从49.0降到42.0,说明CoT对可直接定位的编辑价值有限;改进方向是为编辑RL加入显式区域对齐奖励(如掩码IoU)而非纯VLM裁判打分。弱点三:奖励 hacking 面。OCR的多集IoU奖励只看识别文本集合,模型可能学会渲染OCR易读但人眼看别扭的字形;建议引入人眼感知一致性校验或多OCR引擎集成投票。弱点四:序列效率。4K图像对应 4096×4096/32² = 16384 个视觉token,交错长序列(训练序列32768)下注意力成本高;可探索层级化token或块内稀疏注意力。弱点五:MoT双流8.2B+8.2B共16B级参数,推理时生成只走生成分支但共享注意力仍需载入两套参数,部署成本高于同等激活量的密集模型;可研究更激进的专业化路由或分支剪枝。
未来方向
作者提出的方向:原生统一建模的核心机会不是架构简化而是「能力交互」——推理改进视觉内容的创造与变换方式,生成本身成为模型解决视觉问题的内部过程,最终让看、想、画成为同一视觉智能的不同表达。基于本文成果可延伸:其一,把统一原生范式推广到视频与时序生成,交错数据中已有的19%视频序列是现成起点;其二,奖励模型与策略共同进化——用HPSv3++的迭代感知特性训练随策略分布更新的奖励,缓解静态奖励的过优化;其三,把「先专精后统一」推广到3D、音频等更多模态专家,检验硬路由OPD的普适性;其四,探索32×32以下的压缩粒度或可变粒度token,突破细节上限同时保持序列效率;其五,既然生成可作推理中间表示(RealUnify-GEU领先),可设计让模型在回答理解问题前主动「画草图」的推理协议,并配合过程奖励优化。此外,训练模板受限却泛化到长结构化指令的现象值得系统性研究,可能揭示理解→生成的规划迁移机制。
复现评估
开源条件较好:作者承诺开源训练代码,覆盖SFT、强化学习与在线策略蒸馏三部分(GitHub: OpenSenseNova/SenseNova-U1,HuggingFace提供模型集合,另有在线Demo),论文给出完整训练配方(Table 2:各阶段步数、学习率、序列长度、数据配比、损失权重)和RL超参(每专家的采样器、η、KL系数、冻结模块)。但全量复现门槛极高:预训练涉及59M新增文图对与78个数据源、38M编辑样本,累计约55万步、序列长至32768、BF16混合精度,需要大规模集群;四专家RL加OPD的完整后训练流水线亦需大量GPU时。相对可复现的部分是Stage 5蒸馏:仅800步、每域25,600样本、全局batch 128——若能获得四个专家checkpoint,单节点即可完成;RL数据规模也友好(约28万美学提示、6万OCR提示、12万编辑样本)。总体评估:复现「后训练+蒸馏」难度中等,从零复现全流程难度很高。
论文图表