MODUS:面向多种模态的解码器型任意到任意生成模型 MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities
单一解码器模型实现15种模态间的任意到任意生成
前置知识
解码器架构(Decoder-only Transformer)
一种只含解码器的 Transformer,通过下一词预测(next-token prediction)建模序列:给定前缀 $x_{<i}$ 预测 $x_i$。它使用因果(causal)自注意力,使得 KV-cache 可以高效缓存前缀、避免重复计算。GPT 系列、LLaMA、BAGEL 都属于这一族。
MODUS 的全部设计都建立在「把所有模态都塞进同一条自回归解码序列」这一范式上,理解因果注意力与 KV-cache 才能看懂它如何统一 1D 和 2D 模态。
流匹配(Flow Matching)
一种连续生成建模方法,通过学习一个速度场 $v_\theta(x_t, t)$ 去拟合从噪声到数据的概率路径(ODE 轨迹)的时间导数 $\dot{x}_t$,损失为 $\mathcal{L}_{FM}=\mathbb{E}_{t,x_0,\epsilon}[\|v_\theta(x_t,t)-\dot{x}_t\|_2^2]$。它是扩散模型 Rectified Flow 形式的推广,常用于潜空间图像生成。
MODUS 用流匹配在 VAE 潜空间里生成 2D 模态(RGB、深度、法向量等),而本文最关键的发现——时间步采样决定模态混淆——正是针对流匹配训练提出的。
任意到任意建模(Any-to-Any Modeling)
指用一个统一网络在任意模态组合之间做映射:任意若干模态作为条件输入,任意模态作为生成目标,如深度→边缘、法向量+RGB→分割。代表性系统有 Unified-IO、4M、OneDiffusion,但它们多为 encoder-decoder 或扩散结构、从头训练。
这是本文要解决的核心问题设定。读懂「对称地把每个模态同时当输入和输出」是理解 MODUS 为何能做链式生成、自我验证的前提。
ViT+VAE 双重表示
MODUS 用两个互补编码表示每个 2D 模态:SigLIP-2 的 ViT 提取高层语义特征,FLUX 的 VAE 把图像编成连续潜变量并作为流匹配的生成目标。前者保语义、后者保几何与重建细节。
本文一个重要实验(Table 4)证明:只用 ViT 高层特征会产生「语义对但几何错」的幻觉,必须 ViT+VAE 联合才能兼顾语义与结构,这是理解 MODUS 2D 模态设计的关键。
混合 Transformer 专家(Mixture-of-Transformers)
在单一解码器内放置多个参数独立但共享因果注意力上下文的「专家」分支。MODUS 继承自 BAGEL-7B,采用两个专家:1D Expert 处理离散序列模态(文本、检测框、DINOv2 特征),2D Expert 处理连续空间模态。
理解这一双专家结构,才能看清 MODUS 如何在「不引入模态专属输出头」的前提下,同时支持自回归的离散模态和流匹配的连续模态。
研究动机
多模态学习里,「任意到任意」建模(用单个网络在任意模态间做映射)已被 Unified-IO、4M、OneDiffusion 等系统证明可行,但它们普遍采用 encoder-decoder 或纯扩散结构并从头训练,必须同时学习模态自身结构和跨模态对齐,无法借助大规模预训练解码器模型的先验,导致训练成本高、可扩展性差、语义保真度受限。另一方面,解码器架构(Chameleon、Janus、BAGEL)虽然具备统一的目标函数、强零样本泛化和 KV-cache 高效推理,并已成功扩展到图文生成,但现有解码器多模态模型几乎只覆盖文本与 RGB 图像:要么依赖模态专属输出头,要么以文本为中心做枢纽(如 NExT-GPT、AnyGPT 把 depth→image 拆成 depth→text→image),中间的文本描述会丢失细粒度空间信息,使生成图与输入深度只是松散对齐。结果是「任意到任意」与「解码器+预训练先验」两条线索一直没能合流。
本文的目标是本文要在一个完全解码器的模型里实现任意到任意生成,且不引入模态专属输出头、专属损失或任务流水线,让所有模态被对称地当作输入和输出。具体目标包括:把覆盖范围从文本+RGB 扩展到 15 种模态,涵盖几何(深度、法向量)、结构(Canny/SAM 边缘)、语义(分割、grounding、检测)和学习表示(DINOv2、CLIP、ImageBind 特征);在零样本基准上与单任务专家和多任务基线保持竞争力;同时以远低于从头训练的算力(最终约 5,664 GH200 小时)继承 BAGEL-7B 的预训练先验,并开源两个模型权重和 29M 样本的 MODUS-DATASET。
与已有工作不同的是,本文的独特切入点是:与其为每个新模态设计专属分支,不如把所有模态统一进同一条自回归 token 序列、用统一的训练目标驱动,让「任意到任意」成为解码器范式的自然延伸而非另起炉灶。它抓住了一个被忽视的关键现象——在多模态流匹配训练中,早期去噪时间步实际上决定了目标模态的归属,而流行的 logit-normal 采样恰恰欠采样了这一区段,导致严重的模态混淆(如把深度指令生成为法向量图)。MODUS 用「均匀时间步采样 + 三阶段课程」直接对症下药,这是把解码器任意到任意做稳的真正技术杠杆。
核心方法
直觉上,MODUS 像一个只会「接龙」的通用翻译器:无论输入是图、深度、法向量还是文本,都先被打包成同一条 token 序列,解码器按统一目标预测下一个片段,自然就能在任意模态间转换。技术上它由四部分组成:(1)统一 token 化——1D 模态用各自的离散 tokenizer(文本用 Qwen 分词器,检测框坐标归一化到 $[0,999]$ 用 1000 个离散 token,DINOv2 特征用码本 8192 的 MLP tokenizer);2D 模态用 SigLIP-2 的 ViT 取语义特征 + FLUX 的 VAE 取连续重建潜变量,VAE 潜空间作为流匹配目标;(2)双专家解码器——1D Expert 用因果注意力做下一词预测,2D Expert 用模态内双向注意力做流匹配,二者共享同一因果自注意力上下文;(3)稳定化训练——均匀时间步采样 + 三阶段课程;(4)29M 样本的 MODUS-DATASET 支撑任意输入-目标对(如 depth→canny、canny→surface normal)。
MODUS 最本质的创新是把「解码器架构」和「任意到任意」第一次真正缝合在一起:所有模态对称、无专属输出头/损失/流水线,单一解码器即可输出任意模态、读取任意模态。支撑这一点的有两根技术支柱。第一根是均匀时间步采样:作者发现早期去噪步决定「生成哪个模态」,后期步只精修视觉质量;logit-normal 采样把概率质量堆在中间步、欠采样早期步,于是模型在最该锁定模态的阶段缺乏监督,导致输出在深度/法向量/RGB 之间漂移(modality mixing)。改为均匀采样后,每个时间步都被充分覆盖,模态混淆被有效消除。第二根是统一序列 + 共享因果注意力的双专家结构:因为任何 token 都能条件化后续 token,生成出的模态可以直接回灌做条件,于是「链式生成」和「跨模态自我验证」几乎是免费的——这是 encoder-decoder 或文本枢纽式方案给不了的能力。
方法步骤详情
训练分五步:(1)token 化——1D 用离散 tokenizer(文本用 Qwen 分词器,检测框坐标归一化到 $[0,999]$ 用 1000 离散 token,DINOv2 特征用 MLP tokenizer),2D 用 SigLIP-2 ViT 语义特征 + FLUX VAE 连续潜变量作流匹配目标;(2)构造统一序列 $[Cond_1],\dots,[Cond_K]\to[Target]$,随机抽 1–3 个条件并指定目标,用指令 token 声明目标;(3)token 路由——1D 进 1D Expert 做因果注意力,2D 的 ViT 语义 token 进 1D Expert 做模态内双向注意力,2D 的 VAE 潜 token 进 2D Expert,干净态作条件、加噪后作目标;(4)算损失,1D 用交叉熵 $\mathcal{L}_{NTP}=-\sum_i\log p_\theta(x_i|x_{<i})$,2D 用流匹配均方误差;(5)从 BAGEL-7B 起三阶段课程:先训 1D(30B token),再加 2D(20B),最后把条件数提到 3(15B)。
技术新颖性
相对 Unified-IO、4M 这类 encoder-decoder/扩散任意到任意系统,MODUS 不从头训练、能继承 BAGEL-7B 的大规模先验——把同样配方套到 Janus-Flow-1.3B 上只需 1.5k GH200 小时(约为其原始 19.2k 小时预训练的 1/13)就新增了深度与法向量能力,证明配方可迁移。相对 BAGEL、Janus 这类解码器图文模型,MODUS 把模态从 2 种扩到 15 种且保持对称、无专属头。相对 NExT-GPT、AnyGPT 这类文本枢纽方案,MODUS 让非文本模态之间原生直接交互,不经过文本中转。两个真正属于本文的发现尤其值得一提:一是均匀时间步采样相对 logit-normal 的优势是多模态流匹配特有的、之前未被讨论的;二是 ViT+VAE 双重表示避免了「只靠高层语义导致几何幻觉」,这一现象甚至在 GPT-4o 上也有平行表现,提示了一条普适的设计原则。
实验结果
Table 1 的零样本系统级对比是核心:MMMU 51.1(介于 Janus-Pro 41.0 与 BAGEL 53.2);GenEval 0.81(接近 FLUX 0.82);DIODE 深度 0.285(优于 4M-21 的 0.331 与 Unified-IO 2 的 0.369,逊于专家 DepthAnything2 的 0.249);NYUv2 法向量 19.92(远好于 4M-21 的 37.28 和 Unified-IO 2 的 28.55,略逊专家 Marigold 16.40);RefCOCOval grounding 54.5(超 GroundingDINO 50.4 与 Kosmos-2 52.3);ImageNet 检索 77.9/92.5 略低于 DINOv2。关键消融坐实设计:Table 5 显示 logit-normal 采样引发灾难性模态混淆(深度 21.9、法向量 50.54),均匀采样稳定(8.4/21.10/0.81);Table 2 显示 RGB→Canny→法向量 19.87 优于直接 20.02,冗余与不对齐中间态反而无益。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| VQA (MMMU) | 准确率↑ | 51.1 | GPT-4o 69.1 / BAGEL 53.2 / Janus-Pro 41.0 | 以单一模型覆盖,零样本接近 BAGEL,远超 Janus-Pro |
| 文生图 (GenEval) | GenEval↑ | 0.81(自我验证 best-of-4 后 0.84) | FLUX.1-dev 0.82 / BAGEL 0.86 / Janus-Pro 0.80 | 自我验证将 0.81 提升至 0.84,追平大部分差距 |
| 深度估计 (DIODE) | AbsRel↓ | 0.285 | DepthAnything2 0.249 / 4M-21 0.331 / Unified-IO 2 0.369 | 优于多任务基线,略逊于单任务专家 |
| 表面法向量 (NYUv2) | 均值角度误差↓ | 19.92 | Marigold 16.40 / 4M-21 37.28 / Unified-IO 2 28.55 | 大幅优于多任务任意到任意基线(约 2 倍) |
| 指代表达理解 (RefCOCO val) | 准确率↑ | 54.5 | GroundingDINO 50.4 / Kosmos-2 52.3 | 在统一模型中超越专用与解码器 grounding 基线 |
| 图像检索 (ImageNet) | Top-1/Top-5↑ | 77.9 / 92.5 | DINOv2 82.1 / 93.9 / 4M-21 78.3 / 92.4 | 与 4M-21 持平,略低于 DINOv2 专家 |
局限与改进
作者在附录 F 中明确两点:一是 MODUS 只做跨模态转换,不支持同一模态内的迭代编辑(如 depth→精修 depth),这类多轮精修数据在现有语料中稀缺;二是模型纯预训练、未针对复杂推理任务做后训练,要支持多模态思维链还需引入 DeepEyes 这类后训练目标。我额外观察到几处:相对基座 BAGEL,GenEval 从 0.86 降到 0.81,在计数、位置、颜色+位置等组合性类别上明显退步(Table 14);深度与法向量仍输给单任务专家,存在「教师上限」;图像检索 Top-1 低于 DINOv2;训练时每个样本只指定单一目标模态,未能联合优化多目标;自我验证的 best-of-4 把推理成本乘以 4,工程上不便宜。
独立分析的弱点
第一,伪标签教师天花板:MODUS-DATASET 的深度/法向量/分割分别来自 DepthAnything、Marigold、Grounded-SAM,学生模型难以超过教师质量,改进方向是引入人工真值或自训练迭代精炼。第二,均匀时间步采样只是缓解模态混淆的启发式手段,未必最优,可探索学习式/自适应时间步调度或显式的模态锁定损失。第三,77B-A13B 的旗舰检查点推理与训练成本高昂,虽然 2D Expert 已并行化,仍可受益于步数蒸馏与量化。第四,模态覆盖虽达 15 种但仍是「代表性」而非穷尽,缺视频、音频、3D 结构、点云等,扩展主要是数据与 token 化工程。第五,训练只支持单目标模态,难以一次联合生成多目标,链式又增加延时(尽管 Table 15 显示可接受)。第六,自我验证把 best-of-N 计算量翻数倍,可结合早停或学习打分模型降本。
未来方向
作者提出的方向:把模态家族扩到音频与 3D 结构(核心是数据构造、token 化与应用需求而非架构);构造同模态迭代编辑语料以支持 depth→refined depth;接入多模态思维链后训练(如 DeepEyes)增强推理。基于本文成果可延伸的方向:研究任意到任意场景的扩展律(scaling laws);把测试时搜索(有序 token 搜索、diffusion inference-time scaling)系统化接入自我验证;用「链式生成 + 自我验证」构造自洽的合成数据形成自改进闭环;探索跨模态一致性约束的强化学习训练。这些都能在不改动统一解码器架构的前提下推进。
复现评估
复现友好度很高:作者开源了两个权重(Modus-15modality-14B-A7B 与 77B-A13B)、完整的 29M 样本 MODUS-DATASET、代码及项目主页;基座 BAGEL-7B、各教师模型(DepthAnything、Marigold、Grounded-SAM 等)均公开;训练细节在 Table 17 给出(AdamW、$\beta_1,\beta_2=0.9,0.95$、lr $2\times10^{-5}$、恒定调度、bf16、序列长度 14336–16384)。但完整重训需约 5,664 GH200 小时(64 张 GH200 跑约 35h+31h+22.5h),对多数团队仍偏重;伪标签流水线涉及多个教师模型、工程链路较长。复现推理、微调或迁移到新基座(如文中 Janus-Flow 实验)相对可行,而完整从 BAGEL 扩展的全量训练门槛较高。
论文图表
该图三部分展示了 MODUS 的定位——左下强调它是纯解码器模型,所有模态在单一 Transformer 解码器内通过统一自回归 token 序列处理、无模态专属头;左上展示任意到任意设定,支持多种 1D 与 2D 模态;右侧列举单一模型可承载的六大能力,包括 RGB→深度/法向量/边缘/DINO、VQA 与 grounding、任意到任意生成、链式生成、自我验证、视觉表示组合。
这张图是理解全文贡献版图的入口,一眼能看清 MODUS 相对既有解码器图文模型「多出了什么」、相对既有任意到任意系统「换掉了什么骨架」。