← 返回 2026-08-17

生成即辅助监督:基于解耦嵌入预测的零推理开销视觉理解增强 Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

Zhongbin Guo, Jiahao Xie, Dongling Xiao, Qianle Wang, Ruiqi Lu, Xiaomin He, Wanxuan Sun, Cheng Yang 📅 2026-08-12 👍 3 2026-08-22 18:30
Mixture-of-Transformers 多模态大模型 统一理解-生成模型 表征学习 视觉生成 辅助监督

把视觉生成当作训练期辅助监督,训后丢弃生成分支,零推理开销提升理解能力

前置知识

MLLM 的 LLaVA 范式与 NTP 训练目标

主流多模态大模型用 ViT 编码图像,经投影器映射为 LLM 词嵌入空间中的视觉 token,与文本 token 拼接后由 LLM 以 next-token prediction(NTP,交叉熵损失)方式自回归训练。视觉 token 只是文本预测的条件上下文,没有任何梯度直接监督视觉表征本身。

本文的出发点就是『NTP 对视觉感知的监督是间接的』这一缺陷,理解该范式才能明白 GAS 为什么要引入生成侧监督,以及为什么共享 ViT+投影器是生成梯度回流理解模型的必经通道。

离散视觉 token 与连续嵌入生成

统一多模态模型生成图像有两种主流路线:离散 token 化(如 VQ codebook,Chameleon/Emu3)把图像编码成类别符号再自回归;扩散路线(Transfusion/Show-o)在专用 VAE latent 空间去噪。两者的目标空间都与理解分支消费的连续 LLM 输入嵌入不连续,需要额外的解码器或 tokenizer 接口。

GAS 的核心设计 NEP(Next Embedding Prediction)正是在这一点上反其道而行:直接在 LLM 输入嵌入空间自回归预测连续嵌入。只有理解两种路线的割裂,才能体会『Exact U-space』这一属性的价值。

Mixture-of-Transformers (MoT) 解耦架构

MoT 为不同模态/任务维护独立的 transformer 参数,同时共享部分底层。GAS 中主干在中间层 $l_{split} \approx L/2$ 分叉:理解分支上层只由文本 CE 损失优化,生成分支(独立层、从预训练层 copy 初始化)由 NEP 损失优化,梯度仅在共享下干道交汇。

MoT 是 GAS 解决『生成与理解目标冲突』的关键机制:论文用对照实验证明把 NEP 直接加在共享骨干上会导致理解性能从 47.25 掉到 46.00,而解耦后升至 48.25。

EMA 目标投影器(均值教师)

指数滑动平均用 $\theta_{EMA}^{(t)} = 0.999 \cdot \theta_{EMA}^{(t-1)} + 0.001 \cdot \theta^{(t)}$ 维护一份缓慢更新的参数副本。联合训练中活动投影器不断变化,若用动态投影器生成 NEP 回归目标,目标本身会漂移导致表征坍缩;EMA 副本提供稳定目标,类似 BYOL/均值教师思想。

NEP 的回归目标是『ViT + 投影器对目标图像的输出』,目标稳定性直接决定余弦回归损失是否有效,这是复现本文时最容易踩坑的细节。

线性探针与注意力可视化

线性探针冻结模型、只在提取的隐状态上训练线性分类器,用于检验表征本身的判别质量;注意力可视化则展示各层视觉 token 获得的注意力分布。两者是分析『模型内部到底发生了什么变化』的标准工具。

本文的机制性证据几乎全部来自这两个工具:RefCOCO 区域级探针优势逐层扩大、深层注意力保持聚焦,共同解释了下游基准提升的来源。

研究动机

当前主流多模态大模型(MLLM)沿用 LLaVA 式范式:ViT 编码图像、投影器映射进 LLM 词嵌入空间,模型仅以文本 next-token prediction 训练。这种纯文本目标对视觉感知的监督是间接的——模型被训练『谈论』图像而非『从图像学习』。问题体现在三方面:其一,语言存在表达瓶颈,无法精确编码空间关系、像素级物体边界、物理交互动态和细微外观变化,视觉表征只能被语言能言说的部分塑造,几何、结构、关系信息长期处于欠利用状态;其二,经验观察表明推理过程中视觉信息在 LLM 深层逐渐被语言主导的处理『挤出』衰减,而文本目标没有任何机制鼓励视觉特征的持续保留;其三,分割、图像编辑这类视觉密集型任务的数据在结构上无法被标准 VLM 消费,等于放弃了一大池细粒度监督资源。实际后果是,即便是 Qwen3-VL 2B 这样的强模型也会犯低级感知错误——论文定性案例中,基线模型面对『图中有几幅画』注意力在深层完全弥散,给出 0 幅的错误答案;MathVista 减法计数任务中因注意力分散而重复计数,答 6 而非 5。

本文的目标是本文的目标是论证一个反直觉的命题:视觉生成不必作为推理期共存能力保留,而可以纯粹作为训练期辅助监督来增强理解模型,并在部署时实现严格零额外开销。具体拆解为四个此前未被系统回答的科学问题:(1)生成与理解目标是否天然冲突,若有冲突如何在架构上隔离;(2)生成监督应注入到骨干的哪个深度;(3)哪类生成任务增强哪种理解能力,任务间是否互补;(4)生成训练通过什么表示级机制改善理解。最终交付 GAS 训练框架和 2B/4B 模型族,在通用感知、视觉推理、计数与空间理解、视频理解四个维度上验证增益,并配套匹配预算控制实验实现增益归因。

与已有工作不同的是,现有工作存在两条主线,均未占据本文的位置。第一条是统一多模态模型(Chameleon、Emu3、Show-o、Janus-Pro、BAGEL):生成目标多为离散 codebook 或 diffusion latent,与理解分支消费的连续嵌入空间根本脱节,联合训练后理解性能常持平甚至倒退,且生成侧参数在推理时全部保留,带来延迟和显存成本。第二条是『生成辅助理解』的近期探索(ROSS 用 VAE 外观特征去噪重建输入、ASVR 自回归重建离散语义 token、UniHetero 在 LLM 输入嵌入上自回归、UniMRG 后训 UMM 生成 RGB/深度/分割图),但各自只满足部分设计属性:要么保留生成机器,要么目标是输入重建而非任务条件化预测,要么上层理解参数仍被生成梯度污染。GAS 的独特切入是『训练专用、用完即弃』:NEP 把生成目标锚定在理解 LLM 的输入嵌入空间,MoT 非对称隔离理解上层,训练后移除全部生成组件。更难得的是,本文不做『只报总分』的工作,而是用 +11% 数据对照、同生成数据仅文本损失对照、逐任务消融、逐层注入、prompt 相关性控制和表示级诊断,系统回答『生成为什么、何时、如何帮助理解』。

核心方法

先说直觉:如果强迫模型『为了生成而深度理解』——必须先精确定位、分割、推理出该画什么、画在哪——生成损失就成了倒逼网络发展细粒度感知能力的 forcing function,纯文本监督给不了的东西由此补上。技术路线由三个组件构成。第一是 NEP(Next Embedding Prediction):给定输入图像和指令上下文 $x_{ctx}$,模型自回归预测目标图像的嵌入 $\hat{z}_{tgt_i} = f_{gen}(x_{ctx}, \hat{z}_{tgt_{<i}}; \Theta_{gen})$,其中真值目标定义为 $z_{tgt} = \text{Projector}(\text{ViT}(I_{tgt}))$,恰好落在理解 LLM 的输入空间;预测与目标先做 $\ell_2$ 归一化,损失为余弦距离 $\mathcal{L}_{gen} = \sum_{i=1}^{N} \left(1 - \frac{\hat{z}_{tgt_i} \cdot z_{tgt_i}}{\|\hat{z}_{tgt_i}\|_2 \|z_{tgt_i}\|_2}\right)$。第二是 MoT 解耦:主干在第 $l_{split} \approx L/2 = 14$ 层分叉,理解分支继续走剩余上层、只由文本交叉熵 $\mathcal{L}_{und}$ 驱动;生成分支由 $L_{mot}$ 个独立 transformer 层组成(从对应预训练层复制初始化),经 $H_{gen} = \text{Transformer}_{gen}(H^{(l_{split})}; \Theta_{gen})$ 和 vision head 输出嵌入预测。第三是五类与理解强相关的生成任务数据。训练分两阶段:Stage 1(MoT Align)冻结理解侧全部参数,仅用 T2I 数据激活生成通路;Stage 2 联合训练,总损失 $\mathcal{L} = \mathcal{L}_{und} + \lambda \cdot \mathcal{L}_{gen}$,$\lambda$ 从 0.015 线性升至 1.0(4k 步)。推理时整个生成分支(含 vision head 和 EMA 目标投影器)被丢弃,部署成本与基线严格一致。

核心创新是三个设计的组合而非单点技术。第一,目标空间选择:NEP 的生成目标不在离散 codebook 或 diffusion latent,而在理解 LLM 实际消费的输入嵌入空间,生成监督与理解表征共享同一流形,无需外部视觉 tokenizer、VAE 或扩散解码器——这是『Exact U-space』与『No ext. codec』两个属性的来源。第二,非对称梯度路由:论文用对照实验证明把 NEP 直接加到共享骨干会让理解性能从 47.25 崩到 46.00(生成优化压力冲刷语义表征),而 MoT 让 $\mathcal{L}_{gen}$ 的梯度只流经共享 lower trunk($l \le l_{split}$)和视觉投影层,上层理解参数被屏蔽;同时这些上层持续接收被视觉丰富化的 $H^{(l_{split})}$,被迫在 CE 损失下学会利用高质量特征——形成『下层被精化、上层被倒逼适应』的双重机制。第三,任务相关性原则:『画一只猫』式的通用合成几乎不携带理解信号,只有把生成设计为定位、分割、编辑、视觉 CoT 等认知任务的终端输出才构成有效监督;Table 5 显示同一 T2I 任务仅把 prompt 从通用短句改写为知识密集组合描述,overall 增益就从 +0.24pp 提升到 +0.71pp,证明起作用的是任务与理解能力的潜在相关性而非数据量。此外 EMA 目标投影器(decay 0.999)解决了联合训练中投影器漂移导致的监督目标不稳定问题。

方法步骤详情

第一步,数据构造:以 grounding 为代表的自动化无标注管线分四步——(1) RAM++ 开放词表打标发现图中全部显著物体;(2) Grounding DINO 开放词表检测为每个标签定位框;(3) 难度控制采样(面积比例采样得到简单样本、均匀采样得到暴露小物体和杂乱场景的困难样本);(4) Seed VLM 结合标注图和放大 crop 生成无歧义的指代表达式指令。共构造五类 15 子任务约 10M 样本:Grounding(预测绝对坐标)、Segmentation(预测掩码对应的嵌入)、Image Editing(风格迁移、物体删除等条件变换)、Visual-CoT(生成中间视觉证据锚定多步推理)、T2I(知识密集、多物体组合的 prompt 合成)。第二步,模型构建:Qwen3-VL ViT 作为视觉编码器全程冻结;LLM 用 Qwen3 2B/4B 原始权重(无任何多模态对齐);投影器随机初始化,即所有视觉语言能力均由本训练管线获得;生成分支取 $l_s = L/2 = 14$ 层隐状态。第三步,Stage 1(MoT Align):冻结理解侧全部参数,仅用 T2I 数据训练生成分支,对齐生成通路与现有视觉表征空间。第四步,Stage 2(联合训练):理解与生成数据混训,理解分支用 CE、生成分支用 NEP 余弦损失,$\lambda$ 从 0.015 线性 ramp 到 1.0;目标投影器按 $\theta_{EMA}^{(t)} = 0.999 \cdot \theta_{EMA}^{(t-1)} + 0.001 \cdot \theta^{(t)}$ 更新。第五步,部署:删除生成分支、vision head 和 EMA 投影器,推理路径与基线完全一致。训练用 32 卡、DeepSpeed ZeRO-2、AdamW 峰值学习率 $5 \times 10^{-5}$ 余弦调度、全局 batch 128、序列长度 8192;总开销 2,464 GPU-hours,比基线(2,208)多 11.6%。

技术新颖性

与最近邻工作的技术差异可逐一对照。UniHetero 同样发现『在 LLM 输入嵌入上自回归』有效,但它保留生成侧参数、无上层梯度隔离、生成机器推理时不拆卸;ROSS 对连续 VAE 外观特征做去噪重建,本质是输入自重建而非指令条件化的跨图像预测;ASVR 用离散语义 token,目标空间与理解输入脱节;UniMRG 后训已有 UMM 生成 RGB/深度/分割图,需保留生成解码器。Table 8 用六个属性(U-centric、Task-cond.、Exact U-space、No ext. codec、Upper-U isolated、Train-only aux.)系统对比十余个设计,GAS 是唯一全部满足的方案。NEP 与自监督嵌入预测预训练的区别在于条件化多任务设定:预测的是由指令和源图像共同决定的目标图像嵌入,而非输入自身的重建,这使生成信号携带了空间定位、组合推理等认知要求。方法论层面,本文的价值不止于架构,而在于控制变量体系:匹配算力对照(+11% 理解数据)、被动数据暴露对照、无生成损失的 MoT 对照、position-aligned no-shift 损失对照、逐层注入扫描、prompt 相关性控制和重复实验统计,把『生成帮助理解』从经验观察提升为可归因、可证伪的机制结论。

Overview of our generation-guided training framework
Figure 1: Overview of our generation-guided training framework
Overview of generation training data. Five primary task categories spanning 15 subtasks
Figure 2: Overview of generation training data. Five primary task categories spanning 15 subtasks
Generation task construction pipeline
Figure 3: Generation task construction pipeline

实验结果

主结果(Table 1):2B 规模上 GAS 对 matched baseline 全面小幅领先——DynaMath 46.2→47.9(+1.7pp)、MathVista 54.4→56.4(+2.0pp)、CountBenchQA 87.7→90.1、CV-Bench-2D 69.9→73.2(+3.3pp)、VisuLogic 26.8→28.6,增益集中在生成任务直接对准的空间感知与视觉推理维度;4B 规模上取得统一模型族最强总分(MMMU 57.0、CharXiv-DS 78.4、CountBenchQA 90.8),超过 7B+7B 的 BAGEL 和 8B 的 Emu3,唯一例外是 4B VisuLogic 23.6(基线 26.1),属基准特异性回归。跨阶段泛化(Table 2):从零训练增益最大(overall +1.00pp,Perception +1.97、Reasoning +1.25,但 Count&Spatial −1.77);大规模预训练后仍有 +0.48pp;SFT 后 +0.84pp 且四个维度全升——证明这是阶段无关的即插即用增强。归因控制(Table 3):+11% 理解数据仅 47.73、混入同量生成数据只算文本损失 47.14、共享骨干直接加 NEP 崩至 46.00、无生成损失的 MoT 47.63、no-shift 视觉损失 47.84、GAS 48.25——增益来自『任务条件化 NEP × 上层隔离』的组合,而非额外数据、参数或算力。逐任务消融(Table 4,各加 200k 样本):T2I 单任务 overall 最高(48.12,+0.49);Grounding/Segmentation 对 Count&Spatial 分别 +2.37/+2.00pp;Visual-CoT 独特地提升 BLINK +4.2pp 和 MathVision +1.0pp;五任务组合 Count&Spatial 达 75.72、CV-Bench-3D 67.0(基线 52.1),超过任何单任务,呈互补效应。相关性实验(Table 5):固定 T2I 数据量只改 prompt,Easy 仅 47.87(+0.24,且 Perception 掉 0.75pp),Rewrite 达 48.34(+0.71)且四维全面提升。层注入(Table 6):层 14(≈L/2)+渐进 warmup 最佳 48.25;层 8 在 Count&Spatial 上最强(75.88);解冻 ViT 使 overall 掉 1.65pp、CountBenchQA 从 86.4 跌至 79.7,验证生成收益必须只经投影层回流。表示级诊断(Figure 4/5):GAS 在中深层保持更高的视觉 token 余弦相似度(基线在 L/3 后衰减);RefCOCO 区域级线性探针优势从第 8 层起持续扩大而 ImageNet 探针两者相当,说明增益特异地来自细粒度空间表征;第 20 层基线注意力弥散而 GAS 保持聚焦。纯文本能力不降反升(Table 7):ZebraLogic 18.0→20.8、MMLU-Redux 52.66→53.89。代价:训练多花 11.6% GPU-hours,推理零开销。

Overall results for a range of understanding-only MLLMs, Unified Models, baselines and our GAS family
Table 1: Overall results for a range of understanding-only MLLMs, Unified Models, baselines and our GAS family
Generalization across training stages
Table 2: Generalization across training stages
Disentangling data, architecture, and objective
Table 3: Disentangling data, architecture, and objective
Per-task ablation
Table 4: Per-task ablation
Effect of T2I prompt correlation with understanding tasks
Table 5: Effect of T2I prompt correlation with understanding tasks
Layer-wise injection and training strategy ablation
Table 6: Layer-wise injection and training strategy ablation
Text-only reasoning evaluation
Table 7: Text-only reasoning evaluation
Design comparison of representative approaches that combine visual understanding and generation
Table 8: Design comparison of representative approaches that combine visual understanding and generation
Visual information retention and layer-wise linear probing
Figure 4: Visual information retention and layer-wise linear probing
Layer-wise attention visualization on representative understanding samples
Figure 5: Layer-wise attention visualization on representative understanding samples
查看结构化数据
任务指标本文基线提升
DynaMath(动态数学视觉推理,2B) accuracy 47.9 46.2 +1.7pp
MathVista mini(视觉数学推理,2B) accuracy 56.4 54.4 +2.0pp
CountBenchQA(物体计数问答,2B) accuracy 90.1 87.7 +2.4pp
CV-Bench 2D(空间关系理解,2B) accuracy 73.2 69.9 +3.3pp
MMMU(多学科多模态理解,4B) accuracy 57.0 54.9 +2.1pp
VisuLogic(视觉逻辑谜题,4B) accuracy 23.6 26.1 −2.5pp(回归,论文承认的唯一例外)
ZebraLogic(纯文本逻辑推理) Puzzle Acc 20.8 18.0 +2.8pp
训练开销(2B 主实验) GPU-hours 2,464 2,208 +11.6%(推理零开销)

局限与改进

作者承认的局限:增益是任务依赖的(per-benchmark transfer is task-dependent),并非每个基准都提升;4B 上 VisuLogic 从 26.1 回归到 23.6,说明谜题类基准对骨干规模有特异敏感性;视频维度基本无收益甚至略降(2B MVBench 49.0→47.8;4B Video-MME 55.0→54.4、MVBench 54.2→52.4),因为生成监督完全没有时间维度建模;from-scratch 场景 Count&Spatial 反而 −1.77pp;Table 3 中 no-shift 对照在 Count&Spatial 上更强(76.38 vs 75.15),说明 NEP 的自回归性并非在所有能力维度上最优,只是总体转移最好。我自己的观察:其一,关键超参——分支层 $l_{split}=L/2$、$\lambda$ 线性 ramp 曲线、EMA decay 0.999——依赖网格搜索,迁移到不同深度或架构的模型时需要重调,Table 6 显示层选择本身就能带来约 1.2pp 的 overall 波动;其二,数据管线的质量上限被教师模型(RAM++、Grounding DINO、SAM、Seed VLM)封顶,检测框和掩码的错误会系统性进入训练信号,且论文未报告教师噪声的定量影响;其三,NEP 目标只对齐嵌入空间,生成质量本身从未评测(没有 FID/GenEval),无法与 T2I 文献对话,也无法排除『嵌入接近但语义错误』的退化情形;其四,主实验是 2.5B token 规模的从头训练,与工业级十亿至万亿 token 预训练的相互作用只有 Table 2 的小规模验证(预训练后增益收窄到 +0.48pp),scaling 行为存疑。

独立分析的弱点

第一,『任务-能力潜在相关性』目前靠人工设计加事后消融验证,缺乏先验的量化指标,新任务该不该纳入只能靠跑一遍 200k 样本消融;改进方向是定义可计算的相关性代理(如生成目标嵌入与理解任务表征的互信息或 CKA 相似度),自动搜索最优任务组合。第二,教师模型瓶颈:RAM++ 和 Grounding DINO 的漏检、错框、SAM 掩码噪声直接成为 NEP 的回归目标;改进方向是置信度过滤加模型自举——用 GAS 自身迭代打标并蒸馏,或对困难样本用更强(更贵)教师、简单样本用弱教师的级联。第三,视频维度无增益:NEP 缺少时间建模,帧内嵌入预测对时序推理无帮助;改进方向是把 NEP 扩展为未来帧嵌入预测或跨帧状态预测,让生成分支承担时序一致性监督。第四,五个生成任务共用一个全局 $\lambda$ 且只有线性 ramp,过于粗糙,任务间梯度冲突未被管理;改进方向是按任务梯度冲突度(PCGrad 式投影)或按验证集各维度增益动态加权——作者也把 adaptive task weighting 列为未来方向。第五,+11.6% 训练开销在大规模场景会被绝对成本放大,EMA 投影器额外占用显存;改进方向是低秩/轻量生成支路,或周期性训练(每 N 步开一次生成损失)摊薄成本。第六,ViT 完全冻结使增益受编码器表征上限约束(解冻又会被生成梯度污染),可探索给编码器加轻量适配器、仅让适配器接收生成梯度。第七,评测限于 2B/4B 学术基准,未见 7B 以上规模和真实产品分布的验证。

未来方向

作者在结论中提出四个方向:把框架扩展到长上下文场景;将 NEP 推广到视频级时间生成任务(如预测未来帧嵌入);探索自适应任务加权策略,在训练中动态平衡五个生成类别;研究生成-理解协同效应是否推广到音频、3D 感知等其他模态。基于本文成果还可以延伸:其一,把 NEP 嵌入预训练主配方而非后训练阶段——从零训练给出最大增益 +1.00pp 暗示早期介入收益更高,值得在数十亿 token 预训练中验证 scaling 行为;其二,测试时自监督,用 NEP 在无标注图像上持续学习,把生成监督变成部署后仍可用的学习信号;其三,与偏好优化结合,让生成式 grounding 监督塑造 reward model 的空间判断;其四,利用管线内置的难度控制采样实现生成任务自动课程(easy→hard 的验证损失驱动调度);其五,把表示级诊断(视觉保留度余弦相似度、RefCOCO 探针、注意力聚焦度)做成训练期监控指标,在不用全量评测的情况下提前预测下游收益,大幅降低消融成本;其六,探究注意力锐化与 NEP 损失之间的因果关系,目前证据是相关性层面的。

复现评估

论文来自字节跳动,正文未提供代码、模型权重或数据的发布链接,开源情况未知,这是复现的最大障碍。有利条件是方法披露非常完整:架构(分支层 $l_s=L/2=14$、生成层 copy init、EMA decay 0.999)、优化(AdamW 峰值 $5\times10^{-5}$ 余弦调度、全局 batch 128、序列 8192、$\lambda$ 从 0.015 到 1.0 的 4k 步 ramp、两阶段训练流程)、数据(约 10M 样本、五类 15 子任务、四步管线、教师模型型号明确)均有量化描述;16 项评测基准与 ZebraLogic/MMLU-Redux 全部公开可得。算力门槛:主实验 2,464 GPU-hours(基线 2,208),消融运行 608 GPU-hours,32 卡集群数天可完成单次配置,对学术实验室可负担;但 Table 6 显示层选择和 warmup 带来约 1pp 级波动,完整复现需多轮消融,实际预算约为论文报告的数倍。数据管线需要部署 RAM++、Grounding DINO、SAM 和 Seed 系 VLM,其中 Seed 模型不可获得,需替换为开源 VLM(如 Qwen2.5-VL),指令质量可能有所折损。综合评估:方法本身可复现、控制实验设计稳健(核心结论『NEP×MoT 组合优于任何单因素』有多重对照支撑),方向性结论可信度高;但缺少官方代码时重写整条 NEP+MoT 训练管线工作量不小,复现难度评为中高。