← 返回 2026-08-06

多模态预训练的物理学:知识流动、模态协同、早期统一与训练配方 Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkinos, Mike Lewis 📅 2026-08-05 👍 58 2026-08-11 18:30
多模态预训练 早期融合 混合专家MoE 知识流动 统一模型 视觉生成

系统解构统一多模态预训练机制,提出高效不对称训练配方

前置知识

Transfusion(统一预训练框架)

Transfusion 是一种在单一 decoder-only Transformer 中同时处理离散文本和连续图像的统一训练范式。对文本采用离散的下一个 token 预测(next-token prediction,交叉熵损失),对图像采用连续的流匹配(flow matching)去噪目标,两种损失在同一组参数上联合优化,并通过权重平衡跨模态学习——本文将扩散损失上权 3.0 倍。它让视觉理解与生成能在原生意义上共享同一个骨干网络。

本文所有实验都建立在 Transfusion 之上,理解文本损失与图像流匹配损失如何在一个网络里共存,是看懂后续模态协同与参数共享分析的前提。

流匹配与修正流(Flow Matching / Rectified Flow)

流匹配是一种连续生成建模方法,通过学习把噪声 $x_t$ 沿轨迹映射到干净样本 $x_0$ 的速度场来生成数据。本文采用 rectified flow 并使用 x-prediction:网络直接预测 $\hat{x}_0$,再即时换算成速度 $v = (x_0 - x_t)/(1-t)$ 用于损失和 25 步 Euler ODE 采样,时间步 $t \in [0,1]$ 从 logit-normal 分布采样,并用 classifier-free guidance(尺度 5.0)解码图像。

论文反复报告的『扩散损失(diffusion loss)』就是流匹配的验证损失,是衡量生成质量的核心代理指标,理解它才能读懂协同/竞争实验与规模化对比。

混合专家与模态专属 FFN(MoE / Mixture-of-Transformers)

混合专家(MoE)让每个 token 只激活部分 FFN 专家,从而在固定激活算力下扩大总参数量。本文扩展到 13.5B 的 MoE(256 个专家、top-16 路由、1.5B 激活参数),并强制 2 个专家分别为语言专属和视觉专属,其余 14 个动态路由。这与小规模实验里的 split-FFN(为文本与图像 token 各保留一组 FFN)一脉相承,目的是隔离模态间的容量竞争。

作者最终的架构结论是『共享注意力与归一化、解耦 FFN』最能促进协同,MoE 正是这一结论在规模化时的自然落地,理解它才能看懂 Table 2 的架构消融。

早期融合 vs 晚期融合(Early-fusion vs Late-fusion)

晚期融合指先用纯文本训练好 LLM,再用适配器把预训练好的视觉编码器对齐进去;早期融合则从训练一开始就把视觉和语言放在一起联合学习。本文把后者细分为两个维度:『早期统一』讨论何时引入视觉(纯语言预热长度),『联合 vs 顺序训练』讨论如何调度模态(同时还是分阶段)。

论文第 5 节的核心主张就是早期联合统一是『机械上的必需』,而晚期对齐会引发『视觉惰性』,这是理解整篇论文立论与配方设计的关键。

柏拉图表征假说(Platonic Representation Hypothesis)

该假说认为,足够强的不同模态表征会趋向同一个与模态无关的『世界结构』。本文援引它来解释为何成熟的语言流形能作为通用先验、近乎零成本地带动视觉学习——语言天然捕获了一种模态无关的世界结构,从而同时为视觉理解与生成提供先验。

论文在知识流动部分用该假说解释『语言是通用助推器』的现象,理解它能把握作者对不对称知识流动背后的理论直觉。

研究动机

统一多模态预训练(在一个模型里同时学语言、视觉理解、视觉生成)正成为基础模型的主流方向,但其设计空间极其复杂,社区主要靠启发式摸索,缺乏对底层『物理』的系统理解。更关键的局限在于:绝大多数现有方法都是把预训练好的 LLM 或 MLLM 改造(retrofit)成统一模型,把视觉当作事后对齐的模块来追加。这种做法把丰富的视觉信号强行塞进一个已经成型的语言空间,不仅天然地瓶颈了视觉能力,更掩盖了视觉应当如何在基础预训练阶段主动参与并塑造表征。结果是几个根本问题至今众说纷纭:语言、理解、生成之间的知识如何流动、是否对称?视觉理解与生成之间到底是互相促进还是互相竞争,不同研究给出相互矛盾的结论,社区仍在反复争论。

本文的目标是本文的目标是用严格的受控实验替代直觉和启发式,自底向上地系统厘清统一多模态预训练的基本机制,并为设计与扩展提供原则性基础。具体而言,作者要回答四个层层递进的问题:语言、视觉理解、视觉生成之间的知识如何流动、是否对称;在共享参数的网络里,模态何时协同、何时竞争、由什么决定;视觉应当在训练的哪个时刻、以何种顺序被引入;以及如何把上述发现综合成可在 2T tokens、13.5B MoE 规模上验证的高效预训练配方。每个结论都要求在合成环境和大规模真实数据上双重验证,并尽可能把相关性结论升级为因果性结论。

与已有工作不同的是,本文的独特切入角度,是把统一预训练当作一个可以用『物理』方法解剖的系统:通过严格分离单一变量(固定一方的算力配额、只改变另一方比例)、引入完全可控的合成 CLEVR 测试床来移除真实数据的混淆因子,从而把过去只能得到相关性结论的问题(如理解↔生成是否互益)转成干净的因果陈述。与以往『先训练 LLM 再对齐视觉』或『把统一模型当工程优化问题』的做法不同,作者关心的不是刷榜,而是机制本身——例如用四组正交的机械性测量(训练/推理激活、wrapper 嵌入范数、对图像的注意力占比)来直接解释为何晚期对齐会失效,而不是停留在端到端指标。

核心方法

可以把这项工作想象成物理学家研究力学定律:作者不追求某个具体模型的 SOTA,而是搭起一套高度可控的『实验台』,一次只拨动一个旋钮,观察模态之间如何相互作用。技术路线上,默认骨干是一个 1.5B 的 Llama-3 风格 decoder-only Transformer(共 2.3B 参数,16 层、hidden 2048、GQA 32 查询头/8 KV 头、FFN 扩展 1.5、词表约 128k,带 SwiGLU、RoPE $\theta=500000$、pre-RMSNorm、QK-norm、FlashAttention),采用 Transfusion 把文本下一个 token 预测与图像流匹配统一在一个网络里,并默认使用 split-FFN(文本/图像各一组 FFN)。视觉侧支持四种 tokenizer(默认 RAE,另含 Raw Pixels、CLIP+VAE、AR/UniTok)以验证结论的普适性。所有受控实验跑 100B–2T tokens,固定随机种子 0、解码温度 0 以保证可复现,整套方法论围绕四大主题展开:知识流动、模态协同/竞争、早期统一、训练配方。

全文最核心的洞见是:多模态预训练存在一套可被测量、可被预测的『物理规律』,而其中最关键的一条是知识流动的强不对称性——语言是通用助推器,视觉理解是生成的强先验,而视觉生成对其他能力几乎是中性的。这条不对称性贯穿全文:它解释了为何任务复杂度决定协同还是竞争(简单任务互益、复杂任务争抢容量)、为何共享注意力加解耦 FFN 能把潜在竞争转成协同、为何必须早期统一否则会触发『视觉惰性』,并直接推导出最终配方——把 70% 算力给语言、25% 给理解、只留 5% 给生成。第二个关键创新是用合成 CLEVR 测试床做『概念级留一实验』,证明这种知识流动不仅不对称、而且是『概念依赖』的:结构化概念(关系、大小、计数)可以从理解零样本迁移到生成,而低层属性(颜色、形状)则完全不能,只能在微调时留下可被激活的『潜先验』。

方法步骤详情

方法分四步展开。第一步『知识流动』(§3):固定某一方算力配额(如视觉 50B tokens),在顶上叠加并扫另一方比例(语言/理解/生成各扫 0%–80%,对应额外 0–200B tokens),测量对其余能力的影响;再在合成 CLEVR 上做留一概念实验——把某概念(如 yellow、sphere)从一种模态训练流里删掉、保留在另一种里看能否零样本迁移,失败则微调 2000 步、每 200 步评估是否有可加速的潜先验。第二步『协同/竞争』(§4):把数据复杂度从纯背景、噪声、文字渲染、OCR、视频到真实图像逐级提升,测 $\Delta\text{PPL}$ 与 $\Delta\text{diffusion loss}$;再把 Transformer 块拆成 FFN、注意力、FinalNorm 三组,枚举五种共享/拆分组合(dense、split_ffn、split_ffn_attn、split_ffn_norm、split_all)定位协同来源,并在四种 tokenizer 上复现。第三步『早期统一』(§5):固定 1T 算力扫 0–800B 纯语言预热;再固定 50/25/25 枚举六种模态顺序、对照 12.5% 重放比较联合基线;最后用四轴机械测量诊断视觉惰性。第四步『配方』(§6):对 1T 混合比做三轴网格搜索找到 L70/U25/G5,再在 13.5B MoE、2T tokens 上做三个单变量消融。

技术新颖性

新颖性体现在三方面。其一,用『概念级留一』把社区长期争论、相互矛盾的结论(理解与生成是否互益)从相关性升级为因果性陈述,并揭示出被既有评测掩盖的『潜先验』现象——生成训练能为低层概念理解建立密集的像素级先验($\Delta\text{mean acc}$ 达 $+0.133$ 到 $+0.273$),即使零样本迁移失败。其二,首次用四组正交的机械性测量(训练/推理时 img_ffn 激活 L2、图像 wrapper 嵌入范数、对图像 token 的注意力占比)把『晚期对齐为何伤视觉』解释为可量化的『视觉惰性』,而非仅靠端到端指标。其三,把『共享注意力加共享归一化加解耦 FFN』这一架构结论直接落地为规模化 MoE(2 个模态专属专家加 14 个路由专家,共 top-16),并用 L70/U25/G5 的极不对称配方证明生成只需 5% 算力即可被语言与理解先验高效 bootstrap。

Overview of the synthetic CLEVR testbed. The standard CLEVR vocabulary is extended across five conceptual axes; specific target concepts are systematically ablated from targeted modality streams.
Figure 4: Overview of the synthetic CLEVR testbed. The standard CLEVR vocabulary is extended across five conceptual axes; specific target concepts are systematically ablated from targeted modality streams.

实验结果

核心发现可归纳为五条。其一,知识流动强不对称:固定 50B 视觉算力,语言占比从 0% 升到 80% 单调提升所有视觉理解轴与生成质量,连条件/无条件扩散损失都同时下降;视觉理解显著催化生成;但视觉生成对语言和理解几乎中性,仅小幅波动、无系统退化。其二,流动是『概念依赖』的:CLEVR 上关系/大小/计数等结构概念可从理解零样本迁移到生成,颜色/形状则双向完全失败;但生成留下可被微调激活的潜先验——颜色/形状理解恢复的 $\Delta\text{mean acc}$ 达 $+0.134$ 到 $+0.273$,而理解对生成的先验几乎为零。其三,协同 vs 竞争由复杂度决定:纯背景使语言 PPL 改善 $\Delta\text{PPL}=-0.211$,而真实图像与视频反而退化 $+0.075$ 与 $+0.052$;架构上 dense 令语言 PPL 退化 $+0.272$、视觉损失退化 $+0.054$,split_ffn 却带来 $-0.211$ 与 $-0.017$ 的协同;该规律在四种 tokenizer 上普适。其四,早期联合统一至关重要:纯语言预热越长视觉越差,六种顺序训练都不敌联合训练(加 12.5% 重放仍不足),且伴随可测量的视觉惰性。其五,配方验证:网格搜索得最优 L70/U25/G5,把生成配额压到 5% 反而使 General VQA 达 48.3,并在 13.5B 规模以 1/5 生成算力取得更高 GenEval(0.482 vs 0.467)与 DPG(0.689 vs 0.676)。

Scaling results and controlled baseline comparisons against three controlled baselines: data mixture recipes (Balanced Recipe), architecture design (Dense Model), and vision alignment strategy (Late-Fusion).
Table 2: Scaling results and controlled baseline comparisons against three controlled baselines: data mixture recipes (Balanced Recipe), architecture design (Dense Model), and vision alignment strategy (Late-Fusion).
Impact of scaling language data on visual understanding and generation. Increasing the language ratio universally improves both vision capabilities.
Figure 1: Impact of scaling language data on visual understanding and generation. Increasing the language ratio universally improves both vision capabilities.
Zero-shot concept transfer results on CLEVR. Low-level (Color, Shape) attributes fail to transfer in either direction; structural concepts exhibit an asymmetric transfer.
Figure 5: Zero-shot concept transfer results on CLEVR. Low-level (Color, Shape) attributes fail to transfer in either direction; structural concepts exhibit an asymmetric transfer.
Concept recovery via fine-tuning. Prior exposure via visual generation acts as a booster, accelerating visual understanding learning across both color and shape.
Figure 6: Concept recovery via fine-tuning. Prior exposure via visual generation acts as a booster, accelerating visual understanding learning across both color and shape.
Impact of task complexity on modality interaction. Escalating visual task complexity gradually turns synergy into competition; the simplest linguistic distribution provides the maximum synergistic boost.
Figure 8: Impact of task complexity on modality interaction. Escalating visual task complexity gradually turns synergy into competition; the simplest linguistic distribution provides the maximum synergistic boost.
Impact of parameter sharing on cross-modal performance. Fully shared (dense) parameters force competition; decoupling solely the FFNs (split_ffn) mitigates competition while leveraging shared attention to foster synergy.
Figure 9: Impact of parameter sharing on cross-modal performance. Fully shared (dense) parameters force competition; decoupling solely the FFNs (split_ffn) mitigates competition while leveraging shared attention to foster synergy.
Timing of unification training. Extending the initial pure language phase yields marginal improvements in text metrics but triggers a steep and consistent decline across all visual benchmarks.
Figure 11: Timing of unification training. Extending the initial pure language phase yields marginal improvements in text metrics but triggers a steep and consistent decline across all visual benchmarks.
Results of vision laziness in late alignment. Across all metrics, longer pure-language pretraining reduces the model's utilization of its visual parameters.
Figure 13: Results of vision laziness in late alignment. Across all metrics, longer pure-language pretraining reduces the model's utilization of its visual parameters.
查看结构化数据
任务指标本文基线提升
规模化配方对比(13.5B MoE, 2T tokens) 语言下游平均准确率 Full (L70/U25/G5): 54.31% 平衡配方 (L50/U25/G25): 52.86% +1.45
规模化配方对比 视觉理解平均准确率 Full: 43.08% 平衡配方: 41.42% +1.66
规模化配方对比(生成质量) GenEval 0.482 平衡配方: 0.467 +0.015(生成 token 仅用 1/5)
规模化配方对比(生成质量) DPG-Bench 0.689 平衡配方: 0.676 +0.013
架构对比(MoE vs Dense) 语言准确率 MoE 平衡配方: 52.86% Dense (3.5B): 52.03% +0.83
统一时机对比(早期 vs 晚期) 语言准确率 早期统一: 52.86% 晚期融合: 51.78% +1.08
统一时机对比(早期 vs 晚期) 视觉生成扩散损失 早期: 0.261 晚期: 0.269 降低 0.008
数据复杂度 → 语言 ΔPPL(相对单模态基线 17.13) 纯背景: −0.211(协同) 真实图像 SSTK: +0.075(竞争) 复杂度切换协同/竞争
参数共享 → 视觉生成 Δdiffusion loss split_ffn: −0.017(协同) dense: +0.054(竞争) 共享注意力+解耦 FFN

局限与改进

作者承认的局限主要有两点:一是实验基本限于文本和静态图像,未覆盖视频、音频等带时间维度的连续模态,这些模态是否会改变知识流动与协同规律仍属开放问题;二是规模虽达 13.5B/2T tokens,但前沿模型常超 1T 参数,超大规模下协同与竞争的临界点可能漂移,甚至可能出现生成作为内部世界模拟器而带来双向知识流动的涌现现象。我自己的观察是:合成 CLEVR 的概念体系仍偏简单(颜色、形状、空间关系),难以刻画真实图像里纹理、风格、长尾语义的迁移行为;作者对生成的评测高度依赖 GenEval/DPG/CLIP-Sim 与单一 VLM-judge(Qwen3-VL-8B),缺乏人类评估,可能系统性低估或高估某些迁移效应;此外『生成只需 5% 算力』这一亮点的代价是扩散损失略升(0.272 vs 0.261),作者自己也承认后期增加生成配比或加入专门生成中期训练仍有必要。

独立分析的弱点

第一个弱点是结论的外推性:受控实验为放大差异,刻意用了简单语言/纯背景这种极端探针,真实训练分布远比这复杂,协同/竞争的临界点(从哪一档复杂度开始转为竞争)在真实混合数据上未必与图 8 完全一致,改进方向是补一套在真实 SSTK 加 DCLM 上系统扫描复杂度的实验来标定临界点。第二个弱点是『视觉惰性』目前只是描述性诊断,缺乏干预手段——既然知道晚期对齐有害,能否用 img_ffn 激活正则、wrapper 嵌入范数约束、或对视觉损失动态上权来主动对抗惰性,作者未做尝试,这是一个可直接拓展的方向。第三个弱点是 CLEVR 概念空间过于离散、几何化,难以反映纹理与风格等连续低层属性的迁移,改进方向是引入带连续属性的合成测试床。第四,生成评估过度依赖自动指标与单一 VLM-judge,存在评估系统性偏差风险,应补充人类偏好评估。第五,配方只在单一 MoE 配置(256 专家、top-16)上验证,专家数/激活比与不对称配比的交互未做扫描。

未来方向

作者明确指出的方向包括:把规律外推到视频、音频、3D、动作乃至任意输入输出格式的全模态基础模型,并验证在超 1T 参数的极端规模下是否会出现生成的『双向回流』涌现。基于本文成果可延伸的方向有:一是把『视觉惰性』的诊断指标(img_ffn 激活、对图像注意力)发展成训练中的在线监控与自适应干预,例如动态上权视觉损失或加激活正则;二是把概念依赖的知识流动规律用于设计分概念的数据课程或路由策略,按概念的迁移性强弱分配算力;三是把 L70/U25/G5 的不对称思想推广到更多模态,研究每新增一个模态应占多少『边际算力』;四是用合成测试床方法系统化研究视觉 tokenizer 设计对协同的影响,给出 tokenizer 选择的原则性准则;五是探索在预训练后期或专门生成中期训练阶段补足生成算力,弥补 5% 配方带来的轻微扩散损失上升。

复现评估

复现门槛整体偏高但可控。算力是主要瓶颈:核心结论的小规模实验在 100B–1T tokens、1.5B–2.3B 参数级别,规模化验证需要 13.5B MoE、2T tokens,单次训练成本巨大,普通团队难以完整复现 Table 2。数据方面,语言用公开的 DCLM,图文对用约 3.5 亿对的 Shutterstock(SSTK,商业数据),后者未必人人可得,是复现的主要障碍;合成 CLEVR 部分作者给出了详细的渲染与评测协议(扩展的颜色/形状词表、留一概念过滤、Qwen3-VL-8B 作为 judge),可自行重建。代码与检查点截至论文日期(2026-08-06)尚未公开,仅给出项目主页。好在作者把超参、种子(0)、温度(0)、损失上权(3.0)、MoE 配置(256 专家/top-16/2 模态专属)等关键细节交代得很完整,且多处强调单变量受控对照,使局部结论(如 split_ffn 优于 dense、早期统一优于晚期)在中规模上可被独立验证。