← 返回 2026-07-27

原生多模态预训练的算力最优扩展定律 Scaling Native Multimodal Pre-Training From Scratch

Haoyuan Wu, Aoqi Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Bei Yu 📅 2026-07-24 👍 28 2026-08-01 18:30
上下文学习 原生多模态预训练 扩展定律 混合专家MoE 算力最优 视觉语言模型

建立原生多模态预训练的算力最优扩展定律,揭示语言与多模态目标的差异化扩展行为

前置知识

算力最优扩展定律(Compute-Optimal Scaling Laws)

扩展定律刻画模型损失、参数量 N、训练数据量 D 与总算力 C 之间的可预测关系。在固定算力预算 $C \approx 6ND$ 约束下,存在一对最优的 $N_{opt}(C)$ 和 $D_{opt}(C)$ 使损失最小。Kaplan 等人(2020)首次建立损失随规模的幂律,Hoffmann 等人(Chinchilla,2022)进一步用 IsoFLOP 剖面和训练曲线包络推导出最优分配服从幂律 $N_{opt}\propto C^a$、$D_{opt}\propto C^b$($a+b=1$),并指出参数与数据应按比例增长。这套框架已成为性能外推和算力分配的标准方法论。

本文的全部工作就是为原生多模态预训练建立这样一套算力最优分配定律,不懂 Chinchilla 式扩展定律就无法理解论文要解决的核心问题和所用的双估计器方法。

原生多模态预训练(Native Multimodal Pre-Training)

相对于主流的晚融合范式(先各自预训练语言模型与视觉编码器,再用投影层连接后继续训练),原生多模态预训练从零开始在混合了图文的交错数据上训练单个模型,让视觉和语言表示从一开始就在同一参数空间、同一优化目标下联合学习,从而实现深层跨模态整合、消除两种模态独立学习带来的优化不对称。本文更进一步去掉传统视觉编码器,只用一个 patch embedding 层把图像直接映射成连续 patch 嵌入,交给 decoder-only Transformer 处理。

本文的研究对象正是这种范式的扩展行为,理解它与晚融合的本质区别(从零联合训练、无独立视觉编码器)是理解论文动机与方法选择的基石。

IsoFLOP 剖面与训练曲线包络(IsoFLOP Profiles & Training-Curve Envelope)

这是 Chinchilla 论文提出的两种估计算力最优前沿的独立方法。IsoFLOP 剖面法:固定算力预算 $C$,把各模型规模 $N$ 的损失对 $\log N$ 作图得到一条抛物线,抛物线最低点即最优模型规模 $N_{opt}(C)$,再由 $D_{opt}=C/(6N_{opt})$ 代数得到最优 token 数。训练曲线包络法:固定 $N$ 不断增加 $D$ 得到一条损失随总算力的轨迹,把所有模型的轨迹汇拢后取下包络,包络上每个点对应一组 $(N,D)$ 配置,对 $\log N$、$\log D$ 关于 $\log C$ 回归即得分配指数。两种方法独立交叉验证,可排除单一函数形式的拟合假象。

论文用这两种互补估计器分别对语言和多模态目标拟合分配指数,二者的吻合或背离是判断扩展定律稳健性还是局部拟合噪声的关键证据。

混合专家(Mixture-of-Experts, MoE)与无辅助损失路由

MoE 是一种稀疏激活架构:每个 token 只激活少数专家子网络,从而在保持参数总量(稀疏参数)远大于激活参数(活跃参数 $N$)的同时控制计算量。本文采用基于 decoder-only Transformer 的 MoE,并用 Liu 等人(2024)的无辅助损失(auxiliary-loss-free)负载均衡方法训练,即不引入额外负载均衡损失项而通过路由机制自然均衡专家负载。论文中讨论的模型规模 71M–3B 指的都是激活的非嵌入参数。

论文的实验模型正是 MoE 架构,理解活跃参数与稀疏参数的区别,以及为何固定算力下可训练更大稀疏模型,对正确解读扩展结果必不可少。

Pareto 前沿(Pareto Frontier)

Pareto 前沿刻画多目标优化中无法在不损害某个目标的情况下改善另一个目标的配置集合。本文同时优化语言损失 $L_{text}$ 和多模态损失 $L_{mm}$,两者共享同一参数量 $N$ 且受同一总算力 $C_{total}$ 约束,存在权衡。扫掠多模态数据比例 $r$ 可在 $(L_{text}, L_{mm})$ 平面绘出一条陡峭的语言-多模态 Pareto 前沿,前沿上每一点给出可部署的最优 $(N, D_{text}, D_{mm})$ 配置。

论文的核心贡献之一就是这条联合 Pareto 前沿,它把分散的算力分配定律收敛为一份可用于指导真实训练资源分配的量化指南。

上下文学习(In-Context Learning, ICL)

上下文学习指模型在不更新参数的情况下,仅通过在输入中拼接少量示例(few-shot 模板)就能完成新任务的能力,是 GPT-3 式大语言模型的标志性涌现能力。本文评估原生多模态预训练后的 base 模型是否也具备多模态上下文学习:通过在测试查询前拼接若干图文示例,观察 0/1/3-shot 准确率是否随模型规模和数据量增长而提升,以此判断该能力是否随规模涌现。

论文在下游评估部分重点论证多模态上下文学习会随模型规模涌现,是理解'原生多模态预训练带来哪些下游收益'这条主线的最后一块拼图。

研究动机

当前多模态预训练的主流范式是晚融合:先分别预训练一个语言模型和一个视觉编码器(如 CLIP、SigLIP),再用一个轻量投影层连接,随后在多模态数据上继续训练。这种设计虽然能复用成熟单模态权重,却引入了根本性的不对称——视觉和语言表示是在不同的数据分布、不同的优化目标下独立学到的,限制了深层跨模态整合。原生多模态预训练(从零开始在交错图文数据上训练单个模型)能消除这种不对称,但立刻面临一个被忽视的实际难题:在固定算力预算 $C$ 下,如何在模型规模 $N$ 与训练 token 数 $D$ 之间分配资源?对于纯语言模型,这一问题由算力最优扩展定律(Kaplan 2020、Chinchilla/Hoffmann 2022)给出明确指导,但对原生多模态是否成立类似的扩展定律、语言与多模态两个目标的最优分配究竟是协调还是冲突,此前几乎无人系统刻画。Shukor 等人(2025)虽探索了原生多模态的扩展行为,却只对单一聚合损失建模,可能掩盖两个目标截然不同的扩展规律。

本文的目标是本文的目标是为原生多模态预训练建立一套算力最优扩展定律。具体而言:在固定算力 $C\approx6ND$ 约束下,求解每个目标(语言 $L_{text}$、多模态 $L_{mm}$)各自的最优 $N_{opt}(C)$ 和 $D_{opt}(C)$,确认它们都服从幂律 $N_{opt}\propto C^a$、$D_{opt}\propto C^b$;刻画数据配比(多模态比例 $r$)如何影响算力定律与分配指数;推导一条联合 Pareto 前沿,对任意算力预算与数据配比给出精确的(模型规模、文本 token 数、多模态 token 数)最优配置。在扩展性之外,本文还要回答三个下游问题:原生多模态预训练是否会损害核心语言能力、是否带来正向跨模态迁移、是否能涌现多模态上下文学习能力。

与已有工作不同的是,本文的独特切入角度在于把联合训练目标解耦为语言和多模态两个目标分别独立分析,而不是像先前工作那样只对单一聚合损失建模。这一解耦揭示了论文最关键的二元性:语言目标的算力最优分配对数据配比高度不变(composition-invariant),而多模态目标的分配对数据配比高度敏感(composition-variant)。论文还用 IsoFLOP 剖面与训练曲线包络两种相互独立的方法做交叉验证,排除单一函数形式的拟合假象,使结论更稳健。最后通过不对称建模——把配比无关的语言目标与配比相关的多模态目标配对——构建统一总算力预算 $C_{total}$ 下的全局 Pareto 前沿,从而把分散的扩展规律收敛为一份可指导真实训练的量化指南。

核心方法

方法整体思路是先把原生多模态预训练形式化为约束优化问题:最小化损失 $L(N,D)$,满足 $C\approx6ND$。由于语言损失 $L_{text}$ 与多模态损失 $L_{mm}$ 由共享参数同时优化,论文把算力解耦为 $C_{text}=6ND_{text}$、$C_{mm}=6ND_{mm}$,其中 $D_{text}=D/(1+r)$、$D_{mm}=Dr/(1+r)$、$r$ 为多模态数据比例。对每个目标分别证明最优分配服从幂律 $N_{opt}(C)\propto C^a$、$D_{opt}(C)\propto C^b$($a+b=1$)。技术路线用两套独立估计器交叉验证:IsoFLOP 剖面为主,在固定算力下对损失-规模曲线拟合抛物线取最低点;训练曲线包络为辅。算力前沿用 $L(C)=E+C_c^{\beta}/C$ 描述,log 空间最小二乘并用 log-sum-exp 保证严格正。架构采用基于 decoder-only Transformer 的 MoE,去掉视觉编码器、仅用一个 patch embedding 层把图像映射为连续 patch 嵌入。

核心创新点是解耦思想:把原生多模态预训练的联合目标拆成语言与多模态两个目标独立分析,从而发现二者遵循根本不同的扩展规律——一个对数据配比几乎不敏感,另一个对数据配比高度敏感。这与已有方法(Shukor 2025 把训练目标当作单一聚合损失)有本质区别。论文进一步提出一种不对称建模框架:把配比无关的语言目标与配比相关的多模态目标配对,反映两种模态在结构上的内在分歧——文本语言建模依赖稳健自足的统计结构,而视觉 token 主要提供外部上下文、几乎不改变 token 间的根本依赖,因此语言目标的计算效率基本与 $r$ 无关;反之跨模态对齐对数据配比极度敏感,若不把 $L_{mm}$ 建模为 $r$ 的函数,就会在大规模时掩盖多模态参数扩展曲线迅速变平的现象,导致过参数化、数据饥饿的架构。

方法步骤详情

方法分六步。第一步模型与数据:训练基于 decoder-only Transformer 的 MoE,活跃参数 71M、128M、340M、590M、874M、3B;语料含 250B 文本 token 与 75B 多模态 token,比例 $r\in\{0,0.1,0.2,0.3\}$,图像分 32×32 patch、单图最多 1536 token。第二步 IsoFLOP 估计:对每算力预算调整 token 数使最终 FLOPs 固定、余弦周期匹配目标算力,把损失对 $\log N$ 作图得抛物线,最低点给 $N_{opt}(C)$,代数得 $D_{opt}=C/(6N_{opt})$,回归得 $a$、$b$。第三步训练曲线包络交叉验证:固定 $N$ 增加 $D$ 得轨迹,汇拢所有模型取下包络回归。第四步拟合算力前沿 $L(C)=E+C_c^{\beta}/C$。第五步联合 Pareto:把配比无关语言与配比相关多模态配对投出 $a(r)$、$b(r)$。第六步下游评估:16 个文本与 23 个多模态基准,0/1/3-shot 设定,多选用最低困惑度、开放题用精确匹配、编码用 Pass@1。

技术新颖性

技术新颖性体现在四个层面。其一,首次把语言目标与多模态目标的扩展行为独立分析,揭示二者遵循根本不同的分配定律——一个配比无关、一个配比相关;其二,首次识别出语言-多模态 Pareto 前沿,为原生多模态预训练的最优扩展提供量化指南,把任意算力预算与数据配比映射到具体的(模型规模、文本 token、多模态 token)配置;其三,用 IsoFLOP 剖面与训练曲线包络两套独立估计器做系统交叉验证,使扩展定律的结论具备稳健性而非单一函数形式的局部拟合假象;其四,提出不对称建模框架,显式承认两种模态的结构分歧(文本自足、视觉提供外部上下文),既避免对语言目标过拟合引入噪声,又避免对多模态目标忽略 $r$ 依赖导致大规模架构过参数化与数据饥饿。此外,论文不提出新架构,而是正交地攻占'原生多模态如何扩展'这一基本未被探索的问题。

IsoFLOP curves (language objective)
Figure 1: IsoFLOP curves (language objective)
Training curve envelope (language objective)
Figure 2: Training curve envelope (language objective)
Compute-optimal allocation (language objective)
Figure 3: Compute-optimal allocation (language objective)
IsoFLOP curves (multimodal objective)
Figure 4: IsoFLOP curves (multimodal objective)
Training curve envelope (multimodal objective)
Figure 5: Training curve envelope (multimodal objective)

实验结果

核心发现如下。其一,语言目标最优分配高度配比无关:IsoFLOP 的 $a$ 在各 $r$ 上落在 $[0.663,0.697]$、$b$ 落在 $[0.303,0.337]$,训练包络交叉验证无单调下降趋势。其二,多模态目标高度配比相关:$r$ 从 0.1 升到 0.3,IsoFLOP 的 $a$ 从 0.709 降到 0.643,训练包络从 0.665 降到 0.634,同步下降,说明密集多模态数据把最优配置推向数据扩展。其三,联合 Pareto 在 $r{=}0.1$ 时 $N_{opt}\propto C_{total}^{0.69}$,$r{=}0.3$ 时降到 $C_{total}^{0.66}$、token 升到 $C_{total}^{0.34}$。其四,文本能力不受损:固定 250B 文本预算下 16 个基准平均准确率偏差 <1 个百分点。其五,跨模态正向迁移:SpatialEval 纯文本抽象空间推理上 $r{=}0.3$ 一致优于 $r{=}0$,差距随规模到 3B 最显著。其六,上下文学习随规模涌现:3-shot 增益从 A71M 接近 0 到 A874M 的 +1.80 再到 A3B 的 +2.43,集中于空间推理、OCR 类上为负。

Compute-optimal allocation (multimodal objective)
Figure 6: Compute-optimal allocation (multimodal objective)
Joint Pareto frontier
Figure 7: Joint Pareto frontier
Text capabilities are preserved under native multimodal pre-training
Figure 8: Text capabilities are preserved under native multimodal pre-training
Multimodal pre-training enhances pure-text spatial reasoning
Figure 9: Multimodal pre-training enhances pure-text spatial reasoning
Multimodal in-context learning emerges with model scaling
Figure 10: Multimodal in-context learning emerges with model scaling
Few-shot accuracy under data scaling
Figure 11: Few-shot accuracy under data scaling
Few-shot trends by task category across model scale
Figure 12: Few-shot trends by task category across model scale
Few-shot gain trends upward with training
Figure 13: Few-shot gain trends upward with training
查看结构化数据
任务指标本文基线提升
文本能力保持(16 个文本基准平均) 平均准确率随多模态配比变化 各配比间偏差 <1 个百分点,A3B 训练轨迹几乎重合 纯文本基线 r=0 无显著退化,证明核心语言能力得以保持
纯文本空间推理(SpatialEval 抽象子任务) 准确率(r=0.3 对比 r=0) r=0.3 一致优于 r=0,差距随规模扩大到 3B 纯文本基线 r=0 跨模态正向迁移:多模态预训练提升纯文本空间推理
多模态上下文学习(21 个多模态基准) k-shot 相对 0-shot 增益(百分点) A71M≈0,A874M=+1.80,A3B=+2.43(3-shot) 0-shot 自身 随规模涌现,3-shot 增益持续高于 1-shot
语言目标算力最优分配稳健性 分配指数 a 随 r 的波动 IsoFLOP a∈[0.663,0.697],包络交叉验证无单调下降 若与多模态目标同样配比相关 配比无关性得到双估计器确认
多模态目标配比相关性 分配指数 a 随 r 从 0.1→0.3 的变化 IsoFLOP a 0.709→0.643,包络 0.665→0.634 假设配比无关 同步单调下降证明稳健的配比相关扩展定律

局限与改进

作者明确承认三方面局限。其一,规模上限有限:分析仅覆盖到 3B 活跃参数,更大的规模下幂律是否继续成立有待验证。其二,数据家族单一:只用了单一的图文数据家族(网络抓取图文对与交错图文文档),未覆盖视频、音频等其他模态或更丰富数据组合。其三,基于损失的扩展代理:由于缺乏可靠的多模态验证指标,且预训练阶段每个 token 大约只看一次,论文仅用平滑训练损失作为测试损失的代理,这可能不能完美反映下游质量。从读者角度看,还有两点隐含局限:上下文窗口仅 4K token(单图最多 1536 token、few-shot 进一步降到 512 token),限制了长上下文与高分辨率场景的评估;论文虽给出 Pareto 前沿的外推(外推到 $10^{24}$–$10^{25}$ FLOPs 量级),但外推本身依赖指数拟合,大尺度外推的不确定性未被量化。

独立分析的弱点

第一个弱点是规模天花板偏低。所有定律在 ≤3B 活跃参数上拟合,外推到数十亿乃至千亿规模时幂律指数是否保持稳定是未知数——语言模型的扩展定律在小尺度外推到大模型时常出现拐点。改进方向是把实验推到更大活跃参数规模并引入拐点检测。第二个弱点是单一数据家族与单一架构。论文只用图文数据、只用 MoE decoder-only Transformer,未验证纯密集 Transformer 或其他模态(视频、音频)下结论是否迁移。改进方向是跨架构、跨模态复现关键定律,尤其是'语言配比无关、多模态配比相关'这一二元性是否普适。第三个弱点是损失代理的有效性。用平滑训练损失代理测试损失在单 epoch 预训练下尚合理,但多模态下游质量与训练损失的偏离程度未被系统量化,可能存在'损失持续下降但下游饱和甚至退化'的风险。改进方向是引入与下游任务相关的评估探针联合标定算力前沿。第四个弱点是联合 Pareto 前沿的不确定性未量化。前沿依赖幂律指数拟合与外推,但论文未给出置信区间或敏感性分析。改进方向是对指数做自助法区间估计并报告不同预算下的鲁棒配置范围。

未来方向

作者明确提出要'在更大规模、跨多种模态与数据组合上验证'。基于本文成果可延伸的方向包括:把扩展定律推广到视频、音频等更多模态的原生多模态预训练,检验'语言配比无关、多模态配比相关'的二元性是否普适;将算力最优分配从预训练阶段推广到指令微调/对齐阶段,推导后训练阶段的资源分配规律;研究不同架构(密集 Transformer 与 MoE、不同注意力机制)下分配指数的变化;把跨模态正向迁移现象(多模态提升纯文本空间推理)作为新型'推理增强'训练范式深入挖掘,探索在更大规模上是否带来更强空间与因果推理;基于上下文学习随规模涌现的发现,进一步研究多模态上下文学习与规模、数据的精确涌现阈值,以及如何通过数据配比主动调控该能力的出现。

复现评估

论文复现性面临较大挑战。其一,代码与模型未明确开源(来自腾讯 LLM 部门与香港中文大学的工业界工作,未在正文中给出代码或权重链接)。其二,数据为私有大规模语料:250B 文本 token(网页、书籍、学术论文等)与 75B 多模态 token(网络抓取图文对与交错图文文档),完全自建,外部研究者难以获得同质数据。其三,算力需求巨大:需在多个模型规模(71M–3B)、多个算力预算、多个数据配比 $r\in\{0,0.1,0.2,0.3\}$ 下进行大量训练运行以拟合 IsoFLOP 剖面与训练包络,总训练成本远超单次预训练。其四,方法学描述相对清晰(双估计器流程、算力前沿拟合 $L(C)=E+C_c^{\beta}/C$、MoE 无辅助损失、patch embedding 32×32、单图 1536 token),实现细节放在附录 Section A,理论上可照搬方法学复现实验流程,但需要相当的计算资源与等效数据。总体而言,论文方法学可复现,但完整实验复现因数据私有与算力门槛而困难。