← 返回 2026-08-24

逐步扩展:面向大规模混合专家模型的计算高效超参数迁移 Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts

Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim 📅 2026-08-20 👍 44 2026-08-29 18:30
MoE Muon优化器 μP 大规模预训练 缩放律 超参数迁移

μP宽度迁移+token缩放律两步法,从代理模型外推万亿token级MoE最优学习率

前置知识

Mixture-of-Experts (MoE)

混合专家架构把 Transformer 的前馈层替换为多个并行"专家"网络,由 router 按每个 token 只激活其中 $k$ 个(如 top-k 路由)。这样总参数量可以做到很大(如 155B),但每个 token 的计算量和推理 FLOPs 只取决于活跃参数(如 17B),实现容量与成本的解耦。代价是引入了路由、负载均衡等额外超参数,且出现"总规模"和"稀疏度"(活跃/总专家比)两个耦合的缩放轴。

本文的全部设计都围绕 MoE 的双轴缩放展开:μP 迁移要在扩宽度+扩总专家数时保持最优学习率不变,而正确定位专家 FC1/FC2 在 µP 分类中的角色依赖于对 MoE 结构的理解。

Maximal Update Parameterization (μP) 与 μ-Transfer

μP 是一种参数化方案:按参数形状分类(vector-like / matrix-like),对矩阵型隐层权重按 fan-in 比例缩放初始化方差和学习率,使得不同宽度的模型在理论上有相同的训练动力学。其推论 μ-Transfer 是:在小代理模型上扫出的最优超参数(尤其是学习率)可以零样本迁移到大模型,从而免去在大模型上做昂贵的超参数搜索。

本文方法的第一步就是把 μP 适配到 MLA+Muon 的 MoE 架构(Table 2 给出具体缩放因子),并用实验证明最优学习率跨 8 倍宽度迁移成功(Figure 3)。

缩放律与 token 维度外推

缩放律指模型损失或最优超参数随规模(参数量、token 预算)呈幂律变化的实证规律。本文利用的是:最优学习率 $\eta^*$ 随 token 预算 $B$ 在 log-log 空间近似线性下降,即 $\log(\eta^*) = \beta\log(B) + \gamma$。在短预算区间拟合该直线,即可外推到从未训练过的长时程(如 10T token),拟合质量用 $R^2$ 衡量。

这是方法的第二步:即使 μP 解决了模型规模维度,直接在万亿 token 上搜索学习率仍然不可承受,必须靠 token 缩放律从 500B token 的代理运行外推出 10T token 的最优学习率。

WSD 调度器与 EMA 权重平均

WSD(Warmup-Stable-Decay)调度器把训练分为预热、恒定学习率稳定期、衰减期三段。本文的技巧是:代理实验只在稳定期终止,不跑衰减,而是对权重做指数移动平均 $\theta^{EMA}_t = \alpha\theta^{EMA}_{t-1} + (1-\alpha)\theta_t$($\alpha=0.6$),每 2B token 更新一次检查点。EMA 平滑参数轨迹,效果近似学习率衰减,因此每个检查点可当作该 token 刻度"衰减后"质量的估计。

这解决了数据效率问题:一次稳定期训练即可在每个 10B token 刻度产出一个"最优学习率"数据点,而传统做法每个 token 预算都要独立跑一次衰减实验,成本高得多。

Muon 优化器与 MLA 注意力

Muon 是近年提出的二阶类优化器,对矩阵参数利用牛顿化更新方向,收敛快且与 AdamW 相当或更优。MLA(Multi-head Latent Attention)出自 DeepSeek 系列,把 key-value 缓存压缩到低维隐空间,大幅降低推理时的 KV cache 显存,是 DeepSeek-V3、Kimi 等主流开源 MoE 的标配。两者都是现代大规模 MoE 训练栈的关键组件。

本文是首个在 MLA+Muon 组合下系统研究 μP 迁移的工作:MLA 的低秩投影维度固定导致上投影矩阵学习率缩放因子退化为 1,Muon 下 μP 的实证有效性也是本文验证的内容之一。

研究动机

MoE 架构(DeepSeek-V3、Qwen3-235B-A22B、Kimi-K2.5、GLM-5 等主流开源模型均采用)以极小的活跃参数代价换取巨大容量,但路由和负载均衡引入了额外超参数,其中学习率对模型规模和 token 预算双重敏感。要在 155B 总参、10T token 这样的极端规模上确定最优学习率,直接网格搜索的算力开销不可承受:按论文估算,传统的"模型规模×token 规模"二维联合扫描中,仅模型规模搜索(比代理宽 1.5× 和 2× 的两组运行)就要额外耗费 240.3 ZFLOPs,而全部 5 次代理运行总成本为 64.8 ZFLOPs,目标全尺寸训练则是代理的 98 倍。更棘手的是,μP/μ-Transfer 等零迁移框架为稠密模型设计,主缩放轴是宽度;MoE 还多出稀疏度(活跃/总专家比)这一维度,且对超百亿参数模型而言单靠扩宽度会推高推理成本,实际做法是增加总专家数——但稀疏度遵循独立的缩放行为,现有宽度迁移框架是否适用完全未知,这使得大规模 MoE 的最优超参数预测成为悬而未决的开放问题。

本文的目标是本文要构建一个计算高效的两步超参数迁移框架,把最优学习率的确定成本压到最低。具体目标分三层:第一,将 μP 形式化地适配到采用 MLA 注意力和 Muon 优化器的 MoE 架构,证明在"同时扩大隐藏维度和总专家数"的实际缩放路径下,最优学习率可以跨宽度零样本迁移;第二,建立 token 维度的预测缩放律,用小代理模型在有限 token 预算(约 500B)上的少量运行,通过 log-log 线性回归把最优学习率外推到 10T token 的目标时程(论文最终外推出 $3.85\times10^{-4}$,$R^2=0.95$);第三,把该框架真正用于从零预训练 155B 总参/17B 活跃参数的自研基础模型,用最小消融成本验证全尺寸配置的可靠性。整体上,方法把传统二维扫描(Figure 1a)解耦为 μP 宽度零迁移加一维 token 外推(Figure 1b),彻底避开在大模型上的试错搜索。

与已有工作不同的是,本文的独特切入角度有三点。首先,针对 MoE 的 μP 研究此前几乎空白:仅有工作(Małasnicki 等 2025)把 μP 用于 Switch Transformer,但受限于 AdamW、固定总专家数和活跃专家数、只缩放隐藏维度,无法推广到拥有 128+ 细粒度专家的现代大规模 MoE;本文首次在"宽度+总专家数联合扩展"路径下验证 μP 迁移,并用谱条件视角论证增加专家数不改变单个专家的 fan-in/fan-out,因此与宽度共享同一 μP 规则。其次,本文把模型规模和 token 规模两个维度显式解耦:已有工作(Bjorck 等 2025、Li 等 2025b)沿模型×token 联合缩放做扫描,而本文用 μP 消掉模型维度,只留一维 token 外推。第三,本文明确把 batch size 排除出迁移目标——因为它是随硬件吞吐调整的系统级变量,且文献对其缩放规律结论相互矛盾(依赖训练算力 vs 仅依赖 token 预算)——转而建立对任意 batch size 都稳健的纯学习率缩放律,并用稳定期 EMA 检查点替代衰减实验来廉价获得多 token 刻度数据点。

核心方法

方法的直觉是把"找大模型最优学习率"这个昂贵的二维问题拆成两个便宜的一维问题:模型规模维度交给 μP(最优学习率对宽度不变),训练时长维度交给缩放律(最优学习率随 token 预算近似幂律下降)。技术路线分四步:第一步,按 Table 1/2 把参数分类——vector-like(embedding、bias、专家 FC2)只做 μP 初始化,matrix-like(FFN、注意力、router、专家 FC1)额外按 $\mathrm{fan\ in}_{base}/\mathrm{fan\ in}$ 缩放学习率;扩展时固定每 token 活跃专家数和 MoE 中间维度,同步增加隐藏维度、总专家数和头数。第二步,代理模型用 WSD 调度器在稳定期训练,配合 $\alpha=0.6$ 的 EMA 每 2B token 合并权重,单次运行即可在每个 10B token 刻度产出一个数据点。第三步,对每个 token 刻度 $B$ 用二阶多项式 $L(\eta) = a(\log\eta)^2 + b\log\eta + c$ 拟合验证损失,顶点给出 $\eta^* = \exp(-b/2a)$。第四步,在 log-log 空间回

核心创新点有两个。其一是 μP 对 MoE 参数的重新分类:专家 FC2 权重被归为 vector-like——因为其有效输入维度受固定的活跃专家数和固定的 MoE 中间维度约束,不随总宽度无限扩展——因此只需 μP 初始化而无需学习率缩放;router 和专家 FC1 则是 matrix-like,需要学习率缩放。对 MLA 而言,query/key-value 的低秩投影维度在宽度扩展时保持固定,它们恰是相应上投影矩阵的 fan-in,使该矩阵的学习率缩放因子退化为 1。这保证了"增加总专家数(提高稀疏度)"不会破坏 μP 的谱条件。其二是 token 维度的数据高效外推设计:利用 WSD 稳定期 + EMA(最近 20B token 保持超过 1% 的权重影响,等效于一段衰减窗口),一次训练产生几十个 token 刻度的数据点,再对 255B 以后(批量调度稳定后)的数据做 log-log 回归,$R^2=0.95$ 地外推出 10T token 的 $3.85\times10^{-4}$。与 Bjorck 等(2025)等联合二维扫描方法相比,本框架把搜索从二维降到一维,避免 240.3 ZFLOPs 的额外算力。

方法步骤详情

流程如下。(1)验证宽度迁移:基础代理 hidden dim 256、16 总专家、4 头,采用 MLA;按 2×/4×/8× 同步放大隐藏维度、总专家数和头数,得 0.6B/0.3B→30.7B/3.6B(总参/活跃参)四档,活跃专家数与 MoE 中间维度固定,各训练 1.3B token,学习率网格 $\{1,3,6\}\times10^{-4}$、$\{1,3,4,6\}\times10^{-3}$、$\{1,3\}\times10^{-2}$,验证 μP 下最优 LR 跨宽度一致。(2)短预算最优 LR 估计:5.6B/1.8B 代理训练至 100B token(WSD、全局 batch 32M token、批量调度),对 40/60/80/100B 各刻度拟合抛物线取顶点,用 2× 宽度 held-out 目标(20.7B/3.8B)验证顶点一致,并准确预测留出的 $2\times10^{-3}$ 处损失。(3)长时程外推:10.8B/3.3B 代理(目标的 1/4 宽度)训练约 500B token,每 10B token 用 EMA 检查点估计最优 LR,只用 255B 后(批量调度稳定)的数据点做 log-log 回归,$R^2=0.95$,外推 10T token 最优 LR 为 $3.85\times10^{-4}$。(4)全尺寸验证:155B/17B 模型在 10T token 上从零预训练(Stage 1 配比 45% 英语/12.5% 数学 STEM/27.5% 代码/15% 多语言,6T 处调整为 22.5%/27.5%/25%/25%),验证损失稳定并做基准评测。

技术新颖性

技术新颖性体现在五方面。(1)首个面向"宽度+稀疏度联合扩展"的 MoE μP 系统实证:证明以增加总专家数为主的缩放路径下 μP 依然成立,理论依据是谱条件视角——增加专家数不引入超出宽度缩放之外的 fan-in/fan-out 变化;此前该问题完全开放。(2)μP 与 Muon 优化器结合的大规模实证扩展:此前 Muon 的 μP 适配(如 Shah 等 2025)停留在理论和小规模,本文在 MLA+Muon 的工业级配置上验证到 30.7B 代理和 155B 目标。(3)专家 FC2 的 vector-like 归类是关键的架构洞察,直接决定缩放规则的正确性,也是与稠密模型 μP 的本质差异。(4)EMA 替代衰减期的实验设计:$\alpha=0.6$、每 2B token 合并、每 10B token 分析,单次运行产生 50 个刻度点,成本远低于每刻度独立衰减实验,且有 DeepSeek-V3(EMA)、OLMo(检查点平均)等实践佐证。(5)明确论证并实践"batch size 不迁移":因文献对最优 batch size 缩放规律矛盾(Bi 等 2024 vs Li 等 2025b),固定 batch 只迁移学习率,使缩放律对任何吞吐最优的 batch size 都稳健,这是与既有联合缩放工作在方法论上的根本区别。

(a) Conventional Hyperparameter Scaling vs (b) Two-Step Hyperparameter Transfer
Figure 1: (a) Conventional Hyperparameter Scaling vs (b) Two-Step Hyperparameter Transfer

实验结果

核心发现有四组。(1)μP 宽度迁移(Figure 3):MLA+Muon 的 MoE 上,基础代理(0.6B/0.3B)的最优学习率在 2×/4×/8× 宽度模型(最大 30.7B/3.6B)上保持一致;标准参数化 SP 下最优 LR 随宽度明显漂移。(2)token 维度动态(Figure 4):5.6B/1.8B 代理与 2× 宽度 held-out 目标(20.7B/3.8B)在 40/60/80/100B token 各刻度的抛物线曲率和顶点位置高度一致,最优 LR 随预算缓慢下降,且四点拟合能准确预测留出的 $2\times10^{-3}$ 处损失。(3)长时程外推(Figure 5):10.8B/3.3B 代理训练约 500B token,对 255B–502B 数据点做 log-log 回归得 $R^2=0.95$,外推 10T token 最优 LR 为 $3.85\times10^{-4}$。(4)全尺寸验证(Figures 6–8):155B/17B 模型在 10T token 上训练损失稳定无尖峰;目标计算量约 6328 ZFLOPs,为代理(64.8 ZFLOPs)的 98 倍;MMLU、MMLU-Pro、BBH、Global-MMLU(Ko/Ja/Vi/Zh)、MATH、GSM8K、MBPP、HumanEval 评测显示模型位于"算力 vs MMLU-Pro"的 Pareto 前沿,以相当或更低算力优于 dots.llm1 与 GLM-4.5-Air。

Parameter classification by shape invariance to model width
Table 1: Parameter classification by shape invariance to model width
μP and learning rate scaling factors for dense and MoE models
Table 2: μP and learning rate scaling factors for dense and MoE models
Detailed model configurations (Appendix B)
Table 3: Detailed model configurations (Appendix B)
Comparison of learning rate transferability under SP and μP across MLA MoE models of increasing width
Figure 3: Comparison of learning rate transferability under SP and μP across MLA MoE models of increasing width
Solid lines denote the base proxy model (5.6B total, 1.8B active), dashed lines represent the 2× width-scaled held-out model (20.7B, 3.8B active)
Figure 4: Solid lines denote the base proxy model (5.6B total, 1.8B active), dashed lines represent the 2× width-scaled held-out model (20.7B, 3.8B active)
(a) Estimated Optimal LRs (b) Extrapolated Optimal LRs, R² = 0.95
Figure 5: (a) Estimated Optimal LRs (b) Extrapolated Optimal LRs, R² = 0.95
Training loss of our model (155B total, 17B active) during Stage 1 pretraining
Figure 6: Training loss of our model (155B total, 17B active) during Stage 1 pretraining
Benchmark performance of our foundation MoE model after Stage 1 pretraining on 10T tokens
Figure 7: Benchmark performance of our foundation MoE model after Stage 1 pretraining on 10T tokens
Estimated training compute vs. MMLU-Pro accuracy with Pareto Frontier
Figure 8: Estimated training compute vs. MMLU-Pro accuracy with Pareto Frontier
查看结构化数据
任务指标本文基线提升
MoE 宽度学习率迁移(1.3B token 代理扫描) 最优学习率跨宽度一致性 μP 下最优 LR 从 0.6B/0.3B 基础代理一致迁移到 2×/4×/8× 模型(最大 30.7B/3.6B) 标准参数化 SP:最优 LR 随宽度漂移,无法迁移 在 MLA+Muon 的 MoE 上首次实现跨 8 倍宽度的零样本学习率迁移
token 维度最优学习率外推(10.8B/3.3B 代理,约 500B token) log-log 线性回归拟合优度 R² R² = 0.95,外推 10T token 最优 LR = 3.85×10⁻⁴(拟合区间 255B–502B) 无外推时需在目标 token 预算上直接搜索(10T token 扫描不可承受) 以约 500B token 的代理成本获得 10T token 的最优 LR 估计
155B/17B 基础模型 Stage 1 预训练(10T token) 训练稳定性与基准分数 损失曲线稳定无尖峰;MMLU-Pro 等基准表现出色,位于 Pareto 前沿 dots.llm1、GLM-4.5-Air、Hunyuan-A13B、DeepSeek-V4-Flash(统一评测框架) 以相当或更低的估计训练算力(6ND,按活跃参数计)超过 dots.llm1 和 GLM-4.5-Air 的 MMLU-Pro 准确率
搜索框架算力对比 总计算量(ZFLOPs) 两步法代理运行 64.8 ZFLOPs(5 次运行),目标为代理的 98× 传统二维联合扫描:模型规模搜索额外耗费 240.3 ZFLOPs(1.5×/2× 加宽模型) 免去二维扫描中约 3.7 倍于代理成本的额外算力

局限与改进

作者承认的局限:(1)在全规模上穷举验证 $3.85\times10^{-4}$ 的最优性计算上不可行,只能以 exceptionally stable 的损失轨迹(Figure 6)和有竞争力的基准分数(Figure 7)作间接证据;(2)框架只针对 MLA+Muon 的 MoE 组合,推广到其他 MoE 结构和优化器(如 AdamW)留待未来;(3)缩放路径把稀疏度与宽度联合扩展,稀疏度轴本身的独立效应无法从结果中解耦;(4)未做逐专家学习率自适应——top-k 路由使各专家分到的 token 数不同,有效 batch size 和梯度噪声尺度可能因专家而异。我自己的观察:(1)回归仅基于 255B–502B 约 250B token 的窗口,却外推 20 倍到 10T,幂律假设在如此长的外推区间上是否保持没有直接验证,置信区间也未报告;(2)抛物线顶点法依赖学习率网格恰好覆盖最优点附近,固定的粗网格可能引入系统偏差;(3)EMA 近似衰减的依据来自大 batch(32M token)场景的文献结论,在其他 batch 规模下是否成立未检验;(4)Figure 8 的横向对比用 6ND 估计算力,未控制各模型 tokenizer、数据质量和训练数据重复策略的差异,Pareto 前沿的结论可能受此混淆;(5)仅报告 Stage 1,6T 处数据配比调整对最终评测分数的贡献没有消融。

独立分析的弱点

独立分析的弱点及改进方向:(1)外推区间过长——回归只用 255B–502B 的数据点却预测 10T,一旦最优学习率与 token 预算的关系在高段出现曲率变化(如学习率下界效应),外推会系统性偏离;改进方向是留一交叉验证(用前半段拟合、后半段检验)并报告预测区间,或在不同窗口长度上检验拟合稳定性。(2)抛物线拟合对网格敏感——顶点估计 $\eta^*=\exp(-b/2a)$ 在数据点稀疏或未包住最优点时方差大;改进方向是两阶段自适应网格,先用粗网格定位再在最优点附近加密采样。(3)单一数据混合与语言分布——所有代理和目标实验都基于同一内部混合,最优学习率的绝对值和缩放指数 $\beta$ 可能依赖数据分布;改进方向是在公开语料上重复实验检验缩放律的普适性。(4)batch size 固定 32M token 且调度策略绑定——缩放律声称对任意吞吐最优 batch size 稳健,但实验并未在多个 batch size 下验证这一点;改进方向是至少对 2–3 个 batch size 重复代理实验。(5)硬件/框架单一——全部实验在 H200 + 内部 Megatron-LM fork 上完成,数值细节(如 routed scaling factor 实现)难以外部复现;改进方向是开源配置文件和缩放规则实现。

未来方向

作者明确提出的方向:(1)把框架扩展到更多 MoE 结构(非 MLA 注意力、不同路由机制)和其他优化器;(2)逐专家学习率自适应——top-k 路由导致各专家有效 batch、梯度噪声尺度不同,理论上可望带来增益,但需处理路由随训练演化、数据配比对专家级 batch 的影响以及大规模高效实现,作者因成本留作未来;(3)孤立稀疏度轴的受控大规模 μP 迁移研究,以解耦稀疏度本身的效应。基于本文成果可自然延伸的方向:(4)把 token 缩放律与其他超参数(warmup 长度、衰减形状、batch size 调度)联合建模,形成多维但仍然低成本的预测框架;(5)在线式缩放律修正——训练过程中用已产生的 EMA 检查点动态更新回归并自适应调整学习率,而非一次性外推;(6)检验缩放指数 $\beta$ 在不同架构、数据混合、优化器间的普适性,如果 $\beta$ 跨设置稳定,可将其作为先验大幅减少新模型的代理实验数量;(7)将该两步法用于稠密模型训练栈或继续预训练/微调场景的超参数预测。

复现评估

复现评估:论文未提及开源代码、模型权重或训练数据,实验使用内部 fork 的 Megatron-LM 在 NVIDIA H200 GPU 上进行,数据为内部混合("通用知识英语语料"+多语言/代码/数学),全部不公开,因此精确复现 155B 模型的结果对学术界不现实——目标训练约 6328 ZFLOPs,即使代理运行也需 64.8 ZFLOPs。方法层面描述相当详细:μP 初始化与学习率缩放规则在 Table 2 完整给出,抛物线拟合(公式 2)、log-log 回归(公式 3)、EMA 参数($\alpha=0.6$、2B token 合并间隔)、批量调度后的数据点筛选(≥255B)均可直接实现;模型配置细节在附录 Table 3。定性验证(如 Figure 3 的宽度迁移实验,最大 30.7B/3.6B 模型、1.3B token)在有数十张高端 GPU 的实验室可以负担;定量复现 $R^2=0.95$ 的外推精度则需要接近工业级的算力。综合评级:方法可复现性中上,结果复现性低(受算力与私有数据双重限制),建议关注作者是否后续开源配置。