逐步扩展:面向大规模混合专家模型的计算高效超参数迁移 Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts
μP宽度迁移+token缩放律两步法,从代理模型外推万亿token级MoE最优学习率
前置知识
Mixture-of-Experts (MoE)
混合专家架构把 Transformer 的前馈层替换为多个并行"专家"网络,由 router 按每个 token 只激活其中 $k$ 个(如 top-k 路由)。这样总参数量可以做到很大(如 155B),但每个 token 的计算量和推理 FLOPs 只取决于活跃参数(如 17B),实现容量与成本的解耦。代价是引入了路由、负载均衡等额外超参数,且出现"总规模"和"稀疏度"(活跃/总专家比)两个耦合的缩放轴。
本文的全部设计都围绕 MoE 的双轴缩放展开:μP 迁移要在扩宽度+扩总专家数时保持最优学习率不变,而正确定位专家 FC1/FC2 在 µP 分类中的角色依赖于对 MoE 结构的理解。
Maximal Update Parameterization (μP) 与 μ-Transfer
μP 是一种参数化方案:按参数形状分类(vector-like / matrix-like),对矩阵型隐层权重按 fan-in 比例缩放初始化方差和学习率,使得不同宽度的模型在理论上有相同的训练动力学。其推论 μ-Transfer 是:在小代理模型上扫出的最优超参数(尤其是学习率)可以零样本迁移到大模型,从而免去在大模型上做昂贵的超参数搜索。
本文方法的第一步就是把 μP 适配到 MLA+Muon 的 MoE 架构(Table 2 给出具体缩放因子),并用实验证明最优学习率跨 8 倍宽度迁移成功(Figure 3)。
缩放律与 token 维度外推
缩放律指模型损失或最优超参数随规模(参数量、token 预算)呈幂律变化的实证规律。本文利用的是:最优学习率 $\eta^*$ 随 token 预算 $B$ 在 log-log 空间近似线性下降,即 $\log(\eta^*) = \beta\log(B) + \gamma$。在短预算区间拟合该直线,即可外推到从未训练过的长时程(如 10T token),拟合质量用 $R^2$ 衡量。
这是方法的第二步:即使 μP 解决了模型规模维度,直接在万亿 token 上搜索学习率仍然不可承受,必须靠 token 缩放律从 500B token 的代理运行外推出 10T token 的最优学习率。
WSD 调度器与 EMA 权重平均
WSD(Warmup-Stable-Decay)调度器把训练分为预热、恒定学习率稳定期、衰减期三段。本文的技巧是:代理实验只在稳定期终止,不跑衰减,而是对权重做指数移动平均 $\theta^{EMA}_t = \alpha\theta^{EMA}_{t-1} + (1-\alpha)\theta_t$($\alpha=0.6$),每 2B token 更新一次检查点。EMA 平滑参数轨迹,效果近似学习率衰减,因此每个检查点可当作该 token 刻度"衰减后"质量的估计。
这解决了数据效率问题:一次稳定期训练即可在每个 10B token 刻度产出一个"最优学习率"数据点,而传统做法每个 token 预算都要独立跑一次衰减实验,成本高得多。
Muon 优化器与 MLA 注意力
Muon 是近年提出的二阶类优化器,对矩阵参数利用牛顿化更新方向,收敛快且与 AdamW 相当或更优。MLA(Multi-head Latent Attention)出自 DeepSeek 系列,把 key-value 缓存压缩到低维隐空间,大幅降低推理时的 KV cache 显存,是 DeepSeek-V3、Kimi 等主流开源 MoE 的标配。两者都是现代大规模 MoE 训练栈的关键组件。
本文是首个在 MLA+Muon 组合下系统研究 μP 迁移的工作:MLA 的低秩投影维度固定导致上投影矩阵学习率缩放因子退化为 1,Muon 下 μP 的实证有效性也是本文验证的内容之一。
研究动机
MoE 架构(DeepSeek-V3、Qwen3-235B-A22B、Kimi-K2.5、GLM-5 等主流开源模型均采用)以极小的活跃参数代价换取巨大容量,但路由和负载均衡引入了额外超参数,其中学习率对模型规模和 token 预算双重敏感。要在 155B 总参、10T token 这样的极端规模上确定最优学习率,直接网格搜索的算力开销不可承受:按论文估算,传统的"模型规模×token 规模"二维联合扫描中,仅模型规模搜索(比代理宽 1.5× 和 2× 的两组运行)就要额外耗费 240.3 ZFLOPs,而全部 5 次代理运行总成本为 64.8 ZFLOPs,目标全尺寸训练则是代理的 98 倍。更棘手的是,μP/μ-Transfer 等零迁移框架为稠密模型设计,主缩放轴是宽度;MoE 还多出稀疏度(活跃/总专家比)这一维度,且对超百亿参数模型而言单靠扩宽度会推高推理成本,实际做法是增加总专家数——但稀疏度遵循独立的缩放行为,现有宽度迁移框架是否适用完全未知,这使得大规模 MoE 的最优超参数预测成为悬而未决的开放问题。
本文的目标是本文要构建一个计算高效的两步超参数迁移框架,把最优学习率的确定成本压到最低。具体目标分三层:第一,将 μP 形式化地适配到采用 MLA 注意力和 Muon 优化器的 MoE 架构,证明在"同时扩大隐藏维度和总专家数"的实际缩放路径下,最优学习率可以跨宽度零样本迁移;第二,建立 token 维度的预测缩放律,用小代理模型在有限 token 预算(约 500B)上的少量运行,通过 log-log 线性回归把最优学习率外推到 10T token 的目标时程(论文最终外推出 $3.85\times10^{-4}$,$R^2=0.95$);第三,把该框架真正用于从零预训练 155B 总参/17B 活跃参数的自研基础模型,用最小消融成本验证全尺寸配置的可靠性。整体上,方法把传统二维扫描(Figure 1a)解耦为 μP 宽度零迁移加一维 token 外推(Figure 1b),彻底避开在大模型上的试错搜索。
与已有工作不同的是,本文的独特切入角度有三点。首先,针对 MoE 的 μP 研究此前几乎空白:仅有工作(Małasnicki 等 2025)把 μP 用于 Switch Transformer,但受限于 AdamW、固定总专家数和活跃专家数、只缩放隐藏维度,无法推广到拥有 128+ 细粒度专家的现代大规模 MoE;本文首次在"宽度+总专家数联合扩展"路径下验证 μP 迁移,并用谱条件视角论证增加专家数不改变单个专家的 fan-in/fan-out,因此与宽度共享同一 μP 规则。其次,本文把模型规模和 token 规模两个维度显式解耦:已有工作(Bjorck 等 2025、Li 等 2025b)沿模型×token 联合缩放做扫描,而本文用 μP 消掉模型维度,只留一维 token 外推。第三,本文明确把 batch size 排除出迁移目标——因为它是随硬件吞吐调整的系统级变量,且文献对其缩放规律结论相互矛盾(依赖训练算力 vs 仅依赖 token 预算)——转而建立对任意 batch size 都稳健的纯学习率缩放律,并用稳定期 EMA 检查点替代衰减实验来廉价获得多 token 刻度数据点。
核心方法
方法的直觉是把"找大模型最优学习率"这个昂贵的二维问题拆成两个便宜的一维问题:模型规模维度交给 μP(最优学习率对宽度不变),训练时长维度交给缩放律(最优学习率随 token 预算近似幂律下降)。技术路线分四步:第一步,按 Table 1/2 把参数分类——vector-like(embedding、bias、专家 FC2)只做 μP 初始化,matrix-like(FFN、注意力、router、专家 FC1)额外按 $\mathrm{fan\ in}_{base}/\mathrm{fan\ in}$ 缩放学习率;扩展时固定每 token 活跃专家数和 MoE 中间维度,同步增加隐藏维度、总专家数和头数。第二步,代理模型用 WSD 调度器在稳定期训练,配合 $\alpha=0.6$ 的 EMA 每 2B token 合并权重,单次运行即可在每个 10B token 刻度产出一个数据点。第三步,对每个 token 刻度 $B$ 用二阶多项式 $L(\eta) = a(\log\eta)^2 + b\log\eta + c$ 拟合验证损失,顶点给出 $\eta^* = \exp(-b/2a)$。第四步,在 log-log 空间回
核心创新点有两个。其一是 μP 对 MoE 参数的重新分类:专家 FC2 权重被归为 vector-like——因为其有效输入维度受固定的活跃专家数和固定的 MoE 中间维度约束,不随总宽度无限扩展——因此只需 μP 初始化而无需学习率缩放;router 和专家 FC1 则是 matrix-like,需要学习率缩放。对 MLA 而言,query/key-value 的低秩投影维度在宽度扩展时保持固定,它们恰是相应上投影矩阵的 fan-in,使该矩阵的学习率缩放因子退化为 1。这保证了"增加总专家数(提高稀疏度)"不会破坏 μP 的谱条件。其二是 token 维度的数据高效外推设计:利用 WSD 稳定期 + EMA(最近 20B token 保持超过 1% 的权重影响,等效于一段衰减窗口),一次训练产生几十个 token 刻度的数据点,再对 255B 以后(批量调度稳定后)的数据做 log-log 回归,$R^2=0.95$ 地外推出 10T token 的 $3.85\times10^{-4}$。与 Bjorck 等(2025)等联合二维扫描方法相比,本框架把搜索从二维降到一维,避免 240.3 ZFLOPs 的额外算力。
方法步骤详情
流程如下。(1)验证宽度迁移:基础代理 hidden dim 256、16 总专家、4 头,采用 MLA;按 2×/4×/8× 同步放大隐藏维度、总专家数和头数,得 0.6B/0.3B→30.7B/3.6B(总参/活跃参)四档,活跃专家数与 MoE 中间维度固定,各训练 1.3B token,学习率网格 $\{1,3,6\}\times10^{-4}$、$\{1,3,4,6\}\times10^{-3}$、$\{1,3\}\times10^{-2}$,验证 μP 下最优 LR 跨宽度一致。(2)短预算最优 LR 估计:5.6B/1.8B 代理训练至 100B token(WSD、全局 batch 32M token、批量调度),对 40/60/80/100B 各刻度拟合抛物线取顶点,用 2× 宽度 held-out 目标(20.7B/3.8B)验证顶点一致,并准确预测留出的 $2\times10^{-3}$ 处损失。(3)长时程外推:10.8B/3.3B 代理(目标的 1/4 宽度)训练约 500B token,每 10B token 用 EMA 检查点估计最优 LR,只用 255B 后(批量调度稳定)的数据点做 log-log 回归,$R^2=0.95$,外推 10T token 最优 LR 为 $3.85\times10^{-4}$。(4)全尺寸验证:155B/17B 模型在 10T token 上从零预训练(Stage 1 配比 45% 英语/12.5% 数学 STEM/27.5% 代码/15% 多语言,6T 处调整为 22.5%/27.5%/25%/25%),验证损失稳定并做基准评测。
技术新颖性
技术新颖性体现在五方面。(1)首个面向"宽度+稀疏度联合扩展"的 MoE μP 系统实证:证明以增加总专家数为主的缩放路径下 μP 依然成立,理论依据是谱条件视角——增加专家数不引入超出宽度缩放之外的 fan-in/fan-out 变化;此前该问题完全开放。(2)μP 与 Muon 优化器结合的大规模实证扩展:此前 Muon 的 μP 适配(如 Shah 等 2025)停留在理论和小规模,本文在 MLA+Muon 的工业级配置上验证到 30.7B 代理和 155B 目标。(3)专家 FC2 的 vector-like 归类是关键的架构洞察,直接决定缩放规则的正确性,也是与稠密模型 μP 的本质差异。(4)EMA 替代衰减期的实验设计:$\alpha=0.6$、每 2B token 合并、每 10B token 分析,单次运行产生 50 个刻度点,成本远低于每刻度独立衰减实验,且有 DeepSeek-V3(EMA)、OLMo(检查点平均)等实践佐证。(5)明确论证并实践"batch size 不迁移":因文献对最优 batch size 缩放规律矛盾(Bi 等 2024 vs Li 等 2025b),固定 batch 只迁移学习率,使缩放律对任何吞吐最优的 batch size 都稳健,这是与既有联合缩放工作在方法论上的根本区别。
实验结果
核心发现有四组。(1)μP 宽度迁移(Figure 3):MLA+Muon 的 MoE 上,基础代理(0.6B/0.3B)的最优学习率在 2×/4×/8× 宽度模型(最大 30.7B/3.6B)上保持一致;标准参数化 SP 下最优 LR 随宽度明显漂移。(2)token 维度动态(Figure 4):5.6B/1.8B 代理与 2× 宽度 held-out 目标(20.7B/3.8B)在 40/60/80/100B token 各刻度的抛物线曲率和顶点位置高度一致,最优 LR 随预算缓慢下降,且四点拟合能准确预测留出的 $2\times10^{-3}$ 处损失。(3)长时程外推(Figure 5):10.8B/3.3B 代理训练约 500B token,对 255B–502B 数据点做 log-log 回归得 $R^2=0.95$,外推 10T token 最优 LR 为 $3.85\times10^{-4}$。(4)全尺寸验证(Figures 6–8):155B/17B 模型在 10T token 上训练损失稳定无尖峰;目标计算量约 6328 ZFLOPs,为代理(64.8 ZFLOPs)的 98 倍;MMLU、MMLU-Pro、BBH、Global-MMLU(Ko/Ja/Vi/Zh)、MATH、GSM8K、MBPP、HumanEval 评测显示模型位于"算力 vs MMLU-Pro"的 Pareto 前沿,以相当或更低算力优于 dots.llm1 与 GLM-4.5-Air。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| MoE 宽度学习率迁移(1.3B token 代理扫描) | 最优学习率跨宽度一致性 | μP 下最优 LR 从 0.6B/0.3B 基础代理一致迁移到 2×/4×/8× 模型(最大 30.7B/3.6B) | 标准参数化 SP:最优 LR 随宽度漂移,无法迁移 | 在 MLA+Muon 的 MoE 上首次实现跨 8 倍宽度的零样本学习率迁移 |
| token 维度最优学习率外推(10.8B/3.3B 代理,约 500B token) | log-log 线性回归拟合优度 R² | R² = 0.95,外推 10T token 最优 LR = 3.85×10⁻⁴(拟合区间 255B–502B) | 无外推时需在目标 token 预算上直接搜索(10T token 扫描不可承受) | 以约 500B token 的代理成本获得 10T token 的最优 LR 估计 |
| 155B/17B 基础模型 Stage 1 预训练(10T token) | 训练稳定性与基准分数 | 损失曲线稳定无尖峰;MMLU-Pro 等基准表现出色,位于 Pareto 前沿 | dots.llm1、GLM-4.5-Air、Hunyuan-A13B、DeepSeek-V4-Flash(统一评测框架) | 以相当或更低的估计训练算力(6ND,按活跃参数计)超过 dots.llm1 和 GLM-4.5-Air 的 MMLU-Pro 准确率 |
| 搜索框架算力对比 | 总计算量(ZFLOPs) | 两步法代理运行 64.8 ZFLOPs(5 次运行),目标为代理的 98× | 传统二维联合扫描:模型规模搜索额外耗费 240.3 ZFLOPs(1.5×/2× 加宽模型) | 免去二维扫描中约 3.7 倍于代理成本的额外算力 |
局限与改进
作者承认的局限:(1)在全规模上穷举验证 $3.85\times10^{-4}$ 的最优性计算上不可行,只能以 exceptionally stable 的损失轨迹(Figure 6)和有竞争力的基准分数(Figure 7)作间接证据;(2)框架只针对 MLA+Muon 的 MoE 组合,推广到其他 MoE 结构和优化器(如 AdamW)留待未来;(3)缩放路径把稀疏度与宽度联合扩展,稀疏度轴本身的独立效应无法从结果中解耦;(4)未做逐专家学习率自适应——top-k 路由使各专家分到的 token 数不同,有效 batch size 和梯度噪声尺度可能因专家而异。我自己的观察:(1)回归仅基于 255B–502B 约 250B token 的窗口,却外推 20 倍到 10T,幂律假设在如此长的外推区间上是否保持没有直接验证,置信区间也未报告;(2)抛物线顶点法依赖学习率网格恰好覆盖最优点附近,固定的粗网格可能引入系统偏差;(3)EMA 近似衰减的依据来自大 batch(32M token)场景的文献结论,在其他 batch 规模下是否成立未检验;(4)Figure 8 的横向对比用 6ND 估计算力,未控制各模型 tokenizer、数据质量和训练数据重复策略的差异,Pareto 前沿的结论可能受此混淆;(5)仅报告 Stage 1,6T 处数据配比调整对最终评测分数的贡献没有消融。
独立分析的弱点
独立分析的弱点及改进方向:(1)外推区间过长——回归只用 255B–502B 的数据点却预测 10T,一旦最优学习率与 token 预算的关系在高段出现曲率变化(如学习率下界效应),外推会系统性偏离;改进方向是留一交叉验证(用前半段拟合、后半段检验)并报告预测区间,或在不同窗口长度上检验拟合稳定性。(2)抛物线拟合对网格敏感——顶点估计 $\eta^*=\exp(-b/2a)$ 在数据点稀疏或未包住最优点时方差大;改进方向是两阶段自适应网格,先用粗网格定位再在最优点附近加密采样。(3)单一数据混合与语言分布——所有代理和目标实验都基于同一内部混合,最优学习率的绝对值和缩放指数 $\beta$ 可能依赖数据分布;改进方向是在公开语料上重复实验检验缩放律的普适性。(4)batch size 固定 32M token 且调度策略绑定——缩放律声称对任意吞吐最优 batch size 稳健,但实验并未在多个 batch size 下验证这一点;改进方向是至少对 2–3 个 batch size 重复代理实验。(5)硬件/框架单一——全部实验在 H200 + 内部 Megatron-LM fork 上完成,数值细节(如 routed scaling factor 实现)难以外部复现;改进方向是开源配置文件和缩放规则实现。
未来方向
作者明确提出的方向:(1)把框架扩展到更多 MoE 结构(非 MLA 注意力、不同路由机制)和其他优化器;(2)逐专家学习率自适应——top-k 路由导致各专家有效 batch、梯度噪声尺度不同,理论上可望带来增益,但需处理路由随训练演化、数据配比对专家级 batch 的影响以及大规模高效实现,作者因成本留作未来;(3)孤立稀疏度轴的受控大规模 μP 迁移研究,以解耦稀疏度本身的效应。基于本文成果可自然延伸的方向:(4)把 token 缩放律与其他超参数(warmup 长度、衰减形状、batch size 调度)联合建模,形成多维但仍然低成本的预测框架;(5)在线式缩放律修正——训练过程中用已产生的 EMA 检查点动态更新回归并自适应调整学习率,而非一次性外推;(6)检验缩放指数 $\beta$ 在不同架构、数据混合、优化器间的普适性,如果 $\beta$ 跨设置稳定,可将其作为先验大幅减少新模型的代理实验数量;(7)将该两步法用于稠密模型训练栈或继续预训练/微调场景的超参数预测。
复现评估
复现评估:论文未提及开源代码、模型权重或训练数据,实验使用内部 fork 的 Megatron-LM 在 NVIDIA H200 GPU 上进行,数据为内部混合("通用知识英语语料"+多语言/代码/数学),全部不公开,因此精确复现 155B 模型的结果对学术界不现实——目标训练约 6328 ZFLOPs,即使代理运行也需 64.8 ZFLOPs。方法层面描述相当详细:μP 初始化与学习率缩放规则在 Table 2 完整给出,抛物线拟合(公式 2)、log-log 回归(公式 3)、EMA 参数($\alpha=0.6$、2B token 合并间隔)、批量调度后的数据点筛选(≥255B)均可直接实现;模型配置细节在附录 Table 3。定性验证(如 Figure 3 的宽度迁移实验,最大 30.7B/3.6B 模型、1.3B token)在有数十张高端 GPU 的实验室可以负担;定量复现 $R^2=0.95$ 的外推精度则需要接近工业级的算力。综合评级:方法可复现性中上,结果复现性低(受算力与私有数据双重限制),建议关注作者是否后续开源配置。
论文图表
算力对比图。模型规模搜索(比代理宽 1.5×/2× 的运行)需额外 240.3 ZFLOPs,叠加代理自身 64.8 ZFLOPs;目标模型总计算量约为代理 5 次运行的 98 倍(约 6328 ZFLOPs),FLOPs 按 Narayanan 等(2021)口径计算。
量化了方法节省的算力:免去约 3.7 倍于代理成本的二维扫描,并说明验证实验的规模跨度,是评估方法实用价值的关键证据。