尺寸可忽略,作用却显著:大语言模型中的 Scale Vector 研究 Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models
系统揭示 RMSNorm 中可学习 scale vector 通过自放大预条件加速 LLM 预训练,并提出异构化、双侧放置与幅向重参数化三项零成本改进。
前置知识
RMSNorm
Root Mean Square Layer Normalization(RMSNorm)是现代 LLM 主流的归一化方法,核心结构为先做归一化 Norm(x) = x/||x|| 再做可学习缩放 γ⊙Norm(x),数学表达为 RMSNorm(x; γ) = γ⊙Norm(x)。相比 LayerNorm,RMSNorm 省略了均值中心化(减去均值再除以标准差),只保留按均方根缩放,因此计算更简单、显存更省,且在实践中训练稳定性相当,因而被 Llama、Qwen、Gemma 等几乎所有现代主流架构采用。
本文研究的核心对象就是 RMSNorm 中那个长期被忽视的可学习 γ 向量(论文称之为 scale vector),不懂 RMSNorm 的数学形式与工程地位,就理解不了本文在优化哪个组件,也无法理解 γ⊙x 为什么能融入到紧邻的线性映射 W 中。
Pre-Norm 架构
Pre-Norm 是 Transformer block 中归一化的一种放置方式:把 RMSNorm 放在残差加法之前,例如 X + FFN(RMSNorm(X)) 或 X + Attn(RMSNorm(X))。Llama、Qwen 等现代 LLM 都采用 Pre-Norm。关键数学性质是 RMSNorm 后面紧跟线性映射 W,因此 γ⊙x 可以被吸收到 W 中形成 W·diag(γ) 而不改变模型函数输出,从而 scale vector 在表达力(可以拟合的函数集合)上是冗余的,这是本文 Theorem 2.2 的逻辑起点。
本文所有理论结论(Theorem 2.2 必要性、Theorem 2.3 weight decay、Theorem 3.1 DP、Theorem 3.2 OR)都建立在 Pre-Norm 设定上;论文反复强调 'scale vector 在 Pre-Norm 中不增加表达力' 这一关键观察,是理解其优化价值的逻辑起点,也是判断论文哪些结论可推广到 Post-Norm 等其他架构的依据。
预条件(Preconditioning)
预条件(Preconditioning)是优化中的核心技术:在梯度下降中用矩阵 P 修改原始梯度方向 dt = -P∇L,目的是改善优化几何、加速收敛。预条件可以是固定的(如对角 rescaling、矩阵缩放)或状态依赖的。优化器如 Adam、RMSProp、Adagrad 本质上都是自适应预条件器,通过累积梯度统计量自适应调整每个参数的学习率。Krylov 子空间方法、共轭梯度法也属于预条件方法。理解预条件才能看懂 'scale vector 等价于一种轻量级状态依赖预条件器' 的核心论点。
本文核心论点之一就是 scale vector 实际上等价于一种 '自放大预条件器'(self-amplifying preconditioner):γ² 项会放大后续线性映射的有效学习率,且这种放大由当前训练状态自适应决定。这是理解全部改进方案统一视角的关键,也是区分本文工作与已有归一化改进(DyT、DeepNorm 等)的关键。
梯度流(Gradient Flow)
梯度流(Gradient Flow)是一种理论分析工具,用连续时间常微分方程 dt = -∇L(θ) 描述参数演化,代替离散的梯度下降迭代。这一设定避免了学习率选择、批次噪声、动量等离散细节干扰,便于严格证明损失的单调性与加速性。梯度流对应的解是 ODE 的精确轨迹,适合用来证明 '对所有 t>0 L_new(t) < L_old(t)' 这种严格的全局加速性,也是神经网络优化理论(如 NTK、过参数化隐式加速)的标准工具之一。
论文中所有理论结果(Theorem 2.2、3.1、3.2、D.1、D.2)都是在梯度流设定下证明加速性。理解梯度流的数学形式,才能看懂证明的逻辑结构(如 Theorem 2.2 中对 af,j = γⱼwf,j 的动力学推导、Theorem D.1 中对输入侧和输出侧 scale vector 联合动力学的分析)。SGD 部分(Theorem 2.3)则是用 SDE 近似梯度流。
Weight Decay(权重衰减)
Weight Decay(权重衰减)是在损失函数上添加 λ||θ||² 项作为正则化项,从而在梯度下降中引入 -λθ 形式的衰减项,起到正则化、限制参数规模、控制优化轨迹的作用。在 LLM 训练中,是否对 scale vector 施加 weight decay 一直存在分歧:OLMo 施加,nanoGPT 不施加,Qwen 也有变体。这一分歧源于实践中对 'scale vector 是否需要正则化' 的不同直觉,且缺乏理论指导。
本文在 Section 2.2 用大量理论与实验证明 weight decay 应该分类讨论:对 Input-Norm 的 scale vector 有益,能控制 Hessian 尖锐度(包括 λmax(∇²L)、Tr(∇²L)、||∇²L||_F),进而稳定 SGD 噪声贡献;对 Output-Norm 的 scale vector 有害,会不当地限制其表达力。这是论文最具实践价值的具体结论之一,直接给出 'IWD 原则' 这一可执行工程规范。
研究动机
在现代 LLM 的 RMSNorm 中,归一化操作 Norm(x) = x/||x|| 已经被广泛研究——从 BatchNorm 在 CV 中的成功,到 LayerNorm 在序列建模中的统治,再到 RMSNorm 在 Llama/Qwen 等模型中的简化演进,每一步都有大量理论分析。然而,与归一化操作配套存在的可学习缩放向量 γ(论文称之为 scale vector)却几乎被当作 '不重要的小细节'。以 Llama-1B 为例,整个模型 1,028,065,024 个参数中,所有 scale vector 合计只有 80,640 个参数,占比仅 7.84×10⁻⁵,参数量上确实可忽略。然而作者通过简单的消融实验发现:在 0.12B Llama 上移除所有 scale vector 后,即使单独重新调优学习率(从 4e-3 改为 2e-3),终端验证损失仍然高出约 0.015,且达到同等损失需要多训练 1.2×-1.4× 的 token。这意味着 scale vector 在训练动态上绝非可忽略,但为什么这么少参数的东西能产生这么大的训练效果?OLMo 施加 weight decay,nanoGPT 不施加,Qwen 也有变体,业界实践长期不一致。这些问题的现有文献均未给出系统答案,本文正是要填补这一空白。
本文的目标是本文目标是从表达力(expressivity)、优化(optimization)、架构结构(architectural structure)三个视角,对 scale vector 进行系统性的理论研究兼工程改进。具体而言,本文希望回答四个层次递进的问题:(1) 'scale vector 是否真的必要'——通过消融实验与梯度流理论共同证明其在训练动态中的不可替代性,即使表达力上冗余;(2) '是否应该对 scale vector 施加 weight decay'——基于 Input-Norm 与 Output-Norm 二分法,推导出 Individual Weight Decay(IWD)原则,统一 OLMo、nanoGPT、Qwen 等长期不一致的工程实践;(3) 基于上述理论理解,提出若干轻量级、零成本的 scale vector 改进方案,包括分支异构化(HG)、双侧放置(DP/DNP)、幅向重参数化(OR/ER),并给出严格加速性证明;(4) 在 0.12B 到 2B 参数的 dense 与 MoE 模型上进行工业级 token 预算(约 100 tokens/param,远超 Chinchilla 最优点)的预训练实验,验证方案的有效性、可扩展性,以及与 AdamW/Muon 优化器和 cosine/wsd 学习率 schedule 的兼容性。
与已有工作不同的是,以往对归一化的研究几乎全部聚焦于归一化操作本身(均值中心化与否、是否引入可学习 bias、是否用 Dynamic Tanh 完全替换归一化层等),却忽略了一个看似平凡却实际起关键作用的组件——scale vector。本文独特之处在于三个层面:第一,严格证明 scale vector 在 Pre-Norm 中 '不增加表达力'(因为 γ⊙x 可被吸收到 W 中形成 W·diag(γ))但 '显著改善优化'(通过自放大预条件),这一定理层面的 '表达力冗余—优化加速' 二象性是此前没人给出的;第二,创造性地把 RMSNorm 分类为 Input-Norm(紧跟线性映射,如标准 Pre-Norm)与 Output-Norm(不紧跟线性映射,如 Q/K-Norm、Attn/FFN Output-Norm)两类,基于此推导出 IWD(Individual Weight Decay)原则,即 wd 对前者有益、对后者有害,解决了实践界长期争论;第三,把所有改进方案(HG、DP、OR 等)统一到 '对线性映射施加秩一结构化缩放场' 这一抽象公式 W_c → diag(u_c) W_c diag(v_c) 下,并明确区分本文预条件机制与 AdamW 等基于梯度历史的预条件器,凸显本质差异。
核心方法
论文方法分四步推进。第一步 '必要性':先做消融实验发现 scale vector 不能去掉,再在 Setting 2.1 简化模型下严格证明含 scale vector 的损失 Lf(t) 严格小于无 scale vector 的 Lg(t),核心机制是 γ 与 W 的耦合产生自放大预条件器 Pf,j = γⱼ²I + wⱼwⱼ⊤。第二步 'weight decay 分类':把 RMSNorm 分为 Input-Norm(紧跟线性映射,如标准 Pre-Norm)和 Output-Norm(不紧跟线性映射,如 Q/K-Norm、Attn/FFN Output-Norm)两类,通过 SDE 分析证明 wd 对 Input-Norm 有益(控制 Hessian 尖锐度)、对 Output-Norm 有害(损害表达力),得到 IWD 原则。第三步 '三种改进':(a) 异构化(HG)— 为 Q/K/V、gate/up 分别配置独立 scale vector 以匹配分支特异的训练动力学;(b) 放置改进(DP/DNP)— 把 scale vector 从线性映射的输入侧移到输出侧或双侧,并对 Q/K 投影自然等价为 Q/K-Norm;(c) 幅向重参数化(OR/ER)— 把 γ 分解为 magnitude β 和 direction α/Norm(α) 分别优化,OR 在欧氏空间、ER 在指数空间。第四步 '统一视角':把所有方案写成 Wc → diag(uc) Wc diag(vc) 的秩一缩放场,与优化器诱导的预条件机制形成对比,证明两类预条件机制可叠加。
本文最核心的创新是揭示 scale vector 在 Pre-Norm 架构下既是 '表达力冗余' 又是 '优化加速器' 的二元性,关键创新点与已有方法的本质区别在于:传统观点(包括 LayerNorm、RMSNorm 的原始论文)把 scale vector 当作简单的逐通道可学习常数,主要用于恢复归一化操作破坏的表达力;但本文通过 Setting 2.1 的梯度流分析证明,在 γ(0)=1、W(0)=0 的初始化下,γ 与 W 的耦合动力学产生状态依赖预条件器 Pf,j(t) = γⱼ(t)²I + wf,j(t)wf,j(t)⊤,其最小特征值 λmin(Pf,j) ≥ γⱼ² ≥ 1(利用不变式 γ²-||w||²=1 推出),从而每个通道都比无 scale vector 的标量动力学更快收敛,严格证明 Lf(t) < Lg(t) 对所有 t>0 成立。这是首个把 '看似无用的 scale vector' 与 '严格的优化加速定理' 联系起来的理论结果,直接导致后续 IWD、HG、DP、OR 等改进方案都有严格的瞬时或全局加速保证(Theorem 3.1、3.2、D.1、D.2)。
方法步骤详情
完整方法流程可概括为以下步骤。步骤一(消融实验):训练 0.12B Llama,对比 w/ 与 w/o scale vector,分别在相同峰值 lr(4e-3)和单独调优 lr(2e-3)两种设定下记录验证损失曲线;观察到前者终端损失低 0.028 且有 1.4× token 效率,后者仍低 0.015,作为经验现象。步骤二(必要性证明):在 Setting 2.1 下构造含/不含 scale vector 的两个学生模型 f 与 g,目标函数 f⋆(x) = W⋆Norm(x),证明梯度流下 Lf(t) < Lg(t) 对所有 t>0 严格成立,关键是定义有效参数 af,j = γⱼwf,j 并推导出其预条件动力学 dt = (γⱼ²I + wf,jwf,j⊤)(w⋆,j - af,j)。步骤三(weight decay 分类):训练 Gemma-0.5B,分别设置 wd 对所有 scale vector、仅 Input-Norm、仅 Output-Norm 三组,10B 与 50B token 两个预算下对比,验证 IWD 原则。步骤四(异构化 HG):把 Q/K/V、gate/up 共用 γ 改为分支独立 γQ/γK/γV/γgate/γup,基于理论动机 '不同分支应使用不同预条件器'。步骤五(放置改进):依次尝试 AP(移到输出侧)、DP(双侧)、DNP(双侧且中间加归一化),其中 DNP 在 Q/K 投影上等价于 Q/K-Norm;Theorem 3.1 证明 DP 在相同有效状态下瞬时损失下降率不小于基线。步骤六(幅向重参数化):OR 形式 γ = β · Norm(α),ER 形式 γ = e^β · e^(α-mean(α));Theorem 3.2 证明 OR 引入各向异性预条件器 d·(γ̂γ̂⊤) + ρ·(I - γ̂γ̂⊤),在 magnitude 方向上放大倍数 d,加速规模调整。步骤七(统一策略):把 HG + DNP + OR + IWD 组合,在 0.12B-1B dense 与 0.25B-2B MoE 上与强基线对比;同时验证与 Muon 优化器及 wsd 学习率 schedule 兼容。
技术新颖性
本文的技术新颖性主要体现在三个层面。第一层面是理论新颖性:首次严格证明了 scale vector 在 Pre-Norm 中 '不增加表达力' 却 '显著改善优化' 的二元性,给出了基于自放大预条件器的统一动力学解释(Theorem 2.2),并将该结论推广到 SDE 框架分析 weight decay 对 Hessian 尖锐度的影响(Theorem 2.3)。第二层面是设计新颖性:把 scale vector 设计抽象为 Wc → diag(uc)Wc diag(vc) 的秩一缩放场,统一了 HG/AP/DP/OR/ER 等多种变体,且每种变体都有瞬时加速的严格理论保证(Theorem 3.1、3.2),这是与已有的归一化改进工作(如 DyT、DeepNorm 等)本质不同的轻量级参数化设计。第三层面是实践新颖性:IWD 原则解决了 OLMo/nanoGPT/Qwen 长期不一致的工程实践问题,作者也坦诚承认 '本文采用 IWD 原则后,这些实现都可以统一'。值得注意的是,所有改进加起来的参数开销在 Llama-1B 上仅为 7.85×10⁻⁵,wall-clock time 仅 1.04×,几乎可忽略。
实验结果
实验结果可分四组分析。第一组是消融(Figure 1):0.12B Llama 在相同峰值 lr(4e-3)下,带 scale vector 的模型终端损失比不带低约 0.028,达到相同损失节省 1.4× token;即便为不带 scale vector 的模型单独调优 lr(2e-3),其终端损失仍比带 scale vector 的高约 0.015。第二组是 weight decay 分类(Figure 3):在 Gemma-0.5B 上,10B token 时,no wd: Input-Norm 优于 no wd: none(对所有 scale vector 都不施加 wd)优于 no wd: Output-Norm;50B token 时趋势一致且差距放大,印证 IWD 原则。第三组是 step-by-step 验证(Figure 5):在 Llama-0.12B 上依次叠加 HG、AP/DP/DNP、OR/ER、IWD,相对基线的损失差最终约为 -0.02,其中 HG+DNP+OR+IWD 组合给出最低终端损失,DNP+OR 优于 DP+OR 与 DNP+ER。第四组是主结果:Dense 模型(Figure 6)在 0.12B/0.25B/0.5B/0.75B/1B 五个规模上,统一策略终端损失一致低于调优后的 Llama 基线,差距随训练持续扩大,拟合的 scaling law 给出 1.22× 的 PFLOP/s-day 效率优势;MoE 模型(Figure 7)在 0.25B-2B(A-0.11B 到 A-0.62B)五个规模上,统一策略终端损失比基线低超过 0.02,scaling law 给出 1.25× 优势,优势在 LR 稳定相持续扩大且在衰减相不缩小。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 0.12B Llama 预训练(同 lr 4e-3) | 验证损失 + token 效率 | w/ scale vectors, 终端损失 -0.028, 1.4× token 效率 | w/o scale vectors, 4e-3 | 终端损失降 0.028, 同等损失节省 1.4× token |
| 0.12B Llama 预训练(分别调优 lr) | 验证损失 | w/ scale vectors, lr=4e-3, 终端损失 -0.015 | w/o scale vectors, lr=2e-3(单独调优) | 即便给基线专门调优 lr, 仍低 0.015 |
| Dense 0.12B-1B 统一策略 vs 基线 | 终端损失 + scaling law 效率 | HG+DNP+OR+IWD, scaling law 1.22× | 调优后的 Llama 基线 | 所有规模均低终端损失, 1.22× PFLOP/s-day 效率 |
| MoE 0.25B-2B 统一策略 vs 基线 | 终端损失 + scaling law 效率 | 统一策略, 终端损失 >0.02 低于基线, 1.25× 效率 | 调优后的 Llama-MoE 基线 | 全部 5 个 MoE 规模均 >0.02 改进, scaling law 1.25× |
| Muon 优化器兼容性 | 终端损失 | Dense-0.12B: -0.0156, Dense-0.5B: -0.0167, MoE-0.5B: -0.0187 | Muon 基线(强基线) | 在 Muon 优化器下仍稳定 >0.015 的终端损失改进 |
| 参数公平消融 | 终端损失 vs 同参数量基线 | HG+DNP+OR+IWD (0.11985B), 终端损失 -0.033 | Llama-large (0.11985B, 通过 FFN 宽度对齐参数量) | 终端损失降 0.033, 而单纯加宽 FFN 几乎无收益 |
局限与改进
作者承认的局限主要在以下几方面。第一,本文所有严格理论结果都建立在 Setting 2.1 的简化模型上(标量输出、平方损失、x∼N(0,I)),这一设定捕捉了 Pre-Norm 中线性映射 + scale vector 的核心结构,但难以完全反映真实 LLM 中的多层耦合、残差流、注意力等复杂交互,虽然 SDE 推广(Theorem 2.3)部分缓解了这一点。第二,IWD 原则基于 Output-Norm 是否直接参数化 submodule 输出的二分判断,但实际架构中可能存在混合情况,论文承认 '未来需扩展到更广义的归一化拓扑'。第三,统一策略的所有改进目前只在 0.12B-2B 范围内验证,论文 'fitted scaling laws also suggest these gains persist at larger scales',但未在 7B+ 规模实际验证。我的额外观察:第一,DNP 在 attention 投影上等价于 Q/K-Norm,但 DNP 在其他投影上引入了额外归一化层,这是否会与已有的 post-attention、post-FFN RMSNorm 产生冗余或冲突,论文没有详细讨论;第二,论文在 Llama 架构上做了实验,但在 Qwen3 等用 Q/K-Norm 的架构上,DNP 会自然让某些 scale vector 变成 Output-Norm 类型,这是否会破坏 IWD 原则的对称美,值得进一步验证;第三,作者论文提到 Muon 仍用 AdamW 优化 scale vector,因此统一策略与 Muon 兼容,但这一点反过来也暗示 scale vector 的改进空间可能与优化器选择有耦合,值得探索是否针对不同优化器需要不同的 scale vector 策略。
独立分析的弱点
独立分析本文存在几个值得关注的具体弱点。第一,Setting 2.1 的理论简化非常强:它假设 x∼N(0,I) 且目标函数是线性 Norm(x),这与真实 LLM 中输入分布随层数变化、残差流将多源信号叠加、目标函数涉及 attention softmax 等复杂结构差距明显。虽然作者在 SDE 部分做了推广,但严格的全架构理论缺失,使得结论在大模型上的可推广性只能依赖实验验证而非理论保证。第二,Figure 5 的 step-by-step 验证表明 DNP+OR 优于 DP+OR,但 OR 与 ER 哪个更好的结论在不同上下文不一致(DNP+OR 略优于 DNP+ER,但在 DP 设定下 ER 反超),作者未给出清晰的指导原则,实践者难以判断该选哪个。第三,所有改进都假定线性映射存在且标准,但对于 LLaMA-2/3 中 GQA(Grouped Query Attention)结构,K/V 投影维度小于 Q,此时分支异构化的 γK/γV 维度处理可能引入额外工程复杂性,论文未讨论。第四,HG 在标准 attention 中引入 3 个独立 γ,Q 与 K 共享部分维度的设计在 DNP+Q/K-Norm 下会产生冗余(同一 γ 被两次优化),论文没有显式处理这种参数耦合。改进方向:针对 (1) 需要更接近真实 LLM 的理论模型,如多层耦合的 NTK 框架;针对 (2) 应在更多架构、更大规模上系统对比 OR vs ER 并给出选择启发;针对 (3) 应在 GQA 等变体上做专项实验验证参数开销与收益;针对 (4) 应在数学上明确 HG 与 DNP 共存时的参数共享方案。
未来方向
作者明确提出的未来方向包括:扩展理论分析到更广泛的架构(如 Post-Norm、混合 Norm),以及研究 scale vector 设计如何随模型规模演化。作者未提但基于本文成果可延伸的方向非常丰富。第一,把本文的 '秩一缩放场' 推广到秩 r 缩放场 Wc → Σdiag(uc,k) Wc diag(vc,k),可能获得更强的预条件能力但代价是 O(r·(d1+d2)) 额外参数。第二,与已有的 FFN 内部结构(如 sparse MoE、shared expert)结合,探索 per-expert 的异构化 scale vector。第三,把 IWD 原则形式化推广到更多归一化变体如 LayerNorm、BatchNorm,以及最近的 DyT 等 '无归一化' 替代方案,理解它们与 scale vector 的关系。第四,本文揭示 scale vector 引入预条件机制,可与 KFAC、Shampoo、Soap 等二阶优化器结合,理论上两类预条件可叠加,实验上验证能否获得额外收益。第五,从可解释性视角,观察 HG 后不同分支的 γ 数值差异能否揭示 Q/K/V 的功能分工。第六,本文实验截止到 2B,验证 7B+ 规模乃至 GPT-4 级别的可扩展性是必然下一步。
复现评估
复现性评估整体良好。代码与模型配置方面,作者使用 Llama 与 Llama-MoE 两种主流架构,提供了完整的模型超参(Table 4、Table 5)包括 dmodel、nhead、nlayer、batch size、lr_max,以及 Muon 和 wsd 的具体设置(Appendix B.1.2),且实验在 H100 80G GPU 上进行,所有 dense 模型 0.12B/0.25B/0.5B/0.75B/1B 都在普通 GPU 集群上可在数天内完成,但完整 MoE 实验(2B 模型 + 60B token)需要工业级算力。数据方面使用 '高质量策划的预训练语料' 但未具体公开数据集名称,降低了部分可复现性;token 预算约为 100 tokens/param,远超 Chinchilla 最优点,更接近工业实践,这意味着完整复现 2B 实验至少需要 ~200B tokens。优化细节方面,AdamW 用 β1=0.9、β2=0.95、wd=0.1、grad clip=1.0,cosine schedule 衰减到 lr_max/20,这些都与 Llama 标准实践一致。论文目前没有显式公开代码仓库链接,但作者来自 ByteDance Seed 且工作发表于 arXiv,开源可能性较高。综合评估:小规模消融实验(0.12B + ~10B tokens)在公开 GPU 上 1-2 天可复现;中等规模(0.5B dense + 50B tokens)需要约一周;完整 2B MoE 实验需要工业级资源,复现难度中等偏低。
论文图表
左右两幅子图。左图在相同峰值学习率(4e-3)下对比 w/ 与 w/o scale vectors,带 scale vectors 的模型在所有 token 预算下损失都更低,终端低约 0.028,达到同等损失节省 1.4× token。右图为 w/o scale vectors 模型单独调优 lr(2e-3)后再对比,即便如此其终端损失仍比带 scale vectors 的高约 0.015,1.2× token 仍然不足。两幅图都用训练 token 数(billions)作横轴,验证损失作纵轴,曲线非常清晰。
这是全文最核心的实验动机图,用最简单直接的消融回答了 'scale vector 是否真的无关紧要' 这一基础问题,直接驱动后续理论分析与改进方案设计。任何对本文动机感兴趣的读者都应首先看这张图,它确立了 '规模可忽略 ≠ 作用可忽略' 的核心张力,也是论文标题 'Negligible in Size, Significant in Effect' 的实证基础。