← 返回 2026-09-01

归一化低秩适配(NoRA) Normalized Low-Rank Adaptation

Jiale Kang, Ziyin Yue, Zheng Zhan, Yangyi Huang, Weiyang Liu 📅 2026-08-31 👍 37 2026-09-01 18:30
LoRA 优化动力学 参数高效微调 大语言模型 预条件子

沿秩维度归一化LoRA下投影矩阵,零额外参数即可加速收敛、提升性能与稳定性

前置知识

LoRA(低秩适配)

LoRA 将预训练权重的更新参数化为 $\Delta W = \alpha B A$,其中下投影 $A \in \mathbb{R}^{r \times k}$ 随机初始化、上投影 $B \in \mathbb{R}^{d \times r}$ 零初始化,$r \ll \min(d,k)$。由于 $B^{(0)}=0$,初始时刻 $\partial \mathcal{L}/\partial A = 0$、$\partial \mathcal{L}/\partial B = \alpha G A^{(0)\top}$,即训练最早期动力学完全由 $A$ 的随机特征决定。

NoRA 的全部改动都发生在下投影 $A$ 上(沿秩维度归一化),不理解 LoRA 的参数化与梯度结构就无法理解本文的动机和理论分析。

秩维度归一化

把 $A$ 的第 $j$ 列 $a_j \in \mathbb{R}^r$ 看作第 $j$ 个输入坐标到 $r$ 维潜在空间的投影向量,NoRA 将每列除以 $\max(\|a_j\|_2, \epsilon)$,使所有列的二范数恒为 1。关键在于归一化'沿秩维度'(对列)而非'沿输入维度'(对行):消融实验显示行归一化 Norm_k 平均分仅 29.75,几乎无收益,而列归一化 Norm_r 达 37.16。

这是本文方法的核心操作,'沿哪个维度归一化'直接决定方法有效性,也是读懂表 3 消融实验的前提。

隐式预条件子(preconditioner)

初始时刻 LoRA 一步梯度引起的合并权重变化为 $\Delta W = -\eta G P$,其中 $P = \alpha^2 A^\top A \in \mathbb{R}^{k \times k}$ 是秩为 $r$ 的半正定矩阵,作用在输入坐标上——这正是曲率类方法放置输入侧预条件子的位置。$P$ 的对角元 $\alpha^2 \|a_j\|_2^2$ 相当于每个输入坐标的私有学习率,非对角元则是秩瓶颈导致的坐标间串扰。

论文用它解释 NoRA 为何有效:归一化使 $\mathrm{Diag}(P)=I$,适配器梯度范数在期望中匹配全量微调,这是全文的理论支柱。

MLA(多头潜在注意力)

MLA 在构造低维潜在特征时使用 $\phi(x) = \mathrm{Norm}(Ax)$,即对潜在表示归一化后再送入上投影,这种归一化潜在瓶颈被证明能显著稳定训练、改善收敛。但 $\mathrm{Norm}(Ax)$ 依赖输入 $x$,使变换对 $x$ 非线性,无法像 LoRA 那样无损合并回预训练权重。

NoRA 的灵感直接来自 MLA;论文的核心问题就是把 MLA 的归一化收益从'潜在特征'迁移到'低秩投影本身'以保住可合并性。

RLVR(可验证奖励的强化学习)

RLVR 指用有确定性判分标准的奖励(如数学题答案是否正确)做强化学习后训练。本文采用 DAPO 目标,在 DAPO-Math-17K 数据集上训练 DeepSeek-R1-Distill-Qwen-1.5B,评测 AIME24/25、AMC、HMMT、MATH500、Minerva。此前研究(Yin et al., 2025)指出谱初始化类 PEFT 方法在此设定下容易优化不稳定。

RLVR 是检验 NoRA 鲁棒性的关键场景:PiSSA 在其中崩塌至平均 0.2 分,而 NoRA 稳定提升,这构成方法最鲜明的对照证据。

研究动机

LoRA 应用极广但其优化动力学长期缺乏理解。标准 LoRA 以 $\Delta W = \alpha B A$ 参数化更新,$A$ 随机初始化、$B$ 零初始化,因此早期优化完全由 $A$ 诱导的随机特征决定。从预条件子视角看,初始时刻 LoRA 等价于带输入侧预条件子 $P = \alpha^2 A^\top A$ 的全量微调:随机初始化使 $\mathbb{E}\|a_j\|_2^2 = r\sigma^2 \propto r/k \ll 1$,即每个输入坐标的等效学习率远小于全量微调,且以 $1/\sqrt{r}$ 的相对幅度随机波动,与数据和曲率无关。实证后果严重:SFT 中标准 LoRA 四项任务平均仅 37.93,低于全量微调的 42.07;MHA 架构预训练中标准低秩参数化甚至整体崩溃(LAMBADA 准确率归零,九项基准平均仅 27.81)。已有的谱初始化方法(PiSSA、MiLoRA)虽能加速收敛,但需要 SVD、要修改预训练权重的初始分解,且在 RL 设定下脆弱——RLVR 中 PiSSA 平均崩塌至 0.2、MiLoRA 仅 18.0。

本文的目标是本文的目标是把 MLA 中'归一化潜在表示能稳定训练、加速收敛'的经验收益迁移到标准 LoRA 上,同时严格保住 LoRA 的工程优点:对输入 $x$ 保持线性(训练后可无损合并回预训练权重)、不增加任何可训练参数、不增加推理开销。具体地,作者希望找到一种对下投影矩阵 $A$ 的正则化方式,在训练全程(或至少初始化时)控制输入坐标到潜在空间的投影尺度,消除列范数失衡,使适配器的梯度范数在期望意义上匹配全量微调;并要求该改进在预训练、监督微调(SFT)、可验证奖励强化学习(RLVR)三种范式下普遍有效,同时缓解灾难性遗忘。最终作者希望把'下投影矩阵的秩维度归一化'确立为改进 LoRA 的一条通用设计原则。

与已有工作不同的是,已有工作从不同角度改进 LoRA:PiSSA/MiLoRA 用预训练权重谱结构构造初始子空间;rsLoRA 修改秩相关缩放;DoRA 引入权重幅值分解约束;LoRA-FA/VeRA 固定随机投影;MiSS 用分块恒等矩阵作固定下投影。但没有工作系统回答:下投影矩阵 $A$ 的幅值正则化本身能否作为改进 LoRA 的独立设计维度?本文的独特切入有三点:(1) 把 MLA 的'对潜在特征归一化' $B\,\mathrm{Norm}(Ax)$ 改写为'对低秩投影本身归一化' $B\,\mathrm{Norm}(A)x$——归一化算子从依赖输入 $x$ 变为只依赖参数,从而保住线性与精确可合并性;(2) 用隐式预条件子理论给出机理解释,指出 $A$ 的列范数就是逐坐标学习率;(3) 揭示 MiSS 的固定分块恒等下投影天然满足列范数为 1,是 NoRA 的特例,把一个独立的 SOTA 方法纳入统一框架。

核心方法

直觉上,LoRA 训练早期 $B=0$ 且 $A$ 尚未更新,一步梯度带来的合并权重变化为 $\Delta W = -\eta\alpha^2 G A^\top A$,对角元 $\alpha^2\|a_j\|_2^2$ 就是输入坐标 $j$ 的'私有学习率';随机初始化让这些学习率既太小($\propto r/k$)又不均衡(相对波动 $1/\sqrt{r}$),优化先天畸形。NoRA 的做法是:把 $A \in \mathbb{R}^{r\times k}$ 按列切分,前向中计算 $\mathrm{Norm}(A)$ 使每列 $\|a_j\|_2=1$,更新变为 $\Delta y = \alpha B\,\mathrm{Norm}(A)x$;归一化只依赖参数不依赖输入,变换对 $x$ 严格线性,训练后可精确合并、推理零开销。理论表明初始化已贡献大部分收益($A$ 的梯度 $\alpha B^\top G$ 随 $B \to 0$ 消失),故又提出 NoRA-init:仅令 $A^{(0)} = \mathrm{Norm}(A_{\text{init}})$,此后按标准 LoRA 训练;结构化变体 BIMI 用分块恒等矩阵 $[I_r,\dots,I_r,E_q]$ 初始化,天然满足单位列范数。推荐配置 $\alpha:r=1:1$。

核心创新有两点。第一是归一化维度的选择:不像 MLA 对潜在特征 $\mathrm{Norm}(Ax)$ 归一化(依赖输入、破坏合并性),也不像行归一化 $\mathrm{Norm}_k$(无效,平均 29.75 vs 无归一化 29.27),而是沿秩维度对列归一化——约束每个输入坐标到 $r$ 维潜在空间的投影向量为单位长度。与已有方法的本质区别:不改变 LoRA 的线性函数形式,只约束参数的几何结构,函数类别、可合并性、参数量完全不变。第二是预条件子解释:归一化加 $\alpha=r$ 使 $\mathrm{Diag}(P)=\mathrm{Diag}(\alpha^2 A^\top A)$ 确定性等于 $I$,且 $\mathbb{E}[P]=I$,适配器梯度范数在期望中独立于秩 $r$ 地匹配全量微调;行归一化只让 $\mathrm{Diag}(P)$ 保持 $r/k$ 量级的随机值故无收益,而 BIMI 虽串扰模式完全不同、但因同样满足 $\mathrm{Diag}(P)=I$ 而表现相近(37.07 vs 37.16),证明 $P$ 的对角元才是决定性量。

方法步骤详情

方法分五步。第一步,参数化:目标层用 $\Delta W = \alpha B A$,$A \in \mathbb{R}^{r\times k}$、$B \in \mathbb{R}^{d\times r}$,$B^{(0)}=0$。第二步,选变体:NoRA 每次前向把 $A$ 的第 $j$ 列除以 $\max(\|a_j\|_2,\epsilon)$,前向为 $\Delta y = \alpha B\,\mathrm{Norm}(A)x$,列范数约束全程成立;NoRA-init 只在初始化执行一次 $A^{(0)}=\mathrm{Norm}(A_{\text{init}})$,此后与标准 LoRA 完全相同。第三步,选初始化:随机归一化可搭配任意分布(均匀、高斯、Kaiming),消融显示归一化后性能几乎一致(36.66-37.16);结构化方案 BIMI 对 $k=br+q$ 构造 $A_{\text{bimi}}=[I_r,\dots,I_r,E_q]$,$E_q$ 取 $I_r$ 前 $q$ 列,天然单位列范数。第四步,设缩放:推荐 $\alpha=r$ 使 $\mathrm{Diag}(P)=I$;$\alpha=2r$ 可进一步压低损失但加重遗忘。第五步,部署:把归一化吸收进低秩因子,$\Delta W = \alpha B\,\mathrm{Norm}(A)$ 直接合并回权重,与 LoRA 部署流程一致。

技术新颖性

技术新颖性体现在四个层面。其一,问题定义新颖:首次把'下投影矩阵的幅值正则化'确立为 LoRA 的独立设计维度,此前文献集中于秩分配(AdaLoRA)、缩放因子(rsLoRA)、谱初始化(PiSSA/MiLoRA)和结构约束(DoRA/OFT)。其二,机理分析新颖:用隐式预条件子 $P = \alpha^2 A^\top A$ 把 LoRA 解释为带输入侧预条件的全量微调,定量指出列范数即逐坐标学习率($\mathbb{E}\|a_j\|_2^2 \propto r/k$、相对波动 $1/\sqrt{r}$),并解释了为何一次初始化归一化即可捕获大部分收益——$A$ 的梯度 $\alpha B^\top G$ 随 $B$ 消失,早期学习率由 $A^{(0)}$ 唯一决定。其三,统一视角:证明 MiSS 的固定分块恒等下投影每列范数为 1,是 NoRA 的特例,把一个表面独立的方法纳入同一理论框架。其四,工程友好:无需 SVD、无需额外数据或统计量、不修改预训练权重的初始分解、保持精确可合并性与推理零开销,且在 RLVR 中稳定,恰好补上谱初始化方法的短板。

Illustration and optimization behavior of NoRA.
Figure 1: Illustration and optimization behavior of NoRA.

实验结果

论文在消融、预训练、SFT、RLVR 四类实验中系统验证。消融(表 3,Llama-3.2-3B SFT):列归一化 Norm_r 把 GSM8K+Math 平均从 29.27 提到 37.16(高斯 36.95、$U(-1,1)$ 36.66),行归一化 Norm_k 仅 29.75 几乎无收益;BIMI 达 37.07,收益与初始化分布无关。预训练(表 4,342M、10B token):MLA 下 $B\,\mathrm{Norm}(Ax)$ 平均 41.17、NoRA-init 40.64,优于 $BAx$ 的 40.36,LAMBADA 困惑度 61.83 降至 48.73/50.77;MHA 下标准低秩崩溃(平均 27.81),NoRA-init 达 39.69 且梯度健康。SFT(表 5):NoRA 四任务平均 43.37,比 LoRA 37.93 高 5.44 分,超过 MiSS 42.70、RSLoRA 41.28、全量微调 42.07;GSM8K 50.94→61.63,HumanEval 37.20→42.10;NoRA-init 已达 42.38,印证初始化贡献大头;遗忘 +0.02 优于 LoRA -0.56、MiSS -0.70;移植到 DoRA 使 38.30→43.34。RLVR(表 6,R1-Distill-Qwen-1.5B):NoRA 平均 44.4,比 LoRA 42.8 高 1.6、比基座 41.0 高 3.4,AMC 72.7 vs 68.0、MATH500 84.5 vs 81.3;PiSSA 崩塌至 0.2、MiLoRA 仅 18.0,凸显 NoRA 在 RL 中的稳定性。

Overview of representative PEFT methods categorized by their primary mechanism, including forward parameterization and initialization strategy.
Table 1: Overview of representative PEFT methods categorized by their primary mechanism, including forward parameterization and initialization strategy.
Overview of all the training settings in our experiments.
Table 2: Overview of all the training settings in our experiments.
Effect of different normalization dimensions under supervised finetuning.
Table 3: Effect of different normalization dimensions under supervised finetuning.
Zero-shot performance of 340M models trained on SlimPajama.
Table 4: Zero-shot performance of 340M models trained on SlimPajama.
Comparison of PEFT methods under supervised finetuning and retained benchmark settings.
Table 5: Comparison of PEFT methods under supervised finetuning and retained benchmark settings.
Comparison of accuracy and pass rate on the RLVR task.
Table 6: Comparison of accuracy and pass rate on the RLVR task.
Hyperparameter settings for the pretraining experiments.
Table 7: Hyperparameter settings for the pretraining experiments.
Hyperparameter settings for the Llama-3.2-3B supervised finetuning experiments.
Table 8: Hyperparameter settings for the Llama-3.2-3B supervised finetuning experiments.
Hyperparameter settings for the reinforcement learning experiments.
Table 9: Hyperparameter settings for the reinforcement learning experiments.
Training dynamics comparison of full finetuning, LoRA, PiSSA, and NoRA on the SFT task.
Figure 2: Training dynamics comparison of full finetuning, LoRA, PiSSA, and NoRA on the SFT task.
查看结构化数据
任务指标本文基线提升
SFT 四任务平均(GSM8K/Math/HumanEval/MBPP,Llama-3.2-3B) 平均准确率 43.37(NoRA) 37.93(LoRA) +5.44(且超过全量微调 42.07)
GSM8K(SFT) 准确率 61.63 50.94(LoRA) +10.69
MHA 架构 LLM 预训练零样本平均(9 项基准) 平均准确率 39.69(NoRA-init) 27.81(标准低秩 BAx,训练崩溃) +11.88
MLA 架构 LLM 预训练 LAMBADA 困惑度(越低越好) 50.77(NoRA-init) 61.83(标准低秩 BAx) -11.06
RLVR 数学推理平均(AIME24/25、AMC、HMMT、MATH500、Minerva) 平均准确率(%) 44.4(NoRA) 42.8(LoRA)/ 41.0(基座) +1.6 / +3.4
SFT 平均(NoRA 原则移植到 DoRA) 平均准确率 43.34(NoRA-DoRA) 38.30(DoRA) +5.04

局限与改进

作者承认的局限:(1) 预训练中直接归一化潜在特征的 $B\,\mathrm{Norm}(Ax)$(41.17)仍略优于可合并的 NoRA-init(40.64),保住线性可合并性有轻微代价;(2) MHA 预训练中 NoRA-init(39.69)未追平全参数 MHA(41.06);(3) $\alpha=2r$ 拟合损失更好但加重遗忘,缩放需在适配与保留间权衡。我的补充观察:(1) 预条件分析主要在初始化附近严格成立(忽略二阶项 $-\eta\alpha^2 BB^\top G$),中后期动力学只有定性论证;(2) 实验规模有限——预训练仅 342M/10B token,SFT 基于 3B,RL 基于 1.5B 蒸馏模型;(3) NoRA 完整版每次前向需计算 $k$ 个列范数并引入 $\epsilon$ 数值项;(4) 未测试与 QLoRA 量化、更大秩、嵌入/卷积层的组合;(5) 标准低秩在 MLA 下尚可、在 MHA 下崩溃(表 4),结论对架构敏感,普适性需更多证据。

独立分析的弱点

独立分析的弱点:其一,理论只覆盖早期阶段——'初始化做了大部分工作'依赖 $B$ 较小的近似,长训练或大学习率下 $A$ 的漂移会改变预条件结构,改进方向是给出全程 $\mathrm{Diag}(P)$ 演化界。其二,秩维度归一化的选择偏经验:消融排除了行归一化,但未从理论上论证为何'列范数'(而非谱范数)是最优约束对象,可比较多种约束形式对 $P$ 谱的影响。其三,RL 实验只在数学推理单一领域验证,且用了 $r=32$、$\alpha=64$,与 SFT 推荐的 $\alpha:r=1:1$ 不一致,读者难以判断 RL 下的最优缩放,应在代码生成、多语言等任务复验并扫描 $\alpha$。其四,BIMI 的分块恒等结构在 $r$ 接近 $k$ 时退化(块数 $b=1$),需单独讨论。其五,与 QLoRA 量化的兼容性未验证,而低比特部署恰是零开销改进最有吸引力的场景;归一化与优化器的交互(Adam 二阶矩、LoRA+ 差异化学习率)也未探索。

未来方向

作者提出或暗示的方向:把秩维度归一化确立为低秩适配的一般设计原则并推广到更多低秩变体(已示范 DoRA),以及用初始化/约束手段抑制低秩预训练在 MHA 架构下的崩溃。基于本文成果可延伸的方向:(1) 与谱方法互补——NoRA 不依赖 SVD 且 RL 稳定,PiSSA 擅长选择主子空间,可探索谱初始化后再做秩维度归一化的混合方案;(2) 自适应归一化——让目标范数随训练进度、层级或模块重要性变化,而非固定为 1;(3) 统一缩放理论——论文已有'$\alpha = r$ 使 $\mathrm{Diag}(P) = I$'的雏形,可进一步把 $\alpha$、$r$、归一化与 rsLoRA 类缩放纳入同一优化几何框架,给出最优配置;(4) 扩展到扩散模型、视觉 Transformer 的 LoRA 微调,以及类似 MLA 潜在归一化的架构设计;(5) 长期动力学理论:把二阶项 $-\eta\alpha^2 B B^\top G$ 纳入分析,刻画归一化约束下 $(A,B)$ 的流形优化行为与隐式正则化效应。

复现评估

复现条件评估:论文给出完整超参数(表 7-9)。预训练:FineWeb-10BT/SlimPajama,AdamW、峰值 lr $3\times10^{-4}$、cosine、batch 256、序列长 2048、20480 步、seed 42,342M 模型训 10B token,需数百 GPU 时、门槛较高但设定完全受控。SFT:PEFT-Arena 设定,Llama-3.2-3B + MetaMath/CodeFeedback,rank 32、$\alpha=32$、lr $2\times10^{-5}$、cosine、batch 128、warmup 0.3、1 epoch,目标模块 Q/K/V/O/Up/Down/Gate,单机可复现。RLVR:R1-Distill-Qwen-1.5B + DAPO-Math-17K,8 卡 bfloat16、1024 步、lr $1\times10^{-5}$、每 prompt 采样 8 条。评测用公开的 lm-evaluation-harness 与公开数据集;项目页 spherelab.ai/NoRA 提供方法说明(正文未明确开源代码链接,需到项目页确认)。总体难度中等,建议从 SFT 入手:实现只需在 LoRA 前向加列归一化(约十行代码),$\epsilon$、归一化维度、$\alpha$ 等细节正文均有交代。