损失函数看不见基底,而 Adam 看得见 The Loss Does Not See the Basis, but Adam Does
以规范等变性为准绳:等变优化器继承梯度流的低秩偏置,Adam 等逐坐标方法则依赖任意基底选解。
前置知识
规范对称性(gauge symmetry)
因式分解模型 $W=UV^\top$ 中,对任意正交矩阵 $Q\in O(k)$,变换 $(U,V)\mapsto(UQ,VQ)$ 不改变乘积 $W$,因而 $L(U,V)=f(UV^\top)$ 完全不变。也就是说,两个因子的列向量取哪组基底是模型描述中的自由度,类似物理中的规范自由:它不影响模型函数,却影响优化器看到的坐标。
全文的判据都建立在'损失对这个对称性不敏感'之上:作者问的是优化器是否同样不敏感。理解了规范变换,才能理解为什么 Adam 一步就能区分两个函数完全相同的初始化。
规范等变性(gauge equivariance)
若优化器从规范旋转后的初始点 $(U_0Q,V_0Q)$(状态经相应映射 $\sigma_Q$)出发,其整条轨迹都是原轨迹的规范旋转:$U_t'=U_tQ,\ V_t'=V_tQ$,则称该优化器规范等变。此时乘积 $W_t=U_tV_t^\top$ 与起点基底无关。注意等变强于'结果不变':它要求路径本身可交换。
这是本文给优化器分类的核心几何判据:GD、动量、共享标量 Adam、Muon、Shampoo 满足;Adam、RMSProp、signSGD、Lion、Adafactor 不满足,从而可被代数地判定。
隐式偏置与最小核范数解
在欠定问题上有无穷多插值解,训练算法没有显式正则项时仍会偏好其中某些解,称为隐式偏置。经典结果(Gunasekar et al. 2017;Arora et al. 2019;Li et al. 2021):从微小初始化出发的梯度流在因式分解模型上收敛到近似最小核范数 $\min\|X\|_*$ 的插值解,核范数强力促进低秩。
本文要回答的正是'哪些部署中的优化器能继承这一偏置'。文中用最小核范数解(恢复误差 0.0335)作为凸基准来校准各优化器恢复误差的绝对水平。
矩阵感知(matrix sensing)任务
从线性测量 $y_i=\langle A_i,X_*\rangle$ 恢复 planted 低秩矩阵 $X_*=U_*V_*^\top$。文中设置 $n=40$、秩 $r_*=3$、$m=462=2\,\mathrm{dof}$ 个高斯测量($\mathrm{dof}=r_*(2n-r_*)$),全过参数化 $k=n$、初始化 $10^{-3}$、无权重衰减、跑到插值(损失 $<10^{-7}$)。
这是全文的受控试验台:参数空间欠定、真值已知,且所有方法都能插值,因此恢复误差 $\mathrm{rec}(W)=\|W-X_*\|_F/\|X_*\|_F$ 的差异只能来自'选了哪个插值解'。
谱调度(spectral schedule)
对形如 $\Phi(G)=\sum_i h(\sigma_i)u_iv_i^\top$ 的谱可分更新,$h(\sigma)$ 决定梯度各奇异方向的相对增速,是等变类内部的行为坐标:GD 对应 $h(\sigma)=\eta\sigma$(贪心,大奇异值优先),Muon 的矩阵符号/极映射对应 $h\equiv\eta$(等速率,拉平谱)。$h(\sigma)/h(\sigma_{\max})$ 度量'调度激进度'。
作者证明等变性只是低秩恢复的'门票'(必要不充分),第二根轴就是谱调度:它决定 Muon 与 GD 在谱尾相位图上的交叉,也解释了两份关于 Muon 的矛盾文献。
有效秩(effective rank, erank)
定义 $\mathrm{erank}(W)=\exp\big(-\sum_i\pi_i\log\pi_i\big)$,其中 $\pi_i=\sigma_i/\sum_j\sigma_j$ 是奇异值占比(Roy & Vetterli 2007)。它衡量谱的能量分散程度:精确秩 3 的矩阵 erank 接近 3,谱平坦的满秩矩阵接近 $n$。
文中反复强调要'恢复误差与秩联合报告':signum 的 erank(7.83)比 Shampoo(6.95)还低,恢复误差却高达 0.445——低秩但方向错误,单看秩会被误导。
研究动机
在 $W=UV^\top$ 这类因式分解模型上,从微小初始化出发的梯度下降具有著名的隐式偏置:在欠定矩阵感知上收敛到近似最小核范数的插值解(Gunasekar et al., 2017;Arora et al., 2019;Li et al., 2021),强烈偏向低秩。与之相对,Wilson et al. (2017) 早就观察到 Adam 族自适应方法虽能达到相近训练损失,测试表现却系统性更差;Xie et al. (2025) 进一步指出 Adam 的逐坐标自适应依赖坐标基底,共享标量预条件子可恢复旋转等变性。但这条线索在此止步:此前没有工作刻画'基底依赖对插值解选择的后果'——即是否存在一个准则,能判定哪些部署中的优化器保留、哪些破坏低秩归纳偏置,并可用真值实验验证排序。这个问题在注意力头中尤其要紧:每个头的 logits 只通过 $x^\top W_Q^\top W_K x$ 依赖 $(W_Q,W_K)$,携带同样的对称性。作者的孪生实验显示,两个在初始化时计算完全相同函数的 transformer,从第一个 Adam 更新起就分歧,最终每头的规范不变量 $W_Q^\top W_K$ 相对 Frobenius 距离相差 56%——而两条运行的验证精度完全相同。
本文的目标是本文的目标是为'优化器是否保留因式分解模型的低秩归纳偏置'给出一个可检验、可计算、可排序的几何判据,并完成五件事:(1)把 GD、动量、Adam、RMSProp、signSGD、Lion、Adafactor、Muon、Shampoo 这九种部署中的更新规则按规范等变性分成两类,且给出完备的结构刻画而非例子罗列;(2)在受控实验中验证分类:让所有方法都插值(训练残差归零,如 Adam 最终损失 $1.2\times10^{-11}$),从而把恢复误差差异完全归因于插值解选择;(3)把判据推广到注意力头的内部规范(两个函数相同的 transformer 为何从第一步起分道扬镳)与真实数据(两个高光谱图像补全基准);(4)调和关于 Muon 的两份矛盾报告(等速率恢复 vs 简单性偏置消失);(5)展示判据的构造性价值——诊断并修复作者自己此前发布的 FlowAdam。作者明确声明这不是推荐新 SOTA 的论文:低秩偏置温和,只在特定条件下有益。
与已有工作不同的是,独特切入角度有三。第一,此前关于 Adam 基底依赖的工作(VectorAdam、Xie et al. 2025、LoRA-RITE)研究的是参数空间整体的环境旋转或 LoRA 因子的外部变换,本文首次聚焦因式分解的'内部规范':$(U,V)\mapsto(UQ,VQ),\ Q\in O(k)$ 这条规范轨道上的等变性,并把优化器动物园放在该对称性下重新审视、用真值恢复排序。第二,GD 隐式偏置文献全部只研究梯度下降/流;本文的转移定理(定理 4.6)把其路径级结论传递到共同标量预条件流,首次系统回答'人们实际部署的优化器对这种偏置做了什么'。第三,作者提出两轴框架:等变性是必要而非充分条件——ScaledGD 等变但等速率调度(erank≈13.7)不恢复,长退火 signum 不等变却能恢复;低秩恢复还需要谱调度把动力学拉向低秩流形。这一框架用目标的'谱尾能量'统一解释了 Kang et al. (2026) 报告的 Muon 精确恢复与 Dragutinović et al. (2026) 报告的简单性偏置消失。
核心方法
直觉上:损失只看得见乘积 $W=UV^\top$,对因子的基底漠不关心;那么'尊重损失几何'的优化器也不该看见基底。而 Adam 每步用逐坐标二阶矩做除法,逐元素平方与右乘正交阵不可交换,所以 Adam 读的是任意选定的坐标基底,可以在同一条规范轨道的不同起点上选出不同的插值解。技术路线分五步:(1) 在 $L(U,V)=f(UV^\top)$ 上定义规范变换与优化器等变性(定义 3.1);(2) 由梯度协变性(引理 4.1:$\nabla_UL(UQ,VQ)=\nabla_UL(U,V)Q$)出发分类——GD/Polyak/Nesterov 动量、共享标量 Adam、Muon 的 msign(含任意有限阶 Newton–Schulz 迭代)、带阻尼 Shampoo 等变(命题 4.2);任何在零优化器状态处施加固定逐坐标非线性的更新必然破坏规范(命题 4.3);(3) 结构定理:无记忆等变规则恰好是 Gram 决定的左预条件子 $\Delta=H(GG^\top)G$(定理 4.5);(4) 转移定理:共同标量预条件流 $\dot\theta=-\nabla L(\theta)/a(t)$ 经时间重参数化 $\tau(t)=\int_0^t du/a(u)$ 后与梯度流走同一路径(定理 4.6),从而 Gunasekar/Arora/Li 的结论原样传递;(5) 在受控矩阵感知、注意力孪生、预条件 dial、谱尾相位图与高光谱真实数据上验证分类与机制。
核心创新是把'优化器保留低秩偏置吗'化为'优化器在规范对称下等变吗'这一可代数判定的性质,并给出两个精确刻画。其一是结构定理(定理 4.5):对无记忆规则,等变当且仅当更新形如 $\Phi(G)=H(GG^\top)G$,$H$ 只依赖规范不变的 Gram 矩阵 $GG^\top$——这证明四个等变成员不是碰巧的例子,而是'仅有的形状'(连 $G=0$ 处的自由度都被消除)。其二是 Adam 的精确一步缺陷(命题 4.4):零状态、偏差校正下 Adam 第一步恰为 $-\eta D_\varepsilon(G)$,其中 $D_\varepsilon(G)=G\oslash(|G|+\varepsilon)$,规范旋转造成的乘积级偏差 $E_Q(G)=D_\varepsilon(GQ)Q^\top-D_\varepsilon(G)$ 有闭式表达;在 $n=1,k=2$ 的数值例中,两个规范等价起点一步后的乘积分别为 $(1-\eta/(1+\varepsilon))^2$ 与 $(1-\eta/(2^{-1/2}+\varepsilon))^2$。与已有工作的本质区别:Xie et al. (2025) 等只指出 Adam 违反旋转等变性并以此解释其效率,本文则量化这种违反在插值解选择上的代价——等变方法恢复误差至多 0.286、逐坐标方法至少 0.42——并强调等变性只是'门票',类内还差一根谱调度轴(GD 的 $h(\sigma)=\eta\sigma$ 贪心 vs Muon 的 $h\equiv\eta$ 等速率),两轴共同决定选出的插值解。
方法步骤详情
第一步(设定):考虑 $L(U,V)=f(UV^\top)$,规范群 $O(k)$ 作用于共享潜维;测试任务为矩阵感知——真值 $X_*=U_*V_*^\top$,$n=40$、秩 3、$m=462=2\,\mathrm{dof}$ 个高斯测量,$k=n$ 全过参数化、初始化尺度 $10^{-3}$、无权重衰减,所有方法跑到插值(损失 $<10^{-7}$,每 200 步检查)。输出指标为恢复误差 $\mathrm{rec}(W)=\|W-X_*\|_F/\|X_*\|_F$ 与 $\mathrm{erank}$。第二步(分类):逐规则验证等变性,例如 Shampoo 的左累积量 $L_t=\sum G_uG_u^\top$ 规范不变、右累积量 $R_t\mapsto Q^\top R_tQ$ 共轭;反例如 sign 算子——$G=(1,1)$ 旋转 $\pi/4$ 后先 sign 得 $(0,1)$,而先 sign 再旋转得 $(0,\sqrt2)$,两者不等。第三步(类内坐标):命题 A.1 证明谱可分等变映射由单变量谱传递函数 $h(\sigma)$ 刻画,GD 为 $h(\sigma)=\eta\sigma$,精确极映射为 $h\equiv\eta$。第四步(隔离机制):构造 Adam-$p$ dial,把分母从 $(\sqrt{\hat v}+\varepsilon)^p(\bar s+\varepsilon)^{1-p}$ 随 $p\in[0,1]$ 变化,$\bar s$ 是对两因子所有 $\hat v$ 求算术平均的规范不变标量(等于 Frobenius 范数统计量),动量与自适应全程不变,$p=1$ 即标准 Adam、$p=0$ 即 scalar-Adam。第五步(诊断协议):注意力孪生三元组——规范孪生(每头用随机正交 $A_h$ 变换 $(W_Q,W_K)$)、$A=I$ 孪生(应逐位相同)、噪声孪生(同基底扰动 $10^{-7}$)——区分结构性规范分裂与数值混沌。第六步(真实数据):Indian Pines(2000 像素 × 200 波段)与 Pavia University(103 波段)上 rank-48 补全,匹配训练损失比较 held-out RMSE。
技术新颖性
技术新颖性:(1) 结构定理是完备刻画而非清单——在无记忆类里,等变性把更新形式锁死为 $H(GG^\top)G$,这在研究'未分解参数化旋转等变性'的文献(VectorAdam 等)中没有对应物。(2) 把平衡性与等变性剥离:命题 A.4 证明 $B_t=U^\top U-V^\top V$ 守恒是共同标量预条件流的性质,Muon 与 Shampoo 严重不平衡(最终 $\|B_T\|_F$ 达 1.47–1.65,GD 仅 0.06)却仍保持偏置——纠正了'Noether 守恒量即隐式偏置来源'的直觉。(3) 孪生三元组协议本身是方法学贡献:能区分 Adam 的结构性规范分裂(比 $100\times$ 更强的噪声孪生仍高出 $39\times$)与 Muon 的 msign 数值混沌(规范孪生与噪声孪生走同一条曲线,步 100 后平均仅差 0.05 个数量级)。(4) 构造性自证:用判据回溯诊断作者自己的 FlowAdam——逐坐标速度裁剪 $v\mapsto\mathrm{clip}(v,-c,c)$ 正是破坏等变的元凶,换成全局范数裁剪即恢复偏置注入。(5) dial 是第一条把'预条件子各向异性'作为连续变量隔离出来的实验设计,把 Wilson et al. (2017) 的定性观察细化为单调可调关系。
实验结果
(1)优化器动物园(§5,Table 2/Figure 1):九种规则在 $40\times40$、秩 3、$m=462$ 的感知任务上全部插值,恢复误差干净分成两簇——等变类 Muon $0.0000$(未舍入 $6.8\times10^{-6}$,erank 2.95)、GD $0.1312$、scalar-Adam $0.2010$、Shampoo $0.2856$;逐坐标类 Lion $0.4248$、signum $0.4454$、RMSProp $0.5266$、Adafactor $0.5430$、Adam $0.5734$(erank 14.37),中间留 0.14 空隙。最小核范数凸基准 0.0335;Muon 超越凸基准(在核范最小化失效的那颗种子上仍恢复 $X_*$)。10 种子阶梯把 9/9 分类保持到 $n=256$(Shampoo 未调参与长退火 signum 两个标注例外)。(2)注意力孪生(§6,Table 3/Figure 2):Adam 规范孪生第 1 步 logit 相对距离 $3.6\times10^{-3}$,约为噪声孪生($2.9\times10^{-7}$)的一万倍,最终饱和 0.77,逐头 $W_Q^\top W_K$ 差 56%;SGD/scalar-Adam 停在浮点噪声级;GPU float64 下等变方法第 1 步仅 $2.8\times10^{-16}$–$1.1\times10^{-15}$,Adam 为 $6.5$–$11\times10^{-3}$;6 层字符级 LM 在相同 minibatch 流下 Adam 第一步分裂 $2.2$–$2.4\times10^{-3}$,验证损失几乎相同(1.579 vs 1.585)而 logit 分布相距 0.36–0.37。(3)Dial(§7,Figure 3):$p$ 从 1 降到 0,恢复单调 0.570→0.201、erank 14.5→5.4,固定步长臂一致;代价是插值步数约 8 倍(400→3200)。(4)谱尾相位图(§8,Table 4/Figure 4):$\tau=0$ 时 Muon 精确(0.000)、GD 0.112、Shampoo 0.334、Adam 0.542;τ≈0.2(约 4% 尾能量)处 Muon 让位 GD;Adam 在所有 τ 都最差。命题 8.1 的两时间尺度模型解释机制:贪心调度下头部达到 $(1-\delta)s_1$ 时尾部仍被压在 $C_{\delta,\rho}s_1(w_0/s_1)^{1-\rho}\to0$,等速率下 $w_2(T_1)=s_2$ 与初始化无关。(5)真实数据(§9,Table 5/Figure 5):rank-48 高光谱补全、匹配训练损失 ≤$10^{-5}$ 时,Indian Pines 在 $m/\mathrm{dof}\approx1.15$ 上 GD 1.481 vs Adam 2.600(RMSE ×$10^{-2}$,+43.0%),1.9 上 +27.6%;Pavia +43.8%/+22.9%,四种子全赢;GD 有效秩 11 vs Adam 28(场景内禀秩 24),Adam 越拟合测试越差(训练损失 3e-4→3e-5 时 held-out 0.0251→0.0268)。(6)FlowAdam 修复(§10):全局范数裁剪单独把恢复 0.347→0.220(+37%),加 dial 后 FlowAdam-p 达 0.169 vs Adam 0.573,erank 4.8–5.4 最接近 GD 的 4.51。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 矩阵感知真值恢复(40×40,秩3,m=462,全部插值,无权重衰减) | 恢复误差 rec(越低越好) | Muon 0.0000(未舍入 6.8e-6),erank 2.95 | Adam 0.5734(erank 14.37);最小核范数凸基准 0.0335 | 等变簇 0.00–0.286 与逐坐标簇 0.42–0.57 之间 0.14 空隙;Muon 相对 Adam 恢复误差降低约四个数量级,且超越凸基准 |
| 注意力孪生(mod-47,2层4头 d=64,全批 CPU 确定性) | 规范孪生 logit 相对距离(第1步/最终)与 QK 不变量 Frobenius 距离 | Adam:3.6e-3(第1步)→0.77(最终);W_Q^T W_K 相差 56% | 噪声孪生第1步 2.9e-7;SGD/scalar-Adam 停在浮点噪声(≈2.9e-7/1.6e-7) | 结构性分裂高出噪声放大 4 个数量级;GPU float64 下等变方法第1步 2.8e-16–1.1e-15,比 Adam 低 12–13 个数量级 |
| Adam-p 预条件 dial(同 zoo 任务,共享学习率网格) | 恢复误差 / 有效秩 | p=0:0.201 / erank 5.4(n=128 H100:0.40 / erank 12.0) | p=1(标准 Adam):0.570 / erank 14.5(n=128:0.67 / 36.6) | 随 p 单调改善约 65%;固定步长臂在 η=1e-3 处 0.576→0.201,趋势一致 |
| 谱尾相位图(planted 尾幅值 τ 扫描,10 种子,float64) | 恢复误差 | τ=0:Muon 0.000、GD 0.112、Shampoo 0.334 | Adam 0.542(所有 τ 最差);τ=0.2 处 Muon 0.354 vs GD 0.351 | 定位交叉边界 τ*≈0.2(≈4% 尾能量):低尾 Muon 最优、高尾 GD 胜出,且不依赖衰减调度 |
| Indian Pines 高光谱补全(rank-48,无 wd,匹配训练损失≤1e-5,4 种子) | held-out RMSE(×1e-2)与有效秩 | GD 1.481±0.013,有效秩 11 | Adam 2.600±0.047,有效秩 28 | +43.0%(m/dof≈1.15,每个种子都赢);m/dof≈1.9 时 +27.6%;Pavia University 为 +43.8%/+22.9% |
| FlowAdam 修复(同 zoo 任务,3×1e4 步预算) | 恢复误差 / 有效秩 | FlowAdam-p 0.169,erank 4.8–5.4 | 原 FlowAdam(逐坐标裁剪)0.347;Adam 0.573;GD 0.131 | 全局范数裁剪单独 +37%(0.347→0.220);FlowAdam-p 相对 Adam 降低约 70%,同学习率下比纯 dial 再好 15.9% |
局限与改进
作者承认的局限:这不是实践处方——低秩偏置温和,只在最优显式正则本身温和且方向对齐时赢过调好的权重衰减;在需要强正则的场景(稀疏观测、病态低秩目标)flow 反而有害;PINNs 等刚性问题上各向异性(Adam 式)优化更合适;LoRA 固定秩从根上破坏该机制;grokking 需要权重衰减类持续力,几何流没有对应物。理论上的空隙:转移定理只覆盖无记忆共同标量流,scalar-Adam 的一阶 EMA 一致性只是'经验观察',Muon/Shampoo 等有状态成员完全在定理之外。实验上作者留了两个未调参例外:Shampoo(λ=1)随规模退化,n=64 起超过 Adam(n=96 又略低于);长退火 signum 能把非等变方法带到零恢复——因此 Figure 1 的'空隙'是关于此计算预算与规模范围的陈述,而非渐近原理。我自己的观察:等变≠赢——Muon 在 Indian Pines 两个密度上都输给 Adam(3.397/3.210 vs 2.600/1.718),说明真实数据的谱调度维度可能主导判据;高光谱 +43% 的优势依赖 train-only 学习率选择规则,若各方法按自身 held-out 最优选率,GD 只领先 13%,协议敏感性偏高;模型合并的推论只是不变量测量的推论,未做端到端合并实验;scalar-Adam 在高光谱网格欠采样下未能复现现象;整体实验规模仍属中小(矩阵至 2000×200、transformer 至 6 层、阶梯至 n=256)。
独立分析的弱点
独立分析的弱点:(1)判据是二值的,行为预测要靠第二根谱调度轴,而这根轴目前只是启发式坐标 $h(\sigma)/h(\sigma_{\max})$——只对谱可分的无记忆映射有精确定义,Muon/Shampoo 这类有状态方法只有一阶理想化;相位边界 τ*≈0.2 来自 10 种子经验扫描,命题 8.1 是解耦平衡标量模型的理想化,不能给出 τ* 的先验预测。改进方向:建立带模式间相互作用的调度动力学定理,从测量设计与目标谱直接估计边界。(2)注意力实验范围窄:只研究 $W_Q,W_K$ 的头内规范,未覆盖 $W_V,W_O$(其规范作用方式不同),也没量化 qk-norm、bias 项等打破规范的组件在真实 LLM 配置下的影响,56% 的 QK 分裂对下游能力的后果未测。改进:在带 qk-norm 的现代架构上重复孪生实验,并把规范分裂与可测能力关联。(3)协议依赖:高光谱结论对学习率选择规则敏感(train-only 规则 +43% vs 各自最优 +13%),应报告多种选择规则下的区间。(4)缺下游大模型证据:p=0 修复偏置但插值步数慢约 8 倍,速度-偏置权衡只在玩具任务上定价;应在 LoRA 微调或中小型 LLM 训练上实测 scalar-Adam/Adam-p 的真实成本收益。
未来方向
作者提出的方向:(1)完整动力学定理——沿 Kang et al. (2026) 的路线刻画'等变 × 贪心调度'区域的边界,ScaledGD(等速率极端)与 signum(大步展平极端)是两轴端点,命题 8.1 只是解耦近似;(2)动量不变性引理——证明一阶 EMA(线性且保规范)保持流的极限点,把转移定理推广到带动量方法,使 scalar-Adam 与梯度流的一致性从经验观察升级为定理;(3)随机性理论——刻画 minibatch 噪声扩散项与规范的交互以及 Muon 的 msign 混沌,作者建议用商几何框架(Aladrah et al., 2026);(4)规范感知的不变优化器设计(附录 F)。基于本文成果可延伸的方向:把孪生三元组(规范孪生/A=I 孪生/噪声孪生)做成训练管线的常规诊断工具,用于检测生产级优化器是否在'读基底';规范感知的模型合并——先逐头 Procrustes 对齐再平均、且只在 $W_Q^\top W_K$ 一致时合并——值得端到端验证,因为本文只测量了不变量分歧(56%)而未实验合并本身;把 dial 思想推广到 Shampoo 的阻尼 λ、逆根刷新频率等'谱平坦度旋钮',形成统一的规范-调度设计空间;研究持续学习中逐坐标预条件子'记住'旧基底导致的规范漂移与灾难性遗忘的关系。
复现评估
复现条件良好:代码、随机种子与全部控制条件(调度对称化、学习率曲线、初始化变体、噪声孪生缩放等)开源在 https://github.com/idevender/loss-basis-adam。算力门槛低——机制实验在 CPU 上数分钟完成,只有 H100 复现阶梯(n=64–256、10 种子)和更大的注意力孪生需要 GPU。数据可得:合成矩阵感知自生成,两个高光谱场景为公开数据集(Indian Pines AVIRIS 修正版、Pavia University ROSIS)。附录 C 详列超参:Adam β=(0.9,0.999)、ε=1e-8;Muon 动量 0.9、Newton–Schulz 5 次迭代、系数 (3.4445, −4.7750, 2.0315);Shampoo 累积 L/R、λ=1、每 20 步刷新;zoo 种子 {42,123,456};插值阈值 1e-7、每 200 步检查。复现注意事项:表格数字对学习率网格敏感(0.01 以下差异属网格效应,如 GD 在更细网格读 0.113 而非 0.131);高光谱实验必须照抄 train-only 学习率选择规则,否则 +43% 会变 +13%;dial 的 p=0 分母在不同代码路径有 ¯s+2ε 与 ¯s+ε 的 O(ε) 差异(可忽略)。理论部分自洽可独立验证(§1–11 自含,全部证明在附录 B)。总体复现难度:中等偏低——实验轻量、协议文档详尽,但要精确对上表格数字需要复制相同的网格与选择规则。
论文图表