ISO:面向 RLVR 的等谱优化栈 ISO: An RLVR-Native Optimization Stack
复用基模型权重奇异谱、仅优化奇异框架的 RLVR 原生优化栈
前置知识
RLVR(带可验证奖励的强化学习)
在大模型已具备基础能力后,用「能自动判对错」的任务(数学题、代码题,可用规则或测试用例验证)给出 outcome 级奖励,通过 PPO/GRPO 等 RL 算法微调策略以提升推理。奖励稀疏、只有最终结果对错,不同于 token 级监督。
整篇都在研究 RLVR 训练时「奖励信号如何转成权重更新」这一被忽视的优化层。
奇异值分解(SVD)与谱
任意权重矩阵可写为 $W=U\Sigma V^\top$:$U/V$ 是列正交矩阵(输入/输出奇异向量,合称奇异框架),$\Sigma$ 是对角阵(奇异值,即「谱」),决定各方向上的缩放幅度。$\mathcal{F}(W_0)$ 表示共享同一谱的全体矩阵族。
ISO 全部论证都建立在「谱 vs 框架」的分离上,不懂 SVD 无法理解核心创新。
Stiefel 流形、切空间与 retraction
Stiefel 流形 $\text{St}(d,r)=\{X:X^\top X=I_r\}$ 是所有列正交矩阵的集合,奇异框架 $U,V$ 就活在上面;切空间是局部「保持正交」的合法方向;retraction(本文用极分解 $\text{polar}(X)=X(X^\top X)^{-1/2}$)把优化器更新后的矩阵拉回流形。
ISO-Optimizer 和 ISO-Merger 都靠极拉回保证「固定谱」严格成立,是方法落地的关键机制。
训练无关模型合并
代表方法 Task Arithmetic、TIES 把每个专家的「任务向量」$W_i-W_0$ 在欧氏空间线性组合,靠符号消解或低秩结构减干扰;on-policy distillation(OPD)则需要额外 rollout 加蒸馏来融合多专家。
ISO-Merger 是它们的对照基线,并强调自己是首个「纯 checkpoint、零 rollout」的合并方法。
AdamW 与 Muon 优化器
AdamW 是带解耦权重衰减的自适应矩优化器,是 RLVR 主流配方;Muon 则对矩阵动量做正交化更新。本文把它们当作可插拔的「基优化器」。
ISO 不发明新优化器,而是定义变换 $\text{Opt}\mapsto\text{ISO}[\text{Opt}]$,把任意基优化器搬到框架坐标上跑。
研究动机
RLVR 已成为提升大模型推理能力的主轴,但「把奖励信号转成权重更新」的优化层几乎原封不动照搬了预训练配方。问题在于这两个阶段性质截然不同:预训练是稠密的 token 级监督,而 RLVR 是在已具备能力的策略上施加稀疏的 outcome 级奖励。直接复用 AdamW 等优化器并不显然「自然」。已有研究虽指出 RLVR 权重更新稀疏、偏离主方向、不同 run 之间高度重叠,却都停留在欧氏坐标视角,回答不了「RLVR 到底复用了什么、改写了什么」。更具体地,在 reasoning/coding 任务上从 1.5B 到 8B 的 RLVR 训练中,大家只是反复扫学习率(如 $10^{-6}$ 量级),对底层参数化结构缺乏针对性设计,导致收敛慢、训练步数多。
本文的目标是本文要回答两个层层递进的问题,并据此设计一个 RLVR 原生优化栈。第一,从谱(singular value spectrum)角度刻画 RLVR 的权重运动:谱是否稳定、这种稳定是否源于真实优化偏好、发生的小幅谱变化是否功能上必要。第二,若谱可复用,则必须保持可适应的变量是什么。最终目标是把发现变成算法:既要在在线 RLVR 中用固定基谱 $\Sigma_0$ 优化奇异框架 $(U,V)$ 以提升精度、减少训练步数(如在 Qwen3-8B 上做到 2.7× 更少步数),又要在离线场景把多个共享基底的专家直接合并成一个固定谱模型,全程不需要任何合并数据、rollout 生成、梯度更新或蒸馏。
与已有工作不同的是,本文独特切入角度是把权重视角从欧氏坐标切换到谱坐标。已有工作要么在 policy 层用 reverse-KL/KL-proximal 描述 RLVR,要么在参数层报告更新稀疏、偏离主方向,但都没给出一个能分离「复用 vs 改写」的坐标系。作者发现 RLVR 训练后的 checkpoint 几乎落在基模型 $W_0=U_0\Sigma_0V_0^\top$ 的固定谱族 $\mathcal{F}(W_0)$ 附近——奇异值几乎不变(约 $10^{-2}\%$ 漂移),只有奇异向量在变,与 SFT 大幅改写谱形成鲜明对比。作者进一步用维度感知校准 $\kappa_{spec}$ 区分「高维几何自然结果」与「真实偏好」,并直接用「恢复基谱」和「全程固定谱」两类干预证明这种谱复用在功能上必要。这是被同行忽视、却被本文抓得很准的结构性观察。
核心方法
直觉上,可把权重矩阵想象成「作用在特定方向上的力」:奇异值 $\Sigma$ 决定每个方向的力有多大(缩放),左/右奇异向量 $U,V$ 决定力作用在哪些输入方向、产生哪些输出方向。ISO 核心洞察是:RLVR 学到的「新能力」几乎全部来自「换了力作用的方向」,而非「改了力的大小」。所以与其让优化器在庞大权重空间乱撞,不如把 $\Sigma_0$ 冻住,只在「方向」子空间优化。技术路线上,ISO 不是单一数值优化器,而是把任意基优化器(AdamW/Muon)包成「在固定谱族上跑」的变换:参数化 $W(U,V)=U\Sigma_0V^\top$,对 $(U,V)$ 求梯度更新,再用极分解把因子拉回 Stiefel 流形保证奇异值严格不变。这套思路同时支撑离线合并(ISO-Merger)与在线训练(ISO-Optimizer)。
和已有方法最本质的区别在于:别的几何优化工作(Muon、DION、POET、Pion 等)多从「正交性/流形约束对训练稳定有好处」这种通用先验出发,把谱保持当作优化器设计原则;ISO 却走「证据→设计」的 RLVR 专属路线——先观察、校准、做功能干预,确认「基模型谱在 RLVR 中可功能复用、且两侧框架都必须可适应」这规律确实存在且跨阶段复现,再升格为归纳偏置。算法上 ISO 不发明新更新规则,而是定义通用变换 $\text{Opt}\mapsto\text{ISO}[\text{Opt}]$:把现有 AdamW/Muon 直接搬到 $(U,V)$ 坐标,梯度由链式法则 $G_U=G_WV\Sigma_0$、$G_V=G_W^\top U\Sigma_0$ 给出,更新后极拉回。这把「谱保持」从单一优化器技巧,变成横跨在线训练与离线合并的统一接口。
方法步骤详情
ISO-Optimizer 单步:(1) 用固定谱重构 $W=U\Sigma_0V^\top$,前向算 loss、反向得对 $W$ 的梯度 $G_W$;(2) 链式法则算框架梯度 $G_U=G_WV\Sigma_0$、$G_V=G_W^\top U\Sigma_0$,大奇异值模式的位移产生更大权重变化;(3) 用基优化器分别对 $U$、$V$ 及其状态更新得暂态因子 $\bar U,\bar V$;(4) 极拉回 $U^+=\text{polar}(\bar U)=\bar U(\bar U^\top\bar U)^{-1/2}$,重构 $W^+=U^+\Sigma_0(V^+)^\top$。ISO-Merger:对 $K$ 个共享基底专家先符号对齐,把框架位移投影到基底切空间 $\xi_{U,i}=\Pi_{U_0}(\Delta U_i)$;按 keep ratio 0.9 掩掉拖尾不稳模式;用 Gram 矩阵设「单位自保留」目标并岭稳定+clip;聚合位移再投影、极拉回得 $W^\star=U^\star\Sigma_0(V^\star)^\top$,全程零 rollout。
技术新颖性
新颖性体现在三层。第一,分析层面:用命题 2.1 把「到固定谱族的距离」精确等于 $\|\sigma(W)-\sigma(W_0)\|_2$,并用维度归一化指标 $\kappa_{spec}$ 澄清「近等谱」不能简单归因为真实偏好(RLVR 约 1.0–1.35 是 order-one,SFT 高达 89–1364),但功能干预证明谱复用确实必要。第二,结构层面:通过命题 3.1 的「未解释更新比」$u_h$ 证明,四类变换里只有「保持谱、两侧框架都可适应」给出低残差(中位仅 1.8%),而 remix 残差 87%、单侧 42–45%,且规律在 VLA 两阶段 objective-shift 上复现。第三,工程层面:ISO 把任意基优化器包成 $\text{ISO}[\cdot]$,用同一套固定谱坐标统一在线训练与离线合并,ISO-Merger 是首个真正做到「纯 checkpoint、零 rollout」的共享基底 RL 专家合并方法。
实验结果
作者给出四类证据。(1) 谱分析(Figure 2):RLVR 终点层均相对谱残差约 3%(SFT 约 35%),层级谱距离 $\delta_\Sigma$ 约 10⁻²%,比 SFT 低 2–3 个数量级;沿 Qwen3-8B 训练轨迹相对残差稳定约 1.3%。(2) 功能干预(Figure 4):把谱插值回基谱并保留 RL 框架,性能几乎不损;全程固定谱训练仍获强增益甚至超过 AdamW。(3) 结构(Figure 5):累积转移中 remix 残差 87%、单侧 42–45%,固定谱+双框架仅 1.8%。算法侧:ISO-Merger(Table 1/2)在 Qwen2.5-7B 三专家平均 63.80 vs 最强基线 62.88,DS-1.5B 双专家 44.38 vs 43.52;ISO-Optimizer(Table 3)在 Qwen3-1.7B/4B 均拿最强聚合分,4B 上 43.46 vs AdamW 41.69,用约 2.2× 更少步数;8B 上(Figure 9)ISO-AdamW 210 步达 0.509,AdamW 270 步才 0.495,省 2.7× 步数。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 多专家模型合并(Qwen2.5-7B,3 个 RL 专家) | 10 项基准平均(Coding/Tool Use/Memory) | 63.80(ISO-Merger) | 62.88(最强训练无关基线 RAM) | +0.92 平均分,worst@4 提升 1.62 点 |
| 数学推理 RLVR(Qwen3-4B-Base,average@16) | 5 项数学基准平均 | 43.46(ISO-AdamW) | 41.69(AdamW)/ 42.23(Muon) | +1.77 / +1.23,且达最强 AdamW 终点用约 2.2× 更少步数 |
| 大规模数学 RLVR(Qwen3-8B-Base) | average@16 聚合精度 | 0.509 @ 210 步(ISO-AdamW) | 0.495 @ 270 步(AdamW) | 2.7× 更少训练步数达到同一精度 |
| 代码生成 RLVR(DS-1.5B,LiveCodeBench v5/v6) | average@8 平均 | 26.20(ISO-AdamW) | 25.13(AdamW) | +1.07 |
局限与改进
作者相对坦诚,但仍有几处留白。其一,ISO[Opt] 并非「对 $W$ 做一步更新再投影到 $\mathcal{F}(W_0)$」,因此增益不能简单归因于「可行模型类变大」,但作者也承认「因子空间参数化和优化器动力学本身也是方法的一部分」,增益究竟来自谱保持的归纳偏置还是来自换坐标系带来的优化几何,并未彻底分离。其二,「近等谱是否反映真实偏好」的维度校准结论其实偏负面($\kappa_{spec}$ 为 order-one,无额外抑制),意味着把归纳偏置建立在「偏好」之上站不住,只能退而依赖功能干预,逻辑链稍弱。其三,spectrum-only 对照因自由度受限而失败,只能说明「单靠谱缩放不够」,并不能强力反向论证「谱完全不重要」。其四,实验规模上限 8B、训练步数仅几百步,离工业级 long-horizon RL 有距离;ISO-Merger 只验证了「共享基底、领域互补」的专家,未涵盖「广泛重叠的通用策略」合并场景。
独立分析的弱点
第一,可解释性弱点:增益机制不清晰。在 4B/8B 上 ISO 让模型生成更长回答(作者因此在 8B 把 8K 上限提到 16K),那么「精度提升」里有多少来自固定谱、有多少来自更长 rollout 的 test-time compute 红利?作者未做「等长回答」对照。改进:固定生成长度或长度归一化后重评,把优化层收益与长度收益解耦。第二,适用边界窄:ISO-Merger 只覆盖共享基底专家,而现实里很多团队拿不同 SFT/RL 配方训出的通用模型想合并,谱未必接近、基底也未必相同。改进:引入基底对齐/谱插值预处理,或给出谱差异度量作为可用性判据。第三,开销与显存:双因子表示名义上翻倍可训练张量与优化器状态,更大规模下 SVD 成本和因子全分片通信会上升。改进:用随机化/低秩极近似、异步 overlap rollout 摊薄。第四,校准结论与归纳偏置的张力:既然 $\kappa_{spec}$ 显示无强偏好,固定谱更像人为强加,需补「不同谱保持强度下」的消融,确认收益非来自自由度减少的正则化。
未来方向
作者点出的方向包括:与「直接在权重空间表述的谱保持优化器」系统比较;把奇异框架构造作为统一接口推广到 geometry-aware adapter 的初始化、训练与合并;在异步 RL 系统里 overlap 摊薄 retraction 开销。基于成果可延伸的方向我认为有:(1) 把 spectral inheritance 作为「训练停止信号」——既然 RLVR 主要改框架,可监测框架位移饱和度来早停省算力;(2) 把 ISO-Merger 扩到基底对齐+谱融合,统一处理非共享基底专家;(3) 探索「部分谱固定」的插值,在「完全固定谱」与「完全自由」间找自适应平衡,尤其用于 RLVR 后期微调;(4) 用等谱视角解释 RLVR 的稀疏/偏离主方向现象,建立「框架几何」与「能力获得」的因果联系。
复现评估
可复现性中等偏好。正文标注代码与项目页(§Code/§Website),关键超参写得很细:ISO-AdamW 用单一学习率 $7.5\times10^{-7}$(基线要扫 $5\times10^{-7}$ 到 $3\times10^{-6}$),keep ratio 0.9,岭稳定与 clip 范围在附录 E,训练用 Verl,数学任务在 Qwen3-1.7B/4B/8B-Base + DeepMath-103K 上跑 400 步、全局 batch 256、每 prompt 16/12 rollout、全对/全错 prompt 在线过滤,评测用 average@16、AIME24/25/AMC23/Minerva/OlympiadBench,每 20 步评一次。数据集与专家 checkpoint 均公开。算力门槛偏高:1.7B/4B/8B 多卡 RLVR 加 FP64 SVD 极拉回,作者用 DION 式分布式把 retraction 分摊到多 GPU,4B 上每步多约 86 秒,更适合有中大规模 GPU 集群的实验室复现,难点在把固定谱参数化正确接入 Verl 的 FSDP 管线。
论文图表
6 子图对比 SFT 与 RLVR 的谱行为。(a) 代表性奇异值曲线显示 SFT 大幅重塑谱、RLVR 几乎贴合基线;(b) 逐秩相对变化 RLVR 仅千分之几;(c) 层级谱距离 $\delta_\Sigma$ RLVR 比 SFT 低 2–3 个数量级;(d) 相对谱残差 $\rho_\Sigma$ RLVR 约 3% vs SFT 约 35%;(e) $\kappa_{spec}$ RLVR 为 order-one、SFT 高出 2–3 个数量级;(f) 端点示意图。
这是「谱不变」这一核心现象的直接证据,也展示了作者用维度校准澄清「近等谱≠真偏好」的严谨思路,是动机部分最关键的图。
左图(a):训练后只把谱插值回基谱 $\Sigma_0$($\alpha$ 从 1 到 0),保留 RL 框架,AIME24/25、AMC23、LCB 等各项性能基本保持,说明 RL 学到的小幅谱变化并非功能必要。右图(b):全程固定谱训练仍获强增益(ISO-AdamW 超过 AdamW),而只更新谱的 Sigma-only 对照无法复现可比性能。
这张图把「观察」升级为「功能证据」:既证明谱可复用、又证明固定谱训练行得通,是 ISO 整套设计原则的实验基石。
对 VLA 两阶段 RL 的累积转移 $W_0\!\to\!W_2$,画出四类变换的未解释更新比 $u_h$。remix(冻结两侧子空间)残差中位约 87%,单侧保留 $u_L/u_R$ 约 42–45%,而固定谱+双框架可适应 $u_{iso}$ 仅约 1.8%,覆盖语言与视觉模块(attn.qkv、mlp.down_proj 等)。
它回答「谱可复用之后,哪些变量必须可适应」,是 ISO 参数化 $W(U,V)=U\Sigma_0V^\top$ 的直接依据,决定了方法为何要保留两侧框架。