← 返回 2026-07-17

谱重布线:用于探索、净化与模型融合的事后编辑方法 Spectral Rewiring for Exploration, Purification, and Model Merging

Zhilong Zhang, Hongli Yu, Huan-ang Gao, Hanlin Wu, Yuxuan Song, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou 📅 2026-07-03 👍 25 2026-07-22 18:54
SVD 参数高效 强化学习后训练 推理增强 模型融合 谱分析

将RL更新投影到预训练SVD谱子空间,提取紧凑推理核心并改善探索与跨域融合

前置知识

奇异值分解(SVD)与谱子空间

对任意矩阵 $W_0 \in \mathbb{R}^{d_{out} \times d_{in}}$,SVD 将其分解为 $W_0 = U\Sigma V^\top$,其中 $U$、$V$ 为左右奇异向量构成的正交矩阵,$\Sigma$ 为对角奇异值矩阵。奇异向量 $u_i$、$v_i$ 可视为预训练模型中的「原子技能」几何基,奇异值 $\sigma_i$ 决定这些技能的初始连接强度。本文将预训练权重矩阵张成的子空间 $\mathcal{S}_r(W_0) = \text{span}(U \otimes V)$ 定义为「谱流形」,这是分析 RL 更新的核心坐标系。

本文整个方法框架建立在 SVD 坐标之上,不理解奇异向量的几何含义就无法理解 SAR 如何把密集更新拆成「在流形上」和「在流形外」两部分。

测试时缩放与 Pass@k

Pass@k 指对同一问题采样 $k$ 次后至少答对一次的概率,是衡量推理模型探索能力的标准指标。测试时缩放(test-time scaling)指通过增加采样预算 $k$ 来提升解题覆盖。本文观察到全参数 RL 后训练往往提升 Pass@1 但在较大 $k$ 下提前饱和——即增加采样也换不来更多正确解,这是「被抑制的推理性能」的主要表现。

SAR 的核心卖点之一是恢复 Pass@k 的扩展性,作者用 Pass@k 曲线何时越过全 RL 基线来证明方法有效,必须先掌握这一指标的语义。

模型融合(Task Arithmetic / TIES / DARE+TIES)

模型融合将多个独立训练的专家模型在权重空间组合:Task Arithmetic(TA)直接对任务向量 $\Delta W = W_{\text{expert}} - W_{\text{base}}$ 做加权平均;TIES 在平均前按幅度裁剪并解决符号冲突;DARE 先随机丢弃再配合 TIES。这类方法的核心难点是跨域任务向量方向不兼容,导致融合模型在某个域上反而退化。本文证明把任务向量先投影到谱流形可显著缓解这种干扰。

论文把 SAR 与 TA、TIES、DARE+TIES 在 1.5B/14B 的数学-代码专家融合上直接比较,是支撑「超越最佳单域专家」主张的核心证据。

低秩适配与 RL 更新的低维性

LoRA 等参数高效方法假设适配是低秩的,训练时只优化 $BA$ 两个小矩阵($\Delta W = BA$)。近年的 RL 动力学分析也指出 LLM 适配高度低维。本文借鉴了「低维」思想,但更向前一步:只用低秩不够,必须让低秩更新对齐到预训练奇异向量坐标系,才能解释为什么 SAR 在 Pass@k 和跨域迁移上能超过全 RL 基线。

理解这一点才能看懂为什么作者在附录 E/F 设计了「no-projection control」消融——同样的低秩预算不做谱对齐就会更早饱和。

研究动机

RL 已经成为大语言模型标准后训练范式,但全参数 RL 更新是「黑箱」,对部署造成两类具体瓶颈。第一是推理性能被抑制:奖励优化倾向于把策略收缩到一小簇高奖励轨迹上,导致 Pass@k 在较小 $k$ 就饱和,本文在 AIME 2024 上观察到 DeepScaleR 全 RL 模型在 $k=64$ 之后几乎不再增长,反而限制了测试时缩放的收益。第二是跨域干扰:当数学、竞赛编程、指令遵循等多域更新被联合训练或权重空间合并时,它们可能占据参数空间中互不兼容的方向,于是融合模型常出现「提升一域、压制另一域」的现象——例如 Task Arithmetic 在 1.5B 数学-代码融合上把 AIME AVG@32 从单域专家的 40.31% 拉低到 36.25%。这两个问题都指向同一个根因:密集 RL 更新里同时混入了「推理有效成分」和「残余干扰方向」,但现有方法缺少分离它们的坐标系。

本文的目标是本文要回答的核心问题是:能否找到一个几何坐标系,把 RL 更新里「对推理有效」的成分与「残余噪声/干扰方向」分离开,从而既能恢复被抑制的 Pass@k 探索能力,又能减少多域训练与模型融合中的跨域干扰?为此作者追求一种训练无关的事后编辑方法——不重新训练、不改奖励目标、不收集新 rollout,就能从已经训好的 RL 模型中「提炼」出更紧凑、更兼容、更可融合的推理核心,并希望它在压缩比极小(如总参数量的约 0.58%)的同时保留超过 99% 的后训练性能。

与已有工作不同的是,现有工作主要在三个方向上发力,但都未触及本文的切入角度。其一,Pass@k 优化类工作把探索当成训练目标设计问题,需要改奖励函数或重新收集 rollout;其二,LoRA 与 RL 动力学分析只用「低维」做训练参数化或压缩原理,没有回答「低维子空间应该落在哪个坐标系上」;其三,TA/TIES/DARE 等融合方法直接在原始任务向量上做幅度/符号裁剪,没意识到残余方向本身可能就是干扰源。本文的独特之处是提出「预训练 SVD 谱流形」这一功能坐标系,主张 RL 有效成分应该可表达为基模型奇异向量之间的「重布线矩阵」,而非任意低秩扰动,从而把压缩、净化、融合统一在同一个投影操作下。

核心方法

SAR 一句话概括:把 RL 更新 $\Delta W = W_{\text{RL}} - W_0$ 投影回基模型预训练谱流形,保留「在流形上」部分 $\Delta W^*$、丢弃正交残余 $\Delta W^\perp$。直觉是 RL 主要「重组」基模型已有原子技能而非注入新知识,故推理有效成分应天然落在 $\mathcal{S}_r(W_0) = \text{span}(U \otimes V)$ 上。技术路线三步:对基模型做 SVD 得 $W_0 = U\Sigma V^\top$;算 $\Delta W$;用投影算子得 $\Delta W^* = U M V^\top$,其中 $M = U^\top \Delta W V$ 即「重布线矩阵」,重建 $W_{\text{SAR}} = W_0 + \Delta W^*$。实现中先把 $\Delta W$ 做 top-k 低秩截断再投影,同时获得压缩与谱对齐。算法只覆盖注意力与 MLP 的线性权重($W_q, W_k, W_v, W_o, W_{\text{gate}}, W_{\text{up}}, W_{\text{down}}$),参数预算压到总参数量的 0.58%–7.75%。

核心创新是引入「重布线矩阵 $M$」这一几何对象,并对它的对角/非对角结构给出明确的功能解释。基模型的前向是 $y = U\Sigma V^\top x$,SAR 重建后的前向是 $y = U(\Sigma + M)V^\top x$:对角元 $M_{ii}$ 只是把已有技能 $v_i \to u_i$ 做幅度重缩放(类似一元联想记忆),而非对角元 $M_{ij}$($j \neq i$)则把多个不同输入特征 $v_j$ 的证据路由到同一输出方向 $u_i$,实现「多对一的逻辑合成」——这正是作者所主张的推理几何机制。与已有方法的本质区别在于:LoRA/低秩只压缩「参数量」,TA/TIES 只在原始 delta 上做幅度裁剪,而 SAR 明确主张「有效更新必须落在预训练奇异向量坐标系」,并通过 no-projection 消融证明:相同低秩预算不做谱对齐,Pass@k 会更早饱和、跨域融合会丢失数学增益。

方法步骤详情

算法对应 Algorithm 1,输入基模型 $W_0$、RL 模型 $W_{\text{RL}}$ 与目标秩 $k$。第 1 步谱提取:对每个 Transformer 块的注意力与 MLP 线性权重做 top-k SVD 得 $W_0 = U\Sigma V^\top$。第 2 步隔离更新:计算逐层差值 $\Delta W = W_{\text{RL}} - W_0$。第 3 步低秩提取:对 $\Delta W$ 做独立 top-k SVD 得 $\Delta W_k$。第 4 步几何投影:算 $M = U^\top \Delta W_k V \in \mathbb{R}^{k \times k}$。第 5 步重建:$\Delta W^* = U M V^\top$,令 $W_{\text{SAR}} = W_0 + \Delta W^*$,返回模型。精度上 SVD 与投影用 FP32;1.5B/4B/7B 存 FP16,32B 存 FP16 推理 BF16;解码统一用 $T=0.6$、top-$p=0.95$、最大 32768 token(POLARIS 用 96000)。

技术新颖性

技术新颖性集中在四个层面。其一,首次把「预训练 SVD 谱流形」明确化为分析 RL 更新的功能坐标系,并给出可操作的投影算子($P_U \Delta W P_V$),把抽象的「低维适配」具象为「在原子技能之间重新布线」。其二,提出重布线矩阵 $M$ 并区分对角元(重缩放)与非对角元(多对一逻辑合成),给出了「为什么 RL 能涌现推理」的几何机理解释,与关系推理理论文献(unary vs cross-component integration)形成结构对应。其三,证明同一种投影操作能同时服务三类下游任务——提取(压缩)、净化(Mix-RL 去干扰)、融合(跨专家对齐坐标系),这是统一的几何视角而非三个独立 trick。其四,通过严格消融(no-projection、random projection、diagonal-only、off-diagonal-only)证明「对齐到预训练谱」是必要条件,而不是低秩压缩的副产品——这是与 LoRA 类工作的根本区分点。

Overview of Subspace-Aligned Rewiring (SAR).
Figure 1: Overview of Subspace-Aligned Rewiring (SAR).
Illustration of spectral rewiring.
Figure 4: Illustration of spectral rewiring.

实验结果

核心发现分四块。第一,单域提取:DeepScaleR-1.5B 仅 1% 谱秩就把 AIME 24 AVG@32 维持在 40.21%(全 RL 40.31%);OLMo-3.1-32B-Think 1% 秩在 AIME 25 达 75.12%/93.33%,与全 RL 持平;从纯基模型 OLMo3-7B-Base 做 RL-Zero-Math 需 30% 秩。$M$ 仅占总参数约 0.58%(1.5B)和约 0.64%(32B)。第二,高 k 探索:AIME 2024 上 SAR 的 Pass@k 曲线在 $k=2$(1.5B)和 $k=4$(32B)越过全 RL,覆盖率 25/30→26/30。第三,agentic coding:top-1% 投影在七个公开基准改进六个,平均 +2.52%,TerminalBench 2.0 高达 +25.10%。第四,跨域:Mix-RL 上 LCB v5 从 67.61% 提到 69.09%、v6 从 64.30% 提到 65.25%,AIME 25 Pass@16 从 88.33% 提到 91.71%。融合上 1.5B SAR 把 AIME 24 AVG@32 推到 43.44%、LCB AVG@8 到 32.25%,同时超过最佳数学(40.31%)和代码(31.80%)专家。消融显示相同 1% 预算不做谱对齐在 AIME 25 Pass@32 只到 86.67%(SAR 93.33%)。

Reasoning performance on AIME 2024 and AIME 2025 across different model scales.
Table 1: Reasoning performance on AIME 2024 and AIME 2025 across different model scales.
Parameter efficiency and compression ratios of SAR.
Table 2: Parameter efficiency and compression ratios of SAR.
Additional single-domain validation on the in-house model using open agentic coding benchmarks.
Table 3: Additional single-domain validation on the in-house model using open agentic coding benchmarks.
Cross-Domain Generalization via Model Merging.
Table 4: Cross-Domain Generalization via Model Merging.
Coverage analysis on AIME 2024 with 256 rollouts.
Table 5: Coverage analysis on AIME 2024 with 256 rollouts.
Head-to-head comparison on AIME 2025 and LiveCodeBench v5.
Table 6: Head-to-head comparison on AIME 2025 and LiveCodeBench v5.
No-projection control for 1.5B math-code merging.
Table 7: No-projection control for 1.5B math-code merging.
Method ablations on DeepScaleR-1.5B with a 1% update budget.
Table 8: Method ablations on DeepScaleR-1.5B with a 1% update budget.
Pass@k scaling curves on AIME 2024.
Figure 2: Pass@k scaling curves on AIME 2024.
Cross-domain performance evaluation on the OLMo-3-32B scale.
Figure 3: Cross-domain performance evaluation on the OLMo-3-32B scale.
查看结构化数据
任务指标本文基线提升
AIME 2024 推理保持(1.5B) AVG@32 / Pass@32 40.21% / 76.67%(1% 秩,M 占 0.58%) DeepScaleR 全 RL:40.31% / 76.67% 用约 0.58% 参数保住 >99% 性能
AIME 2025 推理保持(32B) AVG@32 / Pass@32 75.12% / 93.33%(1% 秩) OLMo-3.1-32B-Think 全 RL:75.76% / 90.00% Pass@32 提升 +3.33 个百分点
高 k 探索(AIME 2024, 1.5B) Pass@k 越过全 RL 的 k 值 k=2 即越过全 RL 全 RL 在 k=64 后饱和 覆盖 26/30 vs 全 RL 25/30
Agentic Coding(内部模型 7 个基准) 平均相对提升 6/7 基准改进,平均 +2.52% 代码后训练 delta(top-1% 投影前) TerminalBench 2.0 +25.10%、MSWE-Bench +22.86%
Mix-RL 净化(LiveCodeBench v5/v6, 32B) AVG@10 LCB v5 69.09%、v6 65.25% 全 RL v5 67.61%、v6 64.30% 分别 +1.48、+0.95 个百分点
数学-代码专家融合(1.5B) AIME 24 AVG@32 / LCB AVG@8 43.44% / 32.25% 最佳单域专家 40.31% / 31.80%;Task Arithmetic 36.25% / 31.80% 同时超过最佳数学与代码专家
数学-代码专家融合(14B) AIME 24 AVG@32 / LCB AVG@8 74.38% / 63.40% 最佳单域专家 74.27% / 61.00% AIME +0.11、LCB +2.40 个百分点

局限与改进

作者在正文第 5 节和附录 D 明确划定了 SAR 的边界。其一,投影兼容性取决于「RL 是否仍处于 elicitation 体制」:对训练步数极多的 JustRL(>4000 步),投影只恢复约 43% 的 AIME 2024 分数,无法匹配最终 RL 约 52%。其二,直接从纯基模型做代码 RL 兼容性差,因要学代码格式、stdin/stdout 协议等流形外知识;只有先代码 SFT 再 RL(如 X-coder-RL 投影到 X-coder-SFT)才能完整恢复。其三,PPO 配稠密 critic 奖励会带来更大连续参数移动,可能把更新推离紧凑重布线区域。我自己观察到:实验只在 AIME/LiveCodeBench/IFEval 等狭窄基准验证,未覆盖长文本、多轮 agent、安全等更广任务;32B 对比主要在 OLMo-3 系列内做,是否外推到 Llama/Qwen 仍需验证;Pass@k 提升(如覆盖 +1 题)在小规模上方差较大,统计显著性未给出。

独立分析的弱点

独立分析有几处值得改进。第一,「秩扫描选最优」有过拟合评测集风险:rank sweep 在 AIME 上挑出的最小秩是评测集上的超参,无显式留出验证集,改进方向是给出基于 $\Sigma$ 谱衰减或 $M$ 能量比的内在秩选择准则。第二,论文没解释清为什么谱对齐会「提升」而非「保持」性能(违反投影是有损压缩的直觉),缺对 $\Delta W^\perp$ 的功能归因证据。第三,方法只覆盖注意力与 MLP 线性权重,对 embedding/lm_head/norm 沿用基模型,当 RL 实质扩展词表或输出分布时可能失效。第四,融合实验只考虑两专家数学-代码,未触及三域以上或异构基模型(不同预训练起点)的融合,改进方向是把 SAR 推广到「共同参考基模型」缺失时的对齐问题。

未来方向

作者明确指出的方向包括:把 SAR 用作诊断工具判断 RL 是「在流形内 elicitation」还是「流形外 rewriting」,从而指导训练配方的调整(如先 SFT 再 RL、降低优化强度);探索在训练过程中「分段投影」以避免最终更新漂离流形;为稠密奖励/PPO 设计更丰富的谱基或不同参考点。基于本成果还可延伸的方向有:第一,把 SAR 与 LoRA 训练范式结合,直接在 $M$ 空间里做参数高效 RL,可能天然获得更好的探索与可融合性;第二,将「对角=缩放、非对角=推理合成」的二分扩展为更细粒度的谱拓扑分析,用于可解释性与偏好对齐(如识别哪些 $M_{ij}$ 对应特定推理模式);第三,把谱投影推广到 attention head 级别或张量分解(如 Tucker/CP),可能进一步降低 $M$ 的存储;第四,研究 SAR 与模型稀疏化、量化、蒸馏的组合,给出「推理核心 + 部署压缩」的统一管线。

复现评估

复现评估整体偏中等偏上。论文给出 Algorithm 1 的精确步骤与覆盖的参数组(仅 $W_q/W_k/W_v/W_o/W_{\text{gate}}/W_{\text{up}}/W_{\text{down}}$),说明精度设置(SVD/投影 FP32、小模型存 FP16、32B 存 FP16 推理 BF16)与统一解码配置($T=0.6$、top-$p=0.95$、32768 token),评测协议(AVG@32、Pass@k、256 rollout 覆盖率)也较细。基模型与 RL 模型多为公开权重(DeepScaleR、POLARIS、OLMo-3 系列、DeepSeek-Distill-Qwen、OpenReasoner、DeepCoder、Archer-Code),融合基线 TA/TIES/DARE+TIES 也有公开实现。但有三块缺失:agentic coding 的「内部模型」未公开权重,表 3 的 +25.10% 无法独立验证;rank sweep 具体代码未提供;32B 量级 SVD 与重建需相当算力(投影更新 311M、$M$ 204M),完整复现成本较高。