SFT冲突、RL共存:LLM多任务学习范式的理论与实证分析 SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
揭示SFT多阶段训练产生任务冲突而RL可稳定共存,并提出Parallel-RL解耦框架。
前置知识
监督微调 (SFT) 与强化学习 (RL)
SFT用固定的专家分布(ground truth)作为监督目标,梯度为 $g_{SFT}=\mathbb{E}_{x\sim D,y\sim\pi_{expert}}[\nabla_\theta\log\pi_\theta(y|x)]$,属于off-policy;RL(这里特指GRPO等policy gradient方法)从模型自身分布采样响应,梯度为 $g_{RL}=\mathbb{E}_{x\sim D,y\sim\pi_\theta}[A(x,y)\nabla_\theta\log\pi_\theta(y|x)]$,是on-policy且带优势函数 $A$ 加权。两者的区别决定了参数更新 $\Delta W$ 的形态。
本文全部论证都建立在这两条梯度公式的差异上——Policy Source(on/off-policy)和Advantage Function(有无 $A$ 加权)正是后续理论分析解释"为何RL更新稀疏、近正交"的两个机制切入点。
GRPO 算法与优势函数零和性质
GRPO(Group Relative Policy Optimization)对每个输入 $x$ 生成一组 $G$ 个rollout $\{y_k\}$,用组内reward的标准化值作为优势 $\hat{A}_{i,k}(x)=(r_{i,k}-\mu_{r_i})/\sigma_{r_i}$,梯度为 $g_i(x)=\frac{1}{G}\sum_{k=1}^{G}\hat{A}_{i,k}(x)\nabla_\theta\log\pi_\theta(y_k|x)$。由于标准化,优势满足零和性质 $\sum_{k=1}^{G}\hat{A}_{i,k}(x)=0$。
零和性质是Lemma 4.3把RL梯度内积分解为"残差内积 $\langle\delta S_{i,k},\delta S_{j,l}\rangle$"的关键,进而推导出RL干扰上界为方差受限 $V_i\cdot V_j$。不理解GRPO无法读懂第4节理论。
梯度干扰与多任务学习的两种范式
多任务训练有两种范式:Mixed-Data(把多任务数据混合联合训练)和Multi-Stage(模型依次在不同阶段学不同任务)。梯度干扰指任务 $i,j$ 的梯度内积 $\langle g_i,g_j\rangle$ 非零时,优化一个任务会扰动另一个任务的最优方向,是灾难性遗忘(catastastic forgetting)的根源。SFT领域通常用Mixed-Data缓解遗忘,而RL领域常用Multi-Stage。
本文的核心研究问题正是:为什么Multi-Stage下SFT性能崩塌(平均-23.1%)、而RL能稳定提升(+24.9%),这个反差是全文motivation。
RL's Razor 与 KL-最小化解
Shenfeld等(2025)的理论指出,即便没有显式KL惩罚项,on-policy RL优化仍隐式偏向"距初始策略 $\pi_0$ 的KL散度最小"的解,即 $\pi_{updated}=\arg\min_{\pi\in P^*\cap\Pi}D_{KL}(\pi\|\pi_0)$,其中 $P^*$ 是所有reward最优策略集合。等价于一个I-Projection(投影到reward=1集合)+M-Projection(投影回可表示策略集合)的双投影过程。
这是论文解释"RL更新为何稀疏且幅度小"的核心理论依据(4.1节),把RL的保守性归因于隐式KL约束,与SFT必须弥合到外部专家分布形成鲜明对比。
参数更新几何:稀疏性与近正交性
在LLM高维参数空间 $\mathbb{R}^d$ 中,单个任务训练得到参数更新向量 $\Delta W_i$。稀疏性指 $\Delta W$ 仅少数分量幅度显著(RL约20%参数超过 $10^{-5}$,SFT为93%);近正交性指不同任务的 $\Delta W_i$ 间余弦相似度接近0(RL约 $10^{-5}$,SFT约 $10^{-1}$)。高维稀疏向量由"measure concentration"原理天然以高概率正交。
这是第3节实证分析的核心观察,也是Parallel-RL能直接相加合并更新的理论基石——若更新近正交,则 $\Delta W_1+\Delta W_2$ 互不干扰。
模型合并 (Model Merging) 与 TIES/SVD
模型合并指把多个分别训练的任务适配器/权重增量组合为一个模型的技术。本文Parallel-RL用到的合并函数 $M(\Delta W_1,\ldots,\Delta W_N)$ 包括:Naive(直接求和或求平均)、TIES(基于幅值剪枝+冲突解决的经典方法,Yadav et al. 2023)、SVD(对每个 $\Delta W_i$ 做奇异值分解只保留rank-1主方向,受Cai et al. 2025启发,认为rank-1已封装大部分RL训练效果)。
Parallel-RL本质上是一种完整的后训练范式而非单纯模型合并,理解合并函数的差异才能看懂Table 4中Naive/TIES/SVD/Adapted四种变体的性能梯度(1.5B上+6.6%→+10.7%)。
研究动机
提升LLM推理能力的主流后训练范式是SFT和RL,但二者在多任务学习中的行为长期未被系统比较。工业实践中存在明显的范式割裂:SFT领域几乎一致采用Mixed-Data策略来缓解灾难性遗忘(Dong et al. 2023; Park 2025),而RL领域却大量采用Multi-Stage策略(Narvekar et al. 2020; Cho et al. 2024)。论文Table 1的初步实验直接暴露了这种割裂的真实代价:在DeepSeek-R1-Distill-Qwen-1.5B上,Multi-Stage SFT导致四任务全面崩塌,平均比Base Model低23.1%(Logic甚至从31.0%暴跌到9.0%,-22.0%);而同样设置下Multi-Stage RL却获得平均+24.9%的稳健提升(Science从34.9%涨到49.3%,+14.4%)。这种"一边崩、一边涨"的反差直接质疑了"Multi-Stage训练能否用于多任务LLM"这一基本问题。
本文的目标是本文目标分三层递进。第一层现象刻画:通过控制变量严格界定"SFT Conflicts"与"RL Coexists"——单任务训练后,SFT提升目标任务(+4.0%)却严重伤害其他任务(-5.1%),而RL在提升目标任务(+6.8%)的同时还能轻微改善未训练任务(+2.3%)。第二层机理归因:在参数层面追踪差异根源,量化 $\Delta W$ 的幅度、稀疏性与跨任务相似度,并从梯度内积角度给出可证明的上界。第三层工程产出:基于"RL更新近正交、可叠加"这一几何洞察设计Parallel-RL范式,让多任务可并行独立训练再合并,目标是匹配甚至超越单任务性能,同时提升训练效率与模块化灵活性。
与已有工作不同的是,现有研究的盲区在于:大部分SFT vs RL对比工作(Chu et al. 2025"SFT memorizes, RL generalizes";Mukherjee et al. 2025关于RL只微调小子网络;Shenfeld et al. 2025的RL's Razor;Zhu et al. 2025"The Path Not Taken")都聚焦单任务机理,鲜有人系统回答"多任务训练中两者为何行为相反"。即便是与遗忘最相关的RL's Razor,分析对象也是单任务遗忘而非多任务梯度干扰。本文独特切入角度是把分析维度从"单任务"升级到"跨任务梯度内积 $\langle g_i,g_j\rangle$",并首次用定理给出二者干扰上界的本质区别——SFT是norm-limited(受 $M_i\cdot M_j$ 约束)、RL是variance-limited(受 $V_i\cdot V_j$ 约束),直接对应SFT"必须拟合外部专家分布"与RL"只优化组内相对差异"的目标差异。
核心方法
整体思路遵循"直觉→实证→理论→应用"四段递进。直觉来自简单观察:高维空间中稀疏向量天然以高概率正交(measure concentration),若RL的 $\Delta W$ 既稀疏又小,不同任务的更新就互不干扰,Multi-Stage自然可行。技术路线分四步:先用Table 1/2控制变量证明现象(SFT崩、RL涨),再用Figure 2热力图在参数层面量化 $\Delta W$ 的L2范数(RL约 $3\times10^{-2}$、SFT约7.4,差两个数量级)和跨任务余弦相似度(RL约 $10^{-5}$、SFT约 $10^{-1}$);接着从 $g_{SFT}$ 与 $g_{RL}$ 两条梯度公式出发,借助GRPO优势零和性质(Lemma 4.3)推导norm-limited vs variance-limited的上界定理(Theorem 4.5);最后基于"RL更新近正交可叠加"设计Parallel-RL框架,把多任务训练拆成并行单任务训练+权重合并 $W_{final}=W_{base}+M(\Delta W_1,\ldots,\Delta W_N)$,叠加5%样本的轻量post-merge adaptation。
核心创新是把"多任务能否共存"的问题从现象层下沉到"参数更新 $\Delta W$ 的几何形态"层,再下沉到"梯度内积上界的数学结构"层。与已有方法的本质区别有三:第一,相比单纯观察"RL更稳健",本文给出可证明的界限 $|I_{SFT}(i,j)|\leq M_i\cdot M_j$ vs $|I_{RL}(i,j)|\leq V_i\cdot V_j$,把模糊的"干扰小"量化为"方差受限"。第二,相比RL's Razor只解释单任务遗忘,本文用零和优势(Lemma 4.3)和on-policy采样两个机制共同解释跨任务正交性——优势函数像滤波器滤掉dense的均值梯度 $\bar S$ 只留组内残差 $\delta S$,on-policy则保证残差小且来自独立分布,由measure concentration天然正交。第三,Parallel-RL不是简单的模型合并,而是一整套后训练范式,额外涉及"哪些任务可并行"的任务选择和单任务训练trick,并系统验证了SVD rank-1、TIES稀疏化、5%样本adaptation的有效性。
方法步骤详情
方法分七步。步骤1(现象验证,第2节):在1.5B上对Math/Science/Logic/Code用LoRA分别跑Mixed-Data与Multi-Stage的SFT和GRPO,评测MATH500/MMLU/Knights&Knaves/LiveCodeBench得Table 1。步骤2(泛化分析):单任务训练后测未训练任务影响(Table 2),定义SFT Conflicts与RL Coexists两现象。步骤3(参数层分析):对每任务算 $\Delta W_i$ 的L2范数与两两余弦相似度,绘Figure 2热力图并统计稀疏度。步骤4(理论推导):引RL's Razor说明RL隐式最小化 $D_{KL}(\pi\|\pi_0)$;用GRPO零和优势+残差分解(Lemma 4.3)把RL梯度内积化为残差内积;在范数/方差有界假设下证Theorem 4.5两上界 $|I_{SFT}|\leq M_iM_j$ 与 $|I_{RL}|\leq V_iV_j$。步骤5(定量验证):对200样本/任务采样score function,用Table 3验证 $\|S\|_2$ 、 $\|\delta S\|_2$ 、CosSim三指标,并用t-SNE(Figure 3)可视化分布可分性。步骤6(Parallel-RL):对1.5B和7B全参数训练,并行N个RL过程各产出 $\Delta W_i$ ,用Naive/TIES/SVD/Adapted四种合并函数组合 $W_{final}=W_{base}+M(\Delta W_1,\ldots,\Delta W_N)$ ,再以5%样本做post-merge adaptation。步骤7(消融):合并时逐个剔除 $\Delta W_i$ ,测对应任务(-7.1%)与其他任务(+0.6%)变化以验证解耦。
技术新颖性
技术新颖性在四层面。第一,首次把SFT与RL的多任务差异追溯到"梯度内积上界的数学结构",给出norm-limited vs variance-limited的形式化定理(Theorem 4.5),把measure concentration、零和优势、on-policy三个看似无关的机制统一进一个证明链。第二,Lemma 4.3的残差分解是关键技巧:利用 $\sum_k\hat A_{i,k}=0$ 把dense均值项 $\bar S$ 完全消去只剩组内残差内积,从代数上解释"为何RL干扰天然小"。第三,Parallel-RL提出SVD rank-1合并(假设rank-1分量已封装RL大部分效果),实验上TIES保留97.4%、SVD保留94.6%单任务性能,证明稀疏化对RL合并特别有效。第四,Adapted Parallel-RL引入5%样本轻量adaptation后,在1.5B上达103.2%、7B上102.4%的单任务保留率,即合并模型甚至超过任意单任务模型,证明"并行训练+少量adaptation"在效率(仅多5%训练量)与效果上双赢。
实验结果
核心发现分四层。第一层现象(Table 1):Multi-Stage SFT在1.5B上四任务平均比Base低23.1%(Logic最惨31.0%→9.0%暴跌22.0%),而Multi-Stage RL平均+24.9%(Science涨幅14.4%最大);Mixed-Data两者都涨(SFT+7.4%、RL+12.6%)。第二层泛化(Table 2):单任务SFT使目标+4.0%但未训练任务-5.1%(Science SFT让Logic掉21.0%);单任务RL使目标+6.8%且未训练+2.3%,正式定义两现象。第三层参数(Figure 2/Table 3):RL的 $\Delta W$ L2约 $3\times10^{-2}$ 、SFT约7.4(差两数量级);RL仅约20%参数超 $10^{-5}$ (SFT为93%);跨任务余弦相似度RL~ $10^{-5}$ 近正交、SFT~ $10^{-1}$ 甚至出现-0.973反向。第四层应用(Table 4):1.5B上Naive(sum)保留94.2%、TIES 97.4%、SVD 94.6%、Adapted 103.2%(ΔBase +10.7%,MATH500 88.6/KK 49.0);7B上Adapted保留102.4%/+8.0%。对照Naive Parallel-SFT(sum)仅保留约66%,证明正交结论对SFT不成立。消融(Table 5)显示剔除某任务 $\Delta W_i$ 仅使该任务-7.1%、其他任务+0.6%,证实任务解耦。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 多阶段/混合数据多任务训练 (1.5B, Table 1) | 四任务平均准确率变化 vs Base Model | Multi-Stage RL: +24.9%;Mixed-Data RL: +12.6% | Multi-Stage SFT: -23.1%;Mixed-Data SFT: +7.4% | Multi-Stage场景下RL相对SFT有约48个百分点的巨大反差,是全文核心motivation |
| 单任务训练对未训练任务的泛化 (Table 2) | 目标任务提升 vs 未训练任务变化 | RL: 目标+6.8%、其他+2.3% | SFT: 目标+4.0%、其他-5.1% | RL不仅不伤害未训练任务反而轻微提升,定义RL Coexists现象 |
| 参数更新几何 (Figure 2/Table 3) | ΔW的L2范数与跨任务余弦相似度 | RL: ||ΔW||~3e-2, CosSim~1e-5, ||δS||~1e-2 | SFT: ||ΔW||~7.4, CosSim~1e-1, ||S||~7.1 | RL更新幅度小两个数量级、相似度低四个数量级,是近正交可叠加的几何基础 |
| Parallel-RL多任务合并 (1.5B GRPO, Table 4) | 六基准平均提升ΔBase与单任务性能保留率 | Adapted Parallel-RL: +10.7%, 保留103.2% | Naive Parallel-SFT(sum): -8.7%, 保留66.6%; Multi-Stage SFT: -8.3% | Adapted Parallel-RL超越单任务RL基线(+9.3%),且仅需5%额外adaptation样本 |
| Parallel-RL多任务合并 (7B GRPO, Table 4) | 六基准平均提升ΔBase与单任务性能保留率 | Adapted Parallel-RL: +8.0%, 保留102.4% | Naive Parallel-SFT(sum): -16.4%, 保留66.6%; Multi-Stage SFT: -11.7% | 7B上趋势与1.5B一致,证明结论可扩展到更大模型 |
| 任务解耦消融 (1.5B, Table 5) | 剔除某任务ΔW后的目标/其他任务准确率变化 | ΔTarget平均-7.1%, ΔOthers平均+0.6% | — | 移除某任务仅影响该任务、几乎不波及其他任务,证实Parallel-RL实现真正的能力解耦 |
局限与改进
作者承认的局限有:第一,Mixed-Data RL相对Multi-Stage RL增益较小(+12.6% vs +24.9%),作者归因于跨任务梯度不平衡(Wu et al. 2025b)但明确表示"不是本文重点",该现象未被深入解释。第二,理论主要基于GRPO,对PPO/REINFORCE等其他算法只在Appendix C.3简略讨论"大部分性质成立",严格性不足。第三,理论依赖Assumption 4.4的bound( $M_i,V_i$ 有限),但未给出这些常数随模型规模、任务类型的经验估计,使Theorem 4.5更像定性而非定量结论。从独立观察看还有几点:实验仅覆盖四个推理任务(Math/Science/Logic/Code),未涉及开放域对话、安全对齐、多模态等更广任务空间;Adapted变体依赖5%样本adaptation,但未分析这5%样本来自混合任务还是单任务、对解耦性的影响;所有合并实验基于全参数训练,未验证LoRA/QLoRA场景下rank-1 SVD合并是否仍成立;Parallel-RL的N个并行训练是N倍算力开销,作者强调"效率"但实际是把串行墙钟时间换成并行算力,对算力受限团队未必划算。
独立分析的弱点
独立分析的弱点及改进方向如下。弱点一:理论假设偏强。Theorem 4.5依赖Assumption 4.4,但论文未给出 $M_i,V_i$ 随训练步数、模型规模的演化曲线,导致norm-limited vs variance-limited是"存在性"而非"紧致性"结论。改进:在训练动态中实测 $M_i(t),V_i(t)$ ,给出二者比值随收敛衰减的经验公式,使上界可定量预测何时Multi-Stage SFT会崩。弱点二:任务覆盖窄。仅四个推理任务,未涵盖指令跟随、安全、多语言、多模态,而工业界多任务LLM恰是这些异构任务混合。改进:扩展到RLHF的安全+有用+诚实三任务,因安全任务reward稀疏可能改变 $V_i$ 量级。弱点三:Parallel-RL的算力账未算清。N个并行RL流程是N倍GPU开销,论文只对比训练样本量(5%额外adaptation)未对比总GPU小时。改进:给出与Multi-Stage/Mixed-Data在相同GPU小时预算下的性能-成本帕累托曲线。弱点四:合并函数选择缺乏自适应。Naive/TIES/SVD/Adapted是手工选择,未给判据。改进:基于 $\Delta W_i$ 间实测余弦相似度自动选择(相似度高用TIES去冲突、低用Naive求和)。
未来方向
作者明确提出的方向在Appendix D初步讨论了两点:(a)如何判断哪些任务可并行训练(task selection);(b)单任务训练时应采用哪些trick以提升合并兼容性。基于本文成果可延伸的方向包括:第一,把variance-limited理论推广到非GRPO算法(PPO的GAE、REINFORCE、DPO),验证"on-policy+优势归一化"是否是该性质的充分必要条件,若DPO也成立则可把Parallel思想迁移到偏好优化。第二,研究Parallel-RL与持续学习结合——既然任务更新近正交,理论上可无限叠加新任务而不遗忘,对应工业界"模型持续迭代"场景。第三,用理论解释和缓解Mixed-Data RL的梯度不平衡(作者承认的gap),设计任务级自适应采样或梯度裁剪让Mixed-Data RL也达Multi-Stage水平。第四,探索Parallel-RL在超大规模任务(数十领域)下rank-1 SVD合并是否会因累积误差失效,需要多少adaptation样本保持性能。第五,从信息论角度量化"on-policy为何使残差小",把measure concentration的指数衰减界 $P(|\langle\delta S_i,\delta S_j\rangle|\geq t)\leq 2\exp(-ct^2d)$ 中的常数 $c$ 与具体任务结构关联。
复现评估
复现评估从四维度看。数据方面:四个任务数据集(MATH500/MMLU/Knights&Knaves/LiveCodeBench)均为公开基准,训练数据未明确开源但附录A给了实现细节,中等可复现。模型方面:基模型DeepSeek-R1-Distill-Qwen-1.5B/7B均开源,GRPO有成熟实现(veRL、OpenRLHF),合并函数TIES/SVD有现成库(mergekit),Adapted的5%样本adaptation是标准流程,工具链成熟。算力方面:1.5B和7B全参数GRPO训练需多卡长时间,N个并行任务则是N倍开销,完整复现需可观GPU预算(论文未明确,但7B全参数RL通常需8×A100/H100量级)。代码方面:论文未提及是否开源代码或checkpoint,是显著短板——尤其Parallel-RL的合并脚本、SVD rank-1提取、Adapted adaptation配置若不公开,他人难精确复现103.2%的保留率。难度评估:现象验证(Table 1/2)和参数分析(Figure 2)较易复现,理论证明可纸面验证,但Parallel-RL的Adapted变体完整复现难度高,预计需2-4人月+可观算力。综合复现难度:中等偏上。
论文图表
该图分左右两部分对比SFT与RL在多阶段训练中的行为。左侧SFT Conflicts部分在策略空间 Ω 中展示:单阶段SFT虽能改进目标任务,但多阶段SFT会引发严重的参数性能冲突甚至崩溃。右侧RL Coexists部分用Math/Code性能等高线展示:RL更新在不同任务间近似正交,干扰极小,能稳定实现多任务提升。底部还展示了RL更新量级远小于SFT的示意。
这是全文的"概念封面图",一图浓缩了SFT Conflicts与RL Coexists两大核心现象,以及RL更新稀疏、近正交这一几何洞察,是读者建立直觉的第一入口。