基于变分学习的RLVR参数空间探索 Parameter Exploration for RLVR via Variational Learning
用变分后验采样扰动权重替代温度调节,为GRPO注入参数空间探索
前置知识
RLVR(可验证奖励强化学习)
用可自动验证的任务(数学题有标准答案、代码能通过隐藏测试)给 LLM 自生成的 rollout 打二值奖励再做强化学习后训练,无需人类示范。由于模型完全从自己的采样轨迹中学习,高奖励但先验概率极低的解可能永远采样不到。
本文的全部动机建立在 RLVR 依赖自采样、需要持续学习信号这一特性上,理解它才能理解探索为什么重要。
GRPO 与零优势组
GRPO 对每个 prompt 采一组 $G$ 条响应,用组内标准化 $A_{i,t}=(r_i-\text{mean}(r))/\text{std}(r)$ 作为 advantage,省去价值网络。当组内奖励全相同(全对或全错)时 advantage 恒为零,该 prompt 不产生梯度,称为零优势组,是训练停滞和算力浪费的主因。
3PO 的核心评价指标(拯救零优势组)和 C3PO 的分组设计都直接针对这一问题。
变分学习与 IVON
变分学习用参数分布(通常对角高斯)近似后验,目标是期望损失加 KL 正则。IVON 是其高效优化器:每步在重参数化扰动点 $\hat\theta=m+\sigma\odot z$ 上计算损失,方差 $\sigma=1/\sqrt{\lambda(h+\delta)}$ 由对角 Hessian $h$ 与有效样本容量 $\lambda$ 控制,运行开销接近 AdamW。
3PO 直接把 IVON 后验当作'可学习的噪声分布',是整个方法的技术底座。
参数空间探索
经典 RL 中的探索思路:把噪声加在策略参数而非动作上,一次参数扰动决定整条 episode,扰动更连贯、不易产生乱码动作。Plappert、Fortunato 等工作证明其在连续控制上匹敌或优于动作空间噪声。
理解本文为何声称权重噪声比温度更'定向',需要知道这条经典研究线的结论。
Seq-MIS
序列级重要性采样与掩码:当生成 rollout 的策略与计算梯度的策略不一致时(C3PO 中 $N$ 个扰动模型生成、单一更新模型打分),对整条序列做重要性比率修正并掩码异常 token,从而稳定训练。
没有 Seq-MIS,C3PO 的训练-生成不匹配会导致不收敛(附录 I 消融证实),它是方法可用性的隐藏前提。
研究动机
RLVR 已成为提升 LLM 推理的主流后训练范式,但模型完全依赖自生成 rollout 学习:当某个 prompt 的一组 rollout 拿到相同奖励(全对或全错)时,GRPO 的组内优势 $A_{i,t}=(r_i-\text{mean}(r))/\text{std}(r)$ 恒为零,学习信号消失,训练停滞并推高本已昂贵的算力成本。最常见的补救是提高 softmax 采样温度,但如 Figure 1 所示,温度只能调节 token 分布的方差、保持相对排序不变,无法把概率极低的高质量轨迹带入可达范围;温度过高时错误 token 的概率被均匀放大,容易产生抽取不出答案的退化输出。熵正则(EntReg)、advantage shaping(Polaris、KL-Cov)等更多是在稳定训练,而非真正扩大探索范围。
本文的目标是本文目标是在 RLVR 中引入参数空间探索,作为动作空间方法的正交且兼容的补充杠杆:训练时不再只从单一策略采样,而是从可学习的参数后验中抽取一个或多个扰动模型来生成 rollout,使同一组内的响应天然来自不同的 plausible 策略。作者提出 3PO(Perturbed Parameter Policy Optimization)方法族,含 B3PO、M3PO、C3PO 三种注入策略,希望在几乎不增加 FLOPs 的前提下提升下游数学推理与代码生成性能、持续拯救零优势组、并降低训练过程中的畸形与错误 rollout 比例。
与已有工作不同的是,参数空间探索在经典 RL 中有长期积累(Plappert、Fortunato 把参数噪声与深度 RL 结合,进化策略也曾扩展到深度策略),但在 LLM 的 RLVR 中几乎是空白:文中仅提到一项并行动作把自适应调度的高斯噪声加到 rollout 策略上。本文的独特切入是用变分学习(IVON 优化器)让每个参数的噪声幅度可学习——方差由对角 Hessian 与有效样本容量 $\lambda$ 共同决定,把'加多少噪声'变成随训练自适应学习的量而非外部调度器;并系统比较单扰动(B3PO)、多扰动梯度平均(M3PO)与跨扰动分组(C3PO)三种 rollout 分配方式对组多样性的影响。
核心方法
直觉上,权重空间的噪声能直接改写 logit、重排 token 分布(Figure 1),比只能'调音量'的温度更能把模型带到解空间的新区域。技术路线是:用 IVON 维护参数的对角高斯近似后验 $q(\theta)=\mathcal{N}(m,\sigma^2)$,每步在重参数化采样点 $\hat\theta=m+\sigma\odot z,\ z\sim\mathcal{N}(0,I)$ 上计算损失,方差 $\sigma=1/\sqrt{\lambda(h+\delta)}$ 由对角 Hessian $h$ 与有效样本容量 $\lambda$ 决定,$\lambda$ 越小噪声越大。生成 rollout 前从后验抽取扰动权重并同步给推理引擎;三种策略的区别只在于每步采几个扰动、以及 advantage 在哪些 rollout 上计算:单扰动的 B3PO、$M$ 个扰动平均梯度的 M3PO、把大小 $G$ 的组切给 $N$ 个扰动再合并计算 advantage 的 C3PO。
核心创新是把探索从动作空间搬到参数空间,并用变分学习实现'可学习的噪声'。与温度的本质区别:温度保持 token 相对排序且均匀扰动整个词表,权重噪声可以重排分布、定向探索当前策略的邻域。与并行动作(自适应调度高斯噪声)的区别:3PO 的噪声幅度由学到的 Hessian 决定,B3PO 可视为其单 MC 样本特例。最关键的设计是 C3PO 的分组切块:GRPO 的学习信号来自组内奖励差异,C3PO 用 $N$ 个不同权重样本各生成 $G/N$ 条响应,把 advantage 建立在跨模型的整组上,直接把'组多样性'变成可控旋钮——这是 M3PO(各扰动分别算 advantage、梯度取平均)做不到的,也解释了后者在等算力下收益有限。
方法步骤详情
训练依托 verl/SkyRL 式生成-训练分离架构:(1) 每个梯度步用 IVON 从后验采样扰动权重 $\hat\theta$,同步给 vLLM rollout 引擎;(2) B3PO 每步只采一个 $\hat\theta$,对整个 prompt batch 生成 rollout,套用标准 GRPO 损失;(3) M3PO 采样 $M$ 个扰动(等算力设定 $G=16/M$),各自生成 rollout 并计算 GRPO 损失,梯度平均后一次性更新后验;(4) C3PO 采样 $N$ 个扰动(主实验 $N=4$),每个生成 $G/N$ 条 rollout 汇入同一 buffer,对合计 $G=16$ 条跨模型响应统一计算 advantage,并用 Seq-MIS 序列级重要性采样稳定训练-生成不匹配;(5) 在扰动点计算的梯度经 IVON 更新均值 $m$ 与 Hessian $h$。实验组大小固定 $G=16$,主结果 $\lambda=10^9$(Qwen2.5-Math 用 $10^{10}$),评测为 8 样本无偏 Pass@1。
技术新颖性
新颖性有四层:(1) 首次把变分学习/IVON 后验采样系统引入 RLVR,把探索强度从动作空间的温度转化为参数空间的可学习方差,且与温度、clip-higher、熵正则等正交可叠加;(2) 形式化并验证了此前被忽视的'组多样性'变量——C3PO 证明 advantage 必须跨越多个参数样本计算才能兑现多样性收益,而 M3PO 的梯度平均在等算力约束下会被组缩小抵消(Figure 5a);(3) 用 rescue/退化率/错误率等训练时诊断指标证明参数探索产出的是更有效的 rollout,而非像 Polaris 那样制造无答案输出;(4) 对任意现成 checkpoint 即插即用:SFT 学到的 Hessian 初始化与常数 $h_0$ 初始化几乎无差别(Figure 5d),无需变分预训练即可受益。
实验结果
数学推理(Table 1):OLMo-3-1025-7B 平均 Pass@1 从 GRPO 42.99 → M3PO 43.22 → C3PO 44.04;Qwen2.5-Math-7B 从 GRPO 45.36 → C3PO 46.88;EntReg/Polaris/KLCov 基线均不及 C3PO。提升集中在更难的 AIME:OLMo3 最高 +4.17%,Qwen 最高 +5.83%(AIME'26 上 26.25 vs 20.42)。代码生成(Figure 4):C3PO 在 LiveCodeBench-v6 达 15.17,reward 全程领先。机制分析(Figure 3):3PO 全程净拯救更多零优势组,M3PO/C3PO 是仅有的畸形与错误 rollout 一致少于 GRPO 的方法。消融:$\lambda=10^9$ 为默认,$\lambda=10^8$ 使 C3PO 崩溃(0.00±0.00);$N=2$–$4$ 已获大部分收益;等算力下增大 $M$ 的收益被组缩小抵消;SFT 学到的 Hessian 初始化与从头初始化几乎无差别(Figure 5)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 数学推理(OLMo-3-1025-7B,6 基准平均) | Pass@1(8 样本无偏估计) | C3PO 44.04±0.46 | GRPO 42.99±0.51 | +1.05 |
| 数学推理(Qwen2.5-Math-7B,6 基准平均) | Pass@1 | C3PO 46.88±0.38 | GRPO 45.36±0.35 | +1.52 |
| AIME 难题(两模型最优成绩) | Pass@1 | OLMo3 +4.17%,Qwen +5.83%(如 AIME'26 26.25 vs 20.42) | GRPO | 最高 +5.83 |
| 代码生成(LiveCodeBench-v6,OLMo3) | Pass@1 | C3PO 15.17 | GRPO(约 11,曲线值) | 约 +4 |
| 训练动态(零优势组拯救) | rescue 数 / 畸形与错误 rollout 配对率 | M3PO/C3PO 全程净拯救且畸形/错误少于 GRPO | GRPO 及动作空间基线(Polaris 退化率最高) | 仅 3PO 两变体全面占优 |
局限与改进
作者承认:(1) 算力受限只在 7B 模型验证,而大模型预训练邻域更密集、应能容忍更小 $\lambda$ 获得更强探索,此猜想未经验证;(2) M3PO/C3PO 实际 wall-clock 约 1.5 倍于 GRPO——小 prompt batch 在 vLLM 权重更新间隙处理降低了并行效率,尽管伪代码 FLOPs 等价;(3) 未探索进一步扩大 MC 样本与 rollout 数做 test-time scaling;(4) 对角高斯后验限制了噪声结构表达力。我的补充观察:$\lambda$ 需按模型手动扫($10^8$–$10^{10}$),C3PO 对噪声过强极敏感(直接崩溃);rescue/退化率等诊断依赖与 GRPO 逐 prompt 配对,解释成本高;M3PO 的等算力劣势暴露了'多模型'与'大组'之间的资源张力,框架并未真正化解。
独立分析的弱点
独立分析三点弱点:(1) 超参敏感性——C3PO 在 $\lambda=10^8$ 完全崩溃(Pass@1 0.00),说明组内 advantage 仍由单一模型主导时扰动方差稍大即失衡,改进方向是按组熵或奖励方差自适应调节 $\lambda$ 的在线调度器;(2) 工程开销——每次采样都要与推理引擎同步权重,$N>1$ 时 vLLM 并行度受损导致 wall-clock 1.5 倍,可用常驻多副本推理引擎、噪声缓存/回放或把扰动限制在部分层来摊薄;(3) 目标脱节——IVON 在扰动点估计损失本质是监督学习式变分目标,并未显式建模组相对 advantage 下的噪声-奖励关系,可探索把后验采样与组内 baseline 设计联合优化;另外评估只报 Pass@1,未量化推理时从后验多次采样的 pass@K 上限,错失了展示方法潜力的机会。
未来方向
作者提出:(1) 在更大模型上容忍更低 $\lambda$、验证更强探索收益;(2) 用结构化/非对角后验(如 K-FAC 类)替代 IVON 的对角近似以获得更有方向的噪声;(3) 自适应噪声调度;(4) 从更长 SFT 或预训练阶段学习后验——本文显示 SFT 结束时 Hessian 近各向同性(<8% 元素偏离 $[0.9h_0,1.1h_0]$),更长训练可能学到真先验。基于成果可延伸:C3PO 与动作空间方法(温度、clip-higher、熵正则)的正交叠加组合实验;推理时从后验采样做 test-time scaling 与 pass@K 提升(作者脚注暗示);迁移到多轮 agent、过程奖励模型或非数学/代码域;对 Seq-MIS 的训练-生成不匹配做理论分析;探索噪声缓存/回放以消除 1.5 倍 wall-clock 开销。
复现评估
可复现性较好:代码开源(GitHub insait-institute/C3PO,权重在 huggingface.co/BayesRL),基座 OLMo-3-1025-7B 与 Qwen2.5-Math-7B 均公开;训练数据 DAPO-MATH-17k、CodeR1-12K 与约 200 万条 Llama-Nemotron Post-Training 子集公开可得;评测基准(AIME 2024–26、AMC、MATH-500、Minerva、LiveCodeBench-v6)皆为标准套件,Pass@1 用 8 样本无偏估计并附标准误,主结果超参明确($G=16$、$\lambda=10^9$/$10^{10}$、$N=4$、$M=4$)。难点在算力:7B GRPO 级 RLVR 需要多卡多机(vLLM 推理引擎 + 训练引擎分离),M3PO/C3PO wall-clock 再乘 1.5;论文未给总 GPU 时数,两阶段(SFT+RL)全流程复现成本高。有 verl 类基础设施的团队可中高难度复现,小团队可先在 1–2B 模型上验证趋势。
论文图表
用 'the quick brown fox' 的下一个 token 分布对比两种探索方式:温度缩放只重加权 token、保持相对排序不变;权重噪声则可选择性修改并彻底重排 token 分布。
一张图讲清参数空间探索的直觉优势——温度只是'调音量'而权重噪声能'改变内容',是全文动机的核心。