← 返回 2026-08-28

理解大模型推理中的进化策略:比GRPO更广的推理覆盖 Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang 📅 2026-08-27 👍 19 2026-09-01 18:30
GRPO LLM推理 Pass@K 后训练 强化学习 灾难性遗忘 进化策略

进化策略比GRPO推理覆盖更广:升Pass@1同时保住Pass@K,大参数漂移不等于灾难性遗忘

前置知识

进化策略(Evolution Strategies, ES)

一种无梯度的黑盒优化方法:在当前参数 $\theta$ 周围采样 $N$ 个高斯扰动 $\epsilon_i \sim \mathcal{N}(0, I)$,对每个扰动模型 $\theta+\sigma\epsilon_i$ 做前向推理获得奖励 $R_i$,再用奖励加权的扰动平均 $\hat{g}_{ES} = \frac{1}{N}\sum_i z_i \epsilon_i$ 作为更新方向($z_i$ 为标准化奖励)。因为不需要反向传播,训练时不保留激活与梯度状态,显存占用低且天然可并行。

本文研究的正是ES作为LLM后训练范式时的优化行为、遗忘风险与超参数设计,理解其扰动-评估-聚合机制是读懂全文的前提。

GRPO(Group Relative Policy Optimization)

主流的RL后训练方法:对每个提示从同一策略采样一组 $G$ 个响应,用组内奖励标准化得到响应级优势 $\hat{A}_i=(r_i-\bar{r}_G)/s_G$,再通过PPO式裁剪代理目标做token级梯度更新。GRPO能稳定提升Pass@1,但训练中策略熵持续下降(熵坍缩),推理路径多样性减少。

GRPO是本文的核心对照组,ES的所有优势(更广推理覆盖、更高Pass@K)都是相对GRPO定义和测量的。

Pass@K 与熵坍缩

Pass@K衡量重复采样 $K$ 次至少一次答对的概率:$J_K(\pi)=\mathbb{E}_x[1-(1-p(x))^K]$,反映模型正确解的覆盖广度,与单次准确率Pass@1互补。熵坍缩指策略分布随训练越来越集中:对表格softmax策略有局部关系 $\Delta H(s)\approx-\eta\,\mathrm{Cov}(\log p_a,\, p_a A_a)$,当高概率动作常获正优势时熵单调下降。

论文核心论点是ES提升Pass@1的同时保住甚至提升Pass@K,而GRPO因熵坍缩在大K下Pass@K低于base模型,这一对指标是区分两种范式的关键。

功能稀疏性与灾难性遗忘

功能稀疏性是本文发现:ES虽扰动全部参数、整体漂移可达GRPO的40倍以上,但对任务性能有实质贡献的只是少数大幅度更新(集中在LayerNorm权重与注意力投影),把大量小幅更新置零后性能几乎不变。灾难性遗忘指后训练损害模型既有能力,先前工作将ES的遗忘归因于大参数漂移。

功能稀疏性是论文反驳ES必然遗忘(RQ2)的核心证据,理解漂移与功能改变的解耦是接受其结论的关键。

Fisher信息与Jensen-Shannon散度

提示条件Fisher信息 $I_x(\theta)=\mathbb{E}_{Y\sim\pi_\theta}[s_\theta(Y|x)s_\theta(Y|x)^\top]$ 度量参数微小位移对输出分布的影响:$D_{KL}(\pi_{\theta+\delta}\|\pi_\theta)\approx\frac{1}{2}\delta^\top I_x(\theta)\delta$。Jensen-Shannon散度 $JS^{pol}_N(x)$ 刻画ES种群中 $N$ 个扰动策略输出分布的差异,即策略多样性。

RQ1的理论部分完全建立在这两个量上:参数扰动如何转化为策略多样性、进而提高找到正确答案的概率,靠它们才能跟上Lemma 1-3和Proposition 1的推导。

研究动机

将强化学习用于LLM推理后训练时,以GRPO为代表的策略梯度方法虽稳定提升Pass@1,却伴随两个已知痼疾:一是熵坍缩——策略分布越来越集中于少数高频推理模式(由 $\Delta H(s)\approx-\eta\,\mathrm{Cov}(\log p_a,\,p_aA_a)<0$ 刻画),推理路径多样性减少;二是大K采样下的Pass@K退化——Yue et al. (2025)等发现RL后训练后,重复采样找到正确答案的能力甚至低于未训练的base模型。另一方面,进化策略(ES)因免反向传播被视为省显存的替代方案,但先前工作(Abdi et al., 2026)观察到ES训练后全模型参数漂移巨大并伴随灾难性遗忘,进而把遗忘归因于漂移。然而这类证据只来自小训练集、单一模型与单一held-out任务,参数漂移是否真导致遗忘从未被严格验证;同时ES的优化动态、相对GRPO的优势边界、以及应如何设置归一化/种群大小/估计器才能稳定训练,都缺乏系统研究。实践者因此无法判断:ES究竟是GRPO的二流省显存替代品,还是一个值得独立对待的后训练范式。

本文的目标是本文的目标是对ES做一次系统性体检,把它与GRPO在同FLOP预算下正面对比,并回答三个递进的研究问题。RQ1:ES是否表现出与GRPO相同的后训练特性,尤其在推理覆盖上——理论上证明ES种群多样性可以转化为更高的重复采样成功率(Pass@K),实证上检验ES能否在提升Pass@1的同时保住Pass@K,并探索ES→GRPO与GRPO→ES两种序列混合训练能否兼得两者优势。RQ2:ES的大参数漂移是否必然导致灾难性遗忘——通过统计参数变化幅度的分布、构造幅度阈值化检查点、在多个held-out基准上评测,厘清整体漂移与功能性改变的关系。RQ3:什么样的奖励归一化、扰动尺度 $\sigma$、种群大小 $N$ 和梯度估计器设计能让ES有效且随模型规模可扩展。最终把ES定位为一种独立的推理后训练范式,而非GRPO的劣化版替代。

与已有工作不同的是,本文的独特切入有三点。第一,视角新:以往比较ES与梯度方法多看最终准确率或显存成本,本文首次从推理覆盖切入,以Pass@K为核心指标,并配上从Fisher信息到Jensen-Shannon散度再到Pass@K的完整理论链条(Lemma 1-3与Proposition 1),把种群扰动→策略多样→更容易找到正确答案讲成一个可证明的因果故事。第二,问题新:针对ES漂移大所以遗忘这一流行直觉,论文不做笼统否认,而是量化参数变化的幅度分布,发现任务收益集中于少数大幅度更新(功能稀疏性),再用Easy与Hard两设定的held-out对比证明漂移与遗忘解耦,把先前的遗忘观测重新解释为训练集过拟合。第三,实用新:系统回答z-score奖励归一化的必要性、两点估计器为何不适用于自回归推理任务、种群大小随模型规模缩放的规律(模型越大可用越小种群)等工程问题,这是此前零阶优化文献(如Malladi et al. 2023针对SFT任务)没有覆盖的空白。

核心方法

论文采用理论刻画、对照实验与设计研究三线并进。理论线:把ES视为对高斯平滑目标 $F_\sigma(\theta)=\mathbb{E}_{\epsilon\sim\mathcal{N}(0,I)}[F(\theta+\sigma\epsilon)]$ 的优化,证明三个引理——扰动诱导策略多样性 $\mathbb{E}[JS^{pol}_N(x)]=\frac{\sigma^2}{2}(1-\frac{1}{N})\operatorname{tr}I_x(\theta)+O(\sigma^4)$;种群内每成员采一个响应的成功率不低于同均值单策略 $P^{N}_{pop}\ge P^{N}_{same}$;奖励权重与成员成功率正相关时加权混合更优——最终在传输误差 $\varepsilon_{succ}$ 足够小、边际 $m_K>K\sqrt{\varepsilon_{succ}/2}$ 时给出ES更新后Pass@K提升的充分条件。实验线:Easy设定用Qwen2.5-1.5B/7B-Instruct与Llama-3.2-3B-Instruct在GSM8K训2个epoch,评测6个任务;Hard设定用DeepSeek-R1-Distill-Qwen-1.5B在DeepScaleR训1个epoch,评测4个数学基准;FLOP匹配ES($N=32$个扰动方向)与GRPO(每组$G=8$个响应)。设计线:消融z-score归一化、扰动尺度、种群大小 $N\in\{8,16,32,64\}$ 与一点/两点估计器。

核心创新是种群多样性→Pass@K的机理刻画与功能稀疏性两个概念。与GRPO从单一策略采样不同,ES的 $N$ 个扰动模型是 $N$ 个异质策略,各有不同正确率 $p_i(x)$。论文证明:(1) 每成员采一个响应的成功率 $P^{N}_{pop}=1-\prod_i(1-p_i(x))$ 严格不低于从平均正确率相同的单策略采 $N$ 个响应(等号当且仅当所有 $p_i$ 相等),差距由 $0\le JS^{succ}_N(x)\le JS^{pol}_N(x)$ 控制;(2) 若奖励权重 $w_i$ 与 $p_i(x)$ 正相关,$p_w(x)-\bar{p}(x)=\frac{1}{N}\operatorname{Cov}_i(w_i,p_i(x))>0$,奖励加权进一步提高成功率;(3) 只要中心更新不破坏这份优势(Bernoulli KL不超过 $\varepsilon_{succ}$),更新后Pass@K就高于初始模型,与GRPO的熵坍缩形成机制级对立。第二,针对遗忘问题,论文发现ES参数变化呈幅度稀疏:$77.6\%-93.0\%$ 的非零更新幅度不超过 $1.5\times10^{-3}$,置零这些小更新后任务Pass@1几乎不变;最大更新集中在LayerNorm与注意力投影,而GRPO集中在token embedding与LM head,说明大漂移主要是沿弱奖励相关方向的随机游走,不等于功能性改变。

方法步骤详情

实验流程分四步。第一步训练:Easy设定用GSM8K对Qwen2.5-1.5B/7B-Instruct与Llama-3.2-3B-Instruct各训2个epoch;Hard设定用DeepScaleR对DeepSeek-R1-Distill-Qwen-1.5B训1个epoch。ES每次更新采样 $N=32$ 个扰动方向,对每个扰动模型 $\theta+\sigma\epsilon_i$ 做rollout并由验证器打分,种群内z-score标准化得 $z_i$,按 $\hat{g}_{ES}=\frac{1}{N}\sum_i z_i\epsilon_i$ 更新 $\theta^+=\theta+\alpha\hat{g}_{ES}$;GRPO每组采 $G=8$ 个响应按裁剪代理目标做token级更新;两者FLOP匹配。第二步序列混合:相同总更新预算下平分两段,先ES后GRPO(ES→GRPO)或先GRPO后ES(GRPO→ES)。第三步遗忘分析(RQ2):统计非零更新幅度分布 $s_\tau$,构造幅度阈值化检查点(置零 $0<|\Delta\theta_i|\le\tau$,$\tau\in\{1.0,1.5,2.0\}\times10^{-3}$),观察任务Pass@1随稀疏度的变化;对比ES与GRPO最大更新的位置与幅度;在held-out任务测Pass@K与Maj@K。第四步设计研究(RQ3):在Qwen2.5-{0.5,1.5,3}B上跑 $N\in\{8,16,32,64\}$ 的匹配实验并记录平滑奖励;消融z-score归一化;对比一点与两点估计器在GSM8K(自回归重生成)与SST-2(固定数据)上的方差收益差异。

技术新颖性

新颖之处有四。一是理论链条完整且对症:从 $\delta=\sigma\epsilon$ 的局部KL位移 $\frac{1}{2}\delta^\top I_x(\theta)\delta$ 出发,经数据处理不等式把 $JS^{pol}$ 传到 $JS^{succ}$,再用KL传输界 $J_K(\pi_{\theta^+})\ge J_K(\pi_w)-K\sqrt{\varepsilon_{succ}/2}$ 收口到Pass@K,每环节可检验,而非停留在定性说法。二是给出ES与GRPO的机制级对照表:信号路径 $R_i\to z_i\to\theta$ 对 $r_i\to\hat{A}_i\to\theta$、是否保留反向状态等,把免反传从工程优点提升为探索行为差异的根源。三是用幅度稀疏加置零实验把漂移与功能改变解耦,修正了Abdi et al. (2026)的归因;并指出ES的大更新位置(Llama-3.2-3B的top-100中72个是归一化参数)与GRPO(embedding/head)截然不同,暗示两种范式适应模型的路径不同。四是纠正零阶优化直觉的迁移误区:两点估计在监督任务上因可复用固定数据而方差更小,但推理任务的响应是自回归重生成的,早期token发散破坏配对协方差,实验显示两点ES在GSM8K上无任何训练奖励或held-out优势,澄清了ZO文献结论的适用边界。

实验结果

RQ1:Easy设定中(Table 2),ES平均同时提升三项指标——Qwen2.5-1.5B平均Pass@1从Base的41.0到ES的41.5(GRPO为42.9),平均Pass@32从80.2到ES的80.9(GRPO降至79.9);GRPO在18组对比中15组Pass@16/32低于Base。GSM8K→GPQA上,Llama-3.2-3B的GRPO把Pass@1从23.0提到26.9却把Pass@16从82.0压到80.3,ES则把Pass@16提至86.9;训练中GRPO的token熵大幅下降而ES基本稳定。Hard设定(Table 3)数学平均Pass@1为Base 47.7/GRPO 52.9/ES 49.9,Pass@32为Base 77.4/GRPO 78.0/ES 78.9;序列组合ES→GRPO取得最高平均Pass@32=79.2且Pass@1=52.3几乎保留GRPO全部收益(Figure 3)。RQ2:ES的相对L2漂移是GRPO的40.7-44.1倍,但 $\tau=1.5\times10^{-3}$ 时77.6%-93.0%的非零更新低于阈值,置零后Pass@1在高位平台保持稳定(Figure 4);最大更新位于LayerNorm与注意力投影(Llama-3.2-3B最大0.01171875,GRPO仅0.00024414,小48倍)。held-out上Easy设定ES的5任务平均Pass@32变化为正而GRPO为负;Hard设定4个非数学任务平均Pass@1为Base 42.9/GRPO 45.6/ES 44.0,平均Pass@32为GRPO→ES 89.8与ES→GRPO 89.9高于GRPO的89.0。RQ3:z-score归一化全程优于无归一化;update 300时 $N=16$ 与 $N=64$ 的奖励差距在1.5B/3B仅0.0051/0.0030(0.5B为0.0352),模型越大所需种群越小;两点估计无优势。

Update and efficiency comparison of ES and GRPO.
Table 1: Update and efficiency comparison of ES and GRPO.
Pass@K results (×100) in the Easy Setting after two epochs of GSM8K post-training.
Table 2: Pass@K results (×100) in the Easy Setting after two epochs of GSM8K post-training.
Pass@K results (×100) on mathematical benchmarks in the Hard Setting.
Table 3: Pass@K results (×100) on mathematical benchmarks in the Hard Setting.
Relative whole-model L2 distance (×10−2) and the distribution of nonzero ES updates across magnitude thresholds.
Table 4: Relative whole-model L2 distance (×10−2) and the distribution of nonzero ES updates across magnitude thresholds.
Pass@K results (×100) on four held-out benchmarks in the one-epoch Hard Setting.
Table 5: Pass@K results (×100) on four held-out benchmarks in the one-epoch Hard Setting.
Smoothed GSM8K rewards across model and population sizes.
Table 6: Smoothed GSM8K rewards across model and population sizes.
Comparison of ES and GRPO during training and testing.
Figure 2: Comparison of ES and GRPO during training and testing.
Representative Pass@1–Pass@K Pareto fronts across models and tasks.
Figure 3: Representative Pass@1–Pass@K Pareto fronts across models and tasks.
Target-task Pass@1 across update-sparsity levels in the Easy and Hard Settings.
Figure 4: Target-task Pass@1 across update-sparsity levels in the Easy and Hard Settings.
查看结构化数据
任务指标本文基线提升
Easy设定:GSM8K训2 epoch后6任务平均(Qwen2.5-1.5B-Instruct) 平均 Pass@32 ES 80.9;ES→GRPO 80.0 Base 80.2,GRPO 79.9 ES 较Base +0.7、较GRPO +1.0个百分点;GRPO在18组对比中15组Pass@16/32低于Base
GSM8K→GPQA(Llama-3.2-3B-Instruct) Pass@16 / Pass@32 ES 86.9 / 95.5 Base 82.0 / 90.4,GRPO 80.3 / 88.4 ES 较Base +4.9 / +5.1个百分点;GRPO反而下降1.7 / 2.0个百分点
Hard设定:DeepScaleR训1 epoch后数学平均(DeepSeek-R1-Distill-Qwen-1.5B) Pass@1 / Pass@32 ES 49.9 / 78.9;ES→GRPO 52.3 / 79.2 Base 47.7 / 77.4,GRPO 52.9 / 78.0 ES→GRPO Pass@32全场最高(+1.8 vs Base),同时保留GRPO绝大部分Pass@1收益
Hard设定held-out:GPQA/MBPP/CSQA/Countdown平均 平均 Pass@32 GRPO→ES 89.8,ES→GRPO 89.9 Base 89.6,GRPO 89.0 ES系方法均不低于Base,GRPO下降0.6,支持大漂移≠遗忘
GSM8K种群缩放(Qwen2.5-{0.5,1.5,3}B,update 300) N=16 相对 N=64 的平滑奖励差距 1.5B差距0.0051,3B差距0.0030 0.5B差距0.0352 模型越大小种群越接近参考值:1.5B/3B可用 N=16,0.5B需 N=32
ES参数漂移与更新幅度分布(4个模型) 相对L2距离 / $s_\tau$($\tau=1.5\times10^{-3}$) ES漂移为GRPO的40.7-44.1倍;77.6%-93.0%非零更新低于阈值 GRPO漂移0.0475-0.0954(×10⁻²) 置零小更新后任务Pass@1几乎不变,证明功能稀疏性

局限与改进

作者承认的局限:一是遗忘问题在持续学习场景(模型需反复适应新任务并保留旧能力)下的表现未验证,Hoy et al. (2026)提示ES对旧能力的影响可能与任务和配置有关;二是理论只是充分条件而非等价刻画,$\varepsilon_{succ}$ 等量在实际训练中难以直接测量,且引理建立在 $\sigma\to0$ 渐近上。我的观察:第一,实验最大只到7B(且7B上各方法差异已收窄到0.1-0.3个百分点),种群缩放规律在数十B规模是否成立未知;第二,幅度阈值化是训练后的post-hoc分析,虽证明功能稀疏,却不能直接转化为训练或存储上的节省;第三,序列组合并非全胜——ES→GRPO在Llama-3.2-3B的GPQA上Pass@16从Base的82.0跌至71.4(掉10.6个百分点),总体平均为正不代表没有单点退化,论文对此归因较少;第四,FLOP匹配掩盖了其他成本差异:ES每步需 $N=32$ 个独立rollout,对采样基础设施与并行度要求与GRPO不同;第五,验证器均为确定性答案匹配,ES在过程奖励或开放式任务下的行为未被探讨。

独立分析的弱点

第一,理论与实践的鸿沟:Proposition 1要求边际 $m_K$ 足够大且 $\varepsilon_{succ}$ 受控,但论文未给出这些量在真实训练中的估计方法,理论更像事后解释而非设计准则;改进方向是开发 $\varepsilon_{succ}$ 或 $JS^{pol}_N$ 的在线代理指标,用于训练中监控多样性是否被保留。第二,功能稀疏性未被利用:既然收益集中在少数大幅更新(DeepSeek模型top-100更新中80个是归一化参数),可在训练中只聚合这些坐标或加稀疏正则,从而降低更新与checkpoint成本,论文只做了置零验证。第三,单点退化被平均数掩盖:如ES→GRPO的GPQA Pass@16降10.6个百分点,应补充逐任务显著性分析与最坏情况报告。第四,种群缩放结论只依据平滑训练奖励这一单一观测量,未验证小种群的最终测试Pass@K表现,且缩放规律随规模单调改善缺乏机理解释(仅援引彩票假说)。第五,对比范围受限:需要额外监督的SFT/OPD被排除,ES相对更便宜的蒸馏是否划算未讨论;所有实验使用0/1验证奖励,连续或部分奖励下z-score归一化是否仍是关键成分待验证。

未来方向

作者提出的方向:其一,更好地利用ES激励推理的优势,扩大对被基础策略赋予低概率的正确路径的访问,例如在奖励加权中显式鼓励稀有正确解;其二,把遗忘研究推进到持续学习设定,在跨多任务的长训练跨度上厘清参数漂移对既有能力的累积影响;其三,探索参数高效更新等方法,在不束缚有益探索的前提下抑制有害漂移。基于本文成果可延伸的方向:把功能稀疏性变成训练时的主动设计——只对识别出的LayerNorm/注意力子空间做扰动(稀疏ES),可能以更少算力获得同等收益并天然缓解遗忘;把ES→GRPO序列组合扩展为多阶段交替调度,用熵与Pass@K监控自动决定切换点;理论上放宽 $\sigma\to0$ 假设,分析有限扰动尺度下多样性与收敛速度的权衡;验证种群缩放规律在10B以上模型与MoE架构上的适用性,并结合vLLM级rollout优化降低ES的采样成本;以及在过程奖励模型(PRM)、代码执行反馈等富信号场景检验ES是否仍保持覆盖优势。

复现评估

复现条件较好。代码已在GitHub开源(https://github.com/yunpengba7/understanding-es),正文与附录给出完整设置:ES用 $N=32$ 个扰动方向、种群内z-score奖励归一化,GRPO每组 $G=8$ 响应,FLOP匹配的完整核算在附录G.2;训练数据GSM8K与DeepScaleR、评测集GPQA、MATH-500、AIME24/25、AMC23、MBPP、CSQA、HotpotQA、Countdown全部公开;模型(Qwen2.5-Instruct系列0.5B-7B、Llama-3.2-3B-Instruct、DeepSeek-R1-Distill-Qwen-1.5B)均可从HuggingFace获取。算力方面,ES免反向传播使单卡显存压力小,但每步需32个扰动模型各自rollout,总前向计算量大,需多卡并行或高效推理栈;完整复现Table 2/3需训练5种方法乘多个模型,估计在数百GPU小时量级。难度中等:主要难点是ES训练稳定性调优($\sigma$ 与 $\alpha$ 只有定性指导)与FLOP对齐;而置零稀疏化、参数位置统计、held-out评测等验证性实验只需推理即可完成,门槛显著更低,适合作为入门复现切入点。