← 返回 2026-07-21

群组熵控制的策略优化 Group Entropy-Controlled Policy Optimization

Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen 📅 2026-07-18 👍 29 2026-07-25 18:30
GRPO 多任务强化学习 大语言模型对齐 强化学习 策略熵控制

用群组熵引导的非对称优势塑形,缓解GRPO多任务训练的探索-利用失衡

前置知识

GRPO(群组相对策略优化)

GRPO 是当前 LLM 后训练强化学习的主导算法之一。它无需训练单独的价值函数,而是对每个提示 $x$ 采样 $K$ 个回复 $\{y_1,...,y_K\}$,获得奖励 $\{r_1,...,r_K\}$ 后通过组内标准化计算相对优势 $A_i = (r_i - \mathrm{mean}(\{r_j\}))/\mathrm{std}(\{r_j\})$,再代入 PPO 式裁剪代理目标。组内标准化是其核心假设:假定各提示组标准化后的优势信号是无偏且跨组可比的。

GEPO 是 GRPO 的直接轻量扩展,读懂 GRPO 的组采样结构和标准化优势假设,才能理解 GEPO 要修正的“结构性偏差”到底是什么。

策略熵(Policy Entropy)与探索-利用权衡

策略熵 $H(\pi_\theta(\cdot|x)) = \mathbb{E}_{y\sim\pi}[-\log\pi(y|x)]$ 衡量策略在提示 $x$ 上的不确定性:熵低意味着概率集中在少数回复上(可能过度利用、模式坍缩),熵高意味着概率分散在多样回复上(积极探索但优化可能不稳定)。探索-利用权衡是 RL 的经典难题:过度探索导致训练发散,过度利用导致陷入次优解。GEPO 的核心就是把“群组熵”作为诊断这一权衡的信号。

熵是本文操纵的核心量,理解熵与探索/利用的对应关系,才能看懂 GEPO 为何要在低熵组压制正优势、在高熵组压制负优势。

优势塑形(Advantage Shaping)

优势塑形指在计算梯度前对优势 $A_i$ 进行变换或重加权,以重新平衡不同样本/任务的优化压力。例如可将优势乘以一个系数 $\hat{A}_i = \omega \cdot A_i$。与奖励塑形(改变奖励定义)不同,优势塑形不改变环境的真实奖励,只调整策略更新时的信号强度。本文的 GEPO 即采用熵条件化的非对称优势塑形:根据该组群组熵落在哪个区间,分别对正、负优势施加不同的衰减系数。

优势塑形是 GEPO 落地其核心思想的机制,理解这一点才能区分它与改变熵正则项系数(如 AEPO)或改变损失项(如 KL-Cov)的方法。

PPO 裁剪代理目标与重要性采样比

PPO/GRPO 使用裁剪代理目标限制单步策略更新幅度。重要性采样比 $\rho_{i,t} = \pi_\theta(y_{i,t}|x,y_{i,<t})/\pi_{\theta_{old}}(y_{i,t}|x,y_{i,<t})$ 衡量新策略相对旧策略的概率比,目标函数对其裁剪到 $[1-\epsilon, 1+\epsilon]$ 区间以稳定训练。本文还额外采用 CISPO 提出的对重要性采样权重的裁剪来避免 token dropping 问题,并在所有基线方法中保持一致。

GEPO 的塑形优势 $\hat{A}_i$ 是直接代入这个裁剪目标的,理解目标函数结构才能明白 GEPO 如何即插即用地集成进现有 GRPO 训练流程。

研究动机

现代 LLM 后训练通常在异构任务混合(指令跟随、代码、写作、数学推理)上进行,这些任务在解的多样性和策略探索的不确定性上差异巨大。现有熵控制方法要么在策略级(如 AEPO,对整个 batch 算一个熵统一调控)操作,要么在 token 级(如 Clip-Cov、KL-Cov,逐 token 调控协方差)操作,把熵当作全局/局部指标维持训练稳定,却忽略异构任务间的优化失衡。GRPO 在每个提示组内标准化奖励构造相对优势,隐式假设优势信号跨组无偏,但作者观察到该假设并不成立:组熵随领域剧烈变化,物理提示集中在 $\mathcal{H}_g \approx 0.49$,数学约 $0.60$,指令跟随约 $0.78$。这种异质性在组内造成正负优势不对称(组准确率 $p\to0$ 时 $|A_+|=\sqrt{(1-p)/p}\gg1$ 而 $|A_-|\ll1$),在组间造成结构性偏差(命题 2.2 给出偏差上界 $C\sqrt{(\log N_x - H(x))/2}$,依赖熵)。结果低熵组主导梯度、高熵组信号越来越弱,形成自增强的失衡循环。

本文的目标是本文的目标是设计一个轻量、模型无关的 GRPO 扩展,在不改变采样结构、零额外采样开销的前提下,按熵区间重新平衡优势信号。具体包括:(1) 用群组熵作为每个提示的诊断信号,识别熵异质性诱导的优化偏差;(2) 衰减低熵组的正优势,防止过度利用进一步拉大熵差距;(3) 衰减高熵组的负优势,避免在策略有机会发现正确推理路径前就过早压制探索;(4) 用从历史熵统计自适应推导的阈值(配合 EMA 平滑)实现自动校准,跨不同基座模型和训练阶段都无需任务级调参;(5) 直接可插入任何基于群组的策略优化方法。

与已有工作不同的是,本文的独特切入角度是首次深入剖析“群组熵异质性如何与 GRPO 的分组优化机制相互作用”。已有熵感知方法(AEPO、Clip-Cov、KL-Cov)都在策略级或 token 级操作,把熵当作全局/局部属性,对“跨采样组的熵变化及其与分组优化的交互”几乎未触及。作者做了两个关键实证观察:组熵跨领域显著异质,且领域级熵区间对应截然不同的优势分布(偏度从物理的约 0 到指令跟随的 2.32,峰度 4.84)。进而用命题 2.1-2.2 严格证明:组内标准化(去均值、除标准差)并不能保证跨提示的共同统计参考系,潜在偏差仍依赖熵。这一分析直接催生了“群组级、熵条件化”的干预思路,而非对所有标准化优势分布一视同仁的统一调控。

核心方法

GEPO 的核心思想是把群组熵作为每个提示级别的诊断信号,在群组级别做熵条件化的非对称优势塑形。直觉上:既不像策略级方法那样对当前 batch 算一个全局熵并统一作用于所有回复,也不像 token 级方法那样逐 token 调控,而是在“回复组”粒度上——用每个提示的 $K$ 个回复算出组熵并据此分别塑形该组的优势,从而在不依赖显式任务标注的情况下实现任务级的探索-利用权衡,尊重多任务学习固有的异质性。技术路线分三步:(1) 从现有 GRPO rollout 零额外开销地估计群组熵;(2) 从当前 batch 的群组熵统计自适应推导熵阈值并用 EMA 平滑;(3) 用这些阈值做非对称优势塑形。非对称约束 $\alpha_{high}<\alpha_{low}$ 至关重要,因为低熵区对激进干预很脆弱,会触发长度坍缩。

核心创新是群组级、熵条件化的非对称优势塑形,与已有方法有本质区别:AEPO 用单一全局熵控制信号把所有任务驱向统一熵模式(一刀切),Clip-Cov/KL-Cov 调控 token 级协方差;GEPO 改用群组熵 $\hat{H}_g(x) = -\frac{1}{K}\sum_i\sum_t \log\pi_\theta(y_{i,t}|y_{i,0$ 且 $\mathcal{H}_g<\mathcal{H}_{low}$)、$\alpha_{high}A_i$(若 $A_i<0$ 且 $\mathcal{H}_g>\mathcal{H}_{high}$)、否则 $A_i$,反映两种熵区间脆弱性的差异。

方法步骤详情

完整流程分四步。第一步,对提示 $x$ 的 $K$ 个回复估计群组熵 $\hat{H}_g$ 并按平均长度归一化为逐 token 群组熵 $\mathcal{H}_g=\hat{H}_g/\bar{T}$(无偏蒙特卡洛估计,方差 $O(K^{-1})$),同时算 GRPO 标准化优势 $A_i=(r_i-\mathrm{mean})/\mathrm{std}$。第二步,自适应阈值:在步骤 $t$ 由 batch 群组熵均值 $\mu_H$、标准差 $\sigma_H$ 得 $\hat{\mathcal{H}}_{low}=\mu_H-\beta_{low}\sigma_H$、$\hat{\mathcal{H}}_{high}=\mu_H+\beta_{high}\sigma_H$。第三步,EMA 平滑 $\mathcal{H}_{low}^{(t+1)}=(1-\gamma)\mathcal{H}_{low}^{(t)}+\gamma\hat{\mathcal{H}}_{low}^{(t)}$(high 同理),得到随模型与训练阶段自动校准的时变熵带。第四步,按分段规则非对称塑形得 $\hat{A}_i$ 并代入 GRPO 裁剪目标。超参数:$\alpha_{high}=0.2,\alpha_{low}=0.5,\beta_{high}=0.3,\beta_{low}=0.2,\gamma=0.01$,$K=16$,batch 256,minibatch 32,温度 1。

技术新颖性

技术新颖性体现在五点。(1) 首次以群组熵(而非策略熵/token 熵)作为熵控制粒度,天然兼容 GRPO 的分组采样结构,零额外采样开销即可纳入。(2) 提出带原则性约束 $\alpha_{high}<\alpha_{low}$ 的非对称优势塑形,源于低熵区对负优势激进惩罚会引发长度坍缩的实证发现,这与简单的对称衰减或单一系数有本质区别。(3) 自适应熵阈值——从 batch 统计推导并用 EMA 平滑,能在不同基座模型(Intern-S1-mini 与 Qwen3.5-9B)和不同训练阶段自动校准,无需任务级调参,这一点已被 Qwen3.5-9B 上无需任何模型特定调优即取得最优所验证。(4) 理论支撑:命题 2.1-2.2 证明标准化优势存在熵依赖的结构性偏差,上界为 $C\sqrt{(\log N_x - H(x))/2}$,为“按熵区间干预”提供了动机。(5) 模型无关,可插入任意基于群组的策略优化方法。

实验结果

Intern-S1-mini 上 GEPO 在 13 个 benchmark 取最佳平均 54.2,优于 GRPO 51.5、AEPO 51.8、Clip-Cov 51.5、KL-Cov 51.8,13 项拿下 7 项最优,含 AIME25(82.0 vs 75.7)、IMO-Bench(52.8 vs 45.5)、GPQA(69.2 vs 64.3)、MMMU-Pro(59.8 vs 55.7)、Code(38.8 vs 34.3)。Qwen3.5-9B 上 GEPO 平均 71.2 仍居首,胜过 GRPO 70.7、Clip-Cov 70.9、KL-Cov 69.9、AEPO 67.1,并在 IMO-Bench(69.5)、CMPhysBench(43.2)、SFE(60.3)夺魁,验证跨模型泛化。训练稳定性上,Qwen3.5-9B 上 GRPO 在约第 170 步灾难性坍缩(AIME25 从约 85% 跌到约 40%),KL-Cov 100 步后坍缩,AEPO 持续震荡,而 GEPO 全程平滑上升;熵动力学上 GEPO 维持有界稳定熵而基线失控增长。消融显示去掉高熵控制退化最大(51.3),去掉低熵控制 52.6,去掉非对称塑形 53.0,证明各组件不可或缺且高熵控制贡献最大。

Main results on thirteen benchmarks across baselines and our methods
Table 1: Main results on thirteen benchmarks across baselines and our methods
Ablation results on asymmetric advantage shaping and bidirectional entropy control with Intern-S1-mini
Table 2: Ablation results on asymmetric advantage shaping and bidirectional entropy control with Intern-S1-mini
Typical validation curves during training process
Figure 3: Typical validation curves during training process
Policy entropy dynamics during training process of Intern-S1-mini
Figure 4: Policy entropy dynamics during training process of Intern-S1-mini
Task entropy dynamics during training process of Intern-S1-mini
Figure 5: Task entropy dynamics during training process of Intern-S1-mini
查看结构化数据
任务指标本文基线提升
Intern-S1-mini 13项平均 平均分 54.2 GRPO 51.5 / AEPO 51.8 / Clip-Cov 51.5 / KL-Cov 51.8 +2.4~2.7
Qwen3.5-9B 13项平均 平均分 71.2 GRPO 70.7 / Clip-Cov 70.9 / KL-Cov 69.9 / AEPO 67.1 +0.3~4.1
Intern-S1-mini 数学 AIME25 82.0 GRPO 75.7 +6.3
Intern-S1-mini 科学 GPQA 69.2 GRPO 64.3 +4.9
Intern-S1-mini 代码 LiveCodeBench 38.8 GRPO 34.3 +4.5
Qwen3.5-9B 物理 CMPhysBench 43.2 GRPO 41.2 +2.0
Qwen3.5-9B 视觉 MicroVQA 64.1 GRPO 62.9 +1.2

局限与改进

作者承认的局限:(1) 只在两个基座模型(Intern-S1-mini、Qwen3.5-9B,体量相对较小)上验证,更大模型的扩展性未经验证;(2) 训练用的是内部专有多模态数据集,未开源,影响可复现性;(3) 理论命题 2.1-2.2 给出的是最坏情况上界(如 $C\sqrt{(\log N_x-H(x))/2}$),且对每个提示并不一定取到最大偏差,是宽松界。我观察到的额外局限:(4) $\alpha_{high},\alpha_{low},\beta,\gamma$ 两组超参在两个模型上完全固定,但能否在架构差异更大的模型上同样鲁棒未作敏感性分析;(5) 与 AEPO/Clip-Cov/KL-Cov 的比较沿用了它们在 Qwen2.5-7B 上的原始超参,可能对基线不利,未做公平调参对照;(6) 群组熵作为蒙特卡洛估计在 $K=16$ 时对单提示仍有方差 $O(K^{-1})$,论文未讨论该噪声对塑形决策稳定性的影响;(7) 未拆分纯文本与多模态任务上 GEPO 增益是否有差异;(8) 群组熵与任务难度的关系是相关性而非因果性的论证。

独立分析的弱点

独立分析的弱点及改进方向:(1) 自适应阈值采用简单的 batch 均值加减若干倍标准差($\mu_H\pm\beta\sigma_H$),隐含群组熵近似高斯分布的假设;当任务混合呈双峰或重尾时阈值会失真,改进方向是改用分位数或聚类方法划定熵带。(2) 非对称系数 $\alpha_{high}<\alpha_{low}$(0.2 vs 0.5)人工固定,缺乏按领域自适应学习或调度的机制,可改为可学习或基于在线反馈的调度。(3) 长度坍缩的担忧是经验性的,论文并未从理论上保证 $\alpha_{high}<\alpha_{low}$ 能预防它,可补充理论分析或更系统的诊断。(4) 仅在不超过 9B 的小模型上验证,扩展到 30B+ 的行为不明,应补做规模实验。(5) 理论界中的 $N_x$(响应空间大小)对 LLM 难以良定义,界偏松,可探索更紧的界。(6) 未与更新的熵方法或 token 级方法做组合消融,可能错失互补增益。每个弱点都给出了相应改进路径。

未来方向

作者提出的方向:扩展到更大模型和更多样化的任务混合。基于成果可延伸的方向:(1) 将群组熵机制扩展到 30B+ 模型及纯文本/多模态的不同配比,研究扩展规律;(2) 图 5 显示 GEPO 保留了任务差异化的探索水平,这提示可探索自动任务课程或难度感知采样,与 GEPO 协同;(3) 自适应阈值机制可与在线奖励塑形、过程奖励模型结合;(4) 把 GEPO 思想移植到 GRPO 之外的其他分组方法(如 DAPO、RLOO)验证普适性;(5) “保留差异化探索优于统一熵”的发现,值得重审多任务 RL 的理论;(6) 群组级与 token 级方法可能互补,值得研究分层组合;(7) 补充收敛性与遗憾界的形式化理论分析,厘清非对称塑形的保证。

复现评估

复现性中等偏下。有利面:超参数完全给定($\alpha_{high}=0.2,\alpha_{low}=0.5,\beta_{high}=0.3,\beta_{low}=0.2,\gamma=0.01$,$K=16$,batch 256,minibatch 32,温度 1),基于开源框架 LMDeploy 和 Xtuner,benchmark 均为公开数据集,算法本身简洁(一个分段优势塑形 + 自适应阈值),易于重新实现。不利面:训练数据是内部专有多模态数据集,未开源;论文未提及发布官方代码(仅称“in-house implementation”);基座模型 Intern-S1-mini 虽开源但确切 checkpoint/版本可能变动,Qwen3.5-9B 的具体版本也需确认;消融只在 Intern-S1-mini 上做。RL 后训练的计算成本(每提示 16 回复、batch 256)不低,预计需要多张高端 GPU。没有官方代码和训练数据时完整复现主结果较困难,但算法可在小规模上做概念验证。