最佳实践评论家优化:面向大语言模型强化学习的稳定Critic训练配方 Best Practice Critic Optimization
通过有界价值头、蒙特卡洛目标与长度自适应GAE,让单样本Critic强化学习稳定媲美GRPO
前置知识
PPO 与比值裁剪
Proximal Policy Optimization 用裁剪代理目标 $\mathcal{L}_{\text{PPO}}=\mathbb{E}_t[\min(\rho_t\hat{A}_t,\text{clip}(\rho_t,1-\epsilon,1+\epsilon)\hat{A}_t)]$ 限制新旧策略比值 $\rho_t=\pi_\theta(y_t|s_t)/\mu(y_t|s_t)$ 的偏离,形成信任域。它对每个 token 施加同一比值阈值。
本文指出这种统一比值阈值对低概率 token 过紧、对高概率 token 过松,正是 BPCO 改用 DPPO 的出发点,理解裁剪机制才能看懂第一步实验。
Critic / 价值函数
价值函数 $V^\mu(s_t)=\mathbb{E}_\mu[R(x,y)|s_t]$ 表示从当前前缀出发、继续采样到结束所能获得的期望回报。Critic 是用神经网络 $V_\phi$ 对它的近似,配合 TD 残差 $\delta_t=r_t+\gamma V(s_{t+1})-V(s_t)$ 为每个 token 构造优势。
整篇论文都在回答'如何让 critic 学得准且稳':价值头输出范围、训练目标、输入信息三个维度都是围绕 critic 展开的。
GAE(广义优势估计)
GAE 把多步 TD 残差做指数加权求和 $\hat{A}^{\text{GAE}(\lambda)}_t=\sum_{l=0}^{T-t}(\gamma\lambda)^l\delta_{t+l}$。$\lambda$ 控制偏差-方差权衡:$\lambda=1$ 时遥测为无偏蒙特卡洛估计 $R(x,y)-V(s_t)$,$\lambda<1$ 则更多依赖自举的 critic 预测、方差更小但有偏。
BPCO 的解耦 GAE(策略 $\lambda_\pi=0.99$、critic 目标 $\lambda_V=1$)和长度自适应 GAE 都是对这一个参数的精细设计,不懂 GAE 无法理解核心章节。
GRPO 组相对优势
GRPO 对每个提示采样 G 条回答(本文基线取 G=16),用组内奖励归一化 $\hat{A}_{t,i}=(R_i-\mu_R)/\sigma_R$ 作为所有 token 的优势,完全不需要 critic。Dr.GRPO 进一步去掉 $\sigma_R$ 归一化,变为 $R_i-\mu_R$。
GRPO 是本文的主要对照组:BPCO 声称在每提示只采 1 条回答(组方法的 1/16 采样量)的条件下匹配或超过它,这一对比贯穿所有实验。
批内优势归一化
许多 PPO 实现在更新前把优势按批标准化 $\hat{A}_t\leftarrow(\hat{A}_t-\bar{A})/\sigma_A$,强制每批优势具有单位方差。初衷是稳定更新尺度,但它抹掉了优势的真实量级信息。
论文用一个完整小节论证这是'根本性有问题'的默认技巧:策略接近最优时它阻止更新自然消失,还会翻转小正优势的符号,是 BPCO 明确移除的组件之一。
特权信息与集中训练分散执行
多智能体 RL 中的 CTDE 思想允许训练时 critic 访问执行时不可见的信息(如 StarCraft II 中隐藏的游戏状态),因为 critic 只在训练期使用、部署时丢弃。特权信息 $q(x)$ 指由提示决定的奖励定义信息,如参考答案、官方解答、评分 rubric。
本文把 CTDE 思想引入 LLM RL:critic 可以'偷看'策略看不到的参考答案,且理论上不改变最优价值函数,这是 BPCO 最独特的贡献点。
研究动机
组相对方法(GRPO)虽然避免了训练价值网络,但每个提示要采样 G=16 条回答才能估计优势,且同一回答内所有 token 共享同一个结果级优势,信用分配粗糙。直接改用学习型 critic 理论上只需一条回答就能给出 token 级优势,但在 LLM 训练中长期不稳定:PPO 的比值裁剪对低概率 token 过紧、对高概率 token 过松;自举(bootstrap)价值目标会继承 critic 自身的误差(VC-PPO 已指出);固定 GAE 参数 λ 让终止奖励在长回答早期 token 上的权重按 $\lambda^{T-t}$ 指数衰减(VAPO 已指出)。作者在 verl 框架上微调 DeepSeek-R1-Distill-Qwen-1.5B 时还发现两个未被系统研究的问题:线性价值头可以预测出超出已知奖励范围 [0,1] 的值;批内优势归一化在策略接近最优、优势方差变小时把估计噪声放大成大更新信号。典型症状是:在 1,460 道初始模型本可解出的数学题上训练,PPO 的训练奖励先升后坍塌——数据可解、容量充足却训不稳,说明问题出在优化配方本身。
本文的目标是本文的目标工程化而明确:构建一套可复现的单 rollout actor–critic 配方 BPCO,使基于 critic 的 LLM 强化学习在稳定性上不再输给 GRPO,同时把每个提示的采样量从 16 条降到 1 条。具体拆解为三层:其一,在可控 sanity 测试中逐个隔离每个设计选择(策略目标、价值头输出范围、价值目标构造、优势归一化、特权输入、GAE 参数)对训练稳定性的因果影响,每一步保留之前所有修改,确保归因干净;其二,把通过验证的组件组合成完整配方,在 40.3K 数学题数据集、1.5B 到 30B-A3B 混合专家模型上验证其随数据和模型规模的扩展性,并与 Dr.GRPO 组基线做轨迹数对齐的公平比较;其三,考察训练期专属的特权信息(参考答案、官方解答、评分 rubric)能否加速 critic 学习,以及这种加速在何种条件下会转化为策略收益、何时反而带来过拟合风险。
与已有工作不同的是,本文的独特切入有三点。第一,作者不把 critic 不稳定当作单一问题,而是像做控制变量实验一样,在 1,460 道初始模型可解的数学题上一次只改一个组件,用'应该能拟合到接近 100% 奖励却失败'来暴露纯优化问题,把 DPPO、有界价值、蒙特卡洛目标、去归一化、LA-GAE 五个修复的因果链逐一拆开,这与大多数论文直接端到端对比的做法截然不同。第二,提出训练期特权输入:critic 在部署后被丢弃,因此可以喂给策略看不到的奖励定义信息 $q(x)$(参考答案/评分 rubric),这借鉴了多智能体 RL 的'集中训练、分散执行'(CTDE)思想,但由于 $q(x)$ 由提示完全决定,理论上不改变最优价值函数,也不增加任何推理成本。第三,正面质疑批内优势归一化这一被广泛当作默认技巧的做法,指出它在接近最优时会阻止更新消失、甚至翻转小正优势的符号,这种对'实现细节'的系统审视在 LLM RL 文献中少见。
核心方法
直觉上,critic 之所以不稳,是因为它的输出范围、训练目标、输入信息和产生的策略信号彼此脱节。BPCO 用五个互相配合的组件把它们对齐。(1) 策略目标用 DPPO:把 PPO 的固定比值边界 $1\pm\epsilon$ 换成 $1\pm\epsilon/\mu(y_t|s_t)$,等价于直接约束被采样 token 的概率绝对变化 $|\pi_\theta(y_t|s_t)-\mu(y_t|s_t)|\le\epsilon$,让高低概率 token 受到同等的绝对概率约束。(2) 价值头有界化:用缩放 arctan 参数化 $V_\phi(s_t)=R_{\min}+\frac{1}{2}(R_{\max}-R_{\min})\left(\frac{1}{2}+\frac{1}{\pi}\arctan z_\phi(s_t)\right)$,保证价值预测永远落在已知奖励区间内。(3) 解耦 GAE:策略优势用 $\lambda_\pi=0.99$ 保留方差缩减,critic 目标用 $\lambda_V=1$ 的蒙特卡洛目标——在仅有结果奖励、$\gamma=1$ 时目标遥测为观测回报 $R(x,y)$,彻底消除自举偏差。(4) 去掉批内优势归一化,直接用原始 GAE 优势更新策略。(5) 长度自适应 GAE:$\lambda_\pi(L)=1-\frac{1}{\alpha L}$(实验取 $\alpha=0.4$),使最早 token 上终止残差的系数 $\lambda_\pi(L)^L\approx\exp(-1/\alpha)$ 几乎与回答长度无关。
核心创新在于与 GRPO 和以往 critic 方法(VC-PPO、VAPO、SAO)的本质区别。GRPO 用每题 16 条采样的组内相对优势彻底回避 critic,代价是采样开销和粗糙的结果级信用分配;VC-PPO 和 VAPO 已经提出解耦 GAE、critic 预热与长度自适应 GAE,但保留了无界线性价值头和批内优势归一化两个隐患。BPCO 首次系统证明这两个默认实现会破坏训练:无界价值头会预测出 [0,1] 之外的极端值导致不稳定;归一化会把接近最优时本应变小的残差信号放大回单位方差,阻止更新消失并翻转小正优势的符号、损害探索。另一个概念性贡献是特权 critic 输入:因为 $q(x)$ 由提示完全决定,条件价值 $V^\mu_\phi(s_t,q(x))\approx\mathbb{E}_\mu[R(x,y;q(x))|s_t,q(x)]$ 与无条件价值的最优值相同,显式给出参考答案或 rubric 只是降低了有限容量模型的拟合难度,策略输入与部署要求完全不变。BPCO 因此把'critic 只是训练期内部工具'这一观察,变成了可度量、可消融的收益来源。
方法步骤详情
论文用六步法逐步构建配方,每步都在 sanity 测试中实验验证。Step1:在 verl(2026-06-16 commit)上以每迭代 1,024 条轨迹、minibatch 256、策略学习率 $10^{-6}$、critic 学习率 $10^{-5}$ 训练 1,500 迭代,输入输出为提示→回答→二元奖励,发现 PPO 在 $\lambda=1$ 时训练奖励坍塌,换 DPPO 后稳定,但 $\lambda=0.99$ 又失稳,后者被保留作为后续步骤的压力测试。Step2:输入为 critic 线性头输出 $z_\phi$,经 arctan 有界化映射到奖励区间,消除 [0,1] 外的极端预测,训练奖励稳定逼近 1.0。Step3:解耦 GAE 参数,策略保留 $\lambda_\pi=0.99$,critic 直接回归观测奖励 $R(x,y)$;同时指出对自举目标的解释方差会自指地冲向 1 而失去诊断意义,改对 MC 目标度量。Step4:删除 $\hat{A}_t\leftarrow(\hat{A}_t-\bar{A})/\sigma_A$ 的批内归一化,保留原始优势尺度。Step5:给 critic 输入拼接参考答案等特权信息 $q(x)$。Step6:把固定 λ 换成 $\lambda_\pi(L)=1-\frac{1}{\alpha L}$。大规模评估时所有方法共享同样的每迭代总轨迹数(组方法减半提示数、critic 方法 1 条/提示),critic 方法仅在第 1–15 迭代预热 critic。
技术新颖性
新颖性在于'配方系统学'而非单点算法:每个组件单独看大多有出处——DPPO 源自同组前作,LA-GAE 源自 VAPO,解耦目标与 critic 预热源自 VC-PPO——但本文的贡献是第一次在受控 sanity 测试里为每个组件给出因果证据,并揭示两个此前无人系统报告的问题:线性价值头越界和批内归一化放大噪声。缩放 arctan 有界价值头本身是新的且实现极简,一行代码即可替换线性头。特权 critic 输入在 LLM RL 语境下也是新应用:StarCraft II 的 SCC 等系统曾把隐藏状态暴露给训练期 critic,但把'参考答案/评分 rubric'作为特权输入、并系统分析其加速收益与小数据过拟合风险的权衡是本文首创。此外,论文澄清了解释方差指标的方法论陷阱:当目标含旧 critic 预测时($\lambda_V<1$),EV 趋近 1 只说明自指拟合,不能证明 critic 准确——这一提醒对整个 LLM RL 社区都有普遍价值。
实验结果
四组实验支撑三个结论。其一,sanity 测试(DeepSeek-R1-Distill-Qwen-1.5B,1,460 道可解题,1,500 迭代,每迭代 1,024 轨迹):PPO 在 $\lambda=1$ 时奖励坍塌,DPPO $\lambda=1$ 稳定而 $\lambda=0.99$ 失稳;加有界价值后训练奖励稳定逼近 1.0;换 MC 目标后收敛更快更稳,而对自举目标的解释方差虚高到接近 1、毫无诊断价值;去归一化让优势范围保持小而稳定(归一化时幅度持续增长),AIME 2025 avg@32 的过拟合更轻;特权参考答案让奖励与解释方差上升更快但 AIME 峰值更早回落;LA-GAE $\alpha=0.4$ 兼得训练速度与验证性能($\lambda=0.99$ 快但验证下滑,$\lambda=1$ 稳但慢)。其二,DeepScaleR 40.3K 数据集(1.5B,最长 24,000 token):BPCO、BPCO+Ans、BPCO+Ans+Sol 在 AIME 2025 avg@32 上全程领先 Dr.GRPO(16 样本/题)与 critic 基线,解释方差持续更高;消融显示去掉有界价值会拖慢训练、降低 AIME,重新引入归一化使优势幅度增长但收益甚微。其三,MoE 扩展(DAPO-Math-17K,Qwen3-30B-A3B(−Base),最长 12,000 token):Qwen3-30B-A3B 上 critic 基线约 100 步后 AIME 停滞,BPCO 显著更高;30B-A3B-Base 上 BPCO 追平或超过组基线。其四,rubric 任务(Qwen3-4B-Base + 冻结 Qwen3-4B-Instruct-2507 评分器,Open-Rubrics):BPCO 学习快于两个基线,组基线最终接近,特权 rubric 无额外策略收益但解释方差更高。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 数学推理 sanity 测试(1,460 道可解题,1.5B 模型) | 训练奖励收敛性 + AIME 2025 avg@32 | DPPO + 有界价值 + MC 目标组合下训练奖励稳定逼近 1.0,AIME avg@32 稳定在 0.2 以上 | PPO(λ=1)训练奖励先升后坍塌至 0 附近;DPPO(λ=0.99)同样失稳 | 唯一稳定收敛的配置,且每一步修复都有独立因果证据 |
| DeepScaleR 40.3K 数学题(DeepSeek-R1-Distill-Qwen-1.5B,最长 24K token) | AIME 2025 avg@32、解释方差 | BPCO 及特权变体(+Ans/+Sol/+Ans+Sol)训练全程领先(图 7 纵轴 0.18–0.35 区间内居顶),解释方差持续更高 | Dr.GRPO 组基线(16 样本/题)与含 VC-PPO/VAPO 技术的 critic 基线 | 以每提示 1 条回答(组方法 1/16 的采样量)匹配或超过组基线 |
| DAPO-Math-17K(Qwen3-30B-A3B 与 30B-A3B-Base 混合专家模型,最长 12K token) | AIME 2025 avg@32 | BPCO 在两个 MoE 模型上均持续提升,30B-A3B 上显著高于两个基线,30B-A3B-Base 上与组基线相当或更好 | critic 基线在 Qwen3-30B-A3B 上约 100 步后 AIME 停止提升(不稳定优化) | 修复了强基线在更大模型上失效的问题,验证配方随模型规模扩展 |
| Open-Rubrics 开放式评分奖励任务(Qwen3-4B-Base,冻结 Qwen3-4B-Instruct-2507 评分) | 验证奖励 / 训练奖励 / 解释方差 | BPCO 早期学习速度最快;特权 rubric 使解释方差更高但无额外策略收益 | 组基线最终达到可比性能;critic 基线终值略低且解释方差低 | 证明有界价值 + 原始优势可从数学奖励迁移到非可验证的 rubric 奖励 |
局限与改进
作者承认的局限:证据仅覆盖数学与 rubric 奖励,未验证代码、agent 等其他任务类型;BPCO 要求奖励范围 $[R_{\min},R_{\max}]$ 先验已知,对连续或过程奖励需要额外假设;特权变体依赖参考答案、官方解答、评分 rubric 这类评估器信息,并非所有任务都存在;critic 训练带来的额外计算与显存开销没有计入轨迹匹配比较,'单 rollout 更省采样'的说法在总算力对账上不完全公平。我的补充观察:关键超参数(LA-GAE 的 $\alpha=0.4$、预热 15 迭代、1:10 的策略/critic 学习率比)来自有限扫描,未必全局最优,迁移到新任务时可能需要重新调参;单 rollout 下没有组内基线可对照,critic 误差会直接进入策略信号,对 critic 质量的敏感性只是被缓解而非消除;MC 目标每个状态只有一个回报样本、方差大,图 7 中解释方差整体仍偏低且波动(约 0.25–0.75),说明 critic 远未达到精准拟合;作者也承认去归一化的收益在大数据集上只是 modest,原因是训练尚未收敛,这一结论的外推需要谨慎;特权信息在小数据上的过拟合问题只被观察到而未给出缓解手段。
独立分析的弱点
弱点一:特权信息是把双刃剑——在 1,460 题的小数据上 AIME 2025 avg@32 更早见顶回落(图 5),在 40.3K 大数据上才有净收益,但论文没有给出自动判断'该不该用特权输入'的准则,可以引入基于验证集的早停、特权输入 dropout 或把 $q(x)$ 编码为可正则化的软提示。弱点二:有界 arctan 头要求奖励范围已知,在奖励范围未知、非平稳(如奖励模型随训练更新)或多目标场景失效,可改为可学习的 soft bound 或用分位数回归的 distributional critic(天然有界且能刻画回报分布)。弱点三:批内归一化的否定结论建立在小批量(256)与接近收敛的设定上,未在其他批量规模、多 epoch 场景系统验证,结论边界不清晰。弱点四:解释方差整体偏低说明 critic 拟合远不充分,每状态单样本的 MC 目标方差大,可用多样本重采样、目标编码或 critic 集成降低方差。弱点五:超长回答(12K–24K token)下信用分配依然困难,$\lambda_\pi(L)$ 的 $\alpha$ 是全局常数,未来可按位置或难度自适应。每个弱点都对应可操作的改进方向,这也是这篇配方型论文留下的明确挖掘空间。
未来方向
作者指出的方向:把 BPCO 推广到更多奖励类型(过程奖励、连续奖励、多目标),研究特权信息的安全使用方式(正则化、早停、选择性输入),以及在奖励范围假设不成立时放宽有界头的要求。基于本文成果可延伸的研究:其一,与 SAO 的异步单 rollout 框架结合,检验 BPCO 在非同步训练、策略漂移更大的 agent 场景中是否依然稳定;其二,把特权 critic 与奖励模型训练结合——学到的 $V(s_t,q(x))$ 本身蕴含了'给定参考答案时前缀的期望得分',可作为过程级评估器或稠密奖励的来源,实现结果奖励到过程监督的蒸馏;其三,理论层面分析有界参数化与 LA-GAE 的收敛性质,目前全套配方只有实证支撑;其四,在代码生成、工具调用等 agent 任务上验证,那里特权信息(测试用例、工具文档)天然存在且强;其五,研究特权输入的'蒸馏'与遗忘:训练结束后 critic 的知识能否部分迁移回策略或奖励模型,而不是直接丢弃;其六,把去归一化的结论推广为'自适应优势缩放',在保留量级信息的同时控制极端值。
复现评估
复现条件在同类工作中属于良好水平。代码已开源(github.com/QPHutu/golden_critic),基于 verl 框架(2026-06-16 commit);论文给出完整超参:策略学习率 $10^{-6}$、critic 学习率 $10^{-5}$、minibatch 256、每迭代 1,024 轨迹、1 个优化 epoch、critic 预热 15 迭代、$\lambda_\pi=0.99$、$\lambda_V=1$、LA-GAE $\alpha=0.4$、DPPO 的 $\epsilon$,以及 24,000/12,000 token 的生成长度上限。数据与模型全部公开:DeepScaleR(40.3K 题,其中 7.3K 含官方解答)、DAPO-Math-17K、Open-Rubrics、AIME 2025 评测集,以及 DeepSeek-R1-Distill-Qwen-1.5B、Qwen3-30B-A3B(−Base)、Qwen3-4B-Base/Instruct-2507。难度主要在算力而非信息缺口:仅 sanity 测试就需 1.5B 模型跑 1,500 迭代×1,024 轨迹,MoE 实验是 30B-A3B 跑约 1,000 步,需要多机多卡集群;1.5B 规模的 sanity 测试与 DeepScaleR 实验对拥有数张 A100/H100 的团队可行,30B-A3B 的复现则需大集群。总体评估:中等偏难,但日志指标(奖励、解释方差、优势范围)齐全,中间结果易核对。
论文图表