可验证奖励下的在策略蒸馏(OPDVR) On-policy Distillation with Verifiable Reward
用一个 ReLU 门控把在策略蒸馏改造成合法的 RLVR 方法,零新增超参数
前置知识
RLVR(可验证奖励强化学习)
用规则验证器(如数学答案判分、代码编译)给出客观确定性奖励来训练策略的后训练范式,典型做法是最终答案正确记 $R=+1$、错误记 $R=0$ 或 $-1$,用策略梯度(REINFORCE/GRPO)最大化期望奖励。奖励来自任务结果而非人工打分,因此信号可靠但极其稀疏。
OPDVR 的核心主张是把 sampled-token 蒸馏'重解释'为一种带隐式 token 级奖励的 RLVR 方法,全文的形式化推导都建立在 RLVR 的梯度公式 $\nabla\theta J = R\cdot\nabla\theta\log\pi_\theta$ 上,不懂 RLVR 就无法理解这个等价转换。
On-policy Distillation(OPD,在策略蒸馏)
学生模型自己采样生成回答,教师模型在相同前缀下给出输出分布,学生逐 token 最小化对教师分布的反向 KL 散度 $D_{KL}(\pi_\theta\|\pi_T)$。相比在离线数据上蒸馏,学生采样保证了训练分布与推理分布一致。sampled-token 版本用单次蒙特卡洛样本近似,损失为 $\sum_t \log\frac{\pi_\theta(o_t|q,o_{<t})}{\pi_T(o_t|q,o_{<t})}$。
OPDVR 就是对 sampled-token OPD 做最小修改:论文先推导出 OPD 梯度等价于带隐式奖励的策略梯度,再加 ReLU 门控。不理解反向 KL 与 sampled-token 近似,就看不懂门控加在哪里、为什么有效。
GRPO(组相对策略优化)
DeepSeek 提出的 RLVR 算法:对每个提示采样 $G$ 条回答,用组内奖励的均值和标准差归一化得到优势 $\hat{A}_{i,t}=\frac{R_i-\text{mean}(\{R_j\})}{\text{std}(\{R_j\})}$,正优势表示优于组平均。相比单轨迹 REINFORCE 大幅降低方差,且无需价值网络。
论文把 OPDVR 与 GRPO 组合得到 GRPD(Group Relative Policy Distillation),用组相对优势的符号替代二元奖励符号;GRPD 是本文的第二大贡献,其损失与 GRPO 同形。
REINFORCE 与对数导数技巧
最基础的策略梯度方法:$\nabla_\theta E[R]=E[R\cdot\nabla_\theta\log\pi_\theta(o|q)]$,即把轨迹奖励 $R$ 乘到每个 token 对数概率的梯度上。奖励为正则提升整条序列概率,为负则压低。它是判断'一个损失是不是合法 RL 方法'的基准形式。
论文的关键推导是把 sampled-token OPD 的梯度与 REINFORCE 梯度逐项对照,匹配 $\nabla_\theta\log\pi_\theta(o_t|q,o_{<t})$ 的系数从而识别出隐式奖励,这一步完全依赖对 REINFORCE 形式的熟悉。
研究动机
大模型后训练的两大主流范式各有硬伤。RLVR(可验证奖励强化学习)靠规则验证器给出确定性奖励,但信号是任务级稀疏的:一条上千 token 的推理链只有最终答案一个对/错信号,中间步骤完全没有监督,信用分配(credit assignment)极其困难。OPD(在策略蒸馏)恰好相反:教师在每个 token 上提供稠密的反向 KL 指导,但目标纯粹是分布匹配——不管轨迹答案对错,只要学生概率偏离教师就被拉回,导致性能上限被教师封死,还会把教师'看走眼'的 token 照样蒸馏给学生。已有的结合方案(OPD+GRPO 直接加权、RLSD 按优势符号在两个损失间切换、Uni-OPD 按教师奖励差距丢弃提示、RG-OPD 整条丢弃冲突轨迹、SG-OPD 对冲突 token 做标量缩放等)都把两者当作两个独立目标,靠加权系数或启发式准则取舍,引入了额外超参数和权衡,或者在轨迹层面粗暴丢弃数据。
本文的目标是本文的目标是把 OPD 的稠密逐 token 分布指导与 RLVR 的任务级可验证正确性无缝融合成单一目标:让每个 token 的学习信号方向严格由验证器判定的轨迹对错决定(正确轨迹只强化、错误轨迹只抑制),同时幅度仍由教师-学生概率比控制以保留教师的分布知识;并且整个过程不引入任何新超参数、不加权、不切换、不丢数据。更进一步,改造后的目标应当是一个'合法的' RLVR 方法,从而可以直接与 REINFORCE、GRPO、DAPO 等任意策略梯度算法组合,把二元验证器奖励升级为组相对优势。
与已有工作不同的是,本文的独特切入是视角转换:不从'两个损失怎么组合'入手,而是站在 RLVR 立场重新推导 sampled-token OPD,发现其梯度在数学形式上与策略梯度完全同构,等价于给每个 token 发放隐式奖励 $R^{OPD}(o_t)=\log\frac{\pi_T(o_t|q,o_{<t})}{\pi_\theta(o_t|q,o_{<t})}$(错误轨迹取反)。关键洞察是这个隐式奖励的符号由师生概率比决定、与轨迹对错完全无关,因此会产生两类违反 RL 原则的冲突更新——正确轨迹上惩罚做对的 token、错误轨迹上奖励做错的 token。既然问题只是符号失配,那么一个 $\max(0,\cdot)$ 的 ReLU 门控强制符号与验证器对齐,OPD 就'天然'变成合法 RLVR——把超参数化的组合问题化归为一次符号修正。
核心方法
直觉层面,RL 的经验原则是:正确轨迹上每个 token 都是有效预测,应获非负优势被强化;错误轨迹上每个 token 都应被非正优势抑制。标准 OPD 违反这条原则,因为其隐式权重 $\log(\pi_T/\pi_\theta)$ 可正可负且与对错无关。OPDVR 的修改因此极其简单:保留 OPD 的对数比幅度,用 ReLU 截断符号冲突的部分。技术路线分四步:第一步,把 sampled-token OPD 损失 $\mathcal{L}^{OPD}_{sample}=\sum_t\log\frac{\pi_\theta(o_t|q,o_{<t})}{\pi_T(o_t|q,o_{<t})}$ 的梯度与 REINFORCE 梯度 $R\cdot\nabla_\theta\log\pi_\theta(o_t|q,o_{<t})$ 逐项对照,识别出隐式 token 奖励 $R^{OPD}(o_t)=\log\frac{\pi_T}{\pi_\theta}$;第二步,按验证器结果 $R\in\{+1,-1\}$ 分情形分析符号失配;第三步,加 ReLU 门控强制符号与轨迹对错对齐;第四步,此时目标已是合法 RLVR,把二元符号替换为 GRPO 组相对优势 $\hat{A}_{i,t}$ 的符号,得到可用任意策略梯度优化器训练的 GRPD 变体。
核心创新是'隐式奖励重推导 + ReLU 门控'。作者证明 sampled-token OPD 梯度与 RLVR 梯度共享 $\nabla_\theta\log\pi_\theta(o_t|q,o_{\pi_T$ 的 token,标准 OPD 会错误压低做对的预测)和 Type II(错误轨迹上教师比学生更自信 $\pi_T>\pi_\theta$ 的 token,标准 OPD 会错误抬高做错的预测)。门控后教师仍控制更新幅度,但更新方向由验证器决定,蒸馏永远不会与任务奖励背道而驰。
方法步骤详情
第一步(采样与打分):给定提示 $q$,学生 $\pi_\theta$ 生成回答 $o=\{o_1,\dots,o_{|o|}\}$,逐 token 记录 $\pi_\theta(o_t|q,o_{<t})$;教师 $\pi_T$ 在相同前缀下给出 $\pi_T(o_t|q,o_{<t})$,得到对数比 $\log\frac{\pi_T}{\pi_\theta}$。第二步(验证):规则验证器判定最终答案,给轨迹二元奖励 $R\in\{+1,-1\}$;GRPD 版本改为对组内 $G$ 条回答计算 GRPO 优势 $\hat{A}_{i,t}=\frac{R_i-\text{mean}}{\text{std}}$ 并取符号。第三步(门控奖励):若 $R=+1$,$R^{OPDVR}(o_t)=\max(0,\log\frac{\pi_T}{\pi_\theta})$,教师越自信奖励越大;若 $R=-1$,$R^{OPDVR}(o_t)=\max(0,\log\frac{\pi_\theta}{\pi_T})\cdot(-1)$,学生越过度自信惩罚越重;符号冲突的 token 奖励归零。第四步(更新):计算 $\mathcal{L}^{OPDVR}(\theta)=-\sum_t R^{OPDVR}(o_t)\log\pi_\theta(o_t|q,o_{<t})$ 做策略梯度更新,被门控归零的 token 不回传梯度;GRPD 损失 $\mathcal{L}^{GRPD}(\theta)=-\frac{1}{G}\sum_i\sum_t\frac{R^{GRPD}(o_{i,t})\log\pi_\theta(o_{i,t}|q,o_{i,<t})}{|o_i|}$,其中 $R^{GRPD}=\text{sign}(\hat{A}_{i,t})\cdot\text{ReLU}(\text{sign}(\hat{A}_{i,t})\cdot\log\frac{\pi_T}{\pi_\theta})$。设置:同构为 Qwen3-4B 学生 + GRPO 在 DeepMath 57k 难度≥6 子集训练的 Qwen3-4B-RL 教师;跨架构为 Qwen3-1.7B-Base 学生 + Qwen3-4B-Base-RL 教师,DAPO-Math-17k 数据,3 epochs;GRPD 组大小 $G=8$。
技术新颖性
新颖性体现在三个层面。其一,理论形式化:首次把 sampled-token OPD 完整重写为带隐式 token 级奖励的 RLVR 方法,证明两类范式在梯度层面同构($\mathcal{L}^{OPD}_{sample}$ 与 $\mathcal{L}^{RLVR}$ 仅差一个符号约定),此前所有加权/切换类工作都没有给出这种统一视角。其二,机制极简且有精确解释:修正冲突信号不需要新损失项、新系数或数据筛选规则,一个 ReLU 即可,且论文证明其恰好等价于剔除 Type I/II 两类冲突 token 的条件掩码——消融实验显示零门控比例稳定在 40-50%,说明冲突 token 是训练全程持续存在的结构性现象而非噪声。其三,可组合性:因为输出是合法 RLVR 目标,天然兼容 REINFORCE/GRPO/DAPO,作者据此提出 GRPD,把二元奖励升级为组相对优势符号,平均 49.4 的成绩也验证了统一优势表述优于 Distilled RL 的启发式切换。与 SG-OPD 对冲突 token 只做标量缩放不同,OPDVR 直接归零;与 RG-OPD/Uni-OPD 的轨迹级丢弃不同,OPDVR 在 token 粒度操作,保留冲突轨迹中的有效 token。
实验结果
主实验覆盖同构与跨架构两种设置,在六个数学推理基准(AIME24/25、AMC、MATH500、Minerva、OlympiadBench)上以 avg@16 准确率评估。同构设置(Qwen3-4B←Qwen3-4B-RL,表 1):OPDVR 平均 49.1,超过最强基线 ExOPD(47.9)1.2 分、标准 OPD(47.8)1.3 分,较学生起点 42.0 提升 7.1 分,并在 AIME24 上以 36.9 反超教师的 36.0。跨架构(Qwen3-1.7B-Base←Qwen3-4B-Base-RL,表 2):OPDVR 平均 22.8,领先最强基线 Top-64 OPD(21.7)1.1 分,AMC 达 30.3(RLSD 28.7)。GRPD(表 3):平均 49.4,全面超越 GRPO(44.8,AIME24 +6.5、AIME25 +10.9)、OPD(48.4)和启发式切换的 Distilled RL(48.7)。门控消融(表 4、图 3):方向取反的 Inverse-Gated 平均仅 44.6,低于普通 OPD 的 47.8,六基准均保持 OPDVR>OPD>Inverse-Gated 的单调次序,证明收益来自门控方向与验证器对齐。训练动态(图 4):零门控 token 比例全程稳定在约一半(4B 学生 0.48-0.50,1.7B 学生 0.40-0.44),说明冲突 token 是贯穿训练的固定比例;熵与响应长度趋势则依赖师生组合(同构设置响应长度从 1.6k 膨胀至 6.7k+,跨架构熵从约 2.0 崩塌),并非蒸馏目标的普遍规律。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 同构数学推理蒸馏(Qwen3-4B←Qwen3-4B-RL,六基准平均) | avg@16 准确率 | OPDVR 49.1 | 最强基线 ExOPD 47.9;标准 sampled-token OPD 47.8;教师 50.4;学生 42.0 | 较 ExOPD +1.2 分,较 OPD +1.3 分,较学生起点 +7.1 分 |
| 同构设置 AIME24 | avg@16 准确率 | OPDVR 36.9 | 教师 Qwen3-4B-RL 36.0;ExOPD 29.8;OPD 34.2 | 反超教师 +0.9 分,较 OPD +2.7 分 |
| 跨架构蒸馏(Qwen3-1.7B-Base←Qwen3-4B-Base-RL,六基准平均) | avg@16 准确率 | OPDVR 22.8 | 最强基线 Top-64 OPD 21.7;OPD 20.9;教师 30.9;学生 17.3 | 较 Top-64 OPD +1.1 分,AMC 单项 30.3 领先 RLSD 28.7 达 1.6 分 |
| GRPD 同构设置(DAPO-Math-17k 训练,六基准平均) | avg@16 准确率 | GRPD 49.4 | GRPO 44.8;OPD 48.4;Distilled RL 48.7 | 较 GRPO +4.6 分(AIME24 +6.5、AIME25 +10.9),较 Distilled RL +0.7 分 |
| 门控方向消融(同构设置,六基准平均) | avg@16 准确率 | OPDVR 49.1 | OPD 47.8;方向取反的 Inverse-Gated 44.6 | 较 OPD +1.3 分;错误方向的门控反而比 OPD 低 3.2 分,验证方向对齐是关键 |
局限与改进
作者承认的局限较少,主要隐含在实验设定中:全部实验限于数学推理(DeepMath、DAPO-Math-17k),验证器依赖可自动判分的最终答案,未覆盖代码之外的可验证任务(SQL、形式证明)和不可验证的开放任务;教师仍是能力天花板——同构设置 OPDVR 平均 49.1 未超过教师的 50.4,门控只是止损冲突信号,无法注入超越教师分布的知识。从我的观察看还有几点:奖励为二元 $\pm1$,比 GRPO 常用的 $\{0,1\}$ 更尖锐,同一条轨迹内所有 token 共享同一符号,长推理链上的信用分配噪声未被讨论;约 48-50% 的 token 梯度被置零,教师打分和前向计算照常进行,样本与算力效率有约一半的隐性损耗;门控依赖师生逐 token 概率比,跨 tokenizer 蒸馏场景(词表不同)下对数比无法直接对齐,论文未讨论;同构设置中响应长度从 1.6k 暴涨逾 4 倍至 6.7k+、熵持续上漂,论文仅作现象描述而未给出长度/熵控制对策;此外理论分析基于 on-policy 单样本估计,与 GRPO/DAPO 的 clipping、KL 正则、off-policy 缓冲共存时的性质未做分析。
独立分析的弱点
第一,二元奖励粒度太粗:OPDVR 用 $\{+1,-1\}$,组内所有错误轨迹(差一步就对与完全跑偏)的惩罚权重相同,改进方向是接入连续/分级验证信号(部分得分、过程奖励模型),把门控从符号对齐扩展到幅度校准。第二,约一半 token 梯度被零门控造成算力浪费:前向与教师打分照做却不产生更新,可按符号冲突预筛选、仅对保留 token 回传。第三,教师与验证器同时出错的 token 得不到任何学习信号(梯度归零形成盲区),可用多教师投票或自洽性采样补充噪声鲁棒信号。第四,适用域受限:需要确定性轨迹级对错判定,开放域生成、多轮对话、Agent 任务无法直接套用,可探索 LLM-as-judge 下的软门控版本。第五,训练稳定性悬而未决:同构设置响应长度膨胀逾 4 倍(约 1.6k 到 6.7k+)、熵单调上升,缺少长度惩罚或熵正则对策。第六,教师天花板未消解:Inverse-Gated(44.6)仍优于学生起点(42.0),说明教师分布指导本身有价值,但门控无法注入超越教师分布的知识,可研究与在线教师更新或 self-distillation 结合。
未来方向
作者明确指出 OPDVR 是通用框架,可与任意策略梯度算法组合,论文只实例化了 GRPO(GRPD),后续可直接扩展到 DAPO、PPO、REINFORCE++、RLOO 等,也可将组相对优势替换为其他优势估计并系统比较。基于本文成果可延伸的方向包括:把门控思想推广到 top-k OPD 与全词表 OPD(本文只处理 sampled-token 版本);在代码生成、形式化数学、Agent 工具调用等更多可验证域验证泛化性;研究零门控比例随训练的演化规律,据此动态调节教师介入强度或设计退火策略;用过程奖励模型提供 token 级连续奖励替代二元符号,实现比符号对齐更细的幅度对齐;针对教师-验证器同时出错的盲区,引入多教师集成或 self-consistency 信号补充;解决跨 tokenizer 蒸馏时对数比的对齐问题以支持真正的异构师生对;以及在数据维度研究门控对不同难度题目的选择性——结论基于 DeepMath 难度≥6 的 57k 子集,是否在简单题或分布外题目上同样成立值得检验。
复现评估
复现条件较好,整体中等偏易。代码已开源:https://github.com/LeapLabTHU/OPDVR。数据全部公开:同构设置用 DeepMath 难度≥6 的 57k 过滤子集,跨架构与 GRPD 用 DAPO-Math-17k。教师是公开 Qwen3-4B-base 用 GRPO 自训练 3 epochs 得到(需额外一轮 RL 训练算力),学生为 Qwen3-4B-nonthinking 与 Qwen3-1.7B-Base,均为开源权重。全部基线(Sampled-Token OPD、Top-64 OPD、OPD+GRPO、RLSD、ExOPD、SG-OPD、Distilled RL)实现细节在附录 B.2。评估协议透明:六个公开基准、avg@16 采样、标准数学答案匹配验证器。算力为 4B/1.7B 模型 RL 训练量级,注意训练时需在片上同时跑教师前向打分,开销高于纯 GRPO;但方法实现极简——在 sampled-token OPD 上加一个 $\max(0,\cdot)$ 与验证器符号即可,工程门槛低,主要成本在 GPU 时与超长响应(6.7k+ token)带来的序列长度压力。
论文图表