在线策略反向蒸馏:激发弱到强泛化 Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation
用弱教师策略偏移方向放大强学生自身梯度,加速训练并突破教师上限
前置知识
RLVR(可验证奖励的强化学习)
用程序化验证器(如精确答案比对、代码执行)代替人类或神经网络奖励来优化语言模型策略的方法,是当前推理后训练的主流范式。典型实现如 GRPO:对每个提示采样一组响应,用组内奖励的相对值作为优势 $A_t$,按 token 级策略梯度 $g_t = A_t \nabla_{z_t} \log \pi_\theta(y_t|s_t)$ 更新模型。
OPRD 的学生优化目标就是 RLVR,论文的所有理论性质(驻点保持、一阶增益)都定义在这个验证器驱动的策略梯度之上,不理解 RLVR 就无法理解 OPRD 在缩放什么。
在线策略蒸馏(OPD)
为解决固定/教师生成序列与学生在推理时实际访问前缀的分布不匹配,OPD 在学生自己采样的响应上逐前缀查询教师,用反向 KL $D_{KL}(\pi_\theta(\cdot|s_t) \| \pi_T(\cdot|s_t))$ 提供稠密的 token 级监督。其逐点最优解就是教师策略本身。
OPD 是本文的直接对照基线:在弱到强场景下 OPD 学生快速逼近弱教师后即饱和,作者通过对比 OPD 与 OPRD 的差异引出'教师不该是优化目标'的核心论点。
弱到强泛化(Weak-to-Strong Generalization)
研究更强的预训练模型能否从更弱的监督者(更小模型、不完美人类反馈)中学习并最终超越监督者。先前工作(Burns 等的超对齐)表明这在语言理解、奖励建模和推理任务上都成立,但弱监督通常只能恢复与强监督差距的一部分。
本文把弱到强泛化从分类/奖励建模推进到 RL 后训练阶段,聚焦两个工程场景:连续代际迁移(小模型教大模型)和多域整合(多个小专家合并成大模型)。
KL 正则化策略优化与参考策略
RLHF/RLVR 通常在目标中加入对参考策略(pre-RL 模型)的 KL 惩罚,防止策略漂移过远。其隐式奖励可解释为 $r = \beta \log(\pi/\pi_{ref})$,因此'后训练策略减参考策略'的 log-policy ratio 携带教师学到的奖励信息。
OPRD 提取的教师信号正是 $\Delta_t = \mathcal{C}(z_T - z^{ref}_T)$,即教师相对其参考策略的逐 token 偏移;这个偏移有隐式奖励解释,是'教师学到了什么'的载体。
梯度投影与梯度手术
多任务优化中在梯度层面(而非损失层面)组合目标的技术:把一个任务的梯度投影到另一任务梯度的法平面(PCGrad)、用余弦相似度门控辅助梯度等,用于消除任务间的梯度冲突。
OPRD 在形式上最接近这个家族——把学生梯度分解为沿教师方向 $d_t$ 的投影 $\text{Proj}_{d_t}(g_t)$ 和正交分量 $g_t^\perp$——但方向相反:它只放大、不删除,因此能严格保持优化驻点。
研究动机
现代大模型迭代中,对每个新一代前沿规模模型从头重复后训练(如 RLVR)成本高到难以承受,因此让上一代已后训练的较弱模型监督下一代更强模型极具吸引力。论文聚焦两个具体场景:(i) 连续代际迁移,例如用 4B 规模的 Qwen3 后训练检查点教 8B 规模的学生;(ii) 多域整合,先在小规模上独立训练多个领域专家(实验中是 4 个 4B-Base 专家),再用多教师蒸馏合并成一个 8B-Base 统一模型。然而现有方法存在结构性缺陷:常规蒸馏和在线策略蒸馏(OPD)把弱教师当作优化目标,反向 KL 的逐点最优解就是教师策略本身(论文式 2.3),于是教师的三种成分——RL 学到的改进、参考策略继承的偏好、弱容量造成的行为限制——被整体转移,学生会被教师容量上限卡住,OPD 在逼近教师水平后即饱和;KDRL 等混合方法在奖励最大化之外增加教师匹配损失,当教师偏好的解与验证器奖励冲突时两个目标相互竞争;即便改成匹配教师后训练的'策略变化量'也不行,因为这个 delta 只包含弱模型实际实现的改进范围,直接匹配同样施加容量限制。
本文的目标是本文的目标是设计一种蒸馏机制,让强学生充分利用弱教师在后训练中学到的收益来加速自身优化,但既不把教师的最终策略、也不把教师的策略偏移当作任何独立的优化目标。具体验收标准包括:在连续代际迁移中,学生应先快速达到教师水平、再持续超越教师而不是停在教师附近;在多教师整合中,学生应在每个任务上都超过对应的领域专家,而不是在任务间相互妥协;在常规强到弱蒸馏中方法同样有效;并且方法应保持学生自身 RLVR 目标的驻点不变,使学生的可达性能由验证器目标和自身策略类决定,而不被教师能力封顶。
与已有工作不同的是,论文的独特切入点是把'教师学到了什么'与'教师是什么'分开处理:不蒸馏教师的完整策略(那是 RL 改进、参考偏好和容量限制的混合体),而是提取教师相对其参考策略的逐 token 策略偏移 $\Delta_t = \mathcal{C}(z_T - z^{ref}_T)$,且只使用其单位方向 $d_t$,绝不把它作为目标。技术形式上 OPRD 借鉴了多任务优化的梯度操纵(如 PCGrad 的投影),但用途相反:已有方法对冲突梯度做删除或降权,OPRD 只对学生验证器梯度中与教师方向对齐的分量做正缩放、正交分量原样保留。由于这等价于线性映射 $(I + \lambda_t d_t d_t^\top) g_t$,它不改变目标函数的驻点、不引入教师定义的最优点,从根本上绕开了'教师匹配 vs 奖励最大化'的目标竞争问题。与并发工作 Direct-OPD(把 delta 当稠密奖励)和 W2S-OPD(用 delta 构造代理教师)相比,OPRD 的差异在于 delta 从未被优化。
核心方法
直觉上,弱教师后训练前后 logits 的差值编码了'哪些 token 选择被奖励改善'的方向信息,这个方向对更强的学生依然有用;但教师策略本身混入了参考偏好和容量限制,不应被整体模仿。OPRD 的做法是:在学生自己采样的 rollout 上,同时用冻结的 RL 教师 $\pi_T$ 和其参考策略 $\pi^{ref}_T$ 对每个学生访问的前缀 $s_t$ 做无梯度前向,计算均值中心化的 logits 差 $\Delta_t$,归一化为单位方向 $d_t = \Delta_t / \|\Delta_t\|_2$;再把学生的 token 级策略梯度 $g_t = A_t \nabla_{z_t} \log \pi_\theta(y_t|s_t)$ 分解为沿 $d_t$ 的投影 $\text{Proj}_{d_t}(g_t) = u_t d_t$(对齐系数 $u_t = d_t^\top g_t$)与正交分量 $g_t^\perp$;最后用 $\tilde{g}_t = g_t + \lambda_t \text{Proj}_{d_t}(g_t)$ 代替 $g_t$ 反传更新。实践中还对 $d_t$ 在学生策略下做 top-10 截断,把校正聚焦在高概率词表区域。整个流程只增加教师和参考模型的两次前向,不改变 rollout 数量。
核心创新是'缩放而非瞄准'。与 OPD 把教师策略作为反向 KL 的最优目标、KDRL 把教师匹配作为并列损失、Direct-OPD 把 log-ratio 当稠密奖励、W2S-OPD 用偏移重锚定后蒸馏代理教师都不同,OPRD 中教师信号只是对学生自身验证器梯度的正缩放。这带来两条可证明的性质:其一是驻点保持,$\tilde{g}_t = 0$ 当且仅当 $g_t = 0$(式 2.6),学生的优化不动点完全由验证器目标决定,教师无法定义新的最优点;其二是对齐增益,$\langle g_t, \tilde{g}_t \rangle = \|g_t\|_2^2 + \lambda_t u_t^2 \geq \|g_t\|_2^2$(式 2.7),变换后的梯度保留原梯度的一阶进展并附加非负增益项 $\lambda_t u_t^2$。当 $u_t < 0$(学生梯度与教师方向相反)时,放大的是验证器支持的'惊喜'行为,让学生走出教师没想到的路径。另一个关键设计是非对称缩放:正对齐分支($u_t \geq 0$)立即启用,负对齐分支按 warm-up 视界 $K_{warm}$ 渐进开启,避免在初期不可靠的学生 rollout 上系统性放大单侧偏差。
方法步骤详情
完整流程五步。第一步准备:冻结经 GRPO 后训练的教师 $\pi_T$ 及其 pre-RL 参考策略 $\pi^{ref}_T$(如 Qwen3-4B-Base 的 step-105 教师检查点与早期参考检查点),学生从指定初始检查点出发,rollout 预算与批大小和 GRPO 基线一致。第二步采样打分:学生按 $\pi_\theta(\cdot|x)$ 生成响应得到前缀 $s_t = (x, y_{<t})$,用可编程验证器计算奖励并做组相对优势 $A_t$。第三步提取教师方向:在 $s_t$ 处分别前向 $\pi_T$ 与 $\pi^{ref}_T$ 得 logits $z_T$、$z^{ref}_T$,做均值中心化差 $\Delta_t = \mathcal{C}(z_T - z^{ref}_T)$ 消除不影响相对 token 偏好的公共偏移,取单位方向 $d_t = \Delta_t/\|\Delta_t\|_2$ 并按学生策略 top-10 截断;此步只需前向、无需梯度。第四步梯度缩放:计算 $g_t$ 与对齐系数 $u_t = d_t^\top g_t$,按式 (2.8) 设 $\lambda_t$——$u_t \geq 0$ 时取定值(默认 $\lambda=0.5$),$u_t<0$ 时随训练步数从 0 线性升至满值;得到 $\tilde{g}_t = (1+\lambda_t)u_t d_t + g_t^\perp$ 后反传更新学生。第五步迭代:每步 rollout 数与 GRPO 完全相同,收益纯粹来自样本效率提升;实测相对 GRPO 仅增加 11.9% 墙钟时间和 10.2% 峰值显存。
技术新颖性
技术新颖性体现在四个层面。其一,信号选取:图 3a 的消融显示弱策略 delta 是最优引导方向,优于 OPD 教师匹配梯度和 OPSD 自蒸馏梯度,因为'教师减参考'恰好分离出奖励相关的更新,且 log-policy ratio 在 KL 正则化下有隐式奖励解释。其二,使用方式:与 Direct-OPD(delta 当稠密奖励)和 W2S-OPD(delta 重锚定构造代理教师)本质不同,这两者都让 delta 成为优化目标从而继承弱模型实现范围的限制,OPRD 保留正交分量 $g_t^\perp$ 让学生能追求 delta 未覆盖的奖励方向,平均 60.81 对 49.22/37.81 的巨大差距直接证明这一点。其三,与梯度手术家族的形式亲缘与本质区别:PCGrad 等所有已有方法都在删减或降权冲突分量,且每个方向都是某个损失自己的梯度;OPRD '只放大、不删除',因此不动点性质可严格成立。其四,非对称 warm-up 调度:附录 B 论证了单侧放大会系统性放大 reward-irrelevant 偏差项 $\epsilon_t$ 并随训练累积,负分支延迟启用既保留即时迁移又逐步支持超越教师的行为,这一设计本身也有独立价值。
实验结果
论文在数学(AIME'24/'25、HMMT'25、OlympiadBench,Mean@16)和 Reasoning Gym(Knights & Knaves、Quantum Lock、String Manipulation、Countdown,Pass@1)上系统实验。设定一(连续代际迁移,4B 教 8B):OPRD 数学平均 51.91、Reasoning Gym 平均 55.18,比最强基线 KDRL(43.99/44.38)分别高 7.92 和 10.80 分,AIME'24 达 66.92 而教师仅 42.50;比 GRPO 少 33-67% 更新达到教师水平,早期检查点最高领先 22.7 个百分点,OPD 则逼近教师均值后饱和。设定二(多教师,4 个 4B-Base 专家→1 个 8B-Base 学生):OPRD 平均 58.77,超 Mix-RL 11.09 分、超专家均值 14.12 分,四个任务全部超过对应专家,比 Mix-RL 少 55% 更新达专家水平。设定三(强到弱,8B→1.7B 数学、8B-Base→0.6B K&K):OPRD 平均 41.49 vs KDRL 29.52,AIME'24 33.58 超 OPD 3.79 分,K&K 49.40 超 OPD 29.20 分,不依赖容量排序。设定四(弱到强方法对比):OPRD 平均 60.81,超 S2L-PO 6.60 分、超 W2S-OPD 11.59 分、超 Direct-OPD 23.00 分,三任务全部第一。分析实验还表明:更好的教师检查点(step-150 vs step-15)带来更快学习,step-60 教师仅 29.0% Pass@1 时学生仍达约 88%;对齐角随训练向 90° 收敛,教师影响随学生成长自然减弱;风格上 OPRD 学生更接近 GRPO 学生而非教师。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 连续代际迁移·数学(AIME'24/25、HMMT'25、OlympiadBench,4B 教师→8B 学生) | Mean@16(5 个检查点平均) | OPRD 51.91(AIME'24 单项 66.92) | KDRL 43.99 / GRPO 39.38 / OPD 39.44 | +7.92 vs 最强基线 KDRL |
| 连续代际迁移·Reasoning Gym 四任务(4B-Base→8B-Base) | Pass@1(5 个检查点平均) | OPRD 55.18(Knights & Knaves 73.30) | KDRL 44.38 / OPD 42.83 / GRPO 41.81 | +10.80 vs KDRL;比 GRPO 少 33-67% 更新达到教师水平 |
| 多教师蒸馏(4 个 4B-Base 专家→1 个 8B-Base 学生) | Pass@1(5 个检查点平均) | OPRD 58.77 | Mix-RL 47.68 / KDRL 47.47 / MOPD 43.10 | +11.09 vs Mix-RL;超专家均值 14.12 分;少 55% 更新达专家水平 |
| 强到弱蒸馏(8B→1.7B AIME'24;8B-Base→0.6B K&K) | Mean@16 / Pass@1 | OPRD 33.58 / 49.40(平均 41.49) | OPD 29.79 / 20.20;KDRL 平均 29.52 | AIME'24 +3.79、K&K +29.20(均 vs OPD);平均 +11.97 vs KDRL |
| 弱到强方法对比(AIME'24、K&K、String Manipulation) | 三任务平均分 | OPRD 60.81 | S2L-PO 54.21 / W2SR-P 48.64 / W2S-OPD 49.22 / Direct-OPD 37.81 | +6.60 vs 最强 S2L-PO,三任务全部第一 |
| 系统开销(相对 GRPO) | 墙钟时间 / 峰值显存 | +11.9% / +10.2% | GRPO(无教师前向) | 在极低开销下获得显著加速 |
局限与改进
作者承认的局限:第一,方法依赖非零验证器策略梯度,极端强到弱场景(8B-Base→1.7B-Base 的 K&K)学生初始 rollout 大多无效、组内奖励全同致优势消失,OPRD 只剩纯 GRPO 信号,所有 RL 类方法低于 20% Pass@1,而不依赖奖励的 OPD 达 40.5%,需 SFT 预热缓解。第二,参考策略选择引入长度偏置:step-0 参考使 OPRD 在 Color Cube 上过度缩短响应、停滞在 52.5%(低于 GRPO 和 KDRL),换 step-30 参考后跳到 89.5%,对检查点选取敏感、需人工干预。我的补充观察:其一,实验限于 Qwen3 家族 0.6B-8B 和可验证奖励任务,对 RLHF 偏好奖励、代码、agent 环境未验证,且 $\Delta_t$ 提取依赖'存在干净的 pre-RL 参考'这一前提;其二,收益与教师 RL 训练程度强耦合(step-15 弱教师加速明显变慢);其三,$\lambda$ 虽不敏感(0.5 即可)但 $K_{warm}$、top-10 截断等仍是新增超参;其四,多教师需逐样本配对对应专家前向,存储与调度成本随专家数线性增长;其五,理论保证是固定响应的 token 级性质,缺少策略层面收敛证明。
独立分析的弱点
独立分析几点弱点。第一,对验证器优势硬依赖:$g_t$ 系统性为零(稀疏奖励、组内全对/全错)时 OPRD 完全失效(图 4a);改进方向是与 OPD 式稠密信号退火混合,早期以教师匹配提供覆盖、后期切回纯缩放。第二,$\Delta_t$ 中混入 reward-irrelevant 成分(长度、格式)会被放大,Color Cube 长度偏置即实例;改进方向是显式剔除已知混淆方向(如对响应长度回归后取残差投影),或用多个参考检查点 delta 平均稀释偏置。第三,参考策略需额外保存一份 pre-RL 检查点并做双份前向,frontier 规模下工程成本不低;可探索 delta 的低秩/LoRA 表示降低调度成本。第四,OPRD 只在 logit 空间重加权相对偏好,无法注入教师会而学生完全不会的'知识',纯能力差距场景仍需 OPD/SFT 补覆盖,可考虑两者联合:匹配提供覆盖、缩放提供超越加速。第五,多教师按样本离散切换、方向冲突隐式处理,可借鉴 PCGrad 显式做任务间教师方向的冲突投影。第六,驻点保持性质在 logit 空间成立,经动量/自适应优化器后参数空间是否严格保持值得分析。
未来方向
作者提出的方向:扩展到代码生成和 agent 环境等反馈来自程序执行或环境响应的场景,检验策略偏移迁移的普适性;扩展到更大规模(0.6B-8B 之外),小模型学 delta 比大模型直接吃 verifier 反馈便宜得多,规模越大经济性越突出;系统性优化——混合并行下冻结教师与参考的高效放置、分片与调度,跨模型和词表分片的通信高效校正;连接递归自改进流水线,让每代模型通过其策略偏移直接参与下一代 successor 的策略更新(作者引述 GPT-6 Astra 用早期模型监督训练、Gemini 3.8 Flash 用 agent 循环递归评估)。基于本文成果可自然延伸:与 RLHF 偏好奖励结合,检验 $\Delta_t$ 在非可验证奖励下是否有效——其隐式奖励解释提示可行;自动参考策略选择,按长度/风格偏置检测自动选参考检查点,消除最需人工干预的环节;用过程奖励模型提供 token 级优势替代结果级优势,缓解稀疏奖励下的梯度消失;只共享 delta 方向而不共享教师权重的知识迁移,适用于蒸馏合规或隐私受限场景。
复现评估
复现条件较好:代码已在 GitHub 开源(raymin0223/on_policy_reverse_distillation),训练数据 DAPO-Math-17K 和 Reasoning Gym 均公开(每任务 20000 实例、19800 训练 200 评估),模型全部为开源 Qwen3 家族(0.6B/1.7B/4B/8B 及 Base 变体),教师检查点由标准 GRPO 训练得到。算力上需要 8B 学生 RL 训练(GRPO 每步组采样)加 4B 教师/参考并行前向,估计需多卡 A100/H100 级别;作者报告 OPRD 相对 GRPO 仅增加 11.9% 墙钟时间和 10.2% 显存,工程负担可控。复现难点在协议细节:参考策略检查点选择(step-0 vs step-30 在 Color Cube 上相差 37 分,是最大敏感点)、负分支 warm-up 步数 $K_{warm}$、top-10 截断实现位置、多教师批内混合比例;评估协议(Mean@16、Pass@1、每 30/60 步取 5 个检查点平均)也需严格对齐。RL 训练方差大,严格复现需多种子对照。总体属于'代码+数据齐全、需中等偏上算力'的可复现工作。
论文图表
8B-Base→1.7B-Base 的 K&K 上学生初始 rollout 大多无效、组内奖励全同使梯度消失,GRPO/KDRL/OPRD 全部低于 20% Pass@1,只有依赖密集匹配、不依赖奖励的 OPD 达到 40.5%; 在 Color Cube 上对比两种参考策略:step-0 参考使 $\Delta_t$ 含强烈缩短响应成分,OPRD 快速缩短响应并停滞在 52.5% Pass@1(低于 GRPO 和 KDRL),换用教师初始长度坍缩后的 step-30 参考后跳升到 89.5%。
坦诚展示方法的两大失效模式——验证器梯度消失与 reward-irrelevant 偏置放大——及其缓解手段,是判断 OPRD 适用边界的关键证据。