← 返回 2026-08-03

弱到强同策略蒸馏 Weak-to-Strong On-Policy Distillation

Fangxu Yu, Zinan Lin, Xiaodong Liu, Weijia Xu, Michael Xu, Tianyi Zhou, Jianfeng Gao 📅 2026-07-28 👍 55 2026-08-08 18:30
同策略蒸馏 大语言模型推理 对数几率算术 弱到强学习 强化学习 知识蒸馏

用弱模型的对数几率差合成代理教师,蒸馏出超越弱教师、逼近自身的强学生。

前置知识

On-Policy Distillation (OPD) / 同策略蒸馏

由 GKD 框架形式化的范式:让学生 $\pi_S$ 自己采样生成 rollout,再由冻结教师 $\pi_T$ 对每个位置提供 token 级分布监督,学生最小化与教师分布的逐 token 散度。因为状态来自学生自身采样,教师会精确地在学生实际访问的状态上纠错。本文用反向 KL $\mathrm{KL}(\pi_S\|\pi_T)$ 配 top-K 近似实现。

OPD 是本文的直接改进对象和基线。不理解它的'同策略'特性(学生自己生成轨迹)与 token 级稠密监督,就无法理解 W2S-OPD 为什么要额外合成代理教师。

反向 KL 散度 / Reverse KL

$\mathrm{KL}(q\|p)$ 是衡量两分布差异的不对称相对熵。用 $\mathrm{KL}(\pi_S\|\pi_T)$ 时,学生被惩罚在教师几乎不分配概率的 token 上过度自信,倾向集中于教师高概率区域,是更'众数寻求'的拟合。本文把它作为逐 token 散度 $D$。

本文 OPD 目标使用反向 KL,且附录 B 把代理教师推导为某个'以反向 KL 为信任域的目标'的闭式最优解,理解这一点才能看懂公式 (8)-(10) 的指数倾斜解释。

弱到强泛化 / Weak-to-Strong Generalization

Burns 等人提出的设定:用比目标模型更弱的监督者去激发更强模型的潜在能力。其核心假设是强模型内含'尚未被触发'的能力,弱监督可作为引导信号而非模仿上限。本文把该范式引入 token 级的 OPD。

弱到强范式是整个工作的立论基础,直接回答'前沿模型没有更强教师可蒸馏时该怎么办'这一根本困境。

RLVR 与 GRPO

RLVR(Reinforcement Learning with Verifiable Rewards)用可验证标量奖励(数学答案对错、代码测试通过)做强化学习,奖励稀疏。GRPO 是组内相对优势估计算法,本文用它把 Qwen3-4B 训成数学/代码领域专家。

pre-RL/post-RL 对比设置依赖对一个 4B 小模型跑 GRPO 得到正样本模型。理解 RLVR 的奖励稀疏性,才明白为何要 OPD 的稠密 token 监督;理解 GRPO 才能复现领域专家。

解码时可控生成 / 对数几率算术 (DExperts)

Liu 等人的 DExperts 在解码时把'专家'logits 加性组合、'反专家'logits 减性组合,从而不重训模型即可改变输出分布。本文把它从推理时控制改造成训练信号,合成代理教师 $\pi_{T,\alpha}=\mathrm{softmax}(z_{\text{base}}+\alpha(z_+-z_-))$。

代理教师公式直接源自 DExperts 的加减 logit 思想,是方法的核心技术源头,看懂 DExperts 才能理解正负模型相减为何能'隔离能力方向'。

曝光偏差 / Exposure Bias

离线蒸馏(SFT)让学生在教师生成的固定轨迹上学习,训练时见到的状态分布与推理时学生自身采样产生的状态分布不一致,导致错误逐步累积。OPD 通过让学生在自己的 rollout 上训练来缓解它。

这是 OPD 优于离线 SFT 的核心动因,理解它才能理解为何即便只有弱教师,本文也要坚持'同策略',而不是简单地拿弱模型生成数据做 SFT。

Top-K KL 估计

完整教师分布需要传输整个词表(Qwen3 约 15 万维)的 logits,跨训练 worker 通信代价过高。由于教师分布很尖锐,只传输每位置 top-K(本文 K=32)的 token 索引与对数概率,在该截断支撑集上重归一化后估计 KL,截断误差由 top-K 之外的微小概率质量决定。

这是本文所有蒸馏实验的实际工程实现,决定了方法能否落地,复现时必须采用,否则显存/通信开销无法承受。

研究动机

当前大模型推理能力提升依赖两条路线。一是强到弱蒸馏,如 Qwen3 把 235B 模型蒸馏进 8B/14B 变体,但模型逼近能力前沿时根本不存在更大的教师,性能被天花板锁死。二是同源聚合(same-origin consolidation),如 MOPD 和 DeepSeek-V4 从共享基座并行训练多个领域专家再蒸馏回单一学生,但要在学生规模上训练多个专家,算力成本极其昂贵。而同策略蒸馏(OPD)虽能同时拿到稠密 token 监督并规避曝光偏差,却预设'教师至少与学生一样强'——这个前提在前沿场景彻底失效:既没有更大模型可蒸馏,又在学生规模上训不起合格专家。论文还用具体数字说明直接拿弱专家当教师的危害:在 pre-RL/post-RL 设置下,OPD 把学生 GPQA-Diamond 从基座 38.9 提到 54.4,但在 IFBench 上反把学生从 26.3 拉低到 25.9,学生吸收了小专家的局限性。

本文的目标是用一组比学生更小、更弱、且廉价的模型,去持续提升一个强学生(本文为 Qwen3-8B)的领域推理能力,同时不损失它已有的通用能力。具体目标包括:在没有任何更强教师、且所有监督源都比学生弱的情况下,让学生仍能超越自身基座;甚至在 pre-RL/post-RL 设置下反超它所学习的那个 4B 领域专家本身;并把弱到强蒸馏做成一种成本可控、可多教师合并、可在多种对比来源下复用的通用 OPD 框架,使前沿模型能够持续从丰富而廉价的弱信号中改进,而不必等待更强的教师被造出来。

与已有工作不同的是,现有弱到强工作多停留在轨迹级信号(如'learning by teaching'),而本文的独特切入角度是:把弱到强学习重新定义为'隔离并迁移一个能力方向',而不是'模仿一个弱监督者'。它借鉴解码时可控生成(DExperts)的 logit 算术,从'正模型减负模型'的 logit 差中提取一条与模型规模大致解耦、因而可跨尺度迁移的能力方向,再把它锚定回学生自己的基座模型,合成一个既带该能力、又与学生分布相邻的代理教师。这样弱模型只通过'差'而非'绝对水平'进入监督目标,既绕开了弱教师与学生之间的分布不匹配,又避免把学生拉向弱教师的能力上限。

核心方法

直觉上,两个弱模型各自都不如强学生,但它们之间'谁更强'所体现的方向,往往蕴含了与尺度无关的可迁移技能。W2S-OPD 的整体路线是:把一对(正、负)弱模型冻结,在每个位置 $t$ 取它们与同一前缀 $s_t$ 下输出的 logits $z_+, z_-$,连同作为锚的学生基座 logits $z_{\text{base}}$,按 $\pi_{T,\alpha}(\cdot|s_t)=\mathrm{softmax}\bigl(z_{\text{base}}(s_t)+\alpha(z_+(s_t)-z_-(s_t))\bigr)$ 合成一个代理教师,再用 top-K 反向 KL 的 OPD 目标让学生在自己的 rollout 上向它蒸馏。放大系数 $\alpha\ge 0$ 控制注入的能力方向强度,权衡信号强度与分布邻近性:$\alpha$ 小则信号弱、改进有限,$\alpha$ 大则可能把代理教师推离学生分布、难以学习。

核心创新是用'方向'取代'模仿'。两个弱模型共同拥有的有限能力,在它们的 logit 差里被相消抵掉,留下来的恰好是 $m_+$ 强于 $m_-$ 的那条能力方向;因为弱模型只以差的形式、而非绝对水平进入目标,蒸馏迁移的是'能力方向'而不会被学生的能力下拽到弱教师水平,从而同时缓解了弱到强蒸馏的两个根本难题(分布不匹配与能力上限被拉低)。本质区别在于:以往 OPD 要求一个更强教师并直接模仿其分布,W2S-OPD 合成的却是一个与学生分布相邻、又叠加了被隔离能力方向的代理教师。附录 B 进一步证明,该代理教师恰是目标 $\max_q\,\mathbb{E}_{a\sim q}r(s,a)-\tfrac{1}{\alpha}\mathrm{KL}(q\|\pi_{\text{base}})$ 的闭式唯一最优解,即'注入能力 + 围绕学生的反向 KL 信任域',其中能力奖励 $r(s,a)=\log\pi_+(a|s)-\log\pi_-(a|s)$ 与两源的绝对能力无关。

方法步骤详情

步骤如下。①准备三组冻结模型——学生基座 $m_{\text{base}}$(本文即 Qwen3-8B,同时充当学生与锚)、正模型 $m_+$、负模型 $m_-$。②让学生 $\pi_S$ 以温度与 top-p 均为 1.0 自己采样生成 rollout $y$。③在每个位置对三模型各做一次前向取 logits。④按 $\pi_{T,\alpha}=\mathrm{softmax}(z_{\text{base}}+\alpha(z_+-z_-))$ 合成代理教师,top-K=32 截断重归一化估计散度。⑤学生最小化 $\mathcal{L}=\sum_t\mathrm{KL}(\pi_S(\cdot|s_t)\|\pi_{T,\alpha}(\cdot|s_t))$。⑥多教师把方向叠加 $\pi_{T,\alpha}=\mathrm{softmax}(z_{\text{base}}+\sum_k\alpha_k(z_{+,k}-z_{-,k}))$,可按 $\alpha_k\in\{0,1\}$ 路由查询。对比对有三类:pre-RL/post-RL(4B-RL 正、4B 负,隔离 RL 技能)、smaller/larger(4B 正、0.6B 负,隔离尺度能力)、contrastive hints(同一 4B 在正确/错误提示下输出,隔离实例级方向)。所有实验与 OPD 配置相同、各跑 100 步。

技术新颖性

技术新颖性有三层。其一,把解码时 logit 算术(DExperts)从'推理时控制'改造成'训练信号',首创性地用它合成代理教师而非直接改写生成。其二,方向视角统一了三种看似无关的弱信号来源——RL 技能、模型尺度、上下文提示——都归结为'正减负 logit 差',并通过实验证明这些方向提供互补的推理模式(post-RL 与 hint 对比强调规划/监控等推理框架 token,scale 对比强调分析/实现等解题步骤 token)。其三,与并发的 Direct-OPD 相比,本文不局限于 RL 训练教师的 log-ratio,可融合多种对比来源,并在数学与代码两类可验证任务上同时验证,把弱到强蒸馏落成 OPD 的一个可持续范式,而非单点 trick。

Overview of W2S-OPD.
Figure 2: Overview of W2S-OPD.

实验结果

实验覆盖三大设置、4 个数学基准(AIME24/25、HMMT25 Feb/Nov)与 3 个代码基准(HumanEval+、MBPP+、LiveCodeBench-V6)。①pre-RL/post-RL(表2):单教师下 W2S-OPD 数学 51.8、代码 60.9,相对 OPD(46.5/58.7)提升 11.4%、3.7%,且数学反超它所学的 4B 领域专家(48.8 vs 51.8);多教师下数学 52.1(+5.6),HMMT25(Nov) 45.2 vs 37.4(+7.8)。②smaller/larger(表3):仅用现成 4B 与 0.6B 两个都弱于学生的基座,学生数学仍从 17.0 升到 23.0(+6.0),HMMT25(Nov) 9.0 跃到 20.1(+11.1)。③contrastive hints(表4):单个 4B 在正确/错误提示下,把数学从 17.0 提到 18.4(+1.4)。④OOD(表5,仅训数学):GPQA-Diamond 从 38.9 升到 56.5(超 OPD +2.1);而 OPD 在 IFBench 把学生从 26.3 拉到 25.9 退化,W2S-OPD 反升到 27.0(+1.1),证明迁移领域技能同时保护通用能力。⑤训练动态(图3)全程领先 OPD;每步开销 1043s vs 868s 仅 +20%(表10)。⑥消融:对比对差距越大信号越强(表11,4B-0.6B 提升 6.0 > 4B-1.7B 的 4.7),中等 $\alpha$ 最佳(图4)。⑦可解释性(表6):post-RL/hint 强调 Plan/Monitor/Answer 框架 token,scale 强调 Analyze/Implement 步骤 token,三者互补。

The three instantiations of the contrast pair in W2S-OPD.
Table 1: The three instantiations of the contrast pair in W2S-OPD.
Results for Pre-RL / Post-RL contrast setting.
Table 2: Results for Pre-RL / Post-RL contrast setting.
Results for Smaller and Larger contrast setting.
Table 3: Results for Smaller and Larger contrast setting.
Results for contrastive hints setting.
Table 4: Results for contrastive hints setting.
Results for OOD generalization on GPQA-Diamond and IFBench.
Table 5: Results for OOD generalization on GPQA-Diamond and IFBench.
Distribution of the top-1% highest-Δ tokens over the eight Schoenfeld episodes.
Table 6: Distribution of the top-1% highest-Δ tokens over the eight Schoenfeld episodes.
Average wall-clock time per training step (s) in the pre-RL / post-RL setting.
Table 10: Average wall-clock time per training step (s) in the pre-RL / post-RL setting.
Average math reasoning accuracy of W2S-OPD with base-model contrast pairs of different capability gaps.
Table 11: Average math reasoning accuracy of W2S-OPD with base-model contrast pairs of different capability gaps.
Performance on the math and code benchmarks over training steps.
Figure 3: Performance on the math and code benchmarks over training steps.
Performance with different α.
Figure 4: Performance with different α.
A case study that the three contrasts strengthen different reasoning tokens.
Figure 5: A case study that the three contrasts strengthen different reasoning tokens.
查看结构化数据
任务指标本文基线提升
数学推理(4 基准均值,单教师 pre-RL/post-RL) avg@32 准确率 51.8 OPD 46.5(正模型专家 48.8) 相对 OPD +11.4%,并反超领域专家本身
代码生成(3 基准均值,单教师 pre-RL/post-RL) avg@4 准确率 60.9 OPD 58.7 相对 OPD +3.7%
数学推理(多教师合并数学+代码) avg@32 准确率 52.1 OPD 46.5 绝对 +5.6
数学推理(smaller/larger,纯弱基座 4B vs 0.6B) avg@32 准确率 23.0 学生基座 17.0 绝对 +6.0,全部监督源都弱于学生
OOD 科学推理 GPQA-Diamond(仅训数学) 准确率 56.5 OPD 54.4 / 学生基座 38.9 超 OPD +2.1,超基座 +17.6
OOD 指令遵循 IFBench(仅训数学) 准确率 27.0 OPD 25.9(退化)/ 学生基座 26.3 OPD 拉低基座,W2S-OPD 反升 +1.1

局限与改进

作者坦承的局限:弱监督源虽多,但弱到强蒸馏何时饱和、能推多强仍是开放问题;contrastive hints 需要参考答案这种特权信息,并非真正无监督。我额外观察到:①所有提升主要在 Qwen3-8B 这一个学生、Qwen3 这一个家族上验证,scaling 到 70B 以上或跨家族是否成立仍是未知数;②只测了数学与代码两类可验证任务,对开放生成、对齐、工具使用等无标准答案的任务,'正减负'方向是否仍有意义存疑;③代理教师依赖'弱模型分布相邻'的假设,若正负模型家族差异大(不同训练数据、不同分词),相消抵消可能失效;④增益随设置递减——pre-RL/post-RL 收益最大(+11.4%),纯弱基座和 hint 设置仅 +1~2%,说明'弱信号能榨出的油'相对有限;⑤hint 设置需要事先知道正确答案才能构造正提示,工程上更像测试时特权信息蒸馏,落地受限。

独立分析的弱点

弱点一:纯弱源(smaller/larger、contrastive hints)增益偏小(数学仅 +1.4~6.0),实用价值有限——改进方向是用更强或差距更大的对比对,或结合自一致性、多采样投票放大弱信号。弱点二:$z_+-z_-$ 的方向假设正负模型'同源同风格',跨家族或跨训练阶段可能引入风格漂移污染——改进方向是引入风格残差校正或归一化,仅保留纯能力差。弱点三:代理教师需对 3 个模型做前向,显存与通信随学生规模线性增长——改进方向是 teacher 侧 forward-only 的并行化与 KV/激活复用,论文已指出各评分 pass 之间互相独立、可跨设备并行。弱点四:对比来源仍偏窄,主要集中在数学与代码——可扩展到长上下文、工具调用、安全对齐等更有意义的能力方向。弱点五:hint 设置需要参考答案,未做到无标签——可结合过程奖励模型(PRM)自动生成正负提示,或用自洽采样替代参考答案。

未来方向

作者提出的方向:把弱到强学习发展成 OPD 与后训练的持续范式,研究弱信号何时饱和、如何榨取更有信息量的监督信号,并探索如何从更丰富廉价的弱来源中持续改进前沿模型。基于本文成果可延伸:①自动搜索最优对比对与 $\alpha_k$(甚至按样本动态路由),把多教师 $\alpha$ 调到更细粒度;②把方向迁移扩展到更大学生(70B/万亿规模)与多模态(已有 OPD 多模态工作如 Visual-OPD 可对接);③把 contrastive hint 与推理时搜索(MCTS、self-consistency、best-of-N)结合,构造更丰富的正负方向;④从理论上刻画'能力方向跨尺度可迁移'的条件,给出饱和界与收敛保证;⑤探索用 PRM/verifier 替代参考答案,让 hint 设置真正免标签、可扩展到无标准答案任务。

复现评估

复现性较好。作者承诺代码开源(github.com/Yu-Fangxu/W2S-OPD),基于 verl 框架,每次蒸馏仅需 2 张 NVIDIA B200、跑 100 步;超参数在附录表7/8/9 完整给出(学生 Qwen3-8B,正/负 Qwen3-4B-RL/4B,数学 $\alpha=1.0$、代码 $\alpha=0.75$,top-K=32,学习率 2e-6,batch 64,温度/top-p=1.0;GRPO 学习率 1e-6、batch 128、rollout G=8、数学 500 步/代码 300 步)。训练数据用公开 DeepMath-103K(L6) 与 Eurus-RL-Code,评测协议(数学 32 采样、代码 4 采样、Math-Verify 验证)清楚。主要风险:①B200 难获取,论文未给总 token 数与总时长,换卡需自调显存与并行;②4B-RL 正模型来自 Yang 等(2026b)'provided'检查点,需确认公开可得性;③部分引用为 2026 年工作,时效性强;④$\alpha$ 需按正负对重新调参。综合:方法公式清晰、配置详尽,中等难度可复现。