← 返回 2026-08-24

硬币的两面:大语言模型在线蒸馏中泛化的双重性 Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models

Zhaoyi Li, Deyang Kong, Yuan Wei, Evan Yang, Ranran Shen, Mahardika Krisna Ihsani, Ming Yang, Wei Zhang, Chuan Hao, Jian Yang, Ran Tao, Bryan Dai, Shikun Zhang, Wei Ye, Ying Wei, Defu Lian 📅 2026-08-17 👍 15 2026-08-29 18:30
在线策略蒸馏 多教师蒸馏 大语言模型后训练 泛化分析 知识迁移

OPD迁移的是教师推理行为而非答案,同源才能整体对齐策略,多教师路由因此产生跷跷板效应

前置知识

在线策略蒸馏(On-Policy Distillation, OPD)

与传统离线蒸馏用教师生成的固定答案训练不同,OPD 从学生自身当前策略采样轨迹,再让教师在学生实际访问到的每个状态上给出逐 token 的概率监督,从而消除训练轨迹与学生真实生成行为之间的暴露偏差。它兼得强化学习的在线探索与蒸馏的稠密监督,已成为大模型后训练把强教师能力注入小模型的重要范式。

本文研究的正是 OPD 的泛化行为,理解其'学生采样、教师打分'的机制是读懂所有实验设计的前提。

反向 KL 散度与 k1 估计

OPD 最小化学生到教师的反向 KL:$D_{KL}(\pi_\theta\|\pi_\phi)$,直觉是学生只在教师可能输出的区域附近被约束。实践中用采样式 k1 估计把它改写为策略梯度形式:逐 token 优势 $\bar{A}^{OPD}_t=\mathrm{sg}[\log\pi_\phi(y_t|h_t)-\log\pi_\theta(y_t|h_t)]$,教师概率更高的 token 被强化,更低的被抑制,stop-gradient 保证教师侧不更新。

该目标只看师生概率差、与学生自身对错无关,这是理解'教师解不出的题同样有用'这一核心结论的关键。

同源/跨源配对(Same/Cross-Origin)

同源指教师与学生来自同一基座模型,典型情形是学生为某基座的 SFT 检查点、教师是在同一基座上再做强化学习后训练的产物;跨源则指两者来自不同基座。本文证明这一谱系关系是预测 OPD 迁移广度的最强变量:同源配对可跨语言、跨推理视界甚至跨任务域整体对齐,跨源配对基本只拟合训练分布。

'同源泛化、跨源拟合'是全文的中心发现,不知道这个概念就无法理解 MOPD 跷跷板效应的成因。

多教师在线蒸馏(MOPD)与 prompt 路由

MOPD 是 OPD 的自然扩展,用于整合多个领域专家的能力:学生照常从自己的 rollout 采样,每个训练 prompt 被路由给对应领域的专家教师打分,优化流程与单教师 OPD 完全相同。传统观点默认这种路由能把每位教师的影响隔离在其被分配的域内,实现专家技能的独立叠加。

论文的核心批判正是这个隔离假设:由于教师影响会越出训练 prompt 的域,路由失效并产生跷跷板效应。

通过率与难度过滤

教师通过率指教师对某题采样若干次(本文为 4 次)全部答对的比例,是训练前可计算的固定难度估计;学生通过率则随训练动态变化。强化学习训练中常按通过率过滤数据(保留难度适中、非零优势的题),本文检验这类过滤在 OPD 中是否仍然必要。

域内泛化实验(Figure 1、Table 1)正是围绕这两种通过率设计的,是理解'OPD 不挑题'结论的直接入口。

研究动机

在线策略蒸馏(OPD)已成为大模型后训练中把强教师能力迁移给小学生的主流手段:它从学生自身策略采样轨迹,再由教师在学生实际访问的状态上给出逐 token 监督,从而缓解离线蒸馏的暴露偏差。然而绝大多数现有工作只在单一训练域、且与训练数据高度接近的基准上评估 OPD,只能证明目标任务分数提升,无法区分'局部拟合训练分布'与'更广泛的策略级迁移'这两种本质不同的现象。这留下两个悬而未决的问题:其一,当训练与评估在语言(英语→中文)、推理视界(短链→长链)或任务域(数学→代码/科学)上发生偏移时,OPD 到底还能不能泛化、泛化程度由什么因素决定;其二,多教师 OPD(MOPD)默认把每个 prompt 路由给对应领域专家就能隔离各教师的影响,但这一假设从未被检验——如果某位教师的影响其实越出了自己被分配的域,路由就会失效,多教师组合的真实行为也就无从诊断。

本文的目标是本文的目标是对 OPD 的泛化行为做一次受控的、逐一变量的系统刻画,并回答三个范围递进的研究问题。RQ1:在固定的数学域内,训练题难度(由教师和学生通过率度量)以及评估分布的语言、推理视界偏移,会在多大程度上影响 OPD 对教师域内性能的迁移?RQ2:用数学 prompt 训练能否提升学生在代码、科学域的表现?代码/科学/指令遵循域的 prompt 又能否迁移回数学?这种双向迁移由什么因素控制?RQ3:既然单教师的影响会越出训练 prompt 所在的域,MOPD 中把 prompt 路由给领域专家还能否隔离各教师的作用?教师混合比例如何把学生在各域的能力拉向不同教师?最终作者希望给出一个统一图景,既划清 OPD 何时泛化、何时只是拟合,也为诊断多教师蒸馏提供可操作的心智模型。

与已有工作不同的是,本文的独特切入角度有三点。第一,方法论上是真正的控制变量实验:固定其余条件、每次只改变一个泛化因子(题目难度、语言、推理视界、任务域、教师来源),而不是提出新算法或在单一设置下刷分,这使得每个结论都有干净的归因。第二,作者提出并验证了'同源性'这一被此前工作忽视的关键变量——教师与学生是否来自同一基座模型——并证明它比教师自身的绝对强度更能预测迁移广度:跨源教师即使单模型成绩更好,蒸馏出的学生反而更弱。第三,对 MOPD 的分析视角新颖:把单教师跨域泛化与多教师路由的失效联系起来,提出'跷跷板效应'——各教师按混合比例把学生的多域能力拉向自身水平,而非各自贡献独立可加的领域技能,这为诊断 MOPD 提供了全新的分析工具。

核心方法

直觉上,论文把'OPD 到底教会了学生什么'拆成可分别操控的变量逐一检验:如果教会的是教师的推理行为,题目难度、语言甚至任务域都应无关紧要;如果只是拟合训练分布,这些偏移就会导致明显掉分。技术上全文统一采用 PG 风格的 OPD:对学生自采样轨迹 $y=\{y_t\}_{t=1}^T$,在上下文 $h_t=(x,y_{<t})$ 上最小化学生到教师的反向 KL 散度 $\mathcal{L}_{OPD}(\theta)=\mathbb{E}\frac{1}{T}\sum_t D_{KL}\!\left(\pi_\theta(\cdot|h_t)\,\|\,\pi_\phi(\cdot|h_t)\right)$,并用采样式 k1 估计改写为策略梯度目标,逐 token 优势为 $\bar{A}^{OPD}_t=\mathrm{sg}[\log\pi_\phi(y_t|h_t)-\log\pi_\theta(y_t|h_t)]$。统一底座上,实验覆盖数学、代码、科学、指令遵循 4 个域、10 个公开模型,并引入 Top-16 token 分布重叠率作机制探针。

核心思想是把 OPD 理解为'迁移教师的推理行为而非具体题目的答案',并指出决定迁移能否推广到整个策略的关键变量是模型同源性。这与已有工作的本质区别有三:以往把 prompt 难度过滤当作提升蒸馏效率的杠杆,本文证明在 OPD 中教师端难度过滤几乎无效——教师解不出的题与全解出的题同样有用,原因在于 OPD 的逐 token 优势只依赖师生概率差,与学生自身对错无关;以往 MOPD 依赖'路由可隔离教师影响'的假设,本文证明同源教师的影响天然越出其训练域,路由无法隔离;此外,作者用教师-学生 Top-16 token 分布重叠率给出机制证据:同源 OPD 随训练把学生策略整体对齐到教师(重叠率持续上升),跨源 OPD 只在训练分布上降低 KL(重叠率持平甚至下降),从机制层面解释了'同源泛化、跨源拟合'这枚硬币的两面。

方法步骤详情

实验按三个研究问题递进。第一步(域内难度):对 BigMath 每题采样 4 条教师回答,按教师通过率切出 easy(=1)、hard(=0)、random 三个 2.5 万题子集,分别训练三对师生模型,在 6 个英文数学基准画训练曲线;再做学生端动态采样,比较只留全解错、只留全解对、只剔除全解对与不过滤四种策略。第二步(语言/视界偏移):仅用英文短链数学(BigMath-random)训练,评估中文(OlymMATH-ZH、LiveMathBench-ZH)与长链(AIME24-Horizon-2、AMC23-Horizon-4)基准,每名学生配一个同源与一个跨源教师。第三步(跨域双向):数学 prompt 训练→代码/科学评估,以及代码/科学/IF prompt 训练→数学评估。第四步(MOPD):固定 prompt 总量,改变 JustRL-1.5B 与 Nemotron-1.5B 的配比(Nemotron/JustRL 从 1/1 到 2/25),并做角色互换、级联蒸馏与 Top-16 重叠率分析。

技术新颖性

新颖性主要体现在实证发现与诊断框架而非新算法。首先,'教师解不出的题与全解出的题同样有用'这一反直觉结论直接否定了从强化学习迁移来的难度过滤直觉,并给出机理解释:OPD 优势只依赖教师与学生概率差,与学生自身对错无关,因此教师即使在端到端解不出题时仍能提供有信息量的 token 级监督。其次,'同源性'作为泛化预测因子是首次被系统提出并验证的变量,且'强教师未必出强学生'(跨源 Light-R1-14B 本身强于同源 Polaris-7B,蒸馏学生却更弱)挑战了蒸馏领域的常识。第三,跷跷板效应、训练中的'拉锯战'(学生曲线先跟随一位教师再漂向另一位)、级联蒸馏的时间维度去耦实验,共同构成诊断 MOPD 的工具箱,甚至能解释'增加数学专家数据反而降低数学成绩'的符号反转现象——这些在既有文献中均无先例。

Top-K (K=16) Overlap Ratio of the teacher and student models in different OPD experiments.
Figure 6: Top-K (K=16) Overlap Ratio of the teacher and student models in different OPD experiments.

实验结果

域内:教师通过率几乎不影响 OPD——easy/hard/random 三个 2.5 万题子集在三对师生上(分别约 59%、42%、56%)收敛到几乎相同精度;GSM8K 或最难切片训练也恢复 80% 以上增益。学生端过滤中仅'剔除已全解对的题'有效:41.4%→42.0%(+0.6pp)、52.4%→52.8%(+0.4pp)。语言/视界偏移:仅英文短链训练即可提升中文与长链成绩;但跨源 Light-R1-14B 自身更强,学生收益却更小,长链几乎无增益。跨域:同源配对下数学 prompt 训练即可让 LiveCodeBench、GPQA 逼近教师,反向亦然;跨源配对只有目标域直训有效。MOPD:增大 JustRL 份额使 GPQA/LiveCodeBench/IF-Eval 全面下滑,GPQA 早期跌约 5%;数学成绩 J/N=25/8 最优 27.1%(+0.8pp),角色互换后升至 22.7%(+0.7pp)。Figure 8 中同源 Polaris-7B(AMC2023 达 95.2%)任科学专家反更提升数学:数学数据占比从 8/25 升至 25/8,成绩反降。

Generalization performance of OPD with student-side dynamic sampling across six math benchmarks.
Table 1: Generalization performance of OPD with student-side dynamic sampling across six math benchmarks.
MOPD math accuracy for different JustRL-1.5B/Nemotron-1.5B mixture ratios (J/N).
Table 2: MOPD math accuracy for different JustRL-1.5B/Nemotron-1.5B mixture ratios (J/N).
In-domain math accuracy (average over six English benchmarks) is insensitive to the difficulty of the training problems, measured by the teacher's pass-rate.
Figure 1: In-domain math accuracy (average over six English benchmarks) is insensitive to the difficulty of the training problems, measured by the teacher's pass-rate.
OPD trained only on English math problems generalizes to Chinese and long-horizon math benchmarks, but the size and stability of the gains depend on model origin.
Figure 2: OPD trained only on English math problems generalizes to Chinese and long-horizon math benchmarks, but the size and stability of the gains depend on model origin.
Cross-domain generalization in single-teacher OPD.
Figure 3: Cross-domain generalization in single-teacher OPD.
The MOPD seesaw effect.
Figure 4: The MOPD seesaw effect.
A tug-of-war between the teachers can be observed during MOPD training.
Figure 5: A tug-of-war between the teachers can be observed during MOPD training.
The MOPD experiment results of DS-distill-7B (student), Light-R1-7B (math teacher), and Light-R1-14B (science/IF teacher).
Figure 7: The MOPD experiment results of DS-distill-7B (student), Light-R1-7B (math teacher), and Light-R1-14B (science/IF teacher).
MOPD on DS-distill-7B (student) with Light-R1-14B as the math expert and Polaris-7B as the science/IF expert, evaluated on four math benchmarks.
Figure 8: MOPD on DS-distill-7B (student) with Light-R1-14B as the math expert and Polaris-7B as the science/IF expert, evaluated on four math benchmarks.
查看结构化数据
任务指标本文基线提升
数学(6 个英文基准平均,Polaris-7B→DS-distill-1.5B) 平均准确率 42.0%(学生动态过滤 pass-rate∈[0,1)) 41.4%(无动态采样);教师通过率 easy/hard/random 子集均约 42% +0.6pp;训练难度几乎不影响结果
数学(6 个英文基准平均,Light-R1-14B→DS-distill-7B) 平均准确率 52.8%(学生动态过滤 pass-rate∈[0,1)) 52.4%(无动态采样) +0.4pp;两个极端过滤(=0 或 =1)反而各降 0.2-0.3pp
MOPD 数学(BeyondAIME+OlymMATH 平均,JustRL-1.5B 任数学教师) 平均准确率 27.1%(J/N=25/8);基线学生仅 11.9% J/N=1/1 为 26.3% +0.8pp 相对 1/1,相对学生初始 +15.2pp
MOPD 数学(Nemotron-1.5B 任数学教师,角色互换) 平均准确率 22.7%(J/N=25/8) J/N=1/1 为 22.0% +0.7pp;说明配比而非被分配的域决定结果
跨域代码迁移(LiveCodeBench,同源教师,1.5B/7B 学生) LiveCodeBench 准确率 数学 prompt 训练与代码 prompt 训练均逼近教师水平 跨源教师:数学 prompt 训练明显低于代码 prompt 直训 同源配对基本消除训练域差距
MOPD 符号反转(DS-distill-7B,跨源 Light-R1-14B 数学专家+同源 Polaris-7B 科学专家) AMC2023 / AIME2026 等四基准 数学数据占比从 8/25 升至 25/8,数学成绩持续下降 仅用跨源数学专家单教师 OPD 在所有基准上最弱 同源科学专家(本身 AMC2023 达 95.2%)免费带数学,形成反转

局限与改进

作者承认的局限:实验仅覆盖面向推理的模型与数学/代码/科学/指令遵循四个域,结论未必推广到多模态、工具使用或交互式智能体等监督依赖外部观测与动作的设定;MOPD 实验只用了两位能力互补的教师和固定的基于域的 prompt 路由,未考察更大、更异构的专家池、自适应路由器或非均匀教师采样。我自己的补充观察:'同源性'目前只是经验规律,Top-16 重叠率提供了机制证据但缺乏因果干预实验(例如先对跨源教师做少量基座对齐能否挽救跨源配对);所有评估以基准准确率为主,缺少 token 级行为变化的细粒度度量;论文也未在同等算力预算下与离线蒸馏或强化学习做对照,'OPD 不挑数据'究竟是鲁棒还是数据效率低,尚无法区分。

独立分析的弱点

第一,跷跷板效应只有诊断没有药方:论文证明了路由无法隔离教师影响,但未提出缓解策略,例如对跨源教师先做基座对齐、按各教师对各域的正负贡献加权教师采样、或在损失中对各域 KL 施加约束,这些方向都值得尝试。第二,MOPD 仅限两教师与固定路由,现实中专家池更大且能力高度重叠,跷跷板可能退化为多体混沌,需要新的分析与控制工具。第三,'同源'定义依赖可查的后训练谱系,对闭源或谱系不明的教师无法直接判断,实用性受限,可探索用初始分布距离或 token 重叠率等可测量指标替代。第四,难度无关的结论是在 2.5 万题规模与数学域内验证的,数据量极小或域更窄时是否仍成立未知。第五,GSM8K 能恢复 80% 增益固然说明 OPD 不挑食,但也暗示其对数据不敏感可能同时意味着数据效率受限——同等算力下精选数据是否仍有上限收益,需要与算力匹配的替代方案对比实验来回答。

未来方向

作者提出的方向:把分析扩展到多模态、工具使用与智能体设定,检验监督依赖外部观测或动作时 OPD 是否仍有类似的跨域行为;研究更大、更异构的专家池,以及自适应路由器与非均匀教师采样下的 MOPD 泛化。基于本文成果可自然延伸的:将 Top-16 重叠率发展为在线监控指标,实时检测某教师对非目标域的'拉扯'并动态调整配比,把跷跷板从事后诊断变成训练中可控的旋钮;设计'同源化'预处理,如跨源教师先在学生基座上做轻量强化学习、或用学生自身分布重写教师输出,以打破同源限制;利用'OPD 不挑题难度'的特性构建低成本数据管线(自动生成简单题并由教师打分);以及在伦理层面,由于能力会跨域泄漏,MOPD 训练的模型应在所有域上做安全与可靠性评估,而不能只测每位教师被分配的域。

复现评估

复现条件较好但工程量不小。所有教师与学生模型均为公开权重(Qwen3 系列、DeepSeek-R1-Distill 系列、Polaris-7B/4B、Light-R1、OpenMath-Nemotron、JustRL、DeepScaleR、VibeThinker 等),训练与评估数据集全部公开(训练用 BigMath、DeepCoder-Preview-Dataset、TextbookReasoning、SCP-116K、Nemotron-Post-Training-IF,评估用 MATH-500、AIME2025/2026、BeyondAIME、OlymMATH、LiveCodeBench、GPQA-Diamond、IF-Eval 等),附录还提供了模型谱系表与数据集细节。论文未提及开源训练代码;OPD 需要学生在线 rollout 加教师逐 token 打分的基础设施(类似 RLHF 训练框架),最大实验涉及 Qwen3-32B 教师与 14B 学生,粗估需要数十张高端 GPU。好消息是核心结论(难度无关、同源效应、跷跷板)在 1.5B 模型配对上即可复现,验证门槛可以大幅降低。