硬币的两面:大语言模型在线蒸馏中泛化的双重性 Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models
OPD迁移的是教师推理行为而非答案,同源才能整体对齐策略,多教师路由因此产生跷跷板效应
前置知识
在线策略蒸馏(On-Policy Distillation, OPD)
与传统离线蒸馏用教师生成的固定答案训练不同,OPD 从学生自身当前策略采样轨迹,再让教师在学生实际访问到的每个状态上给出逐 token 的概率监督,从而消除训练轨迹与学生真实生成行为之间的暴露偏差。它兼得强化学习的在线探索与蒸馏的稠密监督,已成为大模型后训练把强教师能力注入小模型的重要范式。
本文研究的正是 OPD 的泛化行为,理解其'学生采样、教师打分'的机制是读懂所有实验设计的前提。
反向 KL 散度与 k1 估计
OPD 最小化学生到教师的反向 KL:$D_{KL}(\pi_\theta\|\pi_\phi)$,直觉是学生只在教师可能输出的区域附近被约束。实践中用采样式 k1 估计把它改写为策略梯度形式:逐 token 优势 $\bar{A}^{OPD}_t=\mathrm{sg}[\log\pi_\phi(y_t|h_t)-\log\pi_\theta(y_t|h_t)]$,教师概率更高的 token 被强化,更低的被抑制,stop-gradient 保证教师侧不更新。
该目标只看师生概率差、与学生自身对错无关,这是理解'教师解不出的题同样有用'这一核心结论的关键。
同源/跨源配对(Same/Cross-Origin)
同源指教师与学生来自同一基座模型,典型情形是学生为某基座的 SFT 检查点、教师是在同一基座上再做强化学习后训练的产物;跨源则指两者来自不同基座。本文证明这一谱系关系是预测 OPD 迁移广度的最强变量:同源配对可跨语言、跨推理视界甚至跨任务域整体对齐,跨源配对基本只拟合训练分布。
'同源泛化、跨源拟合'是全文的中心发现,不知道这个概念就无法理解 MOPD 跷跷板效应的成因。
多教师在线蒸馏(MOPD)与 prompt 路由
MOPD 是 OPD 的自然扩展,用于整合多个领域专家的能力:学生照常从自己的 rollout 采样,每个训练 prompt 被路由给对应领域的专家教师打分,优化流程与单教师 OPD 完全相同。传统观点默认这种路由能把每位教师的影响隔离在其被分配的域内,实现专家技能的独立叠加。
论文的核心批判正是这个隔离假设:由于教师影响会越出训练 prompt 的域,路由失效并产生跷跷板效应。
通过率与难度过滤
教师通过率指教师对某题采样若干次(本文为 4 次)全部答对的比例,是训练前可计算的固定难度估计;学生通过率则随训练动态变化。强化学习训练中常按通过率过滤数据(保留难度适中、非零优势的题),本文检验这类过滤在 OPD 中是否仍然必要。
域内泛化实验(Figure 1、Table 1)正是围绕这两种通过率设计的,是理解'OPD 不挑题'结论的直接入口。
研究动机
在线策略蒸馏(OPD)已成为大模型后训练中把强教师能力迁移给小学生的主流手段:它从学生自身策略采样轨迹,再由教师在学生实际访问的状态上给出逐 token 监督,从而缓解离线蒸馏的暴露偏差。然而绝大多数现有工作只在单一训练域、且与训练数据高度接近的基准上评估 OPD,只能证明目标任务分数提升,无法区分'局部拟合训练分布'与'更广泛的策略级迁移'这两种本质不同的现象。这留下两个悬而未决的问题:其一,当训练与评估在语言(英语→中文)、推理视界(短链→长链)或任务域(数学→代码/科学)上发生偏移时,OPD 到底还能不能泛化、泛化程度由什么因素决定;其二,多教师 OPD(MOPD)默认把每个 prompt 路由给对应领域专家就能隔离各教师的影响,但这一假设从未被检验——如果某位教师的影响其实越出了自己被分配的域,路由就会失效,多教师组合的真实行为也就无从诊断。
本文的目标是本文的目标是对 OPD 的泛化行为做一次受控的、逐一变量的系统刻画,并回答三个范围递进的研究问题。RQ1:在固定的数学域内,训练题难度(由教师和学生通过率度量)以及评估分布的语言、推理视界偏移,会在多大程度上影响 OPD 对教师域内性能的迁移?RQ2:用数学 prompt 训练能否提升学生在代码、科学域的表现?代码/科学/指令遵循域的 prompt 又能否迁移回数学?这种双向迁移由什么因素控制?RQ3:既然单教师的影响会越出训练 prompt 所在的域,MOPD 中把 prompt 路由给领域专家还能否隔离各教师的作用?教师混合比例如何把学生在各域的能力拉向不同教师?最终作者希望给出一个统一图景,既划清 OPD 何时泛化、何时只是拟合,也为诊断多教师蒸馏提供可操作的心智模型。
与已有工作不同的是,本文的独特切入角度有三点。第一,方法论上是真正的控制变量实验:固定其余条件、每次只改变一个泛化因子(题目难度、语言、推理视界、任务域、教师来源),而不是提出新算法或在单一设置下刷分,这使得每个结论都有干净的归因。第二,作者提出并验证了'同源性'这一被此前工作忽视的关键变量——教师与学生是否来自同一基座模型——并证明它比教师自身的绝对强度更能预测迁移广度:跨源教师即使单模型成绩更好,蒸馏出的学生反而更弱。第三,对 MOPD 的分析视角新颖:把单教师跨域泛化与多教师路由的失效联系起来,提出'跷跷板效应'——各教师按混合比例把学生的多域能力拉向自身水平,而非各自贡献独立可加的领域技能,这为诊断 MOPD 提供了全新的分析工具。
核心方法
直觉上,论文把'OPD 到底教会了学生什么'拆成可分别操控的变量逐一检验:如果教会的是教师的推理行为,题目难度、语言甚至任务域都应无关紧要;如果只是拟合训练分布,这些偏移就会导致明显掉分。技术上全文统一采用 PG 风格的 OPD:对学生自采样轨迹 $y=\{y_t\}_{t=1}^T$,在上下文 $h_t=(x,y_{<t})$ 上最小化学生到教师的反向 KL 散度 $\mathcal{L}_{OPD}(\theta)=\mathbb{E}\frac{1}{T}\sum_t D_{KL}\!\left(\pi_\theta(\cdot|h_t)\,\|\,\pi_\phi(\cdot|h_t)\right)$,并用采样式 k1 估计改写为策略梯度目标,逐 token 优势为 $\bar{A}^{OPD}_t=\mathrm{sg}[\log\pi_\phi(y_t|h_t)-\log\pi_\theta(y_t|h_t)]$。统一底座上,实验覆盖数学、代码、科学、指令遵循 4 个域、10 个公开模型,并引入 Top-16 token 分布重叠率作机制探针。
核心思想是把 OPD 理解为'迁移教师的推理行为而非具体题目的答案',并指出决定迁移能否推广到整个策略的关键变量是模型同源性。这与已有工作的本质区别有三:以往把 prompt 难度过滤当作提升蒸馏效率的杠杆,本文证明在 OPD 中教师端难度过滤几乎无效——教师解不出的题与全解出的题同样有用,原因在于 OPD 的逐 token 优势只依赖师生概率差,与学生自身对错无关;以往 MOPD 依赖'路由可隔离教师影响'的假设,本文证明同源教师的影响天然越出其训练域,路由无法隔离;此外,作者用教师-学生 Top-16 token 分布重叠率给出机制证据:同源 OPD 随训练把学生策略整体对齐到教师(重叠率持续上升),跨源 OPD 只在训练分布上降低 KL(重叠率持平甚至下降),从机制层面解释了'同源泛化、跨源拟合'这枚硬币的两面。
方法步骤详情
实验按三个研究问题递进。第一步(域内难度):对 BigMath 每题采样 4 条教师回答,按教师通过率切出 easy(=1)、hard(=0)、random 三个 2.5 万题子集,分别训练三对师生模型,在 6 个英文数学基准画训练曲线;再做学生端动态采样,比较只留全解错、只留全解对、只剔除全解对与不过滤四种策略。第二步(语言/视界偏移):仅用英文短链数学(BigMath-random)训练,评估中文(OlymMATH-ZH、LiveMathBench-ZH)与长链(AIME24-Horizon-2、AMC23-Horizon-4)基准,每名学生配一个同源与一个跨源教师。第三步(跨域双向):数学 prompt 训练→代码/科学评估,以及代码/科学/IF prompt 训练→数学评估。第四步(MOPD):固定 prompt 总量,改变 JustRL-1.5B 与 Nemotron-1.5B 的配比(Nemotron/JustRL 从 1/1 到 2/25),并做角色互换、级联蒸馏与 Top-16 重叠率分析。
技术新颖性
新颖性主要体现在实证发现与诊断框架而非新算法。首先,'教师解不出的题与全解出的题同样有用'这一反直觉结论直接否定了从强化学习迁移来的难度过滤直觉,并给出机理解释:OPD 优势只依赖教师与学生概率差,与学生自身对错无关,因此教师即使在端到端解不出题时仍能提供有信息量的 token 级监督。其次,'同源性'作为泛化预测因子是首次被系统提出并验证的变量,且'强教师未必出强学生'(跨源 Light-R1-14B 本身强于同源 Polaris-7B,蒸馏学生却更弱)挑战了蒸馏领域的常识。第三,跷跷板效应、训练中的'拉锯战'(学生曲线先跟随一位教师再漂向另一位)、级联蒸馏的时间维度去耦实验,共同构成诊断 MOPD 的工具箱,甚至能解释'增加数学专家数据反而降低数学成绩'的符号反转现象——这些在既有文献中均无先例。
实验结果
域内:教师通过率几乎不影响 OPD——easy/hard/random 三个 2.5 万题子集在三对师生上(分别约 59%、42%、56%)收敛到几乎相同精度;GSM8K 或最难切片训练也恢复 80% 以上增益。学生端过滤中仅'剔除已全解对的题'有效:41.4%→42.0%(+0.6pp)、52.4%→52.8%(+0.4pp)。语言/视界偏移:仅英文短链训练即可提升中文与长链成绩;但跨源 Light-R1-14B 自身更强,学生收益却更小,长链几乎无增益。跨域:同源配对下数学 prompt 训练即可让 LiveCodeBench、GPQA 逼近教师,反向亦然;跨源配对只有目标域直训有效。MOPD:增大 JustRL 份额使 GPQA/LiveCodeBench/IF-Eval 全面下滑,GPQA 早期跌约 5%;数学成绩 J/N=25/8 最优 27.1%(+0.8pp),角色互换后升至 22.7%(+0.7pp)。Figure 8 中同源 Polaris-7B(AMC2023 达 95.2%)任科学专家反更提升数学:数学数据占比从 8/25 升至 25/8,成绩反降。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 数学(6 个英文基准平均,Polaris-7B→DS-distill-1.5B) | 平均准确率 | 42.0%(学生动态过滤 pass-rate∈[0,1)) | 41.4%(无动态采样);教师通过率 easy/hard/random 子集均约 42% | +0.6pp;训练难度几乎不影响结果 |
| 数学(6 个英文基准平均,Light-R1-14B→DS-distill-7B) | 平均准确率 | 52.8%(学生动态过滤 pass-rate∈[0,1)) | 52.4%(无动态采样) | +0.4pp;两个极端过滤(=0 或 =1)反而各降 0.2-0.3pp |
| MOPD 数学(BeyondAIME+OlymMATH 平均,JustRL-1.5B 任数学教师) | 平均准确率 | 27.1%(J/N=25/8);基线学生仅 11.9% | J/N=1/1 为 26.3% | +0.8pp 相对 1/1,相对学生初始 +15.2pp |
| MOPD 数学(Nemotron-1.5B 任数学教师,角色互换) | 平均准确率 | 22.7%(J/N=25/8) | J/N=1/1 为 22.0% | +0.7pp;说明配比而非被分配的域决定结果 |
| 跨域代码迁移(LiveCodeBench,同源教师,1.5B/7B 学生) | LiveCodeBench 准确率 | 数学 prompt 训练与代码 prompt 训练均逼近教师水平 | 跨源教师:数学 prompt 训练明显低于代码 prompt 直训 | 同源配对基本消除训练域差距 |
| MOPD 符号反转(DS-distill-7B,跨源 Light-R1-14B 数学专家+同源 Polaris-7B 科学专家) | AMC2023 / AIME2026 等四基准 | 数学数据占比从 8/25 升至 25/8,数学成绩持续下降 | 仅用跨源数学专家单教师 OPD 在所有基准上最弱 | 同源科学专家(本身 AMC2023 达 95.2%)免费带数学,形成反转 |
局限与改进
作者承认的局限:实验仅覆盖面向推理的模型与数学/代码/科学/指令遵循四个域,结论未必推广到多模态、工具使用或交互式智能体等监督依赖外部观测与动作的设定;MOPD 实验只用了两位能力互补的教师和固定的基于域的 prompt 路由,未考察更大、更异构的专家池、自适应路由器或非均匀教师采样。我自己的补充观察:'同源性'目前只是经验规律,Top-16 重叠率提供了机制证据但缺乏因果干预实验(例如先对跨源教师做少量基座对齐能否挽救跨源配对);所有评估以基准准确率为主,缺少 token 级行为变化的细粒度度量;论文也未在同等算力预算下与离线蒸馏或强化学习做对照,'OPD 不挑数据'究竟是鲁棒还是数据效率低,尚无法区分。
独立分析的弱点
第一,跷跷板效应只有诊断没有药方:论文证明了路由无法隔离教师影响,但未提出缓解策略,例如对跨源教师先做基座对齐、按各教师对各域的正负贡献加权教师采样、或在损失中对各域 KL 施加约束,这些方向都值得尝试。第二,MOPD 仅限两教师与固定路由,现实中专家池更大且能力高度重叠,跷跷板可能退化为多体混沌,需要新的分析与控制工具。第三,'同源'定义依赖可查的后训练谱系,对闭源或谱系不明的教师无法直接判断,实用性受限,可探索用初始分布距离或 token 重叠率等可测量指标替代。第四,难度无关的结论是在 2.5 万题规模与数学域内验证的,数据量极小或域更窄时是否仍成立未知。第五,GSM8K 能恢复 80% 增益固然说明 OPD 不挑食,但也暗示其对数据不敏感可能同时意味着数据效率受限——同等算力下精选数据是否仍有上限收益,需要与算力匹配的替代方案对比实验来回答。
未来方向
作者提出的方向:把分析扩展到多模态、工具使用与智能体设定,检验监督依赖外部观测或动作时 OPD 是否仍有类似的跨域行为;研究更大、更异构的专家池,以及自适应路由器与非均匀教师采样下的 MOPD 泛化。基于本文成果可自然延伸的:将 Top-16 重叠率发展为在线监控指标,实时检测某教师对非目标域的'拉扯'并动态调整配比,把跷跷板从事后诊断变成训练中可控的旋钮;设计'同源化'预处理,如跨源教师先在学生基座上做轻量强化学习、或用学生自身分布重写教师输出,以打破同源限制;利用'OPD 不挑题难度'的特性构建低成本数据管线(自动生成简单题并由教师打分);以及在伦理层面,由于能力会跨域泄漏,MOPD 训练的模型应在所有域上做安全与可靠性评估,而不能只测每位教师被分配的域。
复现评估
复现条件较好但工程量不小。所有教师与学生模型均为公开权重(Qwen3 系列、DeepSeek-R1-Distill 系列、Polaris-7B/4B、Light-R1、OpenMath-Nemotron、JustRL、DeepScaleR、VibeThinker 等),训练与评估数据集全部公开(训练用 BigMath、DeepCoder-Preview-Dataset、TextbookReasoning、SCP-116K、Nemotron-Post-Training-IF,评估用 MATH-500、AIME2025/2026、BeyondAIME、OlymMATH、LiveCodeBench、GPQA-Diamond、IF-Eval 等),附录还提供了模型谱系表与数据集细节。论文未提及开源训练代码;OPD 需要学生在线 rollout 加教师逐 token 打分的基础设施(类似 RLHF 训练框架),最大实验涉及 Qwen3-32B 教师与 14B 学生,粗估需要数十张高端 GPU。好消息是核心结论(难度无关、同源效应、跷跷板)在 1.5B 模型配对上即可复现,验证门槛可以大幅降低。
论文图表