D³-MOPD:面向高效多教师蒸馏的自适应动态域调度 D^3-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation
把训练中现成的逐域反向KL信号变成动态数据配比,零开销让多教师蒸馏更快更强
前置知识
在策略蒸馏(On-Policy Distillation, OPD)
一种知识蒸馏范式:学生模型在自己采样的生成轨迹上训练,教师模型对这些轨迹做预填充(prefill),给出逐 token 的目标分布作为监督信号,学生最小化两者间的散度。与在固定数据集上模仿教师输出的离线蒸馏不同,OPD 的训练数据来自学生自身采样,能缓解训练与推理时的分布偏移,是当前大模型后训练中兼顾质量与成本的高效压缩手段。
本文的调度器完全嵌入 OPD 训练循环之中,理解「学生采样 → 教师预填充 → 反向KL损失」的流程,才能明白为什么逐域反向KL信号是「训练免费送出来的」以及调度器如何旁路接入。
反向KL散度(Reverse KL)
衡量学生分布 $\pi_\theta$ 与教师分布 $\pi_T$ 差异的散度,定义为 $D_{KL}(\pi_\theta \| \pi_T)$。与正向KL倾向于覆盖教师所有模式不同,反向KL是 mode-seeking 的:学生分布会集中在教师的高概率区域。作为逐 token 损失在 OPD 中被最小化,它随训练下降的轨迹天然反映学生对该域的逼近程度。
反向KL是本文唯一的调度信号源:每个域的 KL 下降曲线被转换成「剩余差距」与「下降速度」两个量,整个方法就是围绕这个现成信号做的文章。
多教师蒸馏与域数据混合(MOPD)
MOPD 把 $K$ 个领域专家教师(如数学、代码、指令遵循、工具使用)同时蒸馏进一个学生:训练时按混合比例 $\{p_k\}$ 从各域提示池抽取样本组成 batch,每个样本只查询其所属域的教师。传统做法中 $p_k$ 按各域提示池大小 $N_k/\sum_i N_i$ 在训练前定死且全程不变。
本文的核心论点就是这个固定的 $p_k$ 是低效根源——不同域收敛速度差几个数量级,方法的所有内容都是让 $p_k$ 随训练进程动态化。
GRPO(组相对策略优化)
一种强化学习后训练算法:对同一提示采样一组回答,用组内奖励的相对优势替代 critic 网络来估计基线,从而优化策略。因实现简单、算力友好,被广泛用于让模型在数学、代码等可验证领域上自我提升。
论文实验中 4 个领域专家教师正是由同一 backbone(Qwen3.6-35B-A3B)分别经 GRPO 在单域数据上微调得到的,理解教师来源是复现实验设置的前提。
研究动机
多教师在线策略蒸馏(MOPD)在训练前按提示池大小固定各域采样比例 $p_k$,但学生的各域收敛速度差异极大。作者先用单域 OPD 分别训练学生做了诊断实验(Figure 2):Math 在训练预算的前四分之一就骤降并进入平台期;Code 匀速缓慢下降、预算内毫无收敛迹象;指令遵循(IF)虽持续下降但绝对反向KL在每个时刻都比其他域高一到两个数量级。三域联合训练且均匀混合($p_k=1/3$)时(Figure 3),各域进入低KL阶段的时点天差地别——Code 约第 48 步、Math 约第 96 步、IF 拖到约第 144 步——而静态混合仍给早已收敛的域每 batch 分配三分之一样本,纯浪费算力,同时挤压了仍在快速学习的域的预算。对 35B 级学生、256 个 rollout 步、batch 128 的训练而言,这种错配意味着巨大的算力浪费和被压低的性能上限。
本文的目标是本文要构建一个零额外开销的域调度器:复用训练损失本来就逐样本计算出的每域反向KL信号,在线更新采样比例 $\{p_k\}$,把 rollout 预算从已收敛域转移到仍在提升的域。设计约束有三:不修改核心训练循环(rollout、教师预填充、学生更新全部不动);天然扩展到任意域数 $K$;同时提升峰值质量与训练效率。量化目标在 Qwen3.6-35B-A3B 学生、4 个领域教师的设定下验证:把学生-教师平均性能差距的关闭比例从 vanilla MOPD 的 63% 提升到 97%,并以约 3 倍少的 rollout 步数达到基线峰值。
与已有工作不同的是,已有 OPD 工作都在监督信号层面做精炼:按教师熵切换正反KL、过滤并重加权噪声 token、修正逐 token KL 与序列级结果的不匹配、稳定学习目标等;已有 MOPD 大规模应用(MiMo-V2-Flash、DeepSeek-V4、GLM-5、Nemotron-Cascade 2 等)则用交替单域训练等方式缓解教师间的冲突拉扯。但所有现有方法的每域数据比例都固定不变,无人回答「数据在各域间怎么分」这个问题。本文的独特切入是把域配比从训练前超参数变成训练中可调度的连续状态变量,并直接征用训练循环免费产出的反向KL作为调度信号——与损失函数改进、教师训练改进完全正交,即插即用。
核心方法
直觉:一个域「值得投入」当且仅当它还有提升空间且正在实际提升。D³-MOPD 只加两个组件(Figure 4):异步 watcher 进程与分层采样数据源,训练主循环零改动。watcher 每 $n=10$ 个 rollout 步从共享日志读取按域分组的逐样本反向KL,先 EMA 平滑,再算归一化剩余差距 $f_k(t)=\overline{KL}_k(t)/\overline{KL}_k(0)$(抹平各域绝对KL相差一到两个数量级的量纲差异)与下降速度 $v_k(t)=\max(0, -\frac{1}{R}\sum_{i=0}^{R-1}\delta_k^{(i)}(t))$($\delta_k^{(i)}$ 为长度 $W$ 窗口的相对变化率,$R=3$ 窗平均抗噪)。乘积 $s_k=f_k\times v_k$ 经归一化与带温度 $T$、下限 $\epsilon$ 的 softmax 映射为合法混合 $p_k(t)=\epsilon+(1-K\epsilon)\cdot\frac{\exp(\tilde{s}_k/T)}{\sum_j \exp(\tilde{s}_j/T)}$ 写入状态文件;数据源按 $\{p_k\}$ 分层组 batch 并叠加 $\eta=0.3$ 的批量级均匀抖动恢复批间随机性。
核心创新有三层。第一,把「域配比」从训练前的静态超参数变成训练中的动态状态变量,并用乘积形式 $s_k=f_k\times v_k$ 同时编码「还有多少空间」和「是否还在学」:只用差距会把平台期的大差距域误判为高价值,只用速度会把接近收敛域的瞬时下降误判为高价值,乘积确保只有「有余量且在下降」的域获得高配比;附录 E 证明在指数衰减模型下该乘积近似归一化的边际KL减少量,即贪心分配规则。第二,零开销设计:信号是损失函数本来就逐样本算出的量,watcher 作为 detached 进程异步运行,训练器只通过状态文件被动读取新配比、永不阻塞,调度与 slime 框架的异步 rollout-update 循环天然契合。第三,温度+下限的 softmax 映射保证配比始终合法($\sum_k p_k=1$、$p_k\ge\epsilon$),固定下限 $\epsilon$ 防止已收敛域被完全饿死而引发灾难性遗忘。这与所有在监督信号上做文章的已有方法是本质不同的维度。
方法步骤详情
流程见 Algorithm 1。① 种子与回退:前 $S_0$ 步各域 KL 均值作为 $\overline{KL}_k(0)$ 只播一次;$t<2W$ 时数据源回退均匀混合 $p_k=1/K$,抖动仍生效。② watcher tick(每 10 步):逐域算 $f_k$、$v_k$,warmup 期用 $R'(t)=\lfloor t/W\rfloor-1$ 替代 $R$、此后封顶 3;信号归一化 $\tilde{s}_k=s_k/\max_j s_j$;若所有域平台化则置零、退化为均匀混合。③ softmax+floor 得 $\{p_k\}$,原子写入 status 文件。④ 每 rollout 步 GETBATCH:读状态文件(缺省均匀),采样 $u_k\sim\text{Uniform}(-\eta,\eta)$,算 $\tilde{p}_k=p_k(1+u_k)/\sum_j p_j(1+u_j)$;每域先分 $\lfloor B\tilde{p}_k\rfloor$ 个名额,剩余按小数部分从大到小补齐,凑满 $B=128$。⑤ 训练器照常 rollout、教师预填充、最小化逐 token 反向KL,逐样本 KL 追加进共享日志,闭环。改动只在数据路径,256 步内 watcher 约更新 25 次配比。
技术新颖性
与现有工作的本质区别:OPD 系改进集中在监督信号本身(token 级过滤、正反KL按教师熵切换、序列级校正),MOPD 系改进集中在教师冲突(Chen et al. 的交替单域训练、工具调用边界漂移与教师置信度异质性的修正),没有工作把「数据在域间如何分配」当作被在线调度的对象。本文把调度器外置成旁路进程,靠 EMA 平滑加 $R=3$ 窗口平均把噪声很大的原始 KL 序列变成可靠信号,工程上非常干净:不改 loss、不改 rollout、不感知训练框架内部结构。两个附加贡献值得一提:其一,批量级抖动 $\eta=0.3$ 被消融证明不只是去噪——去掉后峰值平均分降 0.71(61.63 vs 62.34),且对快速平台化的代码域伤害最大(OJBench $-2.6$、LiveCodeBench $-1.6$),作者推测随机化的比例爆发对接近平台期的域提供了探索式的强梯度更新,这把抖动从工程细节升格为有机制含义的设计;其二,gap×velocity 乘积在指数衰减假设下等价于按归一化边际收益贪心分配,给了这个启发式方法一个理论注脚。
实验结果
主实验:Qwen3.6-35B-A3B 学生从 4 个 GRPO 单域微调的专家教师蒸馏,batch 128、256 步、每 16 步评估,覆盖 AIME 2025、HMMT、IFBench、IFEval、LiveCodeBench v6、OJBench、BFCL v3 七基准。① 峰值更高:D³ 平均分峰值 62.3(第 95 步),vanilla 61.4(第 143 步);归一化分数关闭 97% 学生-教师差距 vs vanilla 的 63%;单基准增益从 AIME +0.2 到 IFBench +2.8,并在 HMMT(+0.9)、IFEval(+0.4)、OJBench(+1.2)超过专家教师,vanilla 一项都没有。② 更快:vanilla 第 143 步才到 61.4,D³ 第 47 步即达 62.1,约 3 倍加速;vanilla 单基准峰值最晚第 207 步(AIME),D³ 前 79 步内全部匹配或超过。③ 收敛顺序与 r-KL 一致:代码最先达峰(第 79/95 步)、IF 最晚(第 175/191 步),与 Figure 3 的 r-KL 平台化顺序吻合。消融(Table 1):去速度信号 61.41、去差距信号 61.46、去抖动 61.63、$R=1$ 62.17,完整方法 62.34(vanilla 61.36)。Figure 6 还揭示隐式课程:Code 配比 0.25→约 0.15,Math 于 60–127 步升至约 0.50,随后 IF/Tool-use 升至约 0.55/0.50。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| AIME 2025(数学,avg@64) | 峰值准确率(%) | 74.1 | 73.9(vanilla MOPD);教师 76.2 | +0.2,归一化后仍差教师 $-2.1$ |
| HMMT November 2025(数学,avg@32) | 峰值准确率(%) | 73.2(超过教师 72.3) | 72.0(vanilla MOPD) | +1.2,首次超过领域专家教师($+0.9$) |
| IFBench(指令遵循) | 峰值准确率(%) | 48.9 | 46.1(vanilla MOPD);教师 52.1 | +2.8,全文最大单基准提升 |
| IFEval(指令遵循) | 峰值准确率(%) | 92.3(超过教师 91.9) | 91.1(vanilla MOPD) | +1.2,超过专家教师($+0.4$) |
| LiveCodeBench v6(代码,avg@6) | 峰值准确率(%) | 63.2 | 61.5(vanilla MOPD);教师 64.8 | +1.7,且第 79 步即达峰 |
| OJBench C++(代码) | 峰值准确率(%) | 29.7(超过教师 28.5) | 27.6(vanilla MOPD) | +2.1,超过专家教师($+1.2$) |
| BFCL v3 Multi-Turn Base(工具使用) | 峰值准确率(%) | 62.5 | 61.5(vanilla MOPD);教师 67.0 | +1.0,此域距教师差距仍最大($-4.5$) |
| 七基准平均(归一化分数 $\hat{s}_b$) | 学生-教师差距关闭比例 / 峰值平均分 | 0.97(平均分 62.3,第 95 步达峰) | 0.63(平均分 61.4,第 143 步达峰) | 差距关闭比例 +34 个百分点;达到基线峰值仅需约 1/3 的 rollout 步数(47 步 vs 143 步) |
局限与改进
作者承认的局限:蒸馏总体仍低于教师的最大性能,D³ 的归一化分数 0.97 表明蒸馏主要关闭既有能力差距而非创造新技能(与 Ma et al. 的发现一致);超过教师的 3 个胜利(HMMT、IFEval、OJBench)全部来自初始学生-教师绝对差距很小的基准($\Delta\le 5.1$),小幅绝对提升即可让归一化分超过 1.0,存在指标放大效应。我自己的观察:第一,只在单一学生规模(35B-A3B MoE)、单一训练框架(slime)和单一反向KL损失设定下验证,小模型或稠密模型上 r-KL 噪声特性不同,调度稳定性未知;第二,超参数 $W$、$T$、$\epsilon$ 的敏感性完全未报告,消融只覆盖 $R$ 和 $\eta$,而温度 $T$ 直接决定配比的重定向锐度;第三,每域仅约 4k 提示、单轮对话格式,域内难度异质性被 $f_k$ 这个标量抹平;第四,工具域 BFCL 与教师仍有 $-4.5$ 的差距,说明极慢收敛域在 256 步预算内仍受益有限;第五,信号只用了标量 KL 轨迹,未利用逐 token 或逐样本的结构信息,理论上存在信息损失。
独立分析的弱点
第一,调度信号是域级标量,忽略样本级异质性:同域内简单题早已收敛而难题持续欠训练,均匀提升 $p_k$ 无法定向帮助难题,改进方向是把 $f_k$、$v_k$ 细化到难度分层或课程粒度。第二,平台期检测有滞后:$v_k$ 需 $R=3$ 个窗口平均变化非正才归零,Code 域第 48 步就进入低KL阶段但配比是渐进下降的,中间若干步预算仍被浪费,可引入变点检测(如 CUSUM)加速识别。第三,跨域可比性靠除以初始值 $\overline{KL}_k(0)$ 实现,但若某域初始KL很小且迅速触底,$f_k$ 会过早趋零导致预算被提前抽走,而全域统一的下限 $\epsilon$ 不按域难度自适应,可改为差异化下限。第四,抖动的「探索」解释(代码域受益最大)只是假设,缺少梯度范数或损失曲面层面的机制验证实验。第五,所有教师与学生同源于 Qwen3.6,跨家族、异构 tokenizer 教师组合下是否同样工作完全未验证。
未来方向
作者明确提出:D³-MOPD 的期望收益随域数 $K$ 自然增长,因为更多域带来更多样的收敛模式供调度器利用,因此在 $K=8$、$16$ 个域上的扩展实验是最直接的下一步;附录 E 的指数衰减分析可推广为更正式的在线分配理论,例如把域选择建模为多臂老虎机并给出 regret 分析。基于成果可延伸的方向:把调度信号从域级下探到样本级,与 RL 的自动课程学习结合;尝试教师熵、token 级学生-教师分歧等其他可在线观测的指标替代或融合 r-KL,比较各自作为收敛代理的优劣;把「旁路 watcher + 状态文件」的调度模式迁移到多任务 SFT、多数据源 RL 训练乃至持续学习的回顾配比上;探索配比调度与学习率调度、早停策略的联合优化;最后,抖动的探索性收益值得单独一篇消融研究来验证机制。
复现评估
论文未提供开源代码或模型权重链接(AllSpark Team,正文无 GitHub 链接),复现依赖自己实现。方法层面难度低:Algorithm 1 伪代码完整,超参 $T$、$\epsilon$、$S_0$、$R=3$、$W$、$n=10$、$\eta=0.3$、$B=128$ 全部明示,调度器只是几百行日志解析加公式的独立进程。真正门槛在算力与教师:需 35B-A3B 学生加 4 个同 backbone 经 GRPO 各自微调的专家教师,教师微调本身就要可观 GPU 预算;主训练 256 步 × batch 128,外加每 16 步在 7 基准评估,AIME avg@64 等高采样评估开销不小。数据可得性中等:Math 用 DAPO-Math-17K、Code 用 CodeI/O、IF 从 Nemotron-Cascade 2 过滤、Tool-use 用 Fission-GRPO,均公开,但 IF 过滤规则与各域约 4k 提示的筛选细节未完全披露;附录 B 有训练细节、附录 G 有各变体配比轨迹,利于对拍。
论文图表
三域(Math/Code/IF)设定下两种方法的概念对比图:上半部分 vanilla MOPD 全程保持固定课程(Math 33%、Code 33%、IF 33%),导致快域过训练、慢域欠训练,最终对教师的逼近度只有 63%;下半部分 D³-MOPD 在预热后通过逐域 r-KL 计算差距与下降速度,把配比从「简单且已饱和的域」转向「困难但可学习的域」(如 Math 30%、Code 10%、IF 60%),对教师逼近度达 97%。
这是全文的电梯演讲:一张图同时讲清了问题(固定混合的错配)和方案(按 r-KL 动态重分配),读论文前先看它就能建立整体心智模型。
三个域单独做单域 OPD 训练时各自的反向KL曲线(原始值 + EMA $\alpha=0.1$):Math 在前四分之一预算内骤降然后平台化;Code 稳定缓慢下降、预算内未收敛;IF 全程持续下降但绝对KL始终比其他域高一到两个数量级(注意各子图纵轴刻度不同)。
这是动机部分最核心的证据图:它用受控实验证明「各域收敛速度天然异步」不是训练动态的偶然现象,而是普遍规律,直接推导出任何静态配比都必然次优,同时它也解释了为什么调度信号必须做归一化。
三域联合训练、均匀混合下的逐域反向KL曲线:Code 约第 48 步、Math 约第 96 步、IF 约第 144 步先后进入低KL平台期,阴影区域标出各域「已平台化却仍被分配三分之一样本」的算力浪费区间,右下子图为共享坐标轴的平均曲线(平台点约第 96 步)。
它把 Figure 2 的单域诊断落实到联合训练场景,定量指出浪费从何时开始、持续多久,是「固定混合浪费算力」这一核心主张的直接可视化。