先验证再蒸馏:在线策略蒸馏的提示级教师门控 Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation
用验证器抽检教师逐题可靠性,按提示在密集OPD与GRPO间独占路由
前置知识
在线策略蒸馏(On-Policy Distillation, OPD)
学生模型在自己的 rollout 上训练:冻结的教师对每条学生生成的序列做一次前向打分,在每个 token 位置给出密集监督信号。与 RLVR 的整条轨迹单个标量奖励相比,这种逐 token 反馈能让 4B 级学生以快约一个数量级的速度达到教师级准确率。本文的基线 Vanilla OPD 对所有提示无差别地施加这种教师监督。
TGOPD 是对 OPD 的直接改进,只有理解 OPD 的密集监督机制,才能明白'何时该关闭教师信号'这一问题为何关键、以及门控加在哪里。
反向 KL 散度与 Mode-seeking
OPD 通过最小化 $KL(\pi_\theta \| \pi_T)$ 训练学生,其单采样形式是策略梯度更新,逐 token 优势为师生对数似然比 $\hat{A}^{OPD}_{i,t} = \beta\,\mathrm{sg}[\log\pi_T - \log\pi_\theta]$。反向 KL 是'追峰'的:它把学生概率质量集中到教师最高概率的行为上。这带来高效,但也意味着教师'自信地错误'时错误会被强烈放大。
mode-seeking 是论文问题的根源:密集教师信号本身无任何过滤,因此需要在采纳信号前用结果证据验证教师,这正是 TGOPD 的出发点。
GRPO 与可验证奖励强化学习(RLVR)
对每个提示采样一组 $G$ 条 rollout,用验证器给 0/1 结果奖励,组内中心化得到轨迹级优势 $\hat{A}^{GRPO}_i = r(x,y_i) - \frac{1}{G}\sum_j r(x,y_j)$,同一条 rollout 的所有 token 共享该标量(本文省略标准差归一化)。它不依赖教师、以正确性为准绳,但信号比逐 token 蒸馏稀疏。
门控关闭时 GRPO 是'验证器接管'的回退分支;理解它的组内相对优势机制,才能明白为什么全对或全错的组不产生任何更新。
验证器(Verifier)
对生成结果打 0/1 分的自动裁判:代码域用单元测试,数学与指令跟随用规则判定器。它本是 RLVR 的奖励来源;本文的新用法是让它反过来'审计教师'——对教师自己生成的 $K_T$ 条探测 rollout 打分,用通过率作为该提示上教师可靠性的直接结果证据。
TGOPD 的门控完全建立在验证器对教师探测结果的打分上,没有可靠验证器就无法实现提示级可靠性估计,这也是方法适用范围的边界。
AUROC(ROC 曲线下面积)
衡量一个连续分数区分两类样本能力的指标:0.5 等于随机猜测,1.0 为完美区分。论文用它检验'教师自信度能否区分高可靠与低可靠提示':代码域仅 0.51(近乎随机),数学域 0.73。
它是'为什么不能用熵或置信度做门控'的关键量化证据,读懂 Figure 2 的动机实验必须先理解这个指标。
研究动机
Vanilla OPD 对每个提示无差别地采纳冻结教师的逐 token 密集监督,从不检查教师在当前这道题上是否可靠。由于反向 KL 是 mode-seeking 的,学生会集中模仿教师概率最高的行为,一旦教师'自信地错误',错误梯度会被强烈放大。论文的诊断实验(Figure 2,每域 2400 提示、每题 10 条离线教师采样)量化了风险:教师置信度对高/低可靠提示的区分能力 AUROC 在代码域仅 0.51(近乎随机)、数学域 0.73;低可靠区($q_T^{(10)} < 0.5$)内,教师最高置信度的答案在代码上 84% 的概率是错的,数学上 61%——而反向 KL 恰恰强调教师的高概率行为,这正是 Vanilla OPD 会传播的错误。另一侧是系统级浪费:教师只需对已生成 token 做一次前向打分,必须等学生 rollout 完成,4B 单域实测教师节点 GPU 利用率仅 9.8%,59% 的时间低于 5%,集群平均仅 51.5%。既有方法用熵、师生似然一致性等分布代理,只能度量'不确定或不匹配',无法直接验证教师答案对错。
本文的目标是本文的目标是把'是否信任教师'变成一个可在提示级执行、且用结果证据而非分布代理做出的决策:在每个提示上,先用少量由验证器打分的教师探测 rollout 估计教师通过率,只有可靠性检查通过才放行密集 OPD 监督;检查失败时撤回教师信号,改用验证器接地的 GRPO 更新,两个分支互斥路由、绝不混合,从而既不丢掉被拒提示的训练价值,又不让不可靠的教师信号进入梯度。同时希望这套审计几乎不增加额外开销——把探测计算安排进教师本来就闲置的等待窗口,顺带回收异步 OPD 中被浪费的教师算力(实测目标是从 9.8% 的利用率提升到接近饱和)。最终要求在 4B 与 35B 两档学生规模、数学/代码/指令跟随三个域上全面超越 Vanilla OPD 及 TrOPD、RG-OPD 等可靠性感知基线。
与已有工作不同的是,已有可靠性感知蒸馏沿两条路线发展,但都没做到'提示级的事前结果审计'。第一条用分布证据:EOPD 在高熵教师 token 上改用前向 KL,TrOPD 用师生解码一致性定义 token 级信任域,REOPOLD 用似然比与学生熵裁剪奖励——它们度量的是不确定性、兼容性或优化风险,不检验答案对错。第二条引入了结果证据但粒度与时机不同:RG-OPD 只在验证器反馈与师生似然差一致时保留轨迹级蒸馏,RLSD 用环境正确性定更新方向、自蒸馏调幅度,SPOT 用验证器打分的学生续写评估教师提出的分支——它们调节的是单条轨迹或 token 分支,而不是'这条提示是否准入密集监督'这一整体决策;且现有多教师框架只按域路由教师,选定后照单全收其密集奖励。TGOPD 的独特切入是:用重复的完整教师 rollout 通过率,在监督分支选择之前做提示级准入决策,且两个信号是互斥路由而非插值混合。
核心方法
直觉上,TGOPD 把教师当成需要'先考后用'的专家:每道题先让教师做几次小测验(探测 rollout),验证器判卷,通过率高才允许教师逐 token 讲课(密集 OPD),否则交给验证器接地的 GRPO 去练。技术上:教师可靠性定义为期望验证器奖励 $R_T(x) = \mathbb{E}_{y\sim\pi_T(\cdot|x)}[r(x,y)]$,用 $K_T$ 条教师采样通过率 $q_T(x) = \frac{1}{K_T}\sum_k r(x,\hat{y}_k)$ 估计,无偏且 $K_T q_T(x) \sim \mathrm{Binomial}(K_T, R_T(x))$。硬门控 $g(x) = \mathbb{1}[q_T(x) \geq \tau]$,主实验取 $K_T=3$、$\tau=2/3$(两票多数)。逐 token 优势是选择器而非插值:$\hat{A}^{TGOPD}_{i,t} = g(x)\hat{A}^{OPD}_{i,t} + (1-g(x))\hat{A}^{GRPO}_{i,t}$,$g\in\{0,1\}$ 保证两路信号从不共同监督同一提示,Vanilla OPD 与纯 GRPO 分别是 $g\equiv 1$、$g\equiv 0$ 的退化端点。优势进入标准 PPO 裁剪目标(式 7),异步实现附加 IcePop。探测与学生解码并发,填进教师等待打分的空闲窗口,几乎不占额外算力。
核心创新是'提示级、结果导向、事前'的教师准入门控,与已有方法的本质区别有三点。第一,证据类型:EOPD/TrOPD/REOPOLD 用熵、一致性等分布代理,只能说明'不确定'或'不匹配',无法区分同样自信的对与错(代码域置信度 AUROC 仅 0.51);TGOPD 直接用验证器对完整教师答案打分,是结果证据,能区分'同样自信但一个对一个错'的情形。第二,决策粒度与时机:RG-OPD/RLSD/SPOT 把结果反馈用于调节单条轨迹或 token 分支,TGOPD 则在密集监督被采纳之前,用 $K_T$ 次重复教师结果对整条提示做准入决策——这是监督分支选择前的门,而非训练信号内部的调节器。第三,信号组合方式:门是二值选择器,两个优势从不相加或加权插值,避免了把密度和来源不同的两种信号纠缠在一条轨迹里;Vanilla OPD 与纯 GRPO 恰是其两个退化端点。叠加系统设计——探测复用教师结构性空闲(打分只是一次前向、必须等学生生成完,4B 实测 59% 时间利用率低于 5%)——让可靠性审计几乎免费,教师节点利用率从 9.8% 提到 78.9%。
方法步骤详情
一个异步 rollout–更新周期共六步。第 1 步:rollout 节点从冻结快照 $\pi_{old}$ 为每个提示采样 $G$ 条学生 rollout 并记录对数概率(关键路径)。第 2 步(并发):教师节点生成 $K_T=3$ 条探测 rollout,验证器逐条打 0/1 分,输出 $q_T(x)\in\{0,\frac13,\frac23,1\}$,两票多数即开闸。第 3 步:教师对学生 rollout 做打分前向,得 $\log\pi_T(y_{i,t}|x,y_{i<t})$,构成 OPD 优势 $\hat{A}^{OPD}_{i,t} = \beta\,\mathrm{sg}[\log\pi_T - \log\pi_\theta]$,该步无条件执行以保证流水线规整。第 4 步:验证器给学生 rollout 打分,组内中心化得 GRPO 优势 $\hat{A}^{GRPO}_i = r(x,y_i) - \frac{1}{G}\sum_j r(x,y_j)$(不做标准差归一化),组内奖励全同时优势为零、该提示不更新。第 5 步:$q_T(x)\geq 2/3$ 则整条提示用 OPD 优势,否则用 GRPO 优势,互斥选择。第 6 步:构造比率 $\rho_{i,t}(\theta)$,最小化 PPO 裁剪目标(式 7)更新学生,异步实现附加 IcePop。探测大多落在教师空闲期,4B 单域教师节点利用率从 9.8% 升至 78.9%,35B 代码匹配实验步时仅 +5.9%。
技术新颖性
技术新颖性体现在统计与系统两个层面。统计上,论文把教师可靠性形式化为可验证的任务量 $R_T(x)$,指出 $K_T q_T(x)$ 服从二项分布、估计量对任意探测预算无偏(方差 $R_T(1-R_T)/K_T$);阈值消融(Figure 5,$K_T=5$)显示门控严格度与精度呈倒 U 形,在简单多数 $\tau=3/5$ 处三个数学基准同时达峰(AIME 2026 73.1、AIME 2025 64.4、HMMT-Feb 58.0,超 Vanilla OPD +1.9/+3.3/+3.7),过严的 $5/5$ 让 HMMT 跌破基线(52.0 vs 54.3)——说明粗粒度多数决就够,门无需精确排序提示。系统上,可靠性估计被刻意安排在教师节点的结构性空闲期:教师打分只是一次前向且必须等学生生成完毕,57–78% 采样低于 5% 利用率是架构必然;探测填充该窗口后教师利用率升至 78.9%/82.8%(单域)与 66.6%/57.7%(多域),rollout 节点变化均在 ±2 点噪声内。'回收空闲算力审计教师,再按审计结果互斥路由监督'是区别于所有前作的标志。
实验结果
单域主实验(Table 1):TGOPD 在 4B 与 35B 学生 × 数学/代码/IF 三域的全部六个组合上超过 Vanilla OPD,代码域增益最大(4B 平均 +3.0,35B +2.9),IF 次之(+1.6/+1.9),数学再次(+1.5/+1.2)。最突出的是 35B 代码:所有蒸馏基线在 LiveCodeBench 上负迁移(OPD −0.8、TrOPD −2.5、RG-OPD −3.5、RLSD 式 −4.1,均低于基座 61.0),唯有 TGOPD 正迁移到 64.0(OJBench 28.7),超过教师本身(+1.3 LCB、+1.1 OJBench);全表 14 列中 TGOPD 7 列第一、6 列超教师;4B 代码上 Vanilla OPD 只关闭基座到教师差距的 21%,TGOPD 关闭 55%。多域 MOPD(Table 2,199 步):4B 七基准均值 53.40→54.54(+1.14,6/7 列胜),35B 60.99→61.94(+0.95,5/7 列),单项最大增益 AIME 2026 +3.85(4B)、IFBench +2.94(4B)、OJBench +4.31(35B)。算力(Table 3):教师节点利用率 9.8→78.9%(4B 单域)、8.8→82.8%(35B 单域)、7.0→66.6%、5.0→57.7%(MOPD),空闲降至 0–2%,集群 +18.0/+11.8/+12.7/+8.6 点。消融(Figure 5):阈值在 $\tau=3/5$ 达峰、$5/5$ 时 HMMT 跌破基线;关门策略(Table 4/5)显示仅遮蔽即可获得约九成收益(+1.08 vs 完整回退 +1.20),GRPO 回退在四个设置中三个略优,被选为默认。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 代码生成(35B 单域蒸馏) | LiveCodeBench 代码生成子任务 pass@1(6 次平均) | TGOPD 64.0(超教师 62.7 达 +1.3,超基座 61.0 达 +3.0) | Vanilla OPD 60.2;TrOPD 58.5;RG-OPD 57.5;基座 61.0 | 较 Vanilla OPD +3.8;唯一实现正迁移并超过教师的蒸馏方法 |
| 代码竞赛(35B 单域蒸馏) | OJBench C++/Python 总分 | TGOPD 28.7 | Vanilla OPD 26.7;教师 27.6;基座 26.1 | 较 Vanilla OPD +2.0,超教师 +1.1 |
| 数学推理(4B 单域蒸馏) | AIME 2025 / AIME 2026 准确率(64 次平均) | TGOPD 64.8 / 73.5 | Vanilla OPD 61.1 / 71.2;教师 63.4 / 73.4 | 较 Vanilla OPD +3.7 / +2.3,双双超过教师 |
| 指令跟随(35B 单域蒸馏) | IFEval / IFBench | TGOPD 91.5 / 43.7 | Vanilla OPD 90.1 / 41.3;教师 90.8 / 52.1 | IFEval +1.4 并超教师 +0.7;IFBench +2.4 但未达教师 |
| 多域联合训练(35B MOPD) | 七基准平均 | MOPD+TGOPD 61.94 | Vanilla MOPD 60.99 | +0.95(OJBench 单项 +4.31) |
| 多域联合训练(4B MOPD) | 七基准平均 / AIME 2026 | 54.54 / 67.60 | Vanilla MOPD 53.40 / 63.75 | 平均 +1.14;AIME 2026 单项 +3.85 |
| 教师节点算力利用(4B 单域异步 OPD) | 一小时窗口平均 GPU 利用率(15 秒采样) | TGOPD 78.9%(空闲 0%) | Vanilla OPD 9.8%(59% 时间低于 5%) | +69.1 个百分点;集群平均 51.5%→69.5%(+18.0) |
局限与改进
作者承认的局限:方法依赖自动验证器,$r(x,y)\in\{0,1\}$ 的二元判定使其无法直接用于开放式生成任务;门控是二值硬路由,尚无不确定性感知的软门;35B 代码匹配实验显示平均步时 +5.9%,利用率提升不等于零墙钟开销;MOPD 中教师节点被三个域引擎切分,只有当前域引擎活跃,利用率上限仅 57.7–66.6%,无法像单域那样饱和。我的补充观察:其一,$K_T=3$ 时 $q_T$ 只有 4 个取值,真实可靠性在 2/3 附近的边界提示易被误路由,论文未报告误路由率;其二,阈值 $\tau=2/3$ 三域统一,但代码与数学的可靠性分布差异巨大(置信度 AUROC 0.51 vs 0.73),自适应阈值可能更优;其三,GRPO 回退在组内奖励全同时严格为零,作者承认缺少'全对/全错组占比'统计;其四,各表未报多种子方差,+0.95 这类小于 1 点的增益与早期 checkpoint 的运行间波动同量级;其五,域教师与学生同基座,结论向异构、更强教师外推未经验证;其六,遮蔽与回退的优劣随规模和域翻转,默认策略的选择依据只是'一致性'。
独立分析的弱点
独立分析四个弱点并给改进方向。1) 探测预算小、估计噪声大:$K_T=3$ 的通过率方差为 $R_T(1-R_T)/K_T$,$q_T\in\{0,\frac13,\frac23,1\}$,真实 $R_T$ 在 0.6–0.8 的提示极易被误判;改进方向是序贯探测——先采 1–2 条,结果落在阈值附近再追加样本(类似 SPRT),把预算花在边界提示上。2) 二值门丢弃可靠性程度信息:$q_T=1$ 与 $q_T=2/3$ 同样全量放行,可引入按 $R_T$ 置信区间连续调节 OPD 系数 $\beta$ 的软门。3) 依赖完美自动验证器:规则判据覆盖不了开放域与主观任务,可换成校准过的 LLM-as-judge 或学习型验证器,并把验证器自身不确定性传播进门控阈值。4) MOPD 域路由导致教师节点次饱和(57.7–66.6%),可按域批处理提示让单个引擎连续工作,或让空闲域引擎跨域代跑探测。5) 为流水线规整而无条件执行教师打分与双优势预计算,贡献了 5.9% 步时开销,可按门的预测懒计算低价值分支。
未来方向
作者明确提出的方向:把结果接地的可靠性估计扩展到没有自动验证器的开放式任务;设计不确定性感知的门控替代硬二值路由。基于本文成果可延伸的研究:报告关门提示中'组内奖励全同(零优势)'的占比并按域自适应选择关门策略——Table 4/5 已显示遮蔽在 4B MOPD 最优(+1.57 vs +1.14)而回退在 35B 反超(+0.95 vs +0.79),按域/按规模切换策略值得系统研究;将 $K_T$ 与 $\tau$ 做成随训练进度或域特性自适应的调度(训练早期教师与学生的差距结构不同,最优阈值可能漂移);把门控思想迁移到无外部验证器的场景(如 GATES 式的多轨迹一致性代理),以及在离策略蒸馏、偏好蒸馏中验证同样的'先审计后采纳'原则;在异构教师(与学生不同源、更强或更弱)设置下检验可靠性审计的通用性,特别是强教师负迁移(论文引用的 [10])是否被门控自动化解;最后是探测预算的 scaling law——回答'花多少算力审计教师才能换来一点下游精度',为部署者提供配置依据。
复现评估
复现难度偏高但路径清晰。这是 AllSpark Team 的公开技术报告,正文未附开源代码链接。模型为 Qwen3.5-4B 与 Qwen3.6-35B-A3B(MoE,3B 激活),三个域教师均需先对同一基座做 GRPO 训练再冻结,复现者要先承担教师训练成本。训练基于 slime 框架的异步 rollout–更新循环并附加 IcePop(附录 B);算力需求为 4B 用 5 节点(教师占 1/5)、35B 用 7 节点(教师占 1/7,多域时切分为代码 4 GPU + 数学 2 GPU + IF 2 GPU),单域训练约 99–199 步。评估协议(附录 C):AIME 2025/2026 为 64 次采样平均,HMMT-Feb 为 32 次,LiveCodeBench 为 6 次 pass@1,另有 OJBench、IFBench、IFEval。数据全部公开:DAPO-Math-17K、CodeI/O 输入输出预测题、Nemotron-Cascade 2 过滤出的 IF 提示。核心超参极少($K_T=3$、$\tau=2/3$、组大小 $G$、PPO 裁剪 $\epsilon$),方法逻辑容易实现;主要门槛在异步多节点基础设施与 GRPO 教师训练的算力,对单机研究者不现实。
论文图表
4B 实验一小时内教师侧 GPU 利用率。(a) Vanilla OPD 下教师节点利用率分布堆积在低位:一小时均值仅 9.8%,59% 的 15 秒采样低于 5%;TGOPD 利用闲置窗口做可靠性探测后均值升至 78.9%。 集群平均利用率从 51.5% 提升到 69.5%(+18 个百分点),其中大部分来自回收的教师容量。
这张图量化了'教师算力结构性闲置'的现象,是 TGOPD'用空闲算力做可靠性审计'这一设计动机的直接数据依据,也解释了为什么探测几乎免费。
动机诊断:每域 2400 个提示、每题 10 条离线教师采样,$q_T^{(10)}$ 为验证器通过率。(a)(b) 教师自置信度对高($\geq 0.7$)与低($< 0.7$)可靠提示的区分能力:代码域 AUROC 仅 0.51、数学域 0.73; 低可靠区($q_T^{(10)} < 0.5$)内,教师最高置信度答案错误率高达 84%(代码)/ 61%(数学),OPD 模仿目标质量 AUROC 0.75。
这是全文最关键的证据:既然置信度无法代理正确性、自信的错误恰恰是反向 KL 会放大的对象,那么门控必须用结果验证而非分布信号,直接决定了方法路线。