← 返回 2026-08-11

SPOT:面向在线策略蒸馏的稀疏探测与结果校准目标 SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

Zikun Qu, Min Zhang, Mingze Kong, Zhiwei Shang, Yikun Ban, Shuang Qiu, Zhongxiang Dai 📅 2026-08-05 👍 27 2026-08-16 18:30
在线策略蒸馏 大语言模型推理 强化学习 数学推理 知识蒸馏

用稀疏位置探测与验证器校准的蒸馏目标,提升小模型数学推理覆盖

前置知识

在线策略蒸馏(On-Policy Distillation, OPD)

学生在自己生成的轨迹上训练,教师在每个学生 induced 前缀处提供token级分布反馈,通常最小化学生与教师分布间的反向KL。相比SFT和离策略蒸馏,它减少了训练上下文与推理时上下文不一致带来的暴露偏差;相比只给结果奖励的RL,它提供更密集的token级信用分配,已被Qwen3、DeepSeek-V4等大规模系统采用。

SPOT是OPD的直接扩展,全文围绕'标准OPD的反向KL覆盖不足'这一问题展开,不懂OPD就无法理解论文出发点与基线设置。

反向KL与前向KL散度

反向KL $D_{KL}(\pi_\theta\|\pi_T)$ 具有模式寻找特性:倾向把学生概率集中到教师的主导续写上,可能低估其他合理续写;前向KL $D_{KL}(\pi_T\|\pi_\theta)$ 具有模式覆盖特性:要求学生覆盖教师所有高概率区域。EOPD在教师高熵位置用top-k截断加归一化的前向KL来补充覆盖。

SPOT的动机(反向KL欠覆盖)与分支目标(在教师先验的KL信赖域内倾斜)都建立在这两种散度的覆盖-模式权衡之上。

教师熵与top-k概率质量

熵 $H^T=-\sum_v \pi_T(v)\log\pi_T(v)$ 衡量教师下一个token的不确定性,词表归一化后 $\bar{H}^T=H^T/\log|V|\in[0,1]$;top-k质量 $C^k_t=\sum_{v\in \mathrm{TopK}_k}\pi_T(v)$ 衡量概率是否集中在少数候选上。高熵加高C意味着紧凑的多候选分歧;高熵加低C意味着弥散在长尾,两者价值完全不同。

这是SPOT采集分数的前两个因子,用于判断'哪里值得花探测预算',是区分本文与EOPD标量熵阈值的关键。

Pass@k 与 Avg@k 评测指标

对每道题采k个回答:Avg@8是8次采样的平均正确率,衡量单次尝试质量;Pass@8是至少一个回答正确的题目比例,衡量多采样下解空间的覆盖度。两指标可以背离:一个方法可能平均精度不变但让难题的可行解路径变多。

论文的核心主张是覆盖提升:SPOT的Pass@8增益(+2.49~5.28)远大于Avg@8增益(+0.29~1.48),理解两指标差异才能读懂全部实验结论。

KL正则化的奖励倾斜目标(Gibbs/softmax解)

在候选集上的概率单纯形中最大化 $\mathbb{E}_\rho[V]-(1/\gamma)D_{KL}(\rho\|p)$,即在被KL约束锚定到先验p的前提下最大化期望价值。由Gibbs变分恒等式可得唯一闭式解 $\rho_\gamma(v)\propto p(v)e^{\gamma V(v)}$:先验的指数价值倾斜,逆温度γ控制偏离先验的程度。

SPOT'蒸馏什么'的数学核心正是这个经典解:教师先验被验证器价值指数重加权,附录A的全部理论性质都围绕它展开。

研究动机

标准在线策略蒸馏(OPD)在学生自己生成的轨迹上最小化反向KL,其模式寻找特性会把概率集中到教师的主导续写上,可能给其他合理续写分配过少概率,从而限制解法覆盖。EOPD用教师熵作触发器,在高熵位置补充top-k前向KL,但熵是单一标量:它无法区分教师的不确定性是集中在少数几个高概率候选上、还是弥散在长长的概率尾部,也不知道学生是否已经很好地表示并排序了那些候选token。更麻烦的是,评估某个替代候选需要把该token追加后用学生策略rollout续写、再用验证器检查最终结果,代价高昂,固定熵阈值无法回答'有限探测预算该花在哪些位置'。此外,论文引用近期分析(Li et al., 2026;Hou et al., 2026)指出:在学生生成的前缀上,教师的局部next-token概率并不预示下游成功——教师高概率token可能在当前学生策略下导出失败续写,低概率备选反而可能成功,且在更深的prefix上教师概率作为指引会进一步失效。

本文的目标是本文的目标是把不确定性感知的在线策略蒸馏重构为两个耦合决策:在哪里探测(where to probe)与蒸馏什么(what to distill)。具体而言:设计一个轻量的位置级分数,把有限的探测预算分配给'教师把大量概率质量集中在少数候选、且学生尚未覆盖或排序不一致'的位置;再通过验证器评分的学生续写获得结果证据,把教师分布当作提议先验并用结果校准,构造闭式的KL正则化蒸馏目标。最终希望在不牺牲平均准确率Avg@8的前提下显著提升多采样解覆盖Pass@8——即在学生的解空间中开辟更多可行的推理路径,而不是引入风格化或错误的变体。

与已有工作不同的是,独特切入点有三:第一,把教师分布重新定位为候选分支的提议先验(proposal prior)而非最终监督证据,用下游验证结果去校准它,直击'教师局部概率不等于下游价值'这一被先前工作忽视的裂缝;第二,把选择性监督显式解耦为位置选择与目标构造两个独立阶段,而EOPD等前作把'在哪干预'与'蒸馏什么'绑定在同一套未校准的熵触发机制里;第三,用归一化熵、top-k概率质量与师生差距三个因子的乘积作软合取打分,比单一熵阈值更能区分紧凑分歧与长尾弥散、学生已会与未会;探测得到的验证结果通过闭式KL信赖域内的奖励倾斜直接进入token级监督,而非仅作为轨迹级奖励信号。

核心方法

直觉上,SPOT只回答两个问题:值得探测的位置在哪?探测到结果后目标怎么改?技术上分三阶段。获取阶段:对冻结行为策略 $\pi_{\theta old}$ 采出的学生轨迹,教师在每个前缀 $c_t$ 打分,计算位置分数 $s_t=\bar{H}^T(c_t)\cdot C^{k_s}_t\cdot G^{k_s}_t$(归一化熵×top-16质量×师生差距),掩码特殊token后取Top-M(M=2)得探测位置集 $\mathcal{B}$。探索阶段:对每个 $t\in\mathcal{B}$,把教师top-$k_p$=4个候选逐个追加到前缀,从 $\pi_{\theta old}$ 各采1条续写,用二值验证器估分支价值 $\hat{V}_t(v)$,只保留至少一个正奖励候选的位置集 $\mathcal{B}^+$。利用阶段:对 $t\in\mathcal{B}^+$ 构造奖励倾斜闭式目标 $\tilde{\pi}^T(v|c_t)\propto\bar{\pi}^{k_p}_T(v|c_t)e^{\gamma\hat{V}_t(v)}$(γ=1),以分支损失权重β=0.1加到全程反向KL的OPD损失上做PPO式更新。

核心创新是与EOPD在两个决策上的本质区别。EOPD用标量熵阈值决定在哪干预、用未校准教师先验决定蒸馏什么;SPOT用三因子乘积 $s_t=\bar{H}^T\cdot C^{k_s}_t\cdot G^{k_s}_t$ 回答'哪里值得探测'——熵高说明教师犹豫,top-16质量大说明分歧集中在紧凑候选集而非长尾,师生差距(质量欠覆盖 $1-A^{k_s}_t$ 与JS形状失配加权)说明学生尚未学好这些候选;乘法构成软合取,任一条件弱则整体分数低。'蒸馏什么'上,把目标定义为KL信赖域内最大化期望分支价值 $\max_\rho \mathbb{E}_\rho[\hat{V}]-(1/\gamma)D_{KL}(\rho\|\bar{\pi}^{k_p}_T)$,闭式解是教师先验的指数奖励倾斜。$\mathcal{B}^+$ 门控保证只在探索发现可行分支处施加额外监督,$\mathcal{B}^+=\emptyset$ 时退化为标准OPD;对数几率分解 $\log\frac{\tilde{\pi}^T(v)}{\tilde{\pi}^T(u)}=\log\frac{\bar{\pi}^{k_p}_T(v)}{\bar{\pi}^{k_p}_T(u)}+\gamma(\hat{V}_t(v)-\hat{V}_t(u))$ 界定分工:教师出先验odds,验证器按相对价值加校正,且对奖励均匀平移不变。

方法步骤详情

(1) 每次迭代冻结行为策略 $\pi_{\theta old}$,对batch中每个prompt采样轨迹 $x$;(2) 在每个前缀 $c_t=(q,x_{<t})$ 查询教师,掩码特殊、纯空白与纯标点token后计算 $s_t=\bar{H}^T\cdot C^{k_s}_t\cdot G^{k_s}_t$:$\bar{H}^T=H^T/\log|V|$,$C^{k_s}_t=\sum_{v\in S^{k_s}_t}\pi_T(v|c_t)$($k_s$=16),$G^{k_s}_t=0.5(1-A^{k_s}_t)+0.5D_{JS}(\bar{\pi}^{k_s}_T\|\bar{\pi}^{k_s}_{\theta old})$,$A$ 为学生对教师候选集的质量;每条轨迹取Top-2得 $\mathcal{B}$;(3) 对 $t\in\mathcal{B}$ 与教师top-4候选 $v$,追加 $v$ 后从 $\pi_{\theta old}$ 采1条续写 $y$,用boxed-answer验证器算 $\hat{V}_t(v)=R(q,x_{<t},v,y)$;(4) 保留至少一个正奖励候选的位置得 $\mathcal{B}^+$;(5) 按式(10)构造目标 $\tilde{\pi}^T$;(6) 最小化 $\mathcal{L}=\sum_t\mathcal{L}^{OPD}_t+\frac{\beta}{\max\{1,|\mathcal{B}^+|\}}\sum_{t\in\mathcal{B}^+}\mathcal{L}^{Branch}_t$,分支损失为 $-\sum_v\tilde{\pi}^T(v|c_t)\log\pi_\theta(v|c_t)$,verl实现、4×A800训练。

技术新颖性

新颖性有三。其一,位置级软合取分数:前作用单一标量(EOPD熵阈值、token重要性筛选)决定干预位置,SPOT首次把'教师分歧紧凑度'(top-k质量C)与'师生互补性'(质量欠覆盖+JS形状失配G)作为乘性门控;Table 2证明缺一不可——完整分数宏Pass@8=41.60,仅熵35.72,去C的HG=37.30,仅质量项的HC-Mass=37.91。其二,闭式结果校准目标:由Gibbs变分恒等式得唯一最优解 $\rho_\gamma(v)\propto p(v)e^{\gamma V(v)}$;附录A证明γ同时参数化正则化解与KL信赖域半径,期望价值与偏离先验沿γ单调增长($d\mathbb{E}/d\gamma=\mathrm{Var}\ge0$),二值验证器下校准把成功/失败组的先验odds恰好乘 $e^\gamma$ 而组内保持教师相对比例,且对均匀奖励平移不变。其三,开销显式受控:每条轨迹至多 $M\times k_p\times N_p$=2×4×1次额外rollout,且只在高价值位置发生。

An overview of our SPOT framework for on-policy distillation.
Figure 1: An overview of our SPOT framework for on-policy distillation.

实验结果

主实验(Table 1):Qwen3-8B(关闭思考)为教师,六基准为MATH-500/AMC23/Minerva/HMMT25/AIME24/AIME25。Qwen3-0.6B-Base上SPOT宏Avg@8/Pass@8=17.31/34.60,优于KD(14.78/28.00)、GRPO(17.39/30.91)、OPD(15.83/30.05)、EOPD(16.86/31.41);Qwen3-1.7B-Base为26.27/45.59;Qwen3-4B-Base(DAPO-Math-14k训练)为36.13/54.30。三个规模上宏Pass@8全部第一、宏Avg@8第一或第二;相对OPD提升Avg@8 +0.47~1.48、Pass@8 +4.55~5.28,相对EOPD提升+0.29~0.68、+2.49~3.19;Pass@8增幅远大于Avg@8,印证覆盖提升不稀释单次质量。消融:Table 2(0.6B)完整采集分数宏平均21.51/41.60最优,仅熵H=19.40/35.72、去紧凑度C的HG=20.37/37.30;AIME24上H-only仅1.67/3.33而完整版5.00/13.33。Table 3(1.7B)去掉验证器校准使宏平均降至28.57/47.49,AIME24 Pass@8损失13.33点。Figure 2:k∈{4,...,64}下k≥8起SPOT第一或并列,k=64仍领先OPD 12.50~16.67点。Figure 3:β=0.1最优,β=1.0竞赛集最差。泛化:Table 9中GPQA-Diamond Avg@8/Pass@8=29.42/80.81(EOPD 27.21/69.19),MMLU-Pro 42.26居第二(EOPD 42.90);Table 10中Llama-3.2-3B宏Pass@8=34.05,超EOPD 2.54点。

Main results on six mathematical reasoning benchmarks. Avg. is the unweighted mean over the six benchmarks, computed before rounding.
Table 1: Main results on six mathematical reasoning benchmarks. Avg. is the unweighted mean over the six benchmarks, computed before rounding.
Branch-acquisition score ablation. Avg@8 / Pass@8 (%) for Qwen3-0.6B-Base trained on MATH. Macro denotes the unweighted mean.
Table 2: Branch-acquisition score ablation. Avg@8 / Pass@8 (%) for Qwen3-0.6B-Base trained on MATH. Macro denotes the unweighted mean.
Verifier-guidance ablation. Avg@8 / Pass@8 (%) for Qwen3-1.7B-Base trained on MATH. Macro denotes the unweighted mean.
Table 3: Verifier-guidance ablation. Avg@8 / Pass@8 (%) for Qwen3-1.7B-Base trained on MATH. Macro denotes the unweighted mean.
Hyperparameters used for SPOT.
Table 7: Hyperparameters used for SPOT.
Out-of-domain results for Qwen3-1.7B-Base trained on MATH (all values in %).
Table 9: Out-of-domain results for Qwen3-1.7B-Base trained on MATH (all values in %).
Results on the Llama model family. Macro avg. is the unweighted mean over the four benchmarks, computed before rounding.
Table 10: Results on the Llama model family. Macro avg. is the unweighted mean over the four benchmarks, computed before rounding.
Pass@k and its gain over OPD on AIME 2024, AIME 2025, and AMC 2023. Each point is read from the corresponding summary of a separately generated k-sample run.
Figure 2: Pass@k and its gain over OPD on AIME 2024, AIME 2025, and AMC 2023. Each point is read from the corresponding summary of a separately generated k-sample run.
Sensitivity to the branch-distillation weight. Pass@8 of Qwen3-1.7B-Base for β ∈ {0.05, 0.1, 0.5, 1.0}. The main configuration β = 0.1 is marked as Ours.
Figure 3: Sensitivity to the branch-distillation weight. Pass@8 of Qwen3-1.7B-Base for β ∈ {0.05, 0.1, 0.5, 1.0}. The main configuration β = 0.1 is marked as Ours.
查看结构化数据
任务指标本文基线提升
数学推理六基准宏平均(Qwen3-0.6B-Base,MATH训练) Pass@8 (%) 34.60 EOPD 31.41 / OPD 30.05 +3.19 vs EOPD,+4.55 vs OPD
数学推理六基准宏平均(Qwen3-1.7B-Base,MATH训练) Pass@8 (%) 45.59 EOPD 42.74 / OPD 40.31 +2.85 vs EOPD,+5.28 vs OPD
数学推理六基准宏平均(Qwen3-4B-Base,DAPO-Math-14k训练) Pass@8 (%) 54.30 EOPD 51.81 / OPD 49.57 +2.49 vs EOPD,+4.73 vs OPD
数学推理六基准宏平均(Qwen3-1.7B-Base,MATH训练) Avg@8 (%) 26.27 EOPD 25.98 / GRPO 24.96 +0.29 vs EOPD
GPQA-Diamond 域外科学推理(1.7B学生,MATH训练) Pass@8 (%) 80.81 EOPD 69.19 / OPD 67.17 +11.62 vs EOPD
Llama-3.2-3B-Instruct 四基准宏平均 Pass@8 (%) 34.05 EOPD 31.51 / GRPO 31.44 +2.54 vs EOPD

局限与改进

作者承认的局限:附录A的改进保证只针对被探测的估计值 $\hat{V}_t$,不直接断言未知总体分支价值的提升;Llama实验并非受控比较(架构、容量、初始化、教师配对与训练数据均不同),只能说明可移植性而非架构不变性;MMLU-Pro上SPOT(42.26)略逊于EOPD(42.90),说明token级不确定性匹配对异构知识题仍有独到优势。我的补充观察:训练验证器是二值boxed-answer匹配,使 $\hat{V}\in\{0,1\}$,信号粒度粗糙,γ=1时成功odds一律乘 $e\approx2.72$,无法区分'略优'与'远优'的候选;方法依赖在线教师逐前缀打分与可验证奖励,难以直接迁移到无验证器的开放任务;每条轨迹至多8次额外探测rollout加上教师全前缀查询,训练成本高于纯OPD;超参M=2、γ=1的敏感性只在部分设置检验,γ未做退火或自适应。

独立分析的弱点

独立分析的弱点与改进方向:(1) 二值奖励粒度太粗——探测只回答'成/不成',$\hat{V}\in\{0,1\}$ 使γ=1时所有成功候选odds同乘 $e^\gamma\approx2.72$,改进方向是引入过程奖励模型(PRM)提供连续 $\hat{V}$,或每候选采 $N_p>1$ 条取均值降噪;(2) 候选集限于教师top-4——若正确分支位于长尾(恰恰对应熵高、C低的位置),SPOT会系统性错过,改进方向是师生候选并集探测、或对学生高概率token做重要性加权;(3) 预算M=2与γ=1全局固定——难题轨迹与易题轨迹获得同样的探测数,改进方向是按分数分布自适应分配预算、按位置显式约束KL半径或退火γ;(4) 训练开销——教师需对每条学生轨迹的所有前缀打分并做分支rollout,改进方向是离线教师打分(Lightning OPD思路)、前缀级缓存与只对高分位置查询教师;(5) 评测集中在数学与通用推理,无代码生成、多模态、多智能体场景,'覆盖提升'的结论外推需谨慎。

未来方向

作者提出的延伸与可拓展方向:作者方向上,结果校准分支监督展现出向 deliberative reasoning 的迁移能力(GPQA-Diamond Pass@8 +11.62),可延伸到代码生成、多模态推理等拥有可靠验证器的领域;附录A的理论框架(正则化-信赖域等价、价值-先验单调性、二值odds更新)可直接推广到连续奖励与多候选校准分析。基于成果的进一步方向:(1) 把探测值 $\hat{V}_t(v)$ 作为优势估计与在线RL(如GRPO)统一,形成蒸馏+RL混合目标;(2) 设计自适应逆温度γ与预算M的课程式调度,训练早期多探测、后期收敛回教师先验;(3) 黑盒教师(只见生成样本、不见分布)下用采样近似教师先验与候选探测;(4) 与树搜索或最优先验结合,把'提议先验+结果校准'推广为通用的分支选择框架;(5) 探测信号的方差缩减技术(同前缀共享、控制变量)以降低rollout成本;(6) 对 $\mathcal{B}^+$ 门控与目标偏置做更细的收敛性理论分析。

复现评估

论文未给出官方代码仓库链接,但实现基础完全开源——训练用verl、推理用SGLang、评测用Math-Verify;超参披露极完整(Table 4-7):学习率3e-6、cosine、AdamW、batch 128、PPO裁剪0.2,SPOT专属参数M=2、$k_s$=16、$k_p$=4、λ=0.5/0.5、γ=1.0、β=0.1、每候选1次探测rollout、验证器为boxed-answer匹配;训练数据公开(0.6B/1.7B学生用MATH训练7,500例3 epoch,4B用DAPO-Math-14k 14,116例2 epoch);评测协议细致(vLLM bf16、seed 42、温度1.0、top-p 0.8、8192 tokens、Math-Verify符号等价、缺答案计错);算力为4×A800(80G)。总体复现难度中等:三个基线在verl生态有现成实现,SPOT的采集分数、探测流程与分支损失需自行实现(约数百行代码),主要门槛是多卡算力与教师推理吞吐。