← 返回 2026-08-06

当教师误导时:伪信号感知的在线策略蒸馏 When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation

Yinuo Jiang, Yongjie Ye, Zhou Tao, Xiang Zhuang, Qiang Zhang, Huajun Chen, Tiankai Li 📅 2026-08-04 👍 22 2026-08-11 18:30
在线策略蒸馏 大语言模型 梯度信噪比 知识蒸馏 视觉语言模型

过滤在线蒸馏中既不依赖输入又高影响的虚假教师信号

前置知识

On-Policy Distillation (在线策略蒸馏, OPD)

知识蒸馏的一种范式。区别于用教师离线生成的固定轨迹作监督,OPD 从当前学生策略 $\pi_\theta$ 实时采样响应 $y\sim\pi_\theta(\cdot|x)$,再用冻结教师 $\pi_T$ 在这些"学生自己走过的状态"上提供 token 级密集监督,优化反向 KL 散度 $D_{KL}(\pi_\theta\|\pi_T)$。这样训练分布始终跟随学生策略演化,避免 off-policy 分布不匹配,比 RLHF 稀疏序列奖励更密集高效。

本文所有讨论都建立在 OPD 的 token 级密集监督上,理解"每个 token 都有教师信号"才能理解为什么某些 token 的信号会是"虚假"的。

Sampled Teacher-Student Divergence (采样分歧 $A_t$)

定义 $A_t = \log\pi_\theta(y_t|x,y_{<t}) - \log\pi_T(y_t|x,y_{<t})$,即学生在已采样的前缀上、对自己实际生成 token 的对数概率减去教师的对数概率,衡量师生在该 token 上的打分分歧。它作为 stop-gradient 权重乘以分数函数 $s_t=\nabla_\theta\log\pi_\theta(y_t|x,y_{<t})$,得到 OPD 的 token 级梯度 $g^{OPD}_t = -A_t s_t$。$|A_t|$ 越大,该 token 的优化影响越大。

SA-OPD 的核心就是分析这个分歧信号"是否真的由输入驱动",读者必须先理解 $A_t$ 才能理解"输入接地性"如何衡量。

Spurious Signal / Input-Groundedness (虚假信号与输入接地性)

"虚假信号"指优化影响(梯度能量)很大、却几乎不依赖任务输入 $x$ 的教师信号——其分歧主要来自语言先验、格式约定或刻板推理模板(如"综上所述""因此答案为"),而非当前输入的证据。"输入接地性"衡量一个 token 级信号对输入的敏感程度:若把输入移除、保留同样生成前缀后信号几乎不变,则说明它不依赖输入、接地性低。

这是本文识别的核心失败模式,理解它才能抓住文章"为什么不能只看熵/分歧/可学性"的中心论点。

Gradient Signal-to-Noise Ratio (梯度信噪比)

把 OPD 梯度分解为接地分量 $g^{grd}_t$ 与先验分量 $g^{prior}_t$,有效 SNR 定义为 $\mathrm{SNR}_t = \mathbb{E}[\|g^{grd}_t\|^2]/\mathbb{E}[\|g^{prior}_t\|^2]$。先验分量即使均值近似为零,其二阶矩能量仍可能很大,会膨胀随机梯度噪声却不提供稳定的任务改进方向。论文定理 2 证明这种低 SNR 更新引发的参数漂移期望平方值随步数线性增长 $\mathbb{E}[\|\theta_K-\bar\theta_K\|^2]=\eta^2 Kv$。

这是从理论上论证"虚假信号有害"的数学基础,是方法设计的动机来源。

FLMR (Filtered Loss-Mass Ratio, 过滤损失质量比)

$\mathrm{FLMR}(F)=\sum_{t\in F}|A^{full}_t|/(\sum_{t\in V}|A^{full}_t|+\epsilon)$,衡量当前 OPD 损失质量中被过滤器移除的比例。与只数 token 数量的"过滤比例"不同,FLMR 用分歧绝对值加权,反映被移除监督的真实优化权重。SA-OPD 通过动态约束 $\mathrm{FLMR}\le\beta$ 防止过滤过度或不足。

这是 SA-OPD 落地时的关键自适应机制,理解它才能理解 $\beta=1.8$ 等超参如何控制过滤强度。

研究动机

现有 OPD 的选择性方法(如 TIP、FiRe-OPD、Token Teachability、Entropy-Aware OPD)都在改进 token 级监督的分配,它们的判据是"这个 token 是否高熵、是否与教师分歧大、是否可学"。但这些判据共享一个隐性假设:只要教师在该 token 上的判断是置信的、显著的或可学的,就把它当成可靠监督。这一假设忽略了一个根本事实——教师模型本身也是预训练与后训练得到的,它的 token 级判断不仅由当前输入驱动,还深受大规模语料中习得的语言先验、格式约定、刻板推理模板影响。例如在视觉问答中,教师可能即使图像证据不支持,也过度奖励诸如"因此""综上所述""答案是"这类通用模板短语,或对一条只是偏离教师"风格"但完全正确的学生推理路径过度惩罚。这些输入无关却优化相关的判据被作者定义为 OPD 中的"虚假信号",它们尤其有害:可以产生很大梯度、却几乎不提供任务改进方向。而熵、师生分歧、思维一致性这些常用 OPD 诊断指标都无法检测"信号是否接地于输入",因此这一失败模式对现有所有方法都是不可见的。

本文的目标是本文的目标是三重的。其一,形式化定义并揭示 OPD 中一种此前被忽视的失败模式——"高优化影响却弱接地于输入"的虚假 token 监督,并用梯度 SNR 分解与两条定理给出它为何有害的严格论证。其二,设计一个无需外部验证标签、轻量、即插即用的过滤框架 SA-OPD,只移除同时满足"低输入接地性"与"高优化影响"两个条件的 token,把难以估计的条件互信息 $I(X;A_t|Y_{<t})$ 转化为可计算的残差对照代理。其三,在 LLM 数学推理(Math500、AMC23、AIME24/25、MinervaMATH)与 VLM 视觉理解/视觉推理(EvoChart、MMIFEval、CountQA、MathVision、Geo3K、MathVista)两大设置下,验证该框架相对 Vanilla OPD 和最强选择性 OPD 基线在全部 11 个基准上的一致提升,并把"输入接地性"确立为 OPD 监督选择的第四个关键维度。

与已有工作不同的是,和已有选择性 OPD 工作相比,本文抓的是一个全新的判别维度——"信号是否真的依赖输入"。此前所有 token 选择标准都在问"这个 token 是否不确定/分歧大/可学",但都没问"教师的判断是否接地于当前输入"。SA-OPD 用一个特别巧妙的轻量探针填补这一空白:保留学生已生成的前缀、把任务输入换成空 prompt,比较两种条件下师生分歧的变化,几乎不变则判定为输入无关。这一视角与信号曲率(signal-to-curvature)的 token 重要性理论互补,把"虚假"严格定义为"低接地"与"高影响"的交集,只瞄准最有害的那部分密集监督,而非一刀切地按熵或分歧过滤。

核心方法

直觉上,SA-OPD 像一个"诚实性测谎仪":与其问教师"你有多自信、多有信息量",不如直接做一个对照实验——把任务输入偷偷拿走,看教师的判断会不会变。如果教师在"看不到输入"时仍给出几乎相同的打分,那这个打分显然不是依据输入做出的,而是凭语言习惯"自动"产生的,把它当作监督信号只会污染学生。技术路线因此很自然:对每个学生生成的 token,分别在原 prompt 与"去 prompt 但保留前缀"两种条件下算师生分歧,二者差值的绝对值就是输入接地性间隙;只过滤那些"接地性低"且"优化影响大"的 token,对剩下的 token 做正常反向 KL 蒸馏。整个过程不引入任何可训练参数,也不改变 OPD 主损失的形式,只多两次在残差 no-prompt 上下文上的对数概率评估。

核心创新是用"双条件分歧对照"作为输入接地性的廉价代理。形式上把 token 级分歧分解为 $A_t = A^{grd}_t + A^{prior}_t$,$A^{grd}_t$ 随输入变化、$A^{prior}_t$ 仅由响应前缀预测。定义输入接地性间隙 $\Delta\mathrm{IG}_t = |A^{full}_t - A^{rest}_t|$:$A^{full}_t$ 是原 prompt 下的分歧,$A^{rest}_t$ 是去掉 prompt 但保留前缀时的分歧。差值大说明信号随输入显著变化、接地性强;小说明教师不看输入也给出同样判断、信号靠模板驱动。和 TIP/FiRe-OPD 的本质区别在于:它们把"大分歧"当成有信息量的好信号,而 SA-OPD 指出"大分歧中恰恰有一部分最该被过滤"——即"去掉输入也不会变"的大分歧。其次只过滤低接地与高影响($|A^{full}_t|$ 大)的交集,避免误伤高接地的高影响 token。理论支撑是定理 1(先验分量与输入方向的对齐被 $\kappa_t\le 1$ 约束)与定理 2(低 SNR 更新导致随步数线性增长的参数漂移)。

方法步骤详情

第一步:对 batch 中每个 prompt $x$,从学生 $\pi_\theta$ 采样响应 $y$。第二步:对每个位置 $t$ 算满 prompt 下的采样分歧 $A^{full}_t$(师生对采样 token 的对数概率差),以及去 prompt 残差前缀下的分歧 $A^{rest}_t$,二者差值绝对值即接地间隙 $\Delta\mathrm{IG}_t$。第三步:构造候选过滤集 $F = \mathrm{Bottom}_{p_1}(\Delta\mathrm{IG}_t) \cap \mathrm{Top}_{p_2}(|A^{full}_t|)$,即接地性最低的 $p_1$ 比例与绝对分歧最大的 $p_2$ 比例的交集(初始 $p_1=0.2,p_2=0.3$)。第四步:动态约束 $\mathrm{FLMR}\le\beta$,超限则二分搜索收缩、不足则放大(视觉理解 $\beta=1.8$)。第五步:用保留 token 集 $V\setminus F$ 算反向 KL 损失更新 $\theta$。仅多两次残差上下文的对数概率评估,无可训练参数。

技术新颖性

技术新颖性体现在三点。理论层面:把 OPD 梯度分解为接地分量与先验分量,提出有效梯度 SNR 的形式化(定理 1 证明先验分量对输入特定方向的期望对齐被 $\kappa_t\le 1$ 上界约束;定理 2 证明低 SNR 更新导致 $\mathbb{E}[\|\theta_K-\bar\theta_K\|^2]=\eta^2 Kv$ 的线性漂移),为"为什么虚假信号有害"给出严格论证。方法层面:用"去 prompt 残差对照"作为接地性的无训练代理,把难以估计的条件互信息 $I(X;A_t|Y_{<t})$ 转化为两次廉价前向,工程上即插即用。判别维度层面:首次把"输入接地性"与"信号曲率(优化影响)"正交组合,明确定义虚假信号是二者的交集而非单一条件,与 TIP、FiRe-OPD、Token Teachability、Entropy-Aware OPD 等都形成正交互补关系,而非替代关系。

Overview of the SA-OPD framework(SA-OPD 框架总览)
Figure 2: Overview of the SA-OPD framework(SA-OPD 框架总览)

实验结果

VLM 主实验(Qwen3.5-35B-A3B→Qwen3.5-2B,Table 1)显示 SA-OPD 在全部 6 个基准上均为最佳或并列最佳。视觉理解平均从 OPD 的 50.5 提升到 54.0(+3.5),CountQA 26.4→33.6(相对 OPD +7.2、相对次优 TIP +3.4,最大单项增益),MMIFEval 53.5→55.2、EvoChart 71.6→73.2。视觉推理平均 60.4→63.5(+3.1),Geo3K 67.2→72.2(+5.0)、MathVista 69.0→72.2。LLM 数学推理(Table 2)平均 28.5→30.4(+1.9),Math500 66.4→69.6(比最强基线 TIP 高 3.0)。可扩展性(Table 3)在两对师生上全任务正增益。消融(Table 4)证明两判据缺一不可:仅分歧过滤 69.8/69.6、仅接地性过滤 69.0/70.3、完整版 72.2/72.1。Figure 3 显示 LLM 数学 FLMR 初期速降到零、VLM 全程非零,解释了 VLM 增益更大。开销 +2.64%–7.53%。

Results on visual understanding and visual reasoning benchmarks(VLM 视觉理解与视觉推理基准结果)
Table 1: Results on visual understanding and visual reasoning benchmarks(VLM 视觉理解与视觉推理基准结果)
Results on math reasoning benchmarks(LLM 数学推理基准结果)
Table 2: Results on math reasoning benchmarks(LLM 数学推理基准结果)
Scalability comparison between SA-OPD and Vanilla OPD(SA-OPD 与 Vanilla OPD 的可扩展性对比)
Table 3: Scalability comparison between SA-OPD and Vanilla OPD(SA-OPD 与 Vanilla OPD 的可扩展性对比)
Ablation study of SA-OPD(SA-OPD 消融实验)
Table 4: Ablation study of SA-OPD(SA-OPD 消融实验)
Token-level statistics of SA-OPD filtered tokens(SA-OPD 过滤 token 的统计)
Table 5: Token-level statistics of SA-OPD filtered tokens(SA-OPD 过滤 token 的统计)
Training dynamics across tasks(跨任务训练动力学)
Figure 3: Training dynamics across tasks(跨任务训练动力学)
Analysis of SA-OPD's dynamic threshold and filtered-token entropy distribution(动态阈值与过滤 token 熵分布分析)
Figure 4: Analysis of SA-OPD's dynamic threshold and filtered-token entropy distribution(动态阈值与过滤 token 熵分布分析)
查看结构化数据
任务指标本文基线提升
VLM 视觉理解(EvoChart/MMIFEval/CountQA 平均) Accuracy/EM 平均 54.0 Vanilla OPD 50.5 / TIP 52.3 相对 OPD +3.5,相对最强基线 +1.7
VLM 视觉推理(MathVision/Geo3K/MathVista 平均) Accuracy 平均 63.5 Vanilla OPD 60.4 / TIP 61.6 相对 OPD +3.1,相对最强基线 +1.9
CountQA(视觉计数) Exact Match 33.6 Vanilla OPD 26.4 / TIP 30.2 相对 OPD +7.2(全文最大单项增益)
Geo3K(几何推理) Accuracy 72.2 Vanilla OPD 67.2 / TIP 70.0 相对 OPD +5.0
Math500(LLM 数学) Accuracy 69.6 Vanilla OPD 66.4 / TIP 66.6 相对最强基线 +3.0
LLM 数学推理(5 基准平均) Accuracy/Avg@8 平均 30.4 Vanilla OPD 28.5 / TIP 29.3 相对 OPD +1.9

局限与改进

作者承认的局限较为克制,主要隐含在方法设定中:动态 FLMR 约束只在视觉理解任务显式启用($\beta=1.8$),说明该方法对超参 $\beta$ 仍有任务敏感性。我额外观察到几点。第一,所有实验仅基于 Qwen3/Qwen3.5 与 DeepSeek-R1-Qwen3 系列,对 Llama、Gemma、Mistral 等架构的迁移性未验证,"输入接地性是普适第四维"是否跨家族成立仍开放。第二,"去 prompt 残差"只能近似文本语言先验,对 VLM 场景的视觉先验未必有效——视觉通路仍可能激活这些偏置,残差对照对模态特异性虚假信号的覆盖不完整。第三,无监督代理本质是近似的:$\Delta\mathrm{IG}_t$ 小也可能是教师恰好"基于输入做出了与无输入一致的判断"(罕见但可能),存在误过滤风险。第四,只评估了推理/理解类任务,开放式生成、多轮对话、安全对齐场景未验证。第五,Table 5 显示过滤掉的 token 中 69.9% 是内容词、27.9% 属重复 bigram,若训练数据高度模板化,可能误删真实可学信号。

独立分析的弱点

第一个弱点是代理的"模态盲区":去 prompt 残差对照主要捕捉文本语言先验,但在 VLM 中教师可能因图像固有偏置(如对常见物体组合的偏好)产生虚假信号,此时即使去掉文本 prompt、视觉通路仍激活这些偏置,$\Delta\mathrm{IG}_t$ 可能仍偏大而漏检;改进方向是设计视觉扰动作对照(如随机遮蔽或打乱图像 patch)来估计视觉接地性。第二个弱点是 $\beta$ 的任务依赖:视觉理解需要动态约束、数学推理不需要,跨任务迁移时如何自动确定 $\beta$ 缺乏原则化方法;改进方向是用基于训练曲线 FLMR 一阶导的自适应阈值替代固定 $\beta$。第三个弱点是"被过滤的 69.9% 是内容词"带来的风险:当训练数据分布偏模板化时,真实可学的输入接地信号也可能被一并移除;改进方向是把硬过滤改为软重加权(借鉴 FiRe-OPD 思路),对低接地 token 降权而非归零。第四个弱点是仅在 Qwen 系列验证,跨家族泛化性未证,建议补充 Llama/Gemma 等对比实验。

未来方向

作者提出的方向是把输入接地性确立为 OPD 监督选择的第四维,与置信度、信息量、可学性正交互补,并可与其他选择性方法组合。基于成果可延伸的方向包括:把"双条件对照"思路推广到其他可分解的偏差来源(位置偏置、长度偏置、模态偏置),形成一套多维度虚假信号检测框架;将代理从 token 级扩展到片段级或轨迹级,捕捉跨 token 的虚假推理链;与 RLVR、自蒸馏(Self-Distillation Zero)、混合 RL-蒸馏框架结合,验证在更复杂后训练管线中的稳定性;探索把 $\Delta\mathrm{IG}$ 作为 reward shaping 信号用于纯 RL 训练;理论上为残差代理与真实条件互信息 $I(X;A_t|Y_{<t})$ 的偏差给出更紧的界,定量刻画代理误差。

复现评估

复现评估良好。作者开源代码(https://github.com/jjjyinuo/SA-OPD),基于 verl 框架实现,依赖 PyTorch 2.10、CUDA 12.9、Python 3.12。所有训练超参在 Table 6 完整列出:学习率 $1\mathrm{e}{-6}$、AdamW 优化器、batch size 128、VLM 视觉理解 700 步、视觉推理 270 步、数学 160 步,初始 $p_1=0.2$/$p_2=0.3$、$\beta=1.8$。数据来源公开:DeepMath(数学,难度 $\ge 6$ 取 30% 约 7K 条)、VERO-600K(视觉理解 10%)、MMRL30k(视觉推理 10%)。评估全用官方指标与脚本,零样本设置,温度 1.0、top-p 0.95。算力门槛中等:8×H20 GPU,主训练 1.89–5.54 小时不等,SA-OPD 额外开销仅 2.64%–7.53%。主要难点在于师生模型均为 Qwen3/Qwen3.5(部分为私有或限发权重)需可获取,以及残差对照带来的额外前向评估与动态 FLMR 二分搜索的工程实现细节。