← 返回 2026-09-08

一个症状,三个杠杆:在策自蒸馏批判性综述 One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation

Justin Robert, Raheel Qader 📅 2026-08-26 👍 14 2026-09-12 18:30
大语言模型 强化学习 推理 知识蒸馏 综述

OPSD以自身加特权信息当教师,但不对称也扭曲信号,可用三个杠杆治理坍缩。

前置知识

在策自蒸馏(OPSD/SDPO)

学生模型自己生成 rollout,再让“同一个模型+特权信息”充当教师逐 token 打分,用前向 KL 把学生分布拉向教师分布。教师不需要更大,只需要更知情:OPSD 用参考解作特权信息,SDPO 用环境执行反馈。训练只更新学生,教师冻结。OPSD 与 SDPO 在几天内被独立提出。

全文的分析对象就是这一机制的信号性质与失败模式,不理解循环结构就无法理解三个杠杆各自作用在哪一步。

前向/反向 KL 散度

前向 KL $\mathrm{KL}(p_T\Vert p_S)$ 以教师为基准,要求学生覆盖教师的全部模式(mass-covering);反向 KL 以学生为基准,学生会收敛到教师最自信的单一模式(mode-seeking,由 MiniLLM 在 LLM 上推广)。两者构成性能-多样性权衡的控制旋钮,JSD 是其插值。

杠杆 A(信号几何)的全部讨论围绕散度方向展开,熵感知 OPD 正是靠在高熵 token 上换回前向 KL 来防止多样性坍缩。

pass@k 与 avg@k

avg@k 是同一题采样 $k$ 次的平均正确率,衡量平均性能;pass@k 是 $k$ 次采样中至少一次正确的概率,衡量能力上限与多样性。G-Pass@k 进一步测量推理的稳定性。坍缩的典型签名是 pass@1 上升而 pass@16 平坦或下降。

综述的核心评估主张是:坍缩只在 pass@k 中显形,熵并不是多样性的有效代理,读懂论文所有结论都必须用这把尺子。

特权信息

训练时教师可见、学生测试时不可见的信息(参考解、环境反馈、评分标准等)。概念源自 Vapnik 与 Vashist 2009 年的学习理论;机器人学给出安全判据:学生若能从自身观测在测试时重建该信息则有益,若必须预设或记忆则有毒(模仿鸿沟、Learning by Cheating、RMA 三条证据链)。

杠杆 B 的整个分类学与 PMI 机制都以“教师知道多少、学生能否重建”为核心变量,这是本文最独特的贡献轴。

RLVR 与 GRPO

可验证奖励强化学习:只训练答案可自动验证的问题(数学、代码),模型采样多条 rollout,按最终答案正确性给奖励,GRPO 类算法更新策略。信号稀疏(一条轨迹末尾一个标量)、昂贵(每题 8 条上限 16k token 的轨迹),且熵预算随训练单调耗竭。

OPSD 的效率声明与坍缩两族成因中的“RL 一般性前因”都相对 RLVR 基线陈述,理解其稀疏性才能理解密集信号既吸引又危险的辩证关系。

研究动机

自 DeepSeek-R1 发布以来,RLVR(可验证奖励强化学习)成为训练推理模型的主导路线:模型对每个问题采样多条轨迹,按最终答案正确性发放奖励,再用 GRPO 类算法更新策略。但奖励是稀疏的——一条数百 token 的轨迹只在末尾得到一个标量,信用分配困难;采样昂贵——GRPO 每题需生成 8 条上限 16k token 的轨迹;且容易把概率质量集中到基础模型已有的推理路径上,难以发现新推理。在策蒸馏(OPD)用更大的教师逐 token 打分恢复了密集信号,代价是整个训练期都要并行运行第二个更大的模型。OPSD 与 SDPO 用“模型自身+特权信息”充当教师消除了这一依赖,初期结果喜人,但产生信号的那个不对称同时也在扭曲信号:延伸工作测得思维模型性能相对下降最高达 −17%(avg@16),域外能力退化,一种失败模式——坍缩,即模型可产出推理路径集合的渐进收窄——开始支配整个领域。

本文的目标是本文是对 OPSD 及其分支的批判性综述(该领域两年内已积累两百余项工作),目标不是穷举而是给出结构:把坍缩当作一个症状,由三个杠杆控制——(i) 信号施加在哪里:token 如何加权、用哪种散度;(ii) 给教师看什么:特权信息的性质;(iii) 信号何时变化:教师权重的动态与引导的衰减。作者明确声明不报告任何新实验,贡献在于为不同论文中以不同名字命名的现象建立统一词汇,并清晰划分哪些结论已经确立、哪些仍在争议。范围限定在数学推理——方法起源地且失败模式记录最完整的领域,明确排除多模态与工具智能体两大分支,覆盖截至 2026 年 8 月的文献。

与已有工作不同的是,已有综述要么覆盖含外部教师的整个在策蒸馏领域(Song 与 Zheng、Zhang),要么按方法家族组织 OPSD 但不讨论失败模式与开放问题。本文的独特切入有三:其一,把全部发展组织进“一个症状、三个杠杆”的框架,并强调杠杆并非独立——特权信息的选择同时影响三者,故占据中心位置;其二,指出 OPSD 文献重新发明了但未继承两个老传统的成果——Vapnik 与 Vashist 2009 年的特权信息学习理论(“帮助应用于学得更好,而非被照抄”),以及机器人学关于特权信息何时安全的判据(学生测试时可自行重建则安全,必须预设或记忆则有毒,由 Learning by Cheating、imitation gap、RMA 三项工作支撑);其三,坚持严格的评估网格:avg@k 多种子均值、pass@k 与 G-Pass@k,加随机特权信息对照、等算力对照、新旧基准污染测试、非 Qwen 家族复现四项控制。

核心方法

综述的分析工具是 OPSD 机制本身,它是 SFT、RLVR、在策蒸馏三条谱系的交汇:从 RL 保留在策采样避免暴露偏差,从蒸馏保留逐 token 密集信号解决信用分配,从特权信息保留对外部模型的独立性。训练循环五步:(1) 学生对问题 $x$ 采样 rollout $\hat{y}\sim p_S(\cdot|x)$,上限 1,024 token;(2) 教师——同一模型但额外看到特权信息 $y^\star$——逐位置给出 $p_T(\cdot|x,y^\star,\hat{y}_{<n})$;(3) 逐位置计算前向 KL $D_n=\mathrm{KL}(p_T\Vert p_S)$,每个词表维度的贡献在 $\tau$ 处截断;(4) 对 rollout 与 batch 平均得损失 $\mathcal{L}_{OPSD}(\theta)$;(5) 只对学生反向传播,教师冻结。整篇综述把坍缩治理分解到信号几何、特权信息、环路稳定三个杠杆上逐一审视,并逐杠杆区分已确立与有争议的结论。

核心洞察是:产生信号的那个信息不对称,同时也在偏置信号。Shen 等人证明教师逐 token 传递的信号本质上是 token 与特权上下文之间的逐点互信息(PMI):被条件化为“知道答案”的教师强烈奖励参考解已经蕴含的 token(连接词、可验证内容),而惩罚“wait”“maybe”等深思 token——先知不再需要犹豫,但学生恰恰要靠深思在推理时做多步搜索。这一机制统一了三类此前互不相认的观察:Kim 等人的“认识性言语压制”、Nicolicioiu 等人的“富者愈富”(采样给教师的示范多为主导模式,稀有但正确的策略信号弱而消亡)、Kaur 等人的“分叉率下降”。由此得到安全判据:特权信息只有在学生测试时能自行重建时才安全。再对照 RL 的熵预算定律 $R=-ae^H+b$(性能受单调耗竭的熵预算约束),坍缩被分为 RL 一般性前因与 OPSD 特有前因两族——只有后者可通过设计特权信息直接干预。

方法步骤详情

第一步,学生生成:prompt $x$ 进入学生,自回归采样出上限 1,024 的 $(x,\hat{y})$。第二步,双重前向:教师接收 $x+y^\star+$ 指令,并行收集教师分布 $p_T(\cdot|x,y^\star,\hat{y}_{<n})$ 与学生分布 $p_S(\cdot|x,\hat{y}_{<n})$,得到两个约 $1024\times150000$ 的概率矩阵——除第一步外全部可并行。第三步,前向 KL 加截断:$D_n^{clip}=\sum_v\min(\ell_{n,v},\tau)$,对 rollout 与 batch 平均成单标量。第四步,梯度:经 softmax 得 $\partial\mathcal{L}/\partial z_{n,v}\propto p_S(v)-p_T(v)$,低估的 token 提升、高估的压低,链式回传到权重。第五步,更新 $\theta\leftarrow\theta-\eta\nabla_\theta\mathcal{L}$,教师不动。SDPO 变体把特权信息换成环境反馈,教师以 EMA 正则化。

技术新颖性

本文不报告新实验,其新颖性是结构性的。第一,词汇统一:把 PMI、认识性言语压制、富者愈富、分叉率下降、教师侧暴露失配(ATESD)、状态无关坍缩(CGTR)等不同论文的命名收拢进同一条因果链。第二,跨领域嫁接:视觉自监督学习五年前就解决了同构循环的坍缩问题——SimSiam 证明 stop-gradient 是决定性成分(去掉后精度坍缩至 0.1%)、Mean Teacher 的 EMA 慢教师、BYOL 的结构性不对称三条规则可直接迁移,而 OPSD 文献几乎没有引用这批成果;机器人学的特权信息判据同样被 LLM 侧重新发明而未继承。第三,风险排序:按对解的预设程度给八类特权信息建立分类学——最终答案最危险,参考解次之,半截 CoT、计划、错误对齐批判、评分标准、执行反馈依次更安全——并用两个受控比较(Kara 与 Ersoy 的三形式自蒸馏、Yu 等人的五形式强弱蒸馏)部分证实。第四,逐杠杆明确划分“已确立/有争议”的边界。

Overview of On-Policy Self-Distillation (OPSD).
Figure 2: Overview of On-Policy Self-Distillation (OPSD).
Forward KL versus reverse KL.
Figure 3: Forward KL versus reverse KL.
The three levers, mapped onto the loop of Figure 2. Lever C appears at two points: the teacher's exposure to the privileged information and the update of its weights are two independent mechanisms.
Figure 4: The three levers, mapped onto the loop of Figure 2. Lever C appears at two points: the teacher's exposure to the privileged information and the update of its weights are two independent mechanisms.

实验结果

核心发现分四层。OPSD 以单条 1,024 token rollout 匹敌 GRPO 的 8×16k 采样,Qwen3-1.7B 上 AIME25 由 36.7 升至 43.9,但单步成本约为 GRPO 两倍(20.6s 对 11.2s)。杠杆 A:学生高熵 token 从教师的 18.5% 缩水到 6.8%,最高概率 token 在高熵区变动 84 次、低熵区仅 7 次;熵感知 OPD 只在高熵 token 上加前向 KL,开销 4.5%;只蒸馏正向对齐 token 的 oracle 估计可提升信号 10–15 倍。杠杆 B:全解条件化使思维模型最高相对退化 −17%(avg@16);自蒸馏 pass@1 71.9→73.4 而 pass@16 83.6→78.5,熵反而更高——熵不是多样性代理;步对齐批判较 OPSD/GRPO 高 5.27/16.11;C-Eval 上仅最终答案 59.5 低于无特权 63.0,逐步提示达 71.3;AR-OPD 以 $\lambda=0.6$ 使捷径事件降超 20%。

Not all privileged information is equal, and the kind easiest to obtain is the least useful.
Table 1: Not all privileged information is equal, and the kind easiest to obtain is the least useful.
查看结构化数据
任务指标本文基线提升
数学推理 AIME25(Qwen3-1.7B,OPSD 创始论文) 准确率 % OPSD 50 步内 36.7→43.9(前向 KL);最佳检查点 43.9,训练结束 41.1 GRPO:需每题 8 条上限 16k token 的 rollout 才达相当水平 生成 token 降至约 1/8(1×1k 对 8×16k),代价是单步成本约 2 倍(20.6s 对 11.2s)
代码生成 LiveCodeBench v6(SDPO) 准确率 % 48.8 GRPO 41.2 +7.6;测试时以 3 倍更少的尝试达到 best-of-k 采样的发现概率
功能性多样性测量(Qwen3-8B 自蒸馏) pass@1 / pass@16 73.4 / 78.5 初始模型 71.9 / 83.6 pass@1 +1.5 但 pass@16 −5.1:平均分上升掩盖多样性坍缩的直接证据
特权信息形式对比(C-Eval,Yu 等) 准确率 % 无执行的逐步提示 71.3 无特权信息 63.0;仅最终答案 59.5 +8.3(对无特权);最终答案形式反而 −3.5,证明“知道答案”不等于“可传授”
自教师上下文对比(Kara 与 Ersoy) avg@12 准确率 步对齐批判(照抄正确步、只重写错误步) 参考解 OPSD;GRPO +5.27 与 +16.11;且只修改错误 token,信号远比全 token 扰动更集中
自适应教师暴露(ATESD,Qwen3-1.7B/4B/8B) avg@12 控制器按学生进度调节向教师展示的推理量 固定全量暴露的标准 OPSD +0.95 至 +2.33,并验证全量暴露并非总是最优

局限与改进

作者坦承三点:只处理数学推理,多模态与工具智能体两大分支未覆盖;所引工作几乎全是不到六个月的预印本;实验大多在单一模型家族(Qwen)且规模不超过几十亿参数——创始论文自己就承认受算力所限。作者还自我标注特权信息的风险排序“仅被文献部分支持,可能包含错误”。我补充四点:其一,结论建立在本身脆弱的基准上——AIME 只有 30 题,单题翻转即超 3 分,两种解码种子分差可达 15,AIME 2024 题面部分存在于预训练数据;其二,最实用的部署问题(该不该在生产用 OPSD)只得到一个有条件的否定答案,缺乏部署侧证据;其三,三杠杆的交互未被拆解——特权信息选择同时影响三个杠杆,但没有实验在固定其余杠杆下单独量化其贡献;其四,“坍缩在数百步后才出现”意味着短跑实验看不到失败,领域内大量正结果可能是截断偏差,综述对此方法学难点只是点到为止。

独立分析的弱点

弱点一:证据基座薄弱。综述继承的多数数字来自 AIME 类小基准与 Qwen 家族,而作者自己列出“随机训练信号也能提升 Qwen 分数、Llama 与 OLMo 上不存在”的家族特异性效应,这使得跨论文的数字对比(如 +5.27、+16.11)可信度受限;改进方向是要求所有引用结果标注种子数与置信区间,并对关键结论做非 Qwen 复现。弱点二:风险排序未经统一协议检验。最终答案、CoT、计划、评分标准、反馈等特权信息从未在同一模型、同一基准、严格自蒸馏下横向比较——两个现有比较分别在三种形式(自蒸馏)与五种形式(强弱蒸馏)下进行,regime 不同则结论不可直接拼合。弱点三:修补皆在下游。现有 remedies(Clip-Higher、换散度、Anti-SD 的散度上升、DemoPSD 的分歧调制)都作用在教师已被条件化之后,没有一种直接优化“给教师看什么”这一上游变量,而 PMI 机制恰恰指向上游。弱点四:oracle 与现实的鸿沟——10 到 15 倍的信号增益是训练结束后的 oracle 测量,尚无方法在训练中兑现,需要研究在线可算的对齐代理量。

未来方向

作者留下的开放问题包括:(1) 构造既训练时可得、又与 token 真实用处相关的加权准则——与理想梯度的对齐度量事后才可知,教师熵在线可得但未证明逼近对齐;(2) 确定加权粒度——逐 token 或逐题都未必最优,长短轨迹或需不同尺度;(3) 在严格自蒸馏下横向比较全部特权信息类型;(4) 显式保护推理分叉点(Kaur 等的呼吁);(5) 把 AR-OPD 固定的 $\lambda$ 与 Purified OPSD 的探针做成自适应剂量并扩展到多种信息类型;(6) 在固定特权信息下系统比较冻结、EMA、门控刷新、近端教师——现有比较只有单篇内部消融;(7) 把 OPSD 放到“遗忘谱系 SFT > 密集自蒸馏 > 稀疏 RL”上定标并解决与 SDPO 结果的矛盾;(8) 迁移视觉侧工具,如 EMA 动量随 batch 规模的再校准(Busbridge 等)。可延伸方向:把 ATESD 的“变数量”推进到“变性质”——训练中让特权信息从 oracle 退到计划再到提示;以及用 PMI 作为预测器,在训练前筛选会引发坍缩的特权信息。

复现评估

本综述本身无可复现实验(作者明确不报告新实验),其价值在于指南、词汇与评估清单。它引用的创始代码开源在 github.com/siyan-zhao/OPSD,Qwen3-1.7B 的一次完整训练约 15 分钟(4×H100),复现门槛对有算力的团队很低;单步成本参考为 Qwen3-8B 上 20.6 秒(8×H100),GRPO 为 11.2 秒。但需注意:引用结论大多出自发布不足六个月的预印本,代码与数据可用性参差;关键指标应使用 avg@k 多种子均值与 pass@k,而 AIME 类基准仅 30 题且 2024 卷存在污染,独立复现时建议同时报告新旧基准与至少一个非 Qwen 家族(如 Llama 或 OLMo)的对照。总体而言:复现单篇方法容易,复现综述结论的生态条件(同基准、同种子协议、同模型家族对照)尚不存在,这正是作者指出的领域痛点。