H2SD:混合后见自蒸馏 H^2SD: Hybrid Hindsight Self-Distillation
按轨迹正确性分流的混合自蒸馏框架,统一RLSD稳定优化与OPSD方向纠正。
前置知识
可验证奖励强化学习 RLVR 与 GRPO
RLVR用规则可验证的奖励(如答案对错)作为强化学习信号来提升LLM推理。GRPO是其代表算法:对同一问题采样G条回复,按组内奖励均值$\mu$和标准差$\sigma$计算相对优势$A=(R-\mu)/\sigma$,再用裁剪的token级概率比$\rho=\pi_\theta/\pi_{\theta_{old}}$做策略梯度,无需价值模型。但同一回复内所有token共享同一轨迹级标量$A$,无法区分哪个token该为成败负责。
本文所有方法都建立在GRPO的稀疏标量奖励之上,理解GRPO才能理解为什么要做token级信用分配。
在策略蒸馏 OPD
在策略蒸馏让学生模型自己采样轨迹,再由更强的教师模型对每条轨迹给出token级的下一个token分布作为监督,通过逐token KL散度$D_{KL}(p_T\|p_S)$提供稠密监督。相比轨迹级标量奖励,它能告诉学生每个位置该怎么生成。缺点是需要外部更强教师且常要求师生共享词表,限制了适用范围。
OPD是H2SD想要模拟却想摆脱外部教师依赖的起点,理解它能理解后续OPSD和H2SD的动机。
在策略自蒸馏 OPSD
OPSD用同一模型同时充当学生和教师:教师分支额外条件于特权信息$r$(如标准答案),学生分支只看问题。教师分布$p^T=\pi_\theta(\cdot|x,r,y_{<t})$(停梯度)作为目标,学生匹配它,免去外部教师和词表限制。但直接匹配条件于特权的教师分布会造成信息泄漏——学生学会依赖推理时不可见的特权信息,导致训练不稳定和性能退化。
OPSD是H2SD成功路径的对照(更稳定)和失败路径的基础(反向KL),理解其泄漏问题才能理解为什么需要混合策略。
自蒸馏RLVR RLSD
RLSD为规避OPSD的信息泄漏,不再直接匹配教师分布,而是把教师信号转化为token级权重:$\Delta_t=\log P_T(y_t)-\log P_S(y_t)$衡量特权信息对该token的支持度,权重$w_t=\exp(\text{sign}(A)\cdot\Delta_t)$经裁剪后调制GRPO优势得$\hat{A}_t$。奖励决定方向、教师只调幅度。它稳定但只重新分配奖惩强度、不学习教师完整分布,对失败轨迹无法指明正确替代。
RLSD是H2SD成功路径直接采用的目标,理解其幅度调制机制是读懂H2SD成功分支的前提。
反向KL散度与信用分配
KL散度衡量两个分布差异。反向KL $D_{KL}(p_S\|p_T)$要求学生分布$p_S$在教师$p_T$概率低处也低(mode-seeking),使学生聚焦教师的高概率模式。H2SD用它让失败轨迹的学生向条件于提示的教师对齐,获得方向性纠正。信用分配指把轨迹级奖励归因到具体token的能力——GRPO缺乏token级信用分配,H2SD通过幅度调制和反向KL分别给成功/失败轨迹做token级信用分配。
反向KL是H2SD失败路径的核心目标函数,信用分配是衡量本文方法价值的关键视角。
研究动机
RLVR(如GRPO)将标量奖励分配给整条轨迹,导致稀疏监督和有限的token级信用分配,无法告诉模型哪个token该为成功或失败负责。OPD通过更强教师模型蒸馏token级分布提供稠密监督,但要求额外教师且通常需要共享词表。OPSD用同一模型既当学生又当教师、教师条件于特权信息,免去外部教师依赖,但直接匹配教师分布会造成特权信息泄漏和训练不稳定。RLSD为规避泄漏只用教师信号调节更新幅度、不改变方向,稳定性提升却损失了分布学习能力——当学生走错推理路径时,仅靠幅度调节无法提供明确的纠正方向,教师信号中关于推理表达偏好、候选token相对关系等分布结构无法传递给学生。这一矛盾在失败轨迹上尤为突出。
本文的目标是本文目标是构建一个混合自蒸馏框架,根据轨迹正确性为教师分配不同角色,在保持稳定优化的同时为失败轨迹提供显式分布纠正。对成功轨迹,奖励已给出可靠优化方向,教师接收经验证正确的学生回复加改写指令,其概率仅用于调节更新幅度(RLSD式),不改变奖励决定的方向;对失败轨迹,教师条件于包含关键推理步骤和经验证答案的参考提示,最小化从学生到教师的反向KL散度,提供显式方向性纠正。作者希望证明,性能差异主要源于如何把特权信息转化为学习信号而非信息本身,并在多个推理基准上稳定优于RLVR、OPSD和RLSD基线。
与已有工作不同的是,独特切入角度在于“结果条件路由”。现有OPSD和RLSD各自代表分布匹配与幅度调制两个极端,存在稳定性与纠正力之间的权衡。SRPO虽按正确性路由,但把成功轨迹交给GRPO、失败轨迹交给自蒸馏,并未针对两种情况各自优化信号利用方式。本文首次把“成功轨迹只需细粒度信用分配、失败轨迹才需方向性纠正”这一直觉显式编码进目标函数,统一了RLSD的稳定性与OPSD的分布纠正能力。此外,作者用更强LLM(Kimi-K2.6)仅生成自然语言提示作为特权信息,而非直接当教师,从而绕开了词表共享限制,并把特权信息从“答案级”提升到“过程级”。
核心方法
H2SD的整体思路是“按轨迹正确性分流教师信号”。直觉是:成功轨迹已经走对,奖励方向可信,只需在token级细化信用分配;失败轨迹走错,负奖励只能抑制错误动作、无法指明正确替代,因此需要教师分布给出方向性引导。技术路线分两步:先离线用一个更强模型为每个问题生成包含关键中间步骤和经验证最终答案的自然语言提示$h$;训练时对每条学生采样轨迹,按奖励是否为1判断$m$。当$m=1$,教师接收正确的学生回复加“改写该正确回复”指令,按RLSD计算token级权重$\hat{A}_t$调节幅度;当$m=0$,教师条件于$h$,最小化反向KL。总体目标为$\mathcal{L}_{H2SD}=\mathbb{E}[m\mathcal{L}_{RLSD}+\gamma(1-m)\mathcal{L}_{RKL}]$。整个教师分布仍由当前模型自身(条件于$h$或改写指令)产生,外部强模型只负责生成提示。
核心创新是“结果条件路由”:根据轨迹成功与否,让同一教师扮演两种本质不同的角色。与OPSD直接全程匹配教师分布(信息泄漏、不稳定)、与RLSD全程只调幅度(无法纠正方向)的本质区别在于——H2SD认识到两种情况的最优监督策略不同:成功轨迹的奖励方向已可信,匹配分布反而会过度约束一条本已正确的轨迹;失败轨迹缺乏正向指引,幅度调制无能为力,必须靠分布对齐。另一个关键是“改写”机制:成功路径上教师改写学生自己的正确回复,保留了学生的有效推理链路、仅去除冗余,从而强调有助正确解的token。这种设计让H2SD既继承RLSD稳定、低熵的优势,又拥有OPSD的方向纠正力。
方法步骤详情
步骤1(提示生成):用Kimi-K2.6为每个$x$生成提示$h$,含关键中间步骤与检验器确认的答案;强模型不直接当教师、无需共享词表。步骤2(采样路由):学生Qwen3-30B-A3B对$x$采样$G$条轨迹,检验器打标$R$并标准化得优势$A$,按$m=\mathbf{1}[R=1]$分流。步骤3(成功·幅度调制):教师条件于(正确回复+“改写”指令)算$P_T(y_t)$,得支持度$\Delta_t=\log P_T(y_t)-\log P_S(y_t)$,权重$w_t=\exp(\text{sign}(A)\Delta_t)$裁剪调制成token级优势$\hat{A}_t$。步骤4(失败·反向KL):教师条件于$h$得停梯度分布$\text{sg}[p^T_{h,t}]$,最小化$\mathcal{L}_{RKL}=?rac1T\sum_t D_{KL}(p^S_{t,\theta}\|\text{sg}[p^T_{h,t}])$做方向纠正。步骤5(聚合):总目标按$m$加权,$\lambda$、$\gamma$控两支强度。实现基于VERL+SGLang,4节点×8张H200。
技术新颖性
新颖性体现在三点。第一,首次把“正确性决定监督策略”显式编码进自蒸馏目标,论证并验证了成功/失败轨迹应分别用幅度调制与反向KL,且反例(反向路由)会导致熵崩溃(Figure 4)。第二,提示设计上用外部强模型只生成自然语言提示而非充当教师,绕开OPD的词表共享和外部教师依赖,同时把特权信息从“答案级”提升到“过程级”:Table 3显示提示(76.50%)远优于仅含答案的ground truth(27.50%)和程序反馈(25.50%)。第三,“改写”机制让幅度调制免于分布过度约束,Table 4显示改写使Magnitude Only提升23.75个点却使Reverse-KL Only下降2.5个点,印证了改写与幅度调制的协同、与直接匹配的冲突。这些设计组合使H2SD在Sudoku上把最优基线从约35%量级推到76.50%。
实验结果
Table 1显示H2SD在三基准Overall达50.49%,大幅领先RLSD(24.85%)、GRPO(24.68%)、OPSD(24.01%)、SRPO(24.01%)、RLSD+hint(24.72%),而SDPO(13.46%)甚至低于基线(22.28%)。优势在Sudoku最突出:6×6达76.50%(次优OPSD仅35.25%),8×8达57.25%(次优RLSD仅15.25%)。由于OPSD、RLSD+hint与H2SD用相同提示,差异源于信号转化方式。Figure 3显示H2SD以最少token取得最高pass@1,增益来自信号效率而非更长回答。Table 2路由消融表明仅幅度(60.00)、仅反向KL(60.50)均不及混合(76.50),反向路由使Sudoku跌到17.00;Figure 4显示反向路由使演员熵归零、探索崩溃。Table 3表明过程级提示(76.50/57.25/24.20)远优于答案级。Table 4表明改写对幅度调制(+23.75/+32.00)和H2SD(+8.00/+5.75)有益、对反向KL有害(−2.50/−3.50)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Sudoku-6×6 逻辑推理 | pass@1 准确率(%) | 76.50 | 35.25(次优OPSD)/ 24.50(Base LLM) | 相对次优翻倍以上,+41.25个百分点 |
| Sudoku-8×8 逻辑推理 | pass@1 准确率(%) | 57.25 | 16.75(次优OPSD/GRPO) | +40.50个百分点,约3.4倍 |
| 三基准Overall平均 | pass@1 准确率(%) | 50.49 | 24.85(次优RLSD) | +25.64个百分点,约2倍 |
| Arrow Maze 平均(5个尺寸) | pass@1 准确率(%) | 24.20 | 15.90(次优SDPO) | +8.30个百分点 |
| Sudoku-6×6 生成效率 | 准确率-生成token权衡 | 最高准确率且最少token(左上角) | 基线准确率更低且token更多 | 增益来自信号效率而非更长回答 |
局限与改进
作者承认的局限主要在评估范围:实验仅限于Sudoku、Calcudoku、Arrow Maze三类逻辑谜题(约束满足类),未覆盖数学推理、代码生成等RLVR主流任务,因此方法在更开放、无明确可验证答案的任务上的泛化性存疑;其次依赖外部强模型(Kimi-K2.6)离线生成提示,引入额外算力和对提示质量的依赖。我自己的观察:H2SD的增益高度集中在Sudoku(Overall 50.49很大程度由Sudoku的76.50/57.25拉高),而Arrow Maze提升相对温和(24.20 vs 基线15.60),说明方法对“有清晰中间步骤可写提示”的任务更有效;反向KL对失败轨迹的纠正也可能在多解任务(如Calcudoku)上引入教师特定解的偏置;论文未报告训练成本、收敛步数和提示生成的token开销,难以评估性价比;此外只测了一个基座模型(Qwen3-30B-A3B)。
独立分析的弱点
弱点一:评估任务过窄,仅限逻辑谜题。改进方向是在GSM8K、MATH、HumanEval、LiveCodeBench等数学/代码基准上验证,证明方法不依赖谜题的离散约束结构。弱点二:依赖外部强模型生成提示,算力与质量受限,且提示一旦生成固定,无法随学生能力动态适配。改进方向是让学生模型自身迭代生成更优提示(如迭代自训练)或引入课程式提示。弱点三:路由的二值正确性信号较粗,对于“接近正确”的部分正确轨迹,强反向KL可能过度约束。改进方向是用软奖励或部分匹配度连续化路由权重。弱点四:失败轨迹反向KL对多解任务可能引入单一教师解偏置。改进方向是给教师条件于多个兄弟解的集合而非单一提示,或用Jensen-Shannon散度替代反向KL以容纳多模态目标分布。弱点五:缺少训练效率和提示成本的完整报告。改进方向是补全训练token、GPU小时、提示生成开销的核算。
未来方向
作者在结论中强调成果来自结果路由、信息丰富的推理提示和成功回复改写三者协同,但未明确列出未来方向。基于成果可延伸:第一,把H2SD从谜题推广到数学推理、代码生成、工具使用等RLVR主流场景,检验方法的普适性。第二,研究提示生成的自动化与迭代精化,例如让强模型与学生模型协同迭代提升提示,或用验证器反馈在线筛选提示。第三,将二值正确性路由泛化为基于奖励或部分匹配度的软路由,平滑过渡两种监督。第四,探索多教师或多兄弟解条件化,缓解反向KL在多解任务上的分布坍缩。第五,结合离线蒸馏与在线RL,把外部强模型的提示生成也纳入端到端优化。第六,分析H2SD在不同规模基座(1B到100B+)和MoE架构上的缩放规律。
复现评估
复现性中等偏上但未完全开源。论文明确给出基座模型(Qwen3-30B-A3B-Instruct-2507)、提示生成模型(Kimi-K2.6)、实现框架(VERL+SGLang)、算力(4节点×8张NVIDIA H200 140GB)、长链蒸馏的内存优化(学生top-100 token精确概率加尾部桶合并)、SRPO/SDPO使用的Jensen-Shannon散度(α=0.5)等关键细节,足以指导复现。但未提供开源代码、数据集或预训练权重,也未给出完整超参表(学习率、$\lambda$、$\gamma$、$\epsilon_w$、裁剪范围、批大小、训练步数、提示token开销),这些是复现76%级别结果的瓶颈。逻辑谜题基准(Sudoku/Calcudoku/Arrow Maze)虽有公开实现但需自行搭建验证器。整体看,方法描述清晰、消融充分,但缺少代码与超参细节,完整复现需显著工程投入和约32张H200的算力。
论文图表