← 返回 2026-07-30

CADENCE:通过覆盖自适应的在线策略蒸馏弥合推理鸿沟 CADENCE: Closing the Reasoning Gap via Coverage-Adaptive On-Policy Distillation

Satyam Kumar, Saurabh Jha 📅 2026-07-18 👍 6 2026-08-04 18:30
在线策略蒸馏 大模型推理 小模型高效训练 强化学习 知识蒸馏

统一在线蒸馏框架修复三大失效模式,0.5B学生达GSM8K 69.8%

前置知识

知识蒸馏(Knowledge Distillation)

知识蒸馏是把大模型(教师)的能力迁移到小模型(学生)的技术。经典做法(Hinton 2015)是让学生模仿教师软化后的输出分布,最小化前向 KL 散度。在序列生成中,Kim & Rush 2016 将其扩展到序列级别。这种离策略(off-policy)范式让学生在教师生成的轨迹上训练,但部署时要从自己的分布采样,存在训练-推理不匹配。本文在此基础上研究在线策略(on-policy)蒸馏,即让学生采样自己的轨迹、教师提供逐 token 指导。

理解蒸馏的基本目标和前向/反向 KL 的权衡,是理解本文所诊断三大失效模式的前提。

前向 KL 与反向 KL 散度

前向 KL $D_{KL}(\pi_\phi \| \pi_\theta)$ 是模式覆盖(mode-covering):只要教师给某 token 概率,学生就会被拉过去,代价是生成质量差、可能不连贯。反向 KL $D_{KL}(\pi_\theta \| \pi_\phi)$ 是模式寻求(mode-seeking):学生集中于教师最可能的模式,生成连贯但容易塌缩、丢失多样性。MiniLLM(Gu 2024)用反向 KL,GKD(Agarwal 2024)强调在线训练。CADENCE 的 DRIFT 机制在两者之间做逐 token 的凸组合插值,权重 β 从 1(前向)退火到 0(反向)。

CADENCE 的核心就是对两种散度的调度做自适应改进,不懂这个权衡就无法理解 COVA、FTB 等组件。

在线策略蒸馏与策略梯度(REINFORCE / GKD / DRIFT)

在线蒸馏让学生 $\pi_\theta$ 自己采样轨迹 $x_{1:T} \sim \pi_\theta(\cdot|s)$,再用冻结教师 $\pi_\phi$ 给每个 token 打分。DRIFT 用逐 token 对数比 $\hat{k}_t = \log \pi_\theta(x_t|s_t) - \log \pi_\phi(x_t|s_t)$ 构造优势:反向信号 $-\hat{k}_t$ 和自归一化重要性权重的前向信号 $A^{fwd}_t$,凸组合为 $A^{DRIFT}_t = (1-\beta)(-\hat{k}_t) + \beta A^{fwd}_t$,再用策略梯度 $L = -\frac{1}{G}\sum_t \text{sg}(A_t)\log\pi_\theta(x_t|s_t)$ 更新。这是 REINFORCE 的蒙特卡洛估计,配 leave-one-out 基线减方差。

DRIFT 是 CADENCE 的地基,所有六个新组件都建立在它之上,必须先理解其逐 token 优势的计算。

重要性采样与自归一化权重

为了用学生采样的样本来估计前向 KL 的梯度,需要重要性权重 $w_t = \exp(-\hat{k}_t) = \pi_\phi(x_t)/\pi_\theta(x_t)$(教师/学生概率比)。直接用方差很大,所以做截断 $w_t = \text{clip}(\exp(-\hat{k}_t), 0, c)$($c=10$)并自归一化 $A^{fwd}_t = G \cdot w_t/(\sum_{t'} w_{t'} + \epsilon)$。G-scaling 确保反向和前向信号都是 O(1) 量级,避免反向 KL 项主导。注意论文明确声明这是逐 token 代理目标,不等于序列级 KL 梯度。

理解截断和自归一化才能理解冷启动失效(权重几乎为零)以及 COVA 的覆盖度度量。

LoRA 与轻量化训练

LoRA(Low-Rank Adaptation)冻结原模型权重,只在注意力/MLP 投影上加可训练的低秩矩阵(本文 $r=16, \alpha=32$, dropout 0.05),只训练 9.44M 参数(占 1.91%)。配合 AdamW 优化器、学习率 $2\times10^{-5}$、30 步预热、权重衰减 $10^{-4}$、梯度裁剪 1.0,以及学生 EMA(指数滑动平均,衰减 0.99)。这种配置让 0.5B 学生 + 冻结的 1.5B/3B 教师能在一台苹果 Mac Studio(M 系列、16 核 CPU、40 核 GPU、64GB 统一内存)上跑完 400 步训练。

本文的卖点之一是消费级硬件即可复现,理解 LoRA 和 EMA 是理解其工程可行性的关键。

GSM8K 与 MATH-500 基准及评估协议

GSM8K 是小学数学应用题(约 7500 训练、约 1300 测试),MATH-500 是竞赛数学的 500 题子集。本文强调评估协议:早期用 192 token 生成上限 + 简单正则提取答案,导致教师 Qwen2.5-Math-1.5B 只到 74.5/28.4(远低于发表的约 84/74)。修正后用 512 token 上限(GSM8K 仍 192)和匹配 Qwen2.5-Math 输出格式(解析 $\boxed{...}$)的提取器,复现到 82.1/64.3,接近发表值。所有结果都用 5 个种子报均值±标准差。

评估协议的修正使绝对数字从 65% 变为 70%,理解这一点才能看懂论文对早期草稿结果的诚实更正。

研究动机

在把大教师模型的推理能力蒸馏到紧凑学生模型时,现有在线策略蒸馏方法存在三个叠加的失效模式。第一是冷启动塌缩(cold-start collapse):刚初始化的小学生几乎不给教师偏好的推理 token 分配概率,在反向 KL 下这些位置梯度信号趋近于零(因为几乎不被采样到),学生无法自举产生它从未输出过的推理模式。第二是状态无关的散度调度(state-agnostic divergence scheduling):现有前向→反向 KL 插值用固定的时间表(如 Ko 2024),但不同难度的 prompt 覆盖度增长速度不同,单一时间表必然次优——简单题太久停留在模式覆盖,难题又过早进入锐化。第三是二值奖励稀疏(binary reward sparsity):用结果奖励的 RL 方法(DeepSeek 2025、GRPO)只用对/错信号,在 GSM8K 上预训练 pass@1 约 48.7%,意味着 51% 的轨迹得到零奖励;而一个推理正确但最后算术出错的轨迹,与一个完全语无伦次的轨迹得到同样的零奖励,浪费了部分正确的信息。本文用作者自己的话反复强调诚实性:早期草稿用 192 token 评估、纯正确性门控奖励等设计都重新审视并修正。

本文的目标是本文的目标是为上述三个失效模式各设计一个针对性的修复,并整合成一个统一的、可在消费级硬件上训练的在线策略蒸馏框架 CADENCE。具体而言:(1) 用 DRIFT 机制在每个 token 上凸组合前向和反向 KL 代理信号,并让调度随学生的实际覆盖状态自适应(解决时间表死板);(2) 在高风险分叉 token 上集中梯度、恢复标定、给部分正确轨迹稠密奖励(解决冷启动和奖励稀疏);(3) 在 GSM8K 和 MATH-500 上把 0.5B 学生的 pass@1 从预训练的 48.7%/32.1% 显著提升,并超过同计算量的标签使用基线。作者还特别要求所有结果用 5 个种子、报告标准差、超参数只在验证集上选择,并诚实说明每个组件的有效范围与局限。

与已有工作不同的是,本文的独特切入角度有三点。其一,它不像以往方法(GKD、DistiLLM)只用单一散度或固定插值,而是把散度调度变成数据自适应的——COVA 根据学生已测量到的教师 token 覆盖度 $cov_t$ 来条件化加速前向→反向的过渡,且明确声明它只修复「过渡太慢」而非「过渡太快」。其二,它不像 STaR/RFT 或 GRPO 那样只用正确性二值信号,而是用 CCD 给「数值上接近但错误」的轨迹一个数值邻近度的部分信用 $p_i$,把非零奖励比例从约 49% 提到约 55%,直接对症下药奖励稀疏。其三,它引入五个诊断指标(SAG、FTA、KLPE、CNI、RLD)机械性地分解蒸馏质量,并用 leave-one-out 消融区分「边缘非冗余」与「统计独立」——明确承认组件之间存在正向交互(sum of LOO deltas 18.5 > 移除全部的 6.7),这种诚实区分在同类论文中少见。

核心方法

CADENCE 的整体思路是先直觉后技术。直觉上:学生需要先「广撒网」覆盖教师能产生的推理模式(前向 KL 的模式覆盖作用),再「收紧」到教师最可能的模式以获得连贯高质量生成(反向 KL 的锐化作用),而这两步之间的过渡应根据学生实际掌握了多少来动态决定,而不是按时间一刀切。技术上,CADENCE = DRIFT 基座 + 六个新组件(COVA、FTB、CCD、LAP、EMR、BSD)+ 两个稳定化机制(TFW、KTR)。训练目标为 $\mathcal{L}_{CADENCE} = \mathcal{L}_{DRIFT} + \mathcal{L}_{CCD} + \mathcal{L}_{LAP} + \mathcal{L}_{EMR} + \mathcal{L}_{KTR}$,BSD 是单独的后阶段。配置为 LoRA $r=16$(9.44M 可训练)、AdamW lr $2\times10^{-5}$、400 步、每步 4 个 prompt、生成长度 192、温度 1.0→0.7、β 余弦退火 1.0→0.0、IS 截断 $c=10$,每 prompt 采样 $n_g=4$ 条 rollout。整套训练在一台 Mac Studio 上 14 小时(1.5B 教师)或 22 小时(3B 教师)跑完一个种子。

核心创新是把「时间固定的前向→反向调度」升级为「覆盖度自适应的逐 token 调度」,并围绕它配套六个针对各失效模式的组件。DRIFT 的逐 token 优势是 $A^{DRIFT}_t = (1-\beta)(-\hat{k}_t) + \beta A^{fwd}_t$,其中 $\hat{k}_t = \log\pi_\theta(x_t|s_t) - \log\pi_\phi(x_t|s_t)$。COVA 用覆盖度 $cov_t = \frac{\sum_{v\in T_k(t)}\pi_\phi(v|s_t)\mathbf{1}[\pi_\theta(v|s_t)>\tau]}{\sum_{v\in T_k(t)}\pi_\phi(v|s_t)}$($k=20, \tau=10^{-3}$)作为门控:只有当 $cov_t > \gamma=0.15$ 时才加速退火,即 $\beta_{COVA} = \max(\beta_{end}, \beta_{cosine}(1 - \alpha_{max}\max(0,cov-\gamma)/(1-\gamma)))$。与已有方法的本质区别是:调度权重不靠墙钟时间,而靠学生是否真的「够到了」教师的 token,这是端到端数据驱动的。

方法步骤详情

完整步骤如下。第 0 步(TFW 预热):20 步教师强制 SFT(在教师生成的轨迹上直接监督),让重要性权重从一开始就良好条件化,防止冷启动。第 1 步(在线采样):学生 $\pi_\theta$ 对每 prompt 采样 $n_g=4$ 条轨迹 $x_{1:T} \sim \pi_\theta(\cdot|s)$。第 2 步(教师打分):冻结教师 $\pi_\phi$ 对每个 token 给 $\log\pi_\phi(x_t|s_t)$。第 3 步(对数比与重要性权重):算 $\hat{k}_t$,截断自归一化得 $A^{fwd}_t$。第 4 步(DRIFT 优势):按 COVA 调度得 $\beta$,凸组合得 $A^{DRIFT}_t$。第 5 步(FTB 增强):用全局熵参考 $H_{ref}=2.0$ nats 给高教师熵位置加权 $A^{FTB}_t = A^{DRIFT}_t(1+\gamma_{ftb}\min(1, H_\phi(t)/H_{ref}))$($\gamma_{ftb}=0.5$)。第 6 步(CCD 稠密奖励):对每条 rollout 抽取答案 $\hat{a}^{(i)}$,正确则 $r_i = w_c + w_{con}C$,错误但数值接近则 $r_i = w_{partial}\cdot p_i$,其中 $p_i = \frac{1}{1+|\hat{a}^{(i)}-a_{gold}|/\max(|a_{gold}|,1)}$($w_c=0.30, w_{con}=0.15, w_{partial}=0.10$)。第 7 步(LAP 简短偏好):对正确 rollout 加长度无关的 SFT 项 $\mathcal{L}_{LAP} = \alpha_{lap}\mathbf{1}[\hat{a}=a_{gold}](1-G/G_{max})(-\frac{1}{G}\sum_t\log\pi_\theta)$($G_{max}=192, \alpha_{lap}=0.10$)。第 8 步(EMR 标定):在分叉 token($H_\phi(t)>\eta=1.0$)上加熵匹配 $\mathcal{L}_{EMR} = \lambda_{emr}\frac{\sum_t(H_\theta(t)-H_\phi(t))^2\mathbf{1}[H_\phi(t)>\eta]}{\sum_t\mathbf{1}[H_\phi(t)>\eta]+\epsilon}$($\lambda_{emr}=0.10$)。第 9 步(KTR 信任域):$\mathcal{L}_{KTR} = \lambda_{ktr}\frac{1}{G}\sum_t\max(0,|\hat{k}_t|-\delta_{ktr})^2$($\lambda_{ktr}=0.005, \delta_{ktr}=3.0$)约束逐 token 对数比。第 10 步(策略梯度更新):合成总损失做一步 AdamW,配合学生 EMA(衰减 0.99)。第 11 步(BSD 后阶段):训练结束后再采样、筛一致性 $\geq\tau_{bsd}=0.80$ 且正确的轨迹做 30 步自蒸馏 SFT,正确性门控避免「自信地一致地错误」。

技术新颖性

技术新颖性分几点。第一,DRIFT 把逐 token 代理目标显式化并配 Proposition 1 证明端点($\beta=0$ 是 REINFORCE 估计反向代理,$\beta=1$ 是自归一化 IS 估计前向代理),同时用 Remark 1 诚实声明这不是序列级 KL 梯度——这种「讲清楚它是什么、不是什么」的理论自省很罕见。第二,COVA 的覆盖度门控 $cov_t$ 让 β 调度首次变成数据自适应,且 Proposition 2 证明 $cov\leq\gamma$ 时 COVA 不偏离基线,作用范围被严格刻画。第三,CCD 的数值邻近度部分信用 $p_i$ 直接作用于错误轨迹(而不是只给已正确的重打分),把非零奖励比例从 49% 提到 55%,是对症奖励稀疏的原创设计。第四,FTB 用固定全局熵参考 $H_{ref}=2.0$ 替代早期草稿的逐轨迹最大值,恢复跨序列可比性。第五,五个诊断指标(SAG=$pass@16-pass@1$、FTA 分叉 token 准确率、KLPE、CNI 单位 PFLOP 得分、RLD 响应长度分布)给出机械性分解,配合跨方法诊断表揭示「反向 KL 高 FTA 低 SAG、前向 KL 反之、CADENCE 兼得」。第六,消融明确区分边缘非冗余与统计独立(移除 CCD −3.5、TFW −3.2、FTB −2.9 为最大),承认组件正向交互。

CADENCE end-to-end architecture
Figure 1: CADENCE end-to-end architecture

实验结果

核心发现可逐条分析。主结果(Table 1,修正的 512 token 协议、5 种子):在 GSM8K 上,CADENCE 把 0.5B 学生从预训练 48.7%±0.3 提升到 69.8%±0.5(1.5B 教师,弥合 63.2% 师生差距)和 72.1%±0.4(3B 教师,弥合 76.2%);MATH-500 分别到 47.9%±0.5 和 50.6%±0.5。与最强同计算量标签使用基线 DRIFT+binary(65.4%±0.5)相比,CADENCE 在 GSM8K 提升 +4.4±0.7(约 6σ)、MATH-500 +3.4±0.8(约 4σ),统计显著。诊断指标(Table 2):CADENCE 后 ECE 从 0.164 降到 0.078(EMR 的标定效应)、Brier 从 0.398 到 0.241、SAG 从 24.6 降到 11.7(BSD 的选择效应)、FTA 从 34.8% 升到 58.6%;WikiText-103 PPL 几乎不变(24.53→24.84),说明非回归。跨方法诊断(Table 3)揭示互补失败:反向 KL FTA 47.6% 但 SAG 27.1 最差;前向 KL SAG 17.5 但 FTA 40.9% 弱;CADENCE 兼得 FTA 58.6%、SAG 11.7。消融(Table 4):移除 CCD 部分信用 −3.5(最大)、TFW −3.2、FTB −2.9、BSD −2.0、COVA −2.2、EMR −1.4(但使 ECE 从 0.078 恶化到 0.113,相对退化 45%,机制一致)、LAP −0.8、KTR −0.6;移除全部回到 DRIFT 的 63.1%,累计 LOO 和 18.5 > 总 6.7,说明正向交互。RLD 显示真实压缩(未截断子集 pretrained 中位 134 → CADENCE 108,26 token 真实压缩,验证 LAP)。模式塌缩检查:CCD 4-gram Jaccard 训练中稳定 0.44±0.03,去掉正确性门控后升到 0.71 且 pass@16 退化,验证门控必要性。作者诚实声明不主张 1.5B→3B 教师的缩放趋势(GSM8K delta 4.4 vs 3.9、MATH 3.4 vs 2.8 都在 pooled std 内)。

Main results on GSM8K and MATH-500 (corrected 512-token protocol, 5 seeds µ±σ)
Table 1: Main results on GSM8K and MATH-500 (corrected 512-token protocol, 5 seeds µ±σ)
Diagnostic metrics, before vs. after CADENCE, 5 seeds
Table 2: Diagnostic metrics, before vs. after CADENCE, 5 seeds
Cross-method diagnostics (Experiment 1)
Table 3: Cross-method diagnostics (Experiment 1)
Leave-one-component-out ablation on GSM8K (Experiment 1, 5 seeds)
Table 4: Leave-one-component-out ablation on GSM8K (Experiment 1, 5 seeds)
Experiment 2 detail (5 seeds, 3B→0.5B)
Table 5: Experiment 2 detail (5 seeds, 3B→0.5B)
Training dynamics for Experiment 1 (1.5B→0.5B)
Figure 2: Training dynamics for Experiment 1 (1.5B→0.5B)
Training/evaluation results for Experiment 1
Figure 3: Training/evaluation results for Experiment 1
查看结构化数据
任务指标本文基线提升
GSM8K pass@1(1.5B→0.5B) 准确率(5 种子 µ±σ) 69.8 ± 0.5% DRIFT+binary 65.4 ± 0.5%;预训练 48.7 ± 0.3% 比最强基线 +4.4 ± 0.7;比预训练 +21.1;弥合 63.2% 师生差距
GSM8K pass@1(3B→0.5B) 准确率(5 种子 µ±σ) 72.1 ± 0.4% DRIFT+binary 68.2 ± 0.5%;教师 79.4% 比最强基线 +3.9 ± 0.6;弥合 76.2% 师生差距
MATH-500 pass@1(1.5B→0.5B) 准确率(5 种子 µ±σ) 47.9 ± 0.5% DRIFT+binary 44.5 ± 0.6%;预训练 32.1 ± 0.4% 比最强基线 +3.4 ± 0.8;比预训练 +15.8
标定(ECE,1.5B→0.5B) 10-bin 期望标定误差(越低越好) 0.078 ± 0.006 预训练 0.164 ± 0.008;DRIFT+binary 0.109 相对预训练降低约 52%;EMR 是主驱动
分叉 token 准确率(FTA,1.5B→0.5B) 高熵位置准确率(越高越好) 58.6 ± 0.9% 预训练 34.8 ± 1.2%;反向 KL 47.6%;前向 KL 40.9% 兼得前向/反向 KL 的优势
计算效率(CNI) pts/PFLOP(越高越好) 4.15 ± 0.11(多 rollout 类最高) DRIFT+binary 3.61;GKD+GRPO 3.44;DRIFT base 9.44(单 rollout) 在多 rollout 类内最高,组件带来真实精度/算力增益

局限与改进

局限性来自作者自述与本文观察两方面。作者自述:(1) DRIFT 优化的是逐 token 代理而非序列级 KL 梯度,不主张序列级一致性(Remark 1);(2) CCD 的部分信用提升有限,非零奖励比例从 49% 只到 55%,更大幅提升需步级过程奖励(列为未来工作);(3) COVA 是不对称的,只修复过渡太慢(持续模式覆盖),不修复过渡太快(过早锐化),需靠保守的 β 余弦来兜底;(4) 不主张 1.5B→3B 教师缩放趋势;(5) 组件是正向交互而非统计独立;(6) FTA 用熵作代理,高熵是必要非充分条件(风格性分叉如同义词也有高熵但与正确性弱相关)。本文观察:评估协议的修正使绝对数字从早期草稿的 65% 变到 70%,说明早期结果被高估、相对结论才稳健,这对依赖早期数字的读者有迷惑性;六个组件加两个稳定机制共八个开关、大量超参数(COVA γ、FTB γftb/Href、CCD 四个权重、LAP αlap、EMR λemr/η、BSD τbsd、KTR λktr/δktr、TFW 步数),虽在验证集选过,但搜索空间大、复现门槛不低;实验只在数学推理(GSM8K/MATH-500)做,跨域(代码、逻辑)未验证;教师限于 Qwen2.5 系列,对其它架构的迁移性未知;RLD 简短偏好可能与需要长链推理的任务(如 MATH-500 的多步推导)存在张力,作者自己也承认 192 token 上限在 MATH-500 上截断多步推导,所以评估才改 512 token。

独立分析的弱点

第一,奖励信号仍偏二值化与数值邻近。CCD 的部分信用 $p_i$ 只对数值答案有效,对符号答案、证明题、代码题无能为力;且提升幅度有限(49%→55%)。改进方向:引入步级过程奖励(PRM 风格)或轻量级推理链评分模型,给中间步骤稠密信号——作者自己也列为未来工作。第二,COVA 只修「过渡太慢」是已知不对称缺陷。若基线余弦退火过激导致过早锐化,COVA 不干预,只能靠人工保守选 β。改进方向:设计双向门控,既能在覆盖不足时延后过渡,又能在覆盖已饱和但模型仍欠锐化时主动推进;或用学生在验证集上的 FTA/SAG 实时反馈来闭环调节。第三,超参数空间大。八个组件十几个超参数,虽然都在 200 题验证集上选,但验证集小、搜索网格有限,泛化到其它数据/模型存在过拟合验证集的风险。改进方向:用贝叶斯优化或元学习自动选超参,并扩大验证集。第四,FTB 的熵代理不够精确。高熵位置含风格性分叉,FTB 目标集是理想集的超集,会误增强无关 token。改进方向:结合教师/学生分歧(如 SelecTKD)或正确性反馈来精炼「真正推理关键」的 token 集合。第五,域狭窄。只在数学推理验证,LAP 的简短偏好与代码/长推理任务可能冲突。改进方向:在代码(HumanEval)、逻辑、多步问答上验证,并为不同域设计长度归一化策略。

未来方向

作者明确提出的方向:(1) 为 CCD 引入步级过程奖励,取代/补充数值邻近度部分信用,以获得更稠密的信号;(2) 跨域评估,扩展到代码生成和逻辑推理;(3) token 级自适应 β,把 COVA 的覆盖度门控进一步细化到逐 token。基于本文成果可延伸的方向:把 DRIFT 的逐 token 凸组合推广到更一般的 f-散度路径插值(α-divergence),理论上有 variational inference 的根(Minka 2005);将五个诊断指标(SAG/FTA/KLPE/CNI/RLD)标准化为蒸馏评测套件,供社区复用;把 BSD 的自蒸馏+正确性门控思想与自一致性解码(Wang 2023)结合,做训练-解码联合优化;探索更大教师(7B+)下 COVA 门控行为是否变化,以及是否能闭合剩余的 23.8%–36.8% 师生差距;研究 EMR 的标定效益在教师本身欠标定的基准上是否衰减(作者提到 EMR 的 ECE 收益依赖教师标定良好,需在附录验证);把整套框架迁移到多教师或迭代蒸馏设置。

复现评估

复现性总体良好但门槛不低。有利因素:作者公开了所有超参数(LoRA r=16/α=32/dropout 0.05、AdamW lr $2\times10^{-5}$、400+30 步、$n_g=4$、COVA γ=0.15、FTB γftb=0.50/Href=2.0、CCD wc=0.30/wcon=0.15/wpartial=0.10、LAP αlap=0.10、EMR λemr=0.10/η=1.0、BSD τbsd=0.80、KTR λktr=0.005/δktr=3.0、TFW 20 步、IS clip c=10、β 余弦 1.0→0.0),数据集(GSM8K、MATH-500)公开,基线和教师(Qwen2.5-Math-1.5B-Instruct、Qwen2.5-3B-Instruct、Qwen2.5-0.5B-Instruct)公开,5 种子报均值±标准差,超参在 200 题 GSM8K 验证集上选择,Table 6 还给出 COVA/BSD 的验证-测试扫描曲线。硬件门槛友好:单台苹果 Mac Studio(M 系列、16 核 CPU、40 核 GPU、64GB 统一内存),1.5B→0.5B 约 14 小时/种子,3B→0.5B 约 22 小时/种子,5 种子顺序跑——远低于数据中心规模。不利因素:论文为预印本,未见明确的开源代码链接(文末未给 repository);评估协议细节(Qwen2.5-Math 匹配的 $\boxed{...}$ 提取器、512 token 上限)需自行复现;八个组件的工程实现(尤其 leave-one-out 基线、学生 EMA、TFW 预热与主循环衔接)有一定实现复杂度;FTB 的 $H_{ref}=2.0$ 是基于初始训练 run 的教师熵分布经验选定的,换模型/换域可能需重选。综合看,按论文细节可复现主结果,但首次复现预计需要相当的工程投入。