← 返回 2026-08-07

面向多语言数学推理的在线策略增量蒸馏 On-Policy Delta Distillation for Multilingual Math Reasoning

Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han 📅 2026-08-06 👍 31 2026-08-11 18:30
LLM后训练 Qwen3 在线策略蒸馏 多语言推理 数学推理 知识蒸馏

将OPD2蒸馏扩展至英/韩/日数学推理,揭示推理迁移与语言保留的差异。

前置知识

On-Policy Distillation (OPD, 在线策略蒸馏)

OPD 是一种用蒸馏替代强化学习(RL)完成 LLM 后训练的方法。流程上:学生模型 $\pi_\theta$ 先从当前策略采样出回答 $y$;把「问题-回答」对喂给教师模型 $\pi^*$,得到教师在学生生成轨迹上的逐 token 概率作为反馈;最后用 KL 散度 $\mathbb{E}_{y\sim\pi_\theta(\cdot|x)}[D_{KL}(\pi_\theta(y|x) \| \pi^*(y|x))]$ 训练学生去逼近教师分布。由于 KL 在每个 token 上计算且只对采样到的 token 计算奖励 $R_t = \log\pi^*(y_t|x,y_{<t}) - \log\pi_\theta(y_t|x,y_{<t})$,OPD 提供的是 token 级而非序列级的监督,数据与计算效率更高。

本文的全部讨论都建立在 OPD 与 OPD2 这两种蒸馏范式之上,论文甚至把 OPD 目标写成与 RL 类似的 token 级奖励策略梯度形式。不理解 OPD 的「学生采样→教师打 token 分→缩小分布差」循环,就无法理解 OPD2 的 delta 信号到底替换了哪一项,也就无法理解后续多语言实验的设计动机。

On-Policy Delta Distillation (OPD2, 增量蒸馏)

OPD2 是 OPD 的进阶版本,核心改动是把奖励函数第二项从「学生模型 $\pi_\theta$」替换为「教师的 base 模型 $\pi^*_{base}$」,即奖励定义为 $R_t = \log\pi^*(y_t|x,y_{<t}) - \log\pi^*_{base}(y_t|x,y_{<t})$。这个 delta 信号刻画的是教师「因后训练而新获得的能力」(尤其是推理能力),同时压制 base 模型已有的通用偏好与风格模式。为解决 delta 信号的收敛点问题,OPD2 还引入了奖励中心化(reward centering)求 advantage、以及基于原始 OPD 信号的条件准则(conditioning criterion)两个附加组件。

OPD2 由原论文[4]提出并在英文数学/科学/代码任务上刷新了 Qwen3 家族成绩。本文正是把 OPD2 搬到多语言场景去验证它是否仍优于 OPD,因此 OPD2 的 delta 奖励公式及其与 OPD 的区别是理解所有对比实验(Figure 1、Figure 2、Figure 3)的前提。

序列级 vs token 级监督 (RL 与 OPD 的本质区别)

GRPO 等 RL 后训练通常用一个标量奖励对整条生成轨迹打分(序列级监督),这种方式表征力有限、数据与计算效率低。OPD 则把教师模型的逐 token 生成概率当作密集的 token 级反馈信号,相当于在每个 token 上都给一个奖励 $R_t$,再以 $\mathbb{E}[\sum_t R_t \nabla_\theta \log\pi_\theta(y_t|x,y_{<t})]$ 更新策略。这种稠密监督能更精细地调整当前分布下候选 token 的相对概率,降低模型偏离当前生成分布的风险。

论文反复强调 OPD 相对 RL 的「token 级监督」优势是动机起点。理解这一点才能明白为什么作者选择在 OPD/OPD2 这条路线上做多语言实验,而不是直接套用 RL 后训练——token 级密集监督在低资源语言上理论上更有潜力,这正是作者要验证的核心假设。

多语言数学推理基准

本文使用四个多语言数学推理基准:PolyMath(多语言数学推理)和 Global-MGSM(GSM8K 的多语言扩展)评测英/韩/日三语;HRM8K 评测英语和韩语;MAWPS 评测日语。评测同时在 thinking 模式(模型先在 中推理再给出答案)与 non-thinking 模式下进行。报告指标为准确率(accuracy,单位 % 或 points)。

论文的所有性能数字(如 Qwen3-8B 英文从 62.8 提升到 70.5)都来自这些基准,且 Figure 1/2/3 全部基于 PolyMath 与 Global-MGSM 的平均值。熟悉这些基准及其覆盖的语言,才能判断 OPD2 的提升是否具有语言泛化性,以及哪些结论是基于哪个基准得出的。

研究动机

On-Policy Distillation (OPD) 正在成为强化学习(RL)完成大模型后训练的有力替代方案:它用教师模型对学生采样轨迹的逐 token 概率作为反馈,提供比 RL 序列级标量奖励更稠密的 token 级监督,从而提升数据与计算效率。然而现有 OPD 研究「几乎只聚焦于英文推理基准」,例如 On-Policy Distillation 及其变体 OPD2 的原始论文主要在英文数学、科学和代码任务上验证。唯一与多语言相关的工作(Liu et al.)是把 on-policy self-distillation 扩展到非洲语言,但那是「自蒸馏」(同一个模型既当学生又当教师),而非本文关心的「强教师蒸馏」。至于 OPD 对韩语、日语等东亚语言的效果,基本是一片空白。这就引出一个现实而重要的问题:在英/韩/日多语言数学推理场景下,OPD 与更强的 OPD2 到底有没有用、能不能缩小语言间性能差距,完全是未知的。

本文的目标是本文的目标是系统性地、用实证方法回答三个互相关联的研究问题:其一,OPD2 在多语言(英/韩/日)设置下是否仍然优于原始 OPD?其二,OPD2 后训练是否有助于缩小英语与非英语之间的性能差距(语言鸿沟)?其三,仅用英语数据做 OPD(EN-only OPD)会如何影响多语言推理能力,以及目标语言(如韩语/日语)的生成行为?为回答这些问题,作者构建了 100K 规模的多语言数学训练集(英:韩:日=1:1:1),以及一个 100K 的纯英语训练集,在 Qwen3-1.7B 和 Qwen3-8B 两个学生模型、Qwen3-30B-A3B-2507 教师模型上系统训练与评测,目标是为多语言 OPD 提供一个清晰、可复现的实证基线。

与已有工作不同的是,本文最独特、也最有洞察力的切入角度,是把「跨语言推理能力迁移」与「目标语言生成保持」这两件事明确区分开来。以往的工作只看基准准确率,而本文进一步提出并测量「目标语言响应率」(target-language response rate),即模型最终回答是否真的用了与输入问题相同的语言。正是这个角度,让作者发现了一个反直觉且重要的现象:英语单语 OPD2 确实能把韩语/日语基准分数拉上去,但模型实际上常常「偷偷用英语作答」——也就是说准确率提升并不等于目标语言推理能力真正提升。这种「准确率 vs 响应语言」的双维评测,是本文区别于一切只看分数的多语言研究的核心差异点。

核心方法

整体思路是「不改动 OPD2 算法本体,而把训练数据、教师-学生配置和评测维度系统性地多语言化」。直觉上,OPD2 的 delta 信号 $\log\pi^*(y_t|x,y_{<t}) - \log\pi^*_{base}(y_t|x,y_{<t})$ 提取的是教师因后训练获得的推理能力,理论上可跨语言迁移。技术路线分三块:(1) 数据——多语言训练集含 100K 题,英/韩/日按 1:1:1 抽样(韩日题来自 Nemotron-SFT-Multilingual-v2,英文题来自 Nemotron-Math-v2,三语无重叠),另建 100K 纯英语集对照,且只保留 question 字段;(2) 模型——学生用 Qwen3-1.7B 与 Qwen3-8B,教师用 Qwen3-30B-A3B-2507,统一在 thinking/non-thinking 两模式训练评测,用官方 OPD2 实现,训练 100 步、超参与样本量在多语言与英语单语间一致;(3) 评测——在 PolyMath、Global-MGSM、HRM8K、MAWPS 报告准确率并额外测量目标语言响应率。

方法层面本文没有提出新算法,它的「核心」其实是实验设计上的两个对照:第一个对照是 OPD vs OPD2 在多语言下的横向比较,用来检验 delta 信号(用教师与其 base 的概率差 $\log\pi^* - \log\pi^*_{base}$)是否比原始 OPD 信号(教师与学生概率差 $\log\pi^* - \log\pi_\theta$)在非英语语言上同样甚至更有优势;第二个对照是多语言 OPD2 vs 纯英语 OPD2,配合「目标语言响应率」这一新测量,用来把「推理能力跨语言迁移」与「目标语言生成保持」分离开。这种「同一算法、同一教师、同一超参,只变训练数据语言配比」的极简对照设计,正是本文能把现象讲清楚的关键——它排除了算法差异的干扰,让所有结论都归因到数据语言与 delta 信号这两个变量上。

方法步骤详情

流程拆为五步。一、数据准备:韩/日子集各抽约 33.3K、英文 33.3K 组成 100K 多语言集,另抽 100K 英文题组纯英语集,每条只留 question 字段。二、学生采样:给定问题 $x$,学生 $\pi_\theta$ 在当前策略生成回答 $y$。三、教师 delta 反馈:把 $(x,y)$ 送入教师 $\pi^*$ 及 base $\pi^*_{base}$,对每个 token $y_t$ 算 OPD2 奖励 $R_t = \log\pi^*(y_t|x,y_{ 之后)。

技术新颖性

技术新颖性需要客观看待:算法本体(OPD2)并非本文提出,而是沿用[4]的官方实现,所以本文的新颖性集中在「多语言实证 + 评测维度的扩展」而非新方法。具体体现在三点:其一,首次把 OPD/OPD2 系统放到英/韩/日三语数学推理场景下做对照实验,填补了「OPD 对东亚语言效果未知」的空白;其二,提出并量化了「目标语言响应率」这一评测维度,揭示英语单语训练虽能提升韩日准确率,却会让模型偏向用英语作答——这是把准确率提升与真正目标语言能力剥离的关键证据;其三,通过保持算法、教师、超参完全一致、只改变训练数据语言配比的对照设计,干净地把因果归因到「数据语言」与「delta 信号」上,方法学上比直接换模型/换算法更有说服力。这种「不造新轮子、但把评测做深做透」的实证贡献,正是这类短篇论文的典型价值所在。

实验结果

核心发现四层。一(Figure 1,non-thinking,PolyMath+Global-MGSM 平均):OPD/OPD2 全面提升——1.7B 上 OPD2 英文 55.1→63.6、韩 40.9→51.9、日 37.2→52.0;8B 英 62.8→70.5、韩 57.0→64.4、日 57.1→65.0,强模型仍显著受益。二(OPD2 vs OPD):OPD2 一致更优且韩日增益更大——1.7B 韩/日比 OPD 多 3.1/4.0 分,英文仅多 2.1;8B 韩/日多 3.3/3.1,英文仅多 0.7,证明 delta 信号在非英语上同等有效。三(Figure 2,英-韩差距,thinking):Base 在 Global-MGSM 差 13.4、HRM8K-GSM8K 差 12.1;OPD2 降到 9.3/9.2,七项基准六项缩小差距(仅 M-MMLU 维持 1.1)。四(Figure 3+Table 1,英语单语对照):纯英语 OPD2 把韩/日提到 52.6/53.4,与多语言 51.9/52.0 相当;但响应率崩塌——non-thinking 韩/日 90.5%→48.3%、90.9%→29.6%,thinking 97.6%→36.1%、95.2%→30.8%,说明英语单语能迁移准确率却无法保持目标语言生成。

Target-language response rates on PolyMath
Table 1: Target-language response rates on PolyMath
Performance comparison for OPD and OPD2
Figure 1: Performance comparison for OPD and OPD2
English–Korean accuracy gap
Figure 2: English–Korean accuracy gap
English-only OPD2 versus multilingual OPD2
Figure 3: English-only OPD2 versus multilingual OPD2
查看结构化数据
任务指标本文基线提升
多语言数学推理 (PolyMath + Global-MGSM 平均, non-thinking) 准确率 (points) Qwen3-1.7B OPD2: EN 63.6 / KO 51.9 / JA 52.0;Qwen3-8B OPD2: EN 70.5 / KO 64.4 / JA 65.0 Base Qwen3-1.7B: EN 55.1 / KO 40.9 / JA 37.2;Base Qwen3-8B: EN 62.8 / KO 57.0 / JA 57.1 1.7B 三语分别 +8.5 / +11.0 / +14.8;8B 三语分别 +7.7 / +7.4 / +7.9,日文在 1.7B 上提升最大(+14.8)
OPD2 相对 OPD 的额外增益 准确率差值 (points, OPD2 - OPD) Qwen3-1.7B: EN +2.1 / KO +3.1 / JA +4.0;Qwen3-8B: EN +0.7 / KO +3.3 / JA +3.1 原始 OPD(用学生-教师概率差做奖励) delta 信号在非英语语言上的增益普遍大于英语,1.7B 日文 +4.0、8B 韩文 +3.3 最为显著
英-韩语言鸿沟 (thinking 模式) EN-KO 准确率差 (points, 越小越公平) OPD2: Global-MGSM 9.3, HRM8K-GSM8K 9.2, PolyMath 5.0, KSM 缩小, M-MMLU 1.1(持平) Base: Global-MGSM 13.4, HRM8K-GSM8K 12.1, PolyMath 6.4, KSM 3.3 OPD2 在 7 项基准中 6 项缩小英韩差距,仅 M-MMLU 持平,缩小趋势比 OPD 更稳定一致
英语单语 vs 多语言 OPD2 的目标语言保持 (PolyMath) 目标语言响应率 (%) 多语言 OPD2: KO 90.5% / JA 90.9% (non-think), KO 97.6% / JA 95.2% (think) 英语单语 OPD2: KO 48.3% / JA 29.6% (non-think), KO 36.1% / JA 30.8% (think) 多语言训练在两种模式下都把韩日响应率维持在 90%+,英语单语则崩塌到 30%-48%,证明多语言数据对保持目标语言生成至关重要

局限与改进

作者明确承认的局限主要在于覆盖范围:实验只覆盖英/韩/日三种语言,且这三者同属高资源、文字体系相近(CJK)的语种,结论能否推广到更多语言家族、尤其是低资源或形态差异极大的语言,仍是开放问题;同时模型只用了 Qwen3 家族,跨模型族的普适性未验证。从本文自身内容看,还有几个值得指出的隐含局限:其一,所有主结果高度依赖 PolyMath 与 Global-MGSM 两个基准的平均,论文虽提及 HRM8K 和 MAWPS 但正文只展示了英-韩差距(Figure 2 用了 HRM8K),日文独立的 MAWPS 数字只在附录,主论据略偏窄;其二,训练只跑 100 个优化步,属于短训练,长训练下 OPD 与 OPD2 的差距是否会收敛或反转不得而知;其三,「目标语言响应率」的语言判定方法(用什么工具/模型判定语言)在正文未交代细节,而本文最核心的洞察恰恰依赖这个测量,判定不准会直接影响结论可信度。

独立分析的弱点

第一个弱点是「语言覆盖太窄」:仅英/韩/日三种语言且文化相近,无法回答 delta 信号对阿拉伯语、斯瓦希里语、印地语等更远语族是否有效——改进方向是扩展到至少跨 3-4 个语系的 10 种以上语言,并按资源量分层报告。第二个弱点是「模型单一」:只用 Qwen3 家族做学生/教师,无法排除 delta 信号效果是否依赖 Qwen3 特定的预训练-后训练配对——改进方向是引入 Llama、Gemma、Mistral 等其他家族做交叉验证。第三个弱点是「训练步数过短」:100 步优化可能只反映了早期训练动态,OPD 与 OPD2 的长期差距、是否过拟合、语言响应率随训练的漂移都未展示——改进方向是给出训练曲线(准确率/响应率 vs 步数),并在更长训练(如 1k-5k 步)下复测。第四个弱点是「核心测量工具不透明」:目标语言响应率是全文最关键的洞察,但语言判定方法(基于规则、fastText 还是 LLM 判定)未说明,判定边界(混入多少英文算「非目标语言」)也未定义——改进方向是开源判定脚本并报告判定的鲁棒性(如对混合语言回答的处理)。

未来方向

作者明确提出要继续探索 OPD 在更多语言上的扩展,并把多语言推理迁移与目标语言生成保持这一区分作为后续研究的基线。基于本文成果可延伸的方向至少有四条:其一,研究为何英语单语 OPD2 能迁移推理能力却不保持目标语言生成——是否因为 delta 信号 $\log\pi^* - \log\pi^*_{base}$ 主要编码了与语言无关的「推理模板」而把语言表层留给 base 模型?这值得做机制性分析(如探测/probing 实验)。其二,设计能在少量多语言数据下同时提升准确率与保持目标语言生成的方法,例如在奖励中加入显式的语言一致性约束项,或用混合策略(大部分英文 + 少量目标语言锚定数据)寻找帕累托最优。其三,把目标语言响应率纳入正式的多语言推理基准协议,推动社区不只看准确率。其四,验证 OPD2 在非数学任务(如多语言 QA、代码生成、摘要)上的多语言迁移规律,看「准确率可迁移、语言表层难保持」是否是普适现象。

复现评估

复现性总体较好。算法层面,作者用 OPD2 官方开源实现(github.com/naver-ai/opd2),超参沿用[4]配方,只改数据语言配比,门槛较低。模型层面,学生 Qwen3-1.7B/8B 与教师 Qwen3-30B-A3B-2507 均公开可取。数据层面,Nemotron-SFT-Multilingual-v2、Nemotron-Math-v2 与 PolyMath/Global-MGSM/HRM8K/MAWPS 均有公开版本,1:1:1 抽样与 100K 总量交代清楚。主要成本在算力:需同时加载 30B 教师+8B 学生做在线采样反馈,并跑两种模式、两组数据、两个学生,GPU 消耗不小。风险点是「目标语言响应率」的判定细节未公开,以及 batch size、采样温度等需查官方库才能还原,会略微影响 Table 1 数字的精确复刻。