← 返回 2026-08-12

开放大语言模型多语言机器翻译的无参考后训练 Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation

Chris Han, Pengzhi Gao, Pei Fu, Jian Luan 📅 2026-08-11 👍 14 2026-08-17 18:30
GRPO 在线策略蒸馏 多语言LLM 强化学习 机器翻译 检查点插值 质量估计

GRPO无参考奖励+SFT-RL插值,46语言翻译比肩GPT-5

前置知识

GRPO(组相对策略优化)

一种在线强化学习算法:对每个源句 $x$ 从旧策略 $\pi_{\theta_{old}}$ 采样 $G$ 个候选输出,用组内奖励的均值与标准差把奖励归一化为组相对优势 $\hat{A}_{i,t}$,再以 token 级重要性比率 $r_{i,t}(\theta)$ 配合 PPO 式裁剪(范围 $1-\epsilon$ 到 $1+\epsilon$)更新策略,并用 KL 惩罚项 $\beta D_{KL}(\pi_\theta \| \pi_{ref})$ 把策略拉向参考模型。相比 PPO 它不需要单独训练价值网络,组内相对比较即为基线。

本文的 RL 阶段完全建立在 GRPO 之上:$G=8$ 的 rollout 配置、基于组奖励均值/方差的数据过滤准则、verl 框架实现都围绕它展开,不理解 GRPO 就无法理解其训练目标与实验设置。

无参考质量估计(QE)模型

XCOMET2 与 COMETKiwi3 都是约 10B 参数的神经评价指标,只需输入源句和候选译文即可打分,完全不需要人工参考译文,且与人类判断高度相关(WMT23 指标共享任务验证)。本文奖励取两者平均 $\frac{1}{2}(s_X+s_K)$,评测时也用它们作 reference-free 指标。

无参考奖励是全文的立论前提:正因为 QE 不依赖参考译文,才能利用海量无对齐的源端文本做后训练;但 QE 估计器不完美又带来 reward hacking 风险,构成本文全部方法设计的出发点。

语言识别门控(LID gate)

用 OpenLID-v3 预测候选译文的语种 $\hat{\ell}(y)$:若 $\hat{\ell}(y)=\ell$(目标语种),奖励为两个 QE 分数的平均 $\frac{1}{2}(s_X+s_K)$;否则奖励直接置 0。它相当于在 QE 打分前加一道硬性语种过滤。

QE 模型可能给'流畅但语种错误'的输出打高分,这是无参考奖励下最典型的 reward hacking 形式;门控是本文封堵该漏洞的关键机制,也是理解奖励函数设计的必要概念。

SFT–RL 检查点线性插值

把监督微调权重 $\theta_{SFT}$ 与 RL 权重 $\theta_{RL}$ 按 $\theta_\alpha=\alpha\theta_{SFT}+(1-\alpha)\theta_{RL}$ 逐参数融合,$\alpha\in[0,1]$,无需任何额外训练即可得到介于两端点之间的一族模型,连续调节两者行为的混合比例。

RL 会使 spBLEU 下降(本文平均 $-1.21$ 点),插值是恢复词汇重叠、缓解奖励漂移的手段;最终模型 v1.0 取 $\alpha=0.5$,图 2 的权衡曲线和主结果都以此为核心。

在线策略蒸馏(OPD / PG-OPD)

与传统离线蒸馏不同,学生自己生成 rollout,教师在其诱导的状态 $s_t=(x,y_{<t})$ 上提供信号。策略梯度形式(PG-OPD)把逐 token 单样本反向 KL 估计 $D_t=\mathrm{sg}(\log\pi_\theta(y_t|s_t)-\log\pi_\phi(y_t|s_t))$ 取负号作为奖励 $r_t=-D_t$,交给与 QE-RL 相同的 GRPO 目标优化,总损失 $\mathcal{L}=\mathcal{L}_{policy}+\lambda\mathcal{L}_{distill}$。

第 5 节用 OPD 把 12B 教师的后训练收益迁移给 1B/4B 学生,是与'仅做 RL'工作相比的主要差异化实验;理解反向 KL 与逐 token 奖励化才能读懂 OPD 为何'到达但不超越'RL 前沿。

研究动机

高质量平行语料的稀缺与覆盖不均是监督式多语言机器翻译的根本瓶颈,尤其体现在低资源语言和非英语中心方向上:像 MiLMMT-46-v0.1 这样已在 46 种语言上完成监督微调的强模型,继续用监督学习提升时受制于平行数据的数量与分布。与之相对,源端单语文本在各语言中都远比对齐译文丰富且易收集,却没有成对的目标句可用于常规训练。强化学习似乎能绕开这一限制——QE 模型可对'源句+候选译文'无参考打分——但引入两个新问题:其一,QE 估计器不完美,会诱发 reward hacking,例如模型生成流畅却语种错误的文本来骗取高分;其二,纯 RL 优化无参考奖励会造成策略漂移,使输出偏离 SFT 阶段学到的行为,典型表现是参考式 spBLEU 显著下降。

本文的目标是本文的目标是证明:不使用任何参考译文,仅凭保留了翻译方向、丢弃了参考译文的源端句对,就能对开源 SFT 翻译模型做有效的序列级后训练,并系统回答三个问题。第一,由语言识别门控加双 QE 平均构成的奖励,能否在 1B、4B、12B 三个模型尺度上一致提升 WMT24++ 与 FLORES+ 上的学习式质量指标;第二,SFT–RL 检查点插值能否提供'无参考质量 vs 参考质量'之间的可控权衡,以极小代价恢复 RL 损失的 spBLEU;第三,在线策略蒸馏(OPD)能否把 12B 教师的后训练收益迁移给更小的学生模型,甚至拓展质量前沿。最终产出可开源的 MiLMMT-46-v1.0 系列模型。

与已有工作不同的是,已有工作 Tower+ 与 HY-MT2 也曾在多语言翻译上使用带精心设计奖励的 GRPO,但本文的切入角度有三点不同。首先,它把'无参考 RL'与'免训练的 SFT–RL 检查点插值'组合成完整配方,明确把插值当作质量权衡旋钮而非事后修补。其次,它针对 GRPO 依赖组内奖励方差这一性质设计了数据自过滤准则:用与训练相同的 rollout 配置预打分,只保留组奖励均值 $0.30<\mu_x<0.95$ 且标准差 $\sigma_x\ge0.05$ 的实例,从 263,982 条中筛出 31,572 条,保证训练信号充足。第三,作者把 PG-OPD 与 QE 奖励的 GRPO 统一进同一目标 $\mathcal{L}=\mathcal{L}_{policy}+\lambda\mathcal{L}_{distill}$、用同一批数据公平对照,得出'蒸馏只能到达而非超越 RL+插值前沿'这一对社区有定位价值的结论。

核心方法

直觉上,SFT 模型已经'会翻译',缺的是对'什么是好译文'的序列级反馈,而 QE 模型恰好能提供这种无参考反馈,只是需要防它被骗、防策略漂移。技术路线分四步。第一步构造 RL 数据:从 MiLMMT SFT 平行数据中仅保留源句与翻译方向、丢弃参考译文,得到 263,982 条、覆盖 192 个翻译方向的实例。第二步 GRPO 训练:奖励为语言门控后的 QE 平均 $\frac{1}{2}(s_X+s_K)$,每条实例采 $G=8$ 个候选,用 verl 框架配 vLLM rollout。第三步检查点插值:对 SFT 与 RL 权重做线性插值 $\theta_\alpha=\alpha\theta_{SFT}+(1-\alpha)\theta_{RL}$,三个尺度统一取 $\alpha=0.5$,得到 MiLMMT-46-v1.0。第四步对照实验:以 12B-v1.0 为教师,用 PG-OPD 向 1B/4B 学生做在线策略蒸馏,扫描蒸馏权重 $\lambda$,与 RL+插值的前沿比较。

核心创新有三点。其一是奖励设计:$\frac{1}{2}(s_X+s_K)$ 的双 QE 平均叠加 OpenLID-v3 语种门控(语种错误即 0 分),直接封堵'流畅但错语种'这一典型 reward hacking 通道。其二是 RL 数据自过滤:先用与训练一致的 rollout 配置给每条实例采 8 个候选并打分,只保留组均值 $0.30<\mu_x<0.95$ 且标准差 $\sigma_x\ge0.05$ 的样本——均值上下界剔除几乎全对或全错的实例,方差下界剔除组内无差异、GRPO 无训练信号的实例——最终留下 31,572 条(30,572 训练 + 1,000 验证)。其三是最关键的免训练技巧——SFT–RL 检查点插值:RL 端点把无参考指标推到最高但 spBLEU 下降,SFT 端点相反,插值提供单调权衡曲线,$\alpha=0.5$ 即可在参考 XCOMET 仅损失约 0.5 点的代价下恢复 2.79–4.21 点 spBLEU,把'质量-词汇重叠'变成开源可控的旋钮。

方法步骤详情

步骤一:保留 SFT 平行数据的源句与方向、丢弃参考译文,得 263,982 条、192 个方向;按训练 rollout 配置每条采 $G=8$ 候选打分,保留组均值 $0.30<\mu_x<0.95$、标准差 $\sigma_x\ge0.05$ 的实例,筛出 31,572 条。步骤二:三尺度用 verl+vLLM 训练,每实例采 8 个翻译,QE 由 XCOMET-XXL 与 COMETKiwi-XXL 打分、OpenLID-v3 判语种(错则 0),奖励 $R=\frac{1}{2}(s_X+s_K)$,KL 惩罚拉向 SFT 参考 $\pi_{ref}$,产出 v0.1-RL。步骤三:线性插值 SFT 与 RL 权重,三尺度统一取 $\alpha=0.5$ 得 v1.0。步骤四:以 12B-v1.0 为教师、学生自采样,逐 token 反向 KL 取负为奖励 $r_t=-D_t$,按 $\mathcal{L}=\mathcal{L}_{policy}+\lambda\mathcal{L}_{distill}$ 训练并扫描 $\lambda$。

技术新颖性

相对已有工作的差异体现在四个层面。(1) 与依赖参考译文的后训练不同,本文全程不需要参考译文,可直接利用无对齐源端数据,这对低资源语言和非英语中心方向有直接扩展意义。(2) 与 Tower+、HY-MT2 的 GRPO 相比,本文显式加入 LID 门控,并公开了基于组奖励统计量($\mu_x$、$\sigma_x$ 双阈值)的数据自过滤准则,这是把'GRPO 需要组内奖励方差才有梯度信号'这一性质工程化的具体做法,可被其他 RL 翻译工作直接复用。(3) 检查点插值本身不是新数学(类似模型汤/权重平均),但把它系统性地作为'无参考质量–参考质量'的连续调节旋钮、并给出三尺度一致的 $\alpha=0.5$ 经验规律($\alpha$ 超过 0.5 后 spBLEU 边际收益递减)是新的实证贡献。(4) 把 PG-OPD 与 QE-RL 统一进同一 GRPO 目标、同一数据同框比较,明确给出'OPD 到达但不超越'的结论,此前很少有工作做这种严格的路线对照。

Training and validation rewards during GRPO post-training at the 1B, 4B, and 12B scales. Validation rewards are evaluated every 50 training steps.
Figure 1: Training and validation rewards during GRPO post-training at the 1B, 4B, and 12B scales. Validation rewards are evaluated every 50 training steps.

实验结果

① 后训练增益:相对 v0.1,WMT24++ 三尺度无参考 XCOMET +2.75、COMETKiwi +2.44;FLORES+ 四方向平均参考 XCOMET +1.17、无参考 XCOMET +1.41、COMETKiwi +1.17,spBLEU -1.21。② 插值:α=0.5 较 RL 端点恢复 spBLEU +2.79/+3.70/+4.21(1B/4B/12B),参考 XCOMET 仅降 0.53/0.56/0.54。③ 46 语言:12B-v1.0 无参考分数于 WMT24++ 与四个 FLORES+ 方向组全部第一,超 Google Translate、Gemini 2.5/3 Pro、GPT-5;spBLEU 35.14 超 GPT-5 的 34.94;1B-v1.0 以 1/4 参数全指标超 TranslateGemma-4B;共享子集 16 项 XCOMET 赢 15 项。④ OPD:4B 学生达 34.17/90.82,逼近基线 33.96/90.91 未超越;λ=0.001 时 XCOMET 90.98→91.47、spBLEU 33.98→30.20。

Translation performance on WMT24++ and FLORES+. WMT24++ QE cells report reference-free XCOMET / COMETKiwi. For FLORES+, Ref. cells report spBLEU / reference-based XCOMET, while QE cells report reference-free XCOMET / COMETKiwi.
Table 1: Translation performance on WMT24++ and FLORES+. WMT24++ QE cells report reference-free XCOMET / COMETKiwi. For FLORES+, Ref. cells report spBLEU / reference-based XCOMET, while QE cells report reference-free XCOMET / COMETKiwi.
On-policy distillation from MiLMMT-46-12B-v1.0 into 1B and 4B students, averaged over 46 languages.
Table 2: On-policy distillation from MiLMMT-46-12B-v1.0 into 1B and 4B students, averaged over 46 languages.
Trade-off between spBLEU and reference-based XCOMET under SFT–RL checkpoint interpolation on FLORES+, averaged over four translation-direction groups: en→xx, xx→en, zh→xx, and xx→zh.
Figure 2: Trade-off between spBLEU and reference-based XCOMET under SFT–RL checkpoint interpolation on FLORES+, averaged over four translation-direction groups: en→xx, xx→en, zh→xx, and xx→zh.
查看结构化数据
任务指标本文基线提升
WMT24++ 无参考翻译质量(46 语言,en→xx,12B) reference-free XCOMET / COMETKiwi MiLMMT-46-12B-v1.0:87.88 / 84.06 Gemini 3 Pro:85.03 / 81.70;Google Translate:83.29 / 80.46;GPT-5:84.86 / 82.10 +2.85 / +2.36(vs 最强专有基线 Gemini 3 Pro),无参考分数在 46 语言块居首
FLORES+ 四方向平均 spBLEU(46 语言,12B) spBLEU 35.14 GPT-5:34.94;其余外部开源基线(NLLB-54.5B、TranslateGemma-27B 等)更低 +0.20(vs GPT-5),四个方向组中的三个超过 GPT-5,高于所有评测过的外部开源系统
SFT→RL 后训练增益(WMT24++,1B/4B/12B 三尺度平均) 无参考 XCOMET / COMETKiwi 提升量 +2.75 / +2.44 MiLMMT-46-v0.1(SFT 起点) 分尺度 XCOMET:1B +2.87、4B +2.59、12B +2.79,三尺度一致为正
SFT→RL 后训练增益(FLORES+,四方向三尺度平均) spBLEU / 参考XCOMET / 无参考XCOMET / COMETKiwi -1.21 / +1.17 / +1.41 / +1.17 MiLMMT-46-v0.1(SFT 起点) 学习式质量指标全面提升,仅依赖单一参考的词汇重叠指标 spBLEU 轻微下降
SFT–RL 检查点插值(α=0.5,FLORES+) spBLEU 恢复量 / 参考XCOMET 损失 1B +2.79、4B +3.70、12B +4.21 spBLEU;参考XCOMET 仅降 0.53 / 0.56 / 0.54 纯 RL 端点 MiLMMT-46-v0.1-RL 以不足 0.6 点参考 XCOMET 的代价恢复大部分 RL 期间损失的 spBLEU
在线策略蒸馏 OPD(4B 学生,FLORES+,init v0.1) spBLEU / 参考XCOMET OPD(init v0.1):34.17 / 90.82 MiLMMT-46-4B-v1.0:33.96 / 90.91 spBLEU +0.21、XCOMET $-0.09$:接近但未系统性超越 RL+插值前沿

局限与改进

作者承认并可观察到的局限有以下几点。(1) spBLEU 下降:纯 RL 检查点比 SFT 平均低 1.21 点,作者以'词汇重叠指标低估改写质量'为由弱化该信号,但 12B-v1.0 的 spBLEU(如 46 语言 en→xx 38.04)仍明显低于 Google Translate 的 42.90,说明参考式场景下与顶级系统仍有差距。(2) 训练奖励与评测指标同源:训练用 XCOMET2/COMETKiwi3,评测的主叙事也依赖同一对指标,对 QE 偏好的过拟合无法排除,且全文没有人工评测或 WMT 竞赛榜单的第三方验证。(3) 比较口径依赖子集:WMT24++ 剔除了低质量源句,各基线只在共享语言子集上比较,'领先'结论对子集选择敏感。(4) OPD 收益有限:蒸馏未能拓展质量前沿,暗示 12B 教师中含 QE 奖励无法以逐 token 信号表达的能力成分。(5) 规模上限:实验止步 12B,更大规模上的行为未知,也未触及多模态。

独立分析的弱点

独立分析可见的弱点及改进方向。(1) 奖励-评测循环:建议引入训练中未使用的第三方指标(如 BLEURT、人工直接评估)做解耦验证,并报告各指标间的相关性退化。(2) LID 门控只防'错语种',防不住同语种内的幻觉、漏译或复读,可叠加长度比、源-译一致性校验或多重门控。(3) 数据过滤丢弃近 88% 实例(263,982→31,572),双阈值是手工设定的,可改为可学习的样本权重或连续课程调度以保留更多信息。(4) 插值系数全局统一 $\alpha=0.5$,但不同语言/方向的最优权衡点可能不同,可做按语言、按层(layer-wise)插值或 MoE 式动态路由。(5) 评测仅用贪心解码,未考察采样+MBR 重排等推理侧技术与 RL 模型的组合收益。(6) PG-OPD 使用单样本反向 KL 估计,梯度噪声大且可能低估尾部差异,可尝试多样本估计、分布形式 GKD 的改进或温度校正后再评估'蒸馏是否真不能超越前沿'。

未来方向

作者明确提出的方向:构建更鲁棒、更符合人类偏好的奖励模型;把无参考后训练扩展到多模态多语言翻译;在更大模型规模上研究该配方的行为。基于本文成果可以自然延伸的方向:(1) 训练中动态调度插值系数 $\alpha$(如两阶段退火或基于验证奖励的自适应调节),把插值从后处理变为训练过程的一部分;(2) 把组奖励方差过滤准则上升为'奖励方差采样'的一般理论,与课程学习、数据选择文献对接;(3) 结合量化感知的 OPD,把 12B-v1.0 压缩到端侧小模型,这对小米的设备端翻译场景有直接应用价值;(4) 引入人类偏好数据,将 DPO/RLHF 偏好奖励与 QE 奖励混合,从机制上缓解 spBLEU 与学习式指标的错位;(5) 系统研究'无参考指标 vs 人工判断'的校准,检验 QE 奖励是否引入了系统性的风格偏移(如过度直译或过度流畅化)。

复现评估

开源情况良好:模型发布于 HuggingFace 的 xiaomi-research/milmmt-46 集合(1B/4B/12B 三尺度的 v1.0 与 v0.1-RL),代码在 github.com/xiaomi-research/gemmax;奖励所用的 XCOMET-XXL、COMETKiwi-XXL 与 LID 所用的 OpenLID-v3 均为公开模型;评测基准 FLORES+ 与 WMT24++ 公开可下载。复现难点:(1) RL 训练依赖 verl + vLLM 基础设施,12B 模型每实例 8 个 rollout 的 GRPO 成本可观,论文未披露 GPU 时数与硬件配置;(2) RL 数据与起点模型来自 MiLMMT SFT 数据集和 MiLMMT-46-v0.1,需确认其可获取性;(3) 数据过滤要求用与训练一致的 rollout 配置预打分,温度等采样细节需对齐附录 C 的超参表。总体评估:只复现评测与插值部分难度较低(普通单机多卡即可),完整复现 RL 训练需要较大算力,属中等偏上难度。