构建多语言桥梁:数据混合作为语内推理泛化的支柱 Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning
3.35B小模型靠三种数据混合训练,在60种语言上实现93%以上语内推理率
前置知识
SFT(监督微调)
用预先构造好的(提示,参考回答)数据对直接微调模型,让模型学会模仿参考输出。与强化学习不同,SFT 不需要奖励信号,训练稳定、成本可控,是后训练流水线中最常用的阶段。本文所有实验都在 SFT 阶段完成,通过控制训练数据的构成与配比来塑造模型行为,而非依赖 RL 的语言一致性奖励。
本文的核心主张是仅靠 SFT 数据混合就能教会模型在用户语言中推理,理解 SFT 的机制与批级配比控制是读懂其方法论和全部消融实验的前提。
L2 推理(语内推理)
指模型的思维链(推理轨迹)与用户提示使用同一种语言:用户用法语提问,模型的中间推理过程也用法语展开,而不是切换成英语。论文用 L2 推理率来量化——即推理轨迹被 FastText(GlotLID 兜底)判定为主导语言与提示语言一致的样本百分比,它是本文区别于以往工作的核心指标。
这是全文的目标行为与主评价指标,标题中的 in-language reasoning 即指此概念;'推理能力'与'推理语言'解耦的论证完全围绕它展开。
Translate-train(翻译训练)
多语言 NLP 的经典策略:把资源丰富的英文训练数据机器翻译成目标语言后参与训练,与推理时先翻译输入的 translate-test 相对。本文用它把数万 token 长的英文推理链翻译成 44 种语言,但每语言刻意只保留不到 5K 样本作为'稀缺种子',用来度量 L2 推理能泛化多远,而非指望覆盖每种语言。
MR 数据完全靠翻译生成,理解 translate-train 的成本与质量问题(长推理链翻译昂贵、错误易累积)是理解数据构建与过滤设计的关键。
语言强制(Language Forcing, LF)
推理时不改模型、只靠推理时干预诱导目标语言推理的技巧:或在用户消息前加'Think in the same language as the prompt'(user prefix LF),或预填推理轨迹开头的固定短语(thinking prefix LF,需要模型提供方做语言识别)。它是本文的主要对比基线,代表'不训练、只干预'的现状做法。
论文 4.1 节的核心论点是'强制不能替代训练':thinking prefix LF 虽能把 Qwen3.5-4B 的 L2 率抬到 87%-94%,但 PolyMath 和 MIST-OEG 准确率各掉约 12 点。理解 LF 才能读懂这组对比。
Doomlooping 与 4-gram 重复率
指推理模型陷入循环、反复生成相同 token 序列直到耗尽上下文预算而给不出答案的失败模式。论文用推理轨迹中重复 4-gram 的比例做代理指标:$\frac{\sum_{g:c_g>1}(c_g-1)}{\sum_g c_g}$,其中 $g$ 是不同的 4-gram、$c_g$ 是其出现次数。重复率随轨迹变长而升高,是退化生成而非深度思考的信号。
4.3 节用它揭示语言强制会让 Qwen3.5-4B 产生又长又重复的无效推理(Marco-Bench-MIF 上重复率超 0.6),而 Tiny Aya L2-Thinker 平均思考 token 少于 2000。
多语言诅咒(curse of multilinguality)
指多语言模型中不同语言竞争有限参数容量、增加语言数反而损害已有语言性能的现象(Conneau et al., 2020)。直觉上每加一种语言都会'稀释'模型已学到的能力,因此通常预期语言覆盖与单语言性能之间存在权衡。
论文 5.1 节用受控实验证明该诅咒对推理行为不成立——加语言不产生干扰反而单调提升未见语言的 L2 推理率,这是本文最重要的反直觉发现。
研究动机
推理语言模型的能力高度英语中心化:无论用户以何种语言提问,模型大多在内部切换为英语做思维链推理。这带来三重代价:一是内部翻译会丢失原语言的意图、细微差别与文化框架('lost in translation'),而跨语言理解正是多语言推理的主要瓶颈;二是文化知识与本地术语往往在对应语言中更易表达;三是非英语用户无法检查、审计模型的中间推理,这在医疗等高风险领域尤其危险。数据层面问题同样严重:主流开源推理数据集如 OpenThoughts3、Nemotron 第一版是纯英文,Nemotron v2 只翻译问答却把思维链留在英文;DeepSeek-R1、Qwen3 等甚至不披露推理数据的语言构成。推理时的语言强制(提示前加'Think in language X')对高资源语言勉强有效、对低资源语言效果差。Figure 1 显示即便 Command A+、DeepSeek-v4-Flash 等最强模型也无法完全语内推理,3-7B 规模的 Qwen3.5-4B、M-Thinker-7B 更难以同时保住准确率与 L2 推理率。
本文的目标是本文的目标是让 3.35B 的小型多语言模型 Tiny Aya 具备 L2 推理能力:推理轨迹的语言与用户提示语言一致,在提示与答案之间搭起'语内桥梁',同时任务准确率几乎不下降、语言覆盖尽可能广、推理 token 开销小。量化目标是:在横跨数学(MGSM、PolyMath)、常识与文化推理(GlobalPIQA、Macaron-MCQ)、本地化指令跟随(Marco-Bench-MIF)、开放式生成(MIST-OEG)的 6 个基准、60 种语言(含高低资源)上,L2 推理率超过 93%,且跨语言方差小。方法约束是数据中心的:不依赖 RL、不为每种语言准备大量原生推理监督,只系统研究 SFT 阶段应如何构成与调度数据。更深层的科学目标是验证一个命题:推理是与语言无关的行为,'用哪种语言推理'是可以通过少量多语言监督习得、并泛化到从未见过推理监督的语言的可控性质。
与已有工作不同的是,本文的切入角度是数据中心的泛化研究,与三条已有路线都不同。路线一保留英语推理、通过参数级桥接(层交换、模型融合、可学习映射层)改进非英语输入的处理,但从不报告推理轨迹的语言,迁移的只是答题准确率;路线二在推理时用语言强制控制思考语言,本质是把概率质量重新分配而不是注入能力,低资源语言下失败;路线三用带语言一致性奖励的 RL 训练(如 M-Thinker),成本高且语言覆盖窄(5 或 24 种语言)。本文则问:SFT 数据应如何构成与排布,才能让推理行为跨语言泛化?为此作者把'推理能力'与'推理语言'解耦——前者从海量英文推理数据习得,后者从少量翻译推理加大量便宜的多语言非推理数据习得——并把推理轨迹语言本身作为一等公民指标,系统做了语言覆盖、数据配比、组合策略(混合/顺序适配/权重合并)三组受控消融,这是此前文献没有给出过的系统证据。
核心方法
直觉是'会推理'和'用什么语言推理'可以分开教:英文推理数据教能力,多语言数据教语言选择。技术路线分四步。第一步基座准备:以支持 70+ 语言的 Tiny Aya 3.35B 为起点,把上下文从 8K 扩到 32K——训练中途回到冷却阶段,以 $1.25\times10^{-4}$ 起始的线性学习率衰减,8K 与 32K 序列按 3:1 交错、按域和长度分桶平衡。第二步构建三类数据:英文推理 ER(simple mix 约 170 万条,extended mix 另加约 45 万条更长轨迹);多语言推理 MR(把 ER 翻译成 44 种语言、每语言上限 5K,翻译前过滤易失真样本);非推理 NR(约 490 万条、覆盖全部 67 种语言的指令数据,附空思维块和直接回答标记)。第三步做批级混合的双模式 SFT。第四步在 6 基准 60 语言上用准确率、L2 推理率、4-gram 重复率 $\frac{\sum_{g:c_g>1}(c_g-1)}{\sum_g c_g}$ 和推理长度评估。
核心创新是'三支柱数据混合'配方:ER(英文推理)提供任务求解主干;MR(翻译的多语言推理,每语言少于 5K 条)直接监督目标语言内的推理;NR(多语言非推理指令数据,约 4.9M 条)是最便宜的杠杆——它带空思维块和特殊 token,教模型'输入语言到输出语言'的对齐,并把这种对齐迁移进推理模式。与已有工作的本质区别有三点。第一,不用 RL 语言一致性奖励,只靠 SFT 数据配比就实现 93% 以上的 L2 率,把多语言推理的成本从'每语言单独优化'降为'一次混合训练'。第二,把翻译推理当作刻意稀缺的种子:翻译数万 token 的长推理链既贵又易错,作者只用它度量泛化边界,让 NR 承担语言对齐的脏活。第三,组合方式上选择批内混合而非顺序适配或权重合并——消融显示合并会把各专家的语言条件化平均掉、推理退化回英语,顺序训练则损失准确率并引发语言混乱,混合给出最佳权衡且在 L2 失败时一致地优雅回退到英语推理。
方法步骤详情
步骤如下。第一步源数据过滤:要求英文样本的提示、推理链、回答均被判定为英文,去除代码切换、讨论翻译的轨迹、字数等翻译后易失真的约束。第二步翻译生成 MR:用 command-a-translate 和 DeepSeek-V3 翻译成 44 种语言,逐语言独立采样、每语言上限 5K;消融用 10 语言(德/法/日/韩/印地/孟加拉/阿拉伯/波斯/斯瓦希里/祖鲁),最终版覆盖 45 语言。第三步构造 NR:约 490 万条、覆盖基座全部 67 种语言,混合翻译指令数据、区域指令数据、Aya Collection 及少量合成 MCQA,附空思维块与直接作答 token。第四步长上下文训练:8K 扩到 32K,学习率 $1.25\times10^{-4}$ 起始线性衰减,8K:32K=3:1 交错。第五步批级混合 SFT:配比在 batch 层强制(如固定 MR 10%,NR 从 0% 扫到 40%,其余为 ER),比较相同训练步数的检查点。第六步评估:FastText(GlotLID 兜底)判推理链语言得 L2 率;MIST-OEG 用 GPT-4.1 按 4 个 rubric 评分。
技术新颖性
新颖性在于把多语言推理从'逐语言工程问题'重构为'SFT 数据混合下的泛化问题',并给出三组此前缺失的受控证据。其一,语言覆盖消融(Figure 6):1 语言专家、2 语言区域模型、全 10 语言联合模型对比,发现加语言不产生干扰,反而单调提升未见语言的 L2 推理率(MGSM 上 14%→35%→60%),把 Yang et al. 在 RL 设定下观察到的多语言推理迁移规律扩展到了 SFT。其二,NR 配比扫描(Figure 7):发现'少量非推理数据大有可为',0%→10% 使未见语言 L2 率 46%→89%、准确率 49%→67%,甜点在 20-30%,超过 40% 模型开始跳过思考。其三,组合策略对比(§5.4):首次系统证明合并专家模型会把语言条件化平均掉、顺序适配引发语言混乱、混合最稳健。此外,把'推理轨迹语言'作为一等指标、用 4-gram 重复率量化 doomlooping、揭示'长推理不等于深推理',都是评估方法学上的贡献。
实验结果
其一,主表(Table 1):Tiny Aya L2-Thinker 在 6 基准非英语平均 L2 推理率 93.8%-98.3%,准确率较英文推理版最多掉 2-3 点,仅 PolyMath 从 18.6% 降到 11.1%(缺 RL)。其二,语言强制不是替代:Qwen3.5-4B 的 LF 虽把 L2 率抬到 87%-94%,但 PolyMath/MIST 准确率各掉约 12 点。其三(Figure 6):语言覆盖 1→2→10 使未见 L2 率 MGSM 14→35→60及 GlobalPIQA 19→21→42,已见能力平稳,多语言诅咒不成立。其四(Figure 7):NR 0→10% 使 MGSM 未见 L2 率 46%→89%、准确率 49%→67%,甜点 20-30%。其五(Figure 8):数学准确率随英文主干上升,开放生成不敏感。其六(Figure 9):仅 ER 准确率 36.7%、L2 率 12.8%,加 MR 后 86.1%,加 NR 双升。效率上,思考 token 少于 2000,最低资源层 L2 率 94.5%,Magistral 从 72% 塌到 5%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 多语言小学数学推理(MGSM,60 语言非英语平均) | 任务准确率 / L2 推理率 | 68.0% / 96.5% | En-Thinker(英文推理版)70.8% / 0.8%;M-Thinker-7B 38.0% / 87.8% | L2 推理率从 0.8% 提升到 96.5%,准确率仅降 2.8 点;比 7B 的 M-Thinker 高 30 点准确率 |
| 竞赛级数学推理(PolyMath,三档难度加权) | 任务准确率 / L2 推理率 | 11.1% / 94.9% | Qwen3.5-4B (thinking prefix LF) 27.6% / 87.6%;En-Thinker 18.6% / 0.1% | L2 率从约 0% 提升到 94.9%;准确率是主要代价,差距主要源于缺少 RL 阶段(英文版即落后 21.7 点) |
| 开放Ended生成(MIST-OEG,GPT-4.1 四 rubric 评审) | 评审分数(1-7 缩放至 0-100)/ L2 推理率 | 85.8 / 95.2% | Qwen3.5-4B (LF) 67.7 / 93.3%;M-Thinker-7B 30.0 / 96.5% | 比语言强制的 Qwen3.5-4B 高 18.1 分,比 M-Thinker-7B 高 55.8 分,且 L2 率相当 |
| 本地化指令跟随(Marco-Bench-MIF) | 任务准确率 / L2 推理率 | 50.7% / 96.8% | Qwen3.5-4B (LF) 33.8% / 82.3%;M-Thinker-7B 28.2% / 94.1%;Magistral-Small-24B 50.9% / 48.9% | 比同规模 Qwen3.5-4B 高 16.9 点准确率且 L2 率高 14.5 点;与 24B 的 Magistral 准确率持平但 L2 率高出 47.9 点 |
| 文化常识推理(GlobalPIQA 非平行子集) | 任务准确率 / L2 推理率 | 70.7% / 98.3% | En-Thinker 72.3% / 28.4%;Magistral-Small-24B 77.1% / 49.0% | 语内推理率提升近 70 点,准确率几乎不变,印证文化类任务最适合母语推理 |
| 文化多选推理(Macaron-MCQ,20 语言 22 文化维度) | 任务准确率 / L2 推理率 | 39.8% / 93.8% | En-Thinker 42.6% / 15.2%;M-Thinker-7B 32.7% / 87.7% | L2 率从 15.2% 提升到 93.8%,准确率仅降 2.8 点且优于所有 L2 基线 |
| 数据配比消融(MGSM 未见语言) | L2 推理率 / 任务准确率(NR 从 0% 加到 10%) | 46% → 89% / 49% → 67% | 不含 NR 数据的混合(0%):46% / 49% | 10% 的非推理数据同时提升 L2 率 43 点、准确率 18 点,是最廉价高效的杠杆 |
局限与改进
作者承认三个局限。第一,依赖翻译推理链:多语言推理监督全部来自英文轨迹翻译,必然把推理风格、文化框架、问题分解方式锚定在英文模板上,低资源语言翻译质量退化,未必反映母语者自然的多步推理路径。第二,评估全靠自动代理:L2 率由 FastText/GlotLID 判定、开放式生成由 GPT-4.1 评审,没有对推理质量、流畅度、文化得体性做人评,度量的是'语言合规'而非推理深度与忠实性。第三,提示敏感:报告的 L2 率依赖训练中见过的'Think in the same language as the prompt'触发语,去掉可能回退英语,受限系统提示或混合语言输入场景会退化。此外我补充观察:缺 RL 阶段导致竞赛级数学明显落后(PolyMath 11.1% vs Qwen3.5-4B 的 40.3%,其中 21.7 点差距在英文推理版就存在);L2 率只看主导语言,不衡量推理连贯性与忠实度;评审模型 GPT-4.1 自身可能英语中心;NR 超 40% 引发跳过思考说明双模式存在内在冲突;且未涉及代码与 Agent 推理域。
独立分析的弱点
独立弱点分析如下。其一,翻译链质量控制薄弱:论文只做了源端过滤(去代码切换、翻译讨论、难保留约束),没有对翻译输出本身做质量评估,错误可能在数万 token 推理链中累积并破坏逻辑一致性。改进:用 COMET 类质量估计打分过滤、多翻译系统投票、回译校验。其二,对显式触发指令的依赖是隐性单点故障:部署时若系统提示不可控或输入混杂语言,L2 行为可能失效,论文未量化无触发语时的退化程度。改进:训练时随机化触发语、加入无触发混合、用显式语言条件 token。其三,数学深推理短板:PolyMath 11.1% 与 Qwen 差 29 点,纯 SFT 配方在高难推理上有天花板。改进:加带语言一致性奖励的 RL 阶段或对数学域做多语言 RLVR。其四,L2 率度量粗糙:FastText 判主导语言对代码切换和低资源语言不可靠,GPT-4.1 单一评审有偏。改进:token 级语言占比加权、人评校准子集、多评审集成。其五,45 种语言覆盖仍不及基座的 67 种,tier 4 低资源语言绝对准确率仍低,翻译成本随语言数线性增长。
未来方向
论文指出的方向包括:把'推理语言是可迁移行为'的命题推进为更精确的 scaling 规律(多少语言、多少数据才能覆盖一个给定的新语言);用原生多语言教师直接生成推理链替代翻译,摆脱英文模板锚定;在保持 L2 的同时引入 RL 提升数学等高难任务;利用可审计的母语推理链推动推理忠实性与推理轨迹分析研究。基于其成果可延伸的方向:其一,自动模式选择——NR 超 40% 时模型开始跳过思考,可研究按问题难度动态路由思考/直答的双模式机制;其二,与语言混合 CoT(英语骨架加目标语言关键术语)做系统取舍比较,为不同用户群体找最优混合策略;其三,把三支柱配方推广到安全对齐、工具调用、Agentic 任务等行为的跨语言迁移;其四,扩展到更多非洲、南亚低资源语言与方言,并定量刻画翻译质量与 L2 泛化的关系;其五,跨语言推理一致性研究——同一问题在不同语言下是否得到等价的推理路径与答案,与本文的 L2 率指标互补。
复现评估
开源情况较好:模型权重(tiny-aya-l2-thinker、tiny-aya-en-thinker、tiny-aya-base-32K)和多语言推理数据集(HuggingFace CohereLabs/tiny-aya-l2-thinker-multilingual-reasoning,44 语言、每语言上限 5K)都已发布;Table 3 给出数据统计、Table 4 给出 seen/unseen 划分、附录表 5-12 给出逐语言结果。NR 数据由公开数据集组合(Aya Collection、Dolci Instruct 等)原则上可重组,但部分合成数据与过滤细节需依赖论文描述。算力方面:3.35B 模型的 SFT 加 32K 长上下文训练属中等规模,但论文训练了大量消融变体(10 个单语言专家、5 个区域模型、多个配比扫描检查点),总预算不低;评估需 GPT-4.1 API 做 MIST-OEG 评审;翻译依赖 command-a-translate 与 DeepSeek-V3。整体复现难度中等偏高:核心结论有图表支撑、小规模验证可行,但复现完整数据管线工作量大。
论文图表
各模型在四个基准上任务性能与 L2 推理率的联合对比图(GPT-4.1 作评审,所有模型都在用户提示前加 L2 推理短语)。显示 M-Thinker-7B、R1-Distill-Qwen-7B-Multilingual、Magistral-Small-24B、Command A+ 等专为 L2 推理训练的模型也远达不到完美语内推理,而 3.35B 的 Tiny Aya L2-Thinker 以小得多的规模取得可观分数。
一图看清问题空间与竞争格局,直观说明为什么在 3-7B 规模同时做到任务准确与语内推理非常困难,是引出全文动机的关键。