← 返回 2026-09-11

构建多语言桥梁:数据混合作为语内推理泛化的支柱 Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning

Mehrnaz Mofakhami, Ananya Sahu, Alejandro R. Salamanca, Daniel D'souza, Alexandre Berard, Thomas Euyang, Marzieh Fadaee, Julia Kreutzer 📅 2026-09-09 👍 16 2026-09-12 18:30
多语言推理 小模型 数据混合 监督微调 跨语言迁移

3.35B小模型靠三种数据混合训练,在60种语言上实现93%以上语内推理率

前置知识

SFT(监督微调)

用预先构造好的(提示,参考回答)数据对直接微调模型,让模型学会模仿参考输出。与强化学习不同,SFT 不需要奖励信号,训练稳定、成本可控,是后训练流水线中最常用的阶段。本文所有实验都在 SFT 阶段完成,通过控制训练数据的构成与配比来塑造模型行为,而非依赖 RL 的语言一致性奖励。

本文的核心主张是仅靠 SFT 数据混合就能教会模型在用户语言中推理,理解 SFT 的机制与批级配比控制是读懂其方法论和全部消融实验的前提。

L2 推理(语内推理)

指模型的思维链(推理轨迹)与用户提示使用同一种语言:用户用法语提问,模型的中间推理过程也用法语展开,而不是切换成英语。论文用 L2 推理率来量化——即推理轨迹被 FastText(GlotLID 兜底)判定为主导语言与提示语言一致的样本百分比,它是本文区别于以往工作的核心指标。

这是全文的目标行为与主评价指标,标题中的 in-language reasoning 即指此概念;'推理能力'与'推理语言'解耦的论证完全围绕它展开。

Translate-train(翻译训练)

多语言 NLP 的经典策略:把资源丰富的英文训练数据机器翻译成目标语言后参与训练,与推理时先翻译输入的 translate-test 相对。本文用它把数万 token 长的英文推理链翻译成 44 种语言,但每语言刻意只保留不到 5K 样本作为'稀缺种子',用来度量 L2 推理能泛化多远,而非指望覆盖每种语言。

MR 数据完全靠翻译生成,理解 translate-train 的成本与质量问题(长推理链翻译昂贵、错误易累积)是理解数据构建与过滤设计的关键。

语言强制(Language Forcing, LF)

推理时不改模型、只靠推理时干预诱导目标语言推理的技巧:或在用户消息前加'Think in the same language as the prompt'(user prefix LF),或预填推理轨迹开头的固定短语(thinking prefix LF,需要模型提供方做语言识别)。它是本文的主要对比基线,代表'不训练、只干预'的现状做法。

论文 4.1 节的核心论点是'强制不能替代训练':thinking prefix LF 虽能把 Qwen3.5-4B 的 L2 率抬到 87%-94%,但 PolyMath 和 MIST-OEG 准确率各掉约 12 点。理解 LF 才能读懂这组对比。

Doomlooping 与 4-gram 重复率

指推理模型陷入循环、反复生成相同 token 序列直到耗尽上下文预算而给不出答案的失败模式。论文用推理轨迹中重复 4-gram 的比例做代理指标:$\frac{\sum_{g:c_g>1}(c_g-1)}{\sum_g c_g}$,其中 $g$ 是不同的 4-gram、$c_g$ 是其出现次数。重复率随轨迹变长而升高,是退化生成而非深度思考的信号。

4.3 节用它揭示语言强制会让 Qwen3.5-4B 产生又长又重复的无效推理(Marco-Bench-MIF 上重复率超 0.6),而 Tiny Aya L2-Thinker 平均思考 token 少于 2000。

多语言诅咒(curse of multilinguality)

指多语言模型中不同语言竞争有限参数容量、增加语言数反而损害已有语言性能的现象(Conneau et al., 2020)。直觉上每加一种语言都会'稀释'模型已学到的能力,因此通常预期语言覆盖与单语言性能之间存在权衡。

论文 5.1 节用受控实验证明该诅咒对推理行为不成立——加语言不产生干扰反而单调提升未见语言的 L2 推理率,这是本文最重要的反直觉发现。

研究动机

推理语言模型的能力高度英语中心化:无论用户以何种语言提问,模型大多在内部切换为英语做思维链推理。这带来三重代价:一是内部翻译会丢失原语言的意图、细微差别与文化框架('lost in translation'),而跨语言理解正是多语言推理的主要瓶颈;二是文化知识与本地术语往往在对应语言中更易表达;三是非英语用户无法检查、审计模型的中间推理,这在医疗等高风险领域尤其危险。数据层面问题同样严重:主流开源推理数据集如 OpenThoughts3、Nemotron 第一版是纯英文,Nemotron v2 只翻译问答却把思维链留在英文;DeepSeek-R1、Qwen3 等甚至不披露推理数据的语言构成。推理时的语言强制(提示前加'Think in language X')对高资源语言勉强有效、对低资源语言效果差。Figure 1 显示即便 Command A+、DeepSeek-v4-Flash 等最强模型也无法完全语内推理,3-7B 规模的 Qwen3.5-4B、M-Thinker-7B 更难以同时保住准确率与 L2 推理率。

本文的目标是本文的目标是让 3.35B 的小型多语言模型 Tiny Aya 具备 L2 推理能力:推理轨迹的语言与用户提示语言一致,在提示与答案之间搭起'语内桥梁',同时任务准确率几乎不下降、语言覆盖尽可能广、推理 token 开销小。量化目标是:在横跨数学(MGSM、PolyMath)、常识与文化推理(GlobalPIQA、Macaron-MCQ)、本地化指令跟随(Marco-Bench-MIF)、开放式生成(MIST-OEG)的 6 个基准、60 种语言(含高低资源)上,L2 推理率超过 93%,且跨语言方差小。方法约束是数据中心的:不依赖 RL、不为每种语言准备大量原生推理监督,只系统研究 SFT 阶段应如何构成与调度数据。更深层的科学目标是验证一个命题:推理是与语言无关的行为,'用哪种语言推理'是可以通过少量多语言监督习得、并泛化到从未见过推理监督的语言的可控性质。

与已有工作不同的是,本文的切入角度是数据中心的泛化研究,与三条已有路线都不同。路线一保留英语推理、通过参数级桥接(层交换、模型融合、可学习映射层)改进非英语输入的处理,但从不报告推理轨迹的语言,迁移的只是答题准确率;路线二在推理时用语言强制控制思考语言,本质是把概率质量重新分配而不是注入能力,低资源语言下失败;路线三用带语言一致性奖励的 RL 训练(如 M-Thinker),成本高且语言覆盖窄(5 或 24 种语言)。本文则问:SFT 数据应如何构成与排布,才能让推理行为跨语言泛化?为此作者把'推理能力'与'推理语言'解耦——前者从海量英文推理数据习得,后者从少量翻译推理加大量便宜的多语言非推理数据习得——并把推理轨迹语言本身作为一等公民指标,系统做了语言覆盖、数据配比、组合策略(混合/顺序适配/权重合并)三组受控消融,这是此前文献没有给出过的系统证据。

核心方法

直觉是'会推理'和'用什么语言推理'可以分开教:英文推理数据教能力,多语言数据教语言选择。技术路线分四步。第一步基座准备:以支持 70+ 语言的 Tiny Aya 3.35B 为起点,把上下文从 8K 扩到 32K——训练中途回到冷却阶段,以 $1.25\times10^{-4}$ 起始的线性学习率衰减,8K 与 32K 序列按 3:1 交错、按域和长度分桶平衡。第二步构建三类数据:英文推理 ER(simple mix 约 170 万条,extended mix 另加约 45 万条更长轨迹);多语言推理 MR(把 ER 翻译成 44 种语言、每语言上限 5K,翻译前过滤易失真样本);非推理 NR(约 490 万条、覆盖全部 67 种语言的指令数据,附空思维块和直接回答标记)。第三步做批级混合的双模式 SFT。第四步在 6 基准 60 语言上用准确率、L2 推理率、4-gram 重复率 $\frac{\sum_{g:c_g>1}(c_g-1)}{\sum_g c_g}$ 和推理长度评估。

核心创新是'三支柱数据混合'配方:ER(英文推理)提供任务求解主干;MR(翻译的多语言推理,每语言少于 5K 条)直接监督目标语言内的推理;NR(多语言非推理指令数据,约 4.9M 条)是最便宜的杠杆——它带空思维块和特殊 token,教模型'输入语言到输出语言'的对齐,并把这种对齐迁移进推理模式。与已有工作的本质区别有三点。第一,不用 RL 语言一致性奖励,只靠 SFT 数据配比就实现 93% 以上的 L2 率,把多语言推理的成本从'每语言单独优化'降为'一次混合训练'。第二,把翻译推理当作刻意稀缺的种子:翻译数万 token 的长推理链既贵又易错,作者只用它度量泛化边界,让 NR 承担语言对齐的脏活。第三,组合方式上选择批内混合而非顺序适配或权重合并——消融显示合并会把各专家的语言条件化平均掉、推理退化回英语,顺序训练则损失准确率并引发语言混乱,混合给出最佳权衡且在 L2 失败时一致地优雅回退到英语推理。

方法步骤详情

步骤如下。第一步源数据过滤:要求英文样本的提示、推理链、回答均被判定为英文,去除代码切换、讨论翻译的轨迹、字数等翻译后易失真的约束。第二步翻译生成 MR:用 command-a-translate 和 DeepSeek-V3 翻译成 44 种语言,逐语言独立采样、每语言上限 5K;消融用 10 语言(德/法/日/韩/印地/孟加拉/阿拉伯/波斯/斯瓦希里/祖鲁),最终版覆盖 45 语言。第三步构造 NR:约 490 万条、覆盖基座全部 67 种语言,混合翻译指令数据、区域指令数据、Aya Collection 及少量合成 MCQA,附空思维块与直接作答 token。第四步长上下文训练:8K 扩到 32K,学习率 $1.25\times10^{-4}$ 起始线性衰减,8K:32K=3:1 交错。第五步批级混合 SFT:配比在 batch 层强制(如固定 MR 10%,NR 从 0% 扫到 40%,其余为 ER),比较相同训练步数的检查点。第六步评估:FastText(GlotLID 兜底)判推理链语言得 L2 率;MIST-OEG 用 GPT-4.1 按 4 个 rubric 评分。

技术新颖性

新颖性在于把多语言推理从'逐语言工程问题'重构为'SFT 数据混合下的泛化问题',并给出三组此前缺失的受控证据。其一,语言覆盖消融(Figure 6):1 语言专家、2 语言区域模型、全 10 语言联合模型对比,发现加语言不产生干扰,反而单调提升未见语言的 L2 推理率(MGSM 上 14%→35%→60%),把 Yang et al. 在 RL 设定下观察到的多语言推理迁移规律扩展到了 SFT。其二,NR 配比扫描(Figure 7):发现'少量非推理数据大有可为',0%→10% 使未见语言 L2 率 46%→89%、准确率 49%→67%,甜点在 20-30%,超过 40% 模型开始跳过思考。其三,组合策略对比(§5.4):首次系统证明合并专家模型会把语言条件化平均掉、顺序适配引发语言混乱、混合最稳健。此外,把'推理轨迹语言'作为一等指标、用 4-gram 重复率量化 doomlooping、揭示'长推理不等于深推理',都是评估方法学上的贡献。

Our contribution: Creating target-language bridges between prompts and responses by optimizing multilingual reasoning capabilities through data augmentation, data mixing and carefully calibrated fine-tuning
Figure 2: Our contribution: Creating target-language bridges between prompts and responses by optimizing multilingual reasoning capabilities through data augmentation, data mixing and carefully calibrated fine-tuning
Data composition of our multilingual reasoning data per Tiny Aya regions (Europe, Asia-Pacific, West Asia, Africa, South Asia) and data categories (Math, Science, and General)
Figure 3: Data composition of our multilingual reasoning data per Tiny Aya regions (Europe, Asia-Pacific, West Asia, Africa, South Asia) and data categories (Math, Science, and General)

实验结果

其一,主表(Table 1):Tiny Aya L2-Thinker 在 6 基准非英语平均 L2 推理率 93.8%-98.3%,准确率较英文推理版最多掉 2-3 点,仅 PolyMath 从 18.6% 降到 11.1%(缺 RL)。其二,语言强制不是替代:Qwen3.5-4B 的 LF 虽把 L2 率抬到 87%-94%,但 PolyMath/MIST 准确率各掉约 12 点。其三(Figure 6):语言覆盖 1→2→10 使未见 L2 率 MGSM 14→35→60及 GlobalPIQA 19→21→42,已见能力平稳,多语言诅咒不成立。其四(Figure 7):NR 0→10% 使 MGSM 未见 L2 率 46%→89%、准确率 49%→67%,甜点 20-30%。其五(Figure 8):数学准确率随英文主干上升,开放生成不敏感。其六(Figure 9):仅 ER 准确率 36.7%、L2 率 12.8%,加 MR 后 86.1%,加 NR 双升。效率上,思考 token 少于 2000,最低资源层 L2 率 94.5%,Magistral 从 72% 塌到 5%。

Task accuracy (Acc) and L2 reasoning rate (L2%) on English and averaged over all covered languages besides English for baselines and Tiny Aya L2-Thinker trained on 45 reasoning languages
Table 1: Task accuracy (Acc) and L2 reasoning rate (L2%) on English and averaged over all covered languages besides English for baselines and Tiny Aya L2-Thinker trained on 45 reasoning languages
Detailed statistics of the multilingual reasoning data (referenced in §3.3)
Table 3: Detailed statistics of the multilingual reasoning data (referenced in §3.3)
Seen and unseen language splits per benchmark used in the language coverage experiments (§5.1)
Table 4: Seen and unseen language splits per benchmark used in the language coverage experiments (§5.1)
4-gram repetition score as our doomlooping proxy versus mean number of thinking tokens (log scale) across six benchmarks
Figure 4: 4-gram repetition score as our doomlooping proxy versus mean number of thinking tokens (log scale) across six benchmarks
Efficiency and coverage of L2 reasoning LLMs across tiers of language resourcedness
Figure 5: Efficiency and coverage of L2 reasoning LLMs across tiers of language resourcedness
Effect of language coverage across MGSM, Marco-Bench-MIF, and GlobalPIQA
Figure 6: Effect of language coverage across MGSM, Marco-Bench-MIF, and GlobalPIQA
Effect of the multilingual non-reasoning data fraction (L2 reasoning fixed at 10%; the remainder is English reasoning)
Figure 7: Effect of the multilingual non-reasoning data fraction (L2 reasoning fixed at 10%; the remainder is English reasoning)
English-reasoning sweep, averaged over all languages (English and our 44 translated languages)
Figure 8: English-reasoning sweep, averaged over all languages (English and our 44 translated languages)
Task accuracy and L2 reasoning rate both evolve as we add relevant data pillars: ER (English Reasoning), MR (Multilingual Reasoning), and NR (Non-Reasoning)
Figure 9: Task accuracy and L2 reasoning rate both evolve as we add relevant data pillars: ER (English Reasoning), MR (Multilingual Reasoning), and NR (Non-Reasoning)
Trade-off between task accuracy and L2 reasoning rate for data mixing vs sequential adaptation vs model merging (Appendix G.1)
Figure 11: Trade-off between task accuracy and L2 reasoning rate for data mixing vs sequential adaptation vs model merging (Appendix G.1)
Fallback behavior when L2 reasoning fails: data mixing consistently falls back to English reasoning (Appendix G.2)
Figure 12: Fallback behavior when L2 reasoning fails: data mixing consistently falls back to English reasoning (Appendix G.2)
查看结构化数据
任务指标本文基线提升
多语言小学数学推理(MGSM,60 语言非英语平均) 任务准确率 / L2 推理率 68.0% / 96.5% En-Thinker(英文推理版)70.8% / 0.8%;M-Thinker-7B 38.0% / 87.8% L2 推理率从 0.8% 提升到 96.5%,准确率仅降 2.8 点;比 7B 的 M-Thinker 高 30 点准确率
竞赛级数学推理(PolyMath,三档难度加权) 任务准确率 / L2 推理率 11.1% / 94.9% Qwen3.5-4B (thinking prefix LF) 27.6% / 87.6%;En-Thinker 18.6% / 0.1% L2 率从约 0% 提升到 94.9%;准确率是主要代价,差距主要源于缺少 RL 阶段(英文版即落后 21.7 点)
开放Ended生成(MIST-OEG,GPT-4.1 四 rubric 评审) 评审分数(1-7 缩放至 0-100)/ L2 推理率 85.8 / 95.2% Qwen3.5-4B (LF) 67.7 / 93.3%;M-Thinker-7B 30.0 / 96.5% 比语言强制的 Qwen3.5-4B 高 18.1 分,比 M-Thinker-7B 高 55.8 分,且 L2 率相当
本地化指令跟随(Marco-Bench-MIF) 任务准确率 / L2 推理率 50.7% / 96.8% Qwen3.5-4B (LF) 33.8% / 82.3%;M-Thinker-7B 28.2% / 94.1%;Magistral-Small-24B 50.9% / 48.9% 比同规模 Qwen3.5-4B 高 16.9 点准确率且 L2 率高 14.5 点;与 24B 的 Magistral 准确率持平但 L2 率高出 47.9 点
文化常识推理(GlobalPIQA 非平行子集) 任务准确率 / L2 推理率 70.7% / 98.3% En-Thinker 72.3% / 28.4%;Magistral-Small-24B 77.1% / 49.0% 语内推理率提升近 70 点,准确率几乎不变,印证文化类任务最适合母语推理
文化多选推理(Macaron-MCQ,20 语言 22 文化维度) 任务准确率 / L2 推理率 39.8% / 93.8% En-Thinker 42.6% / 15.2%;M-Thinker-7B 32.7% / 87.7% L2 率从 15.2% 提升到 93.8%,准确率仅降 2.8 点且优于所有 L2 基线
数据配比消融(MGSM 未见语言) L2 推理率 / 任务准确率(NR 从 0% 加到 10%) 46% → 89% / 49% → 67% 不含 NR 数据的混合(0%):46% / 49% 10% 的非推理数据同时提升 L2 率 43 点、准确率 18 点,是最廉价高效的杠杆

局限与改进

作者承认三个局限。第一,依赖翻译推理链:多语言推理监督全部来自英文轨迹翻译,必然把推理风格、文化框架、问题分解方式锚定在英文模板上,低资源语言翻译质量退化,未必反映母语者自然的多步推理路径。第二,评估全靠自动代理:L2 率由 FastText/GlotLID 判定、开放式生成由 GPT-4.1 评审,没有对推理质量、流畅度、文化得体性做人评,度量的是'语言合规'而非推理深度与忠实性。第三,提示敏感:报告的 L2 率依赖训练中见过的'Think in the same language as the prompt'触发语,去掉可能回退英语,受限系统提示或混合语言输入场景会退化。此外我补充观察:缺 RL 阶段导致竞赛级数学明显落后(PolyMath 11.1% vs Qwen3.5-4B 的 40.3%,其中 21.7 点差距在英文推理版就存在);L2 率只看主导语言,不衡量推理连贯性与忠实度;评审模型 GPT-4.1 自身可能英语中心;NR 超 40% 引发跳过思考说明双模式存在内在冲突;且未涉及代码与 Agent 推理域。

独立分析的弱点

独立弱点分析如下。其一,翻译链质量控制薄弱:论文只做了源端过滤(去代码切换、翻译讨论、难保留约束),没有对翻译输出本身做质量评估,错误可能在数万 token 推理链中累积并破坏逻辑一致性。改进:用 COMET 类质量估计打分过滤、多翻译系统投票、回译校验。其二,对显式触发指令的依赖是隐性单点故障:部署时若系统提示不可控或输入混杂语言,L2 行为可能失效,论文未量化无触发语时的退化程度。改进:训练时随机化触发语、加入无触发混合、用显式语言条件 token。其三,数学深推理短板:PolyMath 11.1% 与 Qwen 差 29 点,纯 SFT 配方在高难推理上有天花板。改进:加带语言一致性奖励的 RL 阶段或对数学域做多语言 RLVR。其四,L2 率度量粗糙:FastText 判主导语言对代码切换和低资源语言不可靠,GPT-4.1 单一评审有偏。改进:token 级语言占比加权、人评校准子集、多评审集成。其五,45 种语言覆盖仍不及基座的 67 种,tier 4 低资源语言绝对准确率仍低,翻译成本随语言数线性增长。

未来方向

论文指出的方向包括:把'推理语言是可迁移行为'的命题推进为更精确的 scaling 规律(多少语言、多少数据才能覆盖一个给定的新语言);用原生多语言教师直接生成推理链替代翻译,摆脱英文模板锚定;在保持 L2 的同时引入 RL 提升数学等高难任务;利用可审计的母语推理链推动推理忠实性与推理轨迹分析研究。基于其成果可延伸的方向:其一,自动模式选择——NR 超 40% 时模型开始跳过思考,可研究按问题难度动态路由思考/直答的双模式机制;其二,与语言混合 CoT(英语骨架加目标语言关键术语)做系统取舍比较,为不同用户群体找最优混合策略;其三,把三支柱配方推广到安全对齐、工具调用、Agentic 任务等行为的跨语言迁移;其四,扩展到更多非洲、南亚低资源语言与方言,并定量刻画翻译质量与 L2 泛化的关系;其五,跨语言推理一致性研究——同一问题在不同语言下是否得到等价的推理路径与答案,与本文的 L2 率指标互补。

复现评估

开源情况较好:模型权重(tiny-aya-l2-thinker、tiny-aya-en-thinker、tiny-aya-base-32K)和多语言推理数据集(HuggingFace CohereLabs/tiny-aya-l2-thinker-multilingual-reasoning,44 语言、每语言上限 5K)都已发布;Table 3 给出数据统计、Table 4 给出 seen/unseen 划分、附录表 5-12 给出逐语言结果。NR 数据由公开数据集组合(Aya Collection、Dolci Instruct 等)原则上可重组,但部分合成数据与过滤细节需依赖论文描述。算力方面:3.35B 模型的 SFT 加 32K 长上下文训练属中等规模,但论文训练了大量消融变体(10 个单语言专家、5 个区域模型、多个配比扫描检查点),总预算不低;评估需 GPT-4.1 API 做 MIST-OEG 评审;翻译依赖 command-a-translate 与 DeepSeek-V3。整体复现难度中等偏高:核心结论有图表支撑、小规模验证可行,但复现完整数据管线工作量大。