HOTFIXR:基于学生模型弱点反馈的定向多语言合成数据生成框架 LLMs Get Smarter from Targeted Synthetic Multilingual Data
以学生置信度与跨语言表征距离为奖励训练出题模型,兼顾多语言性能与一致性
前置知识
语言特定能力(LSC)与英语锚定
语言特定能力指同一个语义问题,用不同语言提问时模型会给出不同(甚至矛盾)的答案。其根源被追溯到英语主导的预训练语料:Wendler et al. (2024) 发现多语言模型在中间层会把潜在"思考"路由进英语表征空间,末层再切换回目标语言,英语因此成为内部表征的上限——能在英语里表达的概念更容易答对。
本文要解决的核心问题就是 LSC,HOTFIXR 的 LSI 奖励(隐状态余弦距离)正是对这种跨语言表征错位的直接度量,理解英语锚定假说才能理解奖励设计的动机。
GRPO(组相对策略优化)
GRPO 是 DeepSeekMath 提出的强化学习算法:对每个 prompt 采样一组 rollout,用每个 rollout 的奖励相对组内均值的优势(advantage)来更新策略,省去了 PPO 中的价值网络。本文用它优化的是"出题模型"而非答题模型——奖励来自学生模型对生成题目的反应。
HOTFIXR 的训练闭环完全建立在 GRPO 之上:出题模型每生成一道题,学生模型的 lingual deficit 分数就是奖励信号,不懂 GRPO 就无法理解出题模型如何"学会出难题"。
采集函数(acquisition function)与主动学习
主动学习中,采集函数用于衡量"哪个未标注样本最值得标注",常见策略如不确定性采样。本文借用了这个概念但换了用法:采集函数(lingual deficit)不再用于从固定数据池里挑选样本,而是作为 RL 奖励去训练一个生成模型,让模型主动"爬"向数据空间中缺陷值高的区域。
这是理解本文与数据筛选(Filtered 基线)本质区别的关键:筛选是被动地从已有数据中挑高分样本,HOTFIXR 是主动合成能激发弱点的全新样本,实验证明后者效果好得多(ID 56.2 vs 48.9)。
隐状态与余弦距离
Transformer 每一层对每个 token 都输出一个隐状态向量,最后一层隐状态常被视为模型对该位置的语义表征。余弦距离 $1 - \cos(u, v)$ 度量两个向量的方向差异,常用于比较语义表征的接近程度。本文提取学生模型在"最后一个推理 token"上的末层隐状态来比较两种语言的推理轨迹。
LSI 奖励的实现完全依赖隐状态余弦距离:同一问题用英语和用语言 L 推理,若末层表征相距很远,说明跨语言表征未对齐,该样本就值得进入训练集。
灾难性遗忘
指模型在微调到新任务/新分布后,原本掌握的通用能力大幅退化的现象。SFT 尤其容易引发:用 5000 条窄分布数据微调后,模型在其他任务和语言上的表现常常明显下滑。缓解手段包括混合回放数据、正则化约束、以及让训练数据本身更接近通用分布。
本文的核心卖点之一就是在 ID 任务提升的同时把 OOD 退化压到最低(任务 -0.9%、语言 -1.4%,而 SelectionGEN 语言上掉 12.5%),这是评估合成数据质量的重要维度。
Reward hacking(奖励作弊)
强化学习中策略找到奖励函数的漏洞、以非预期方式最大化奖励的现象。本文中具体表现为:出题模型训练步数过多后会收敛到某一个局部最优样本,推理时无论给什么 in-context 示例都反复生成同一道题,导致 5000 条训练数据全是同一题的复制,学生模型训练后彻底崩溃。
这是 HOTFIXR 工程上最微妙的坑,也是为什么训练集 $D_{QG}$ 只有 500 条、GRPO 只跑约 40 步——理解它才能理解方法超参选择的逻辑和该框架的脆弱性。
LLM-as-a-Judge(LAJ)
用一个(通常更强的)LLM 按评分标准给另一个模型的输出打分,替代人工评估。本文用 Prometheus-7b-v2.0 做 LAJ,对 MATH/CHAT 任务按 1-5 分打分(≥4 分算对),对翻译任务按 1-5 分评语义等价(≥80% ROUGE 或 ≥4 分算对)。
本文一半以上的评测指标(Nemotron MATH/CHAT、OPUS-100 翻译)依赖 LAJ,评估结论的可信度部分建立在 judge 的可靠性上,这也是读结果时需要保留的批判视角。
研究动机
多语言 LLM 存在语言特定能力(LSC)问题:对同一个语义查询,用不同语言提问会得到不同甚至错误的答案。根源在于预训练数据中英语占绝对主导,导致模型内部大量处理在英语空间中进行——Wendler et al. (2024) 证明模型在处理非英语文本时会先把理解"锚定"到英语,再切回目标语言作答,这使英语成为表征上限。作者用一组实验直观展示了这一现象(Figure 1):在多语言 HotPotQA(RAG 任务)上,英语主导预训练的 Qwen2.5-7B-Instruct 英语 pass@5 高达 84.3%,但中文、俄语、阿拉伯语掉到 65.7%、63.6% 附近;而刻意均衡 23 种语言预训练数据的 Cohere Aya-23-8B 各语言稳定在 69.3%–74.4% 之间,一致性更好,但英语峰值(69.3%)远不如 Qwen。这揭示了多语言困境的两难:要么为英语性能优化而牺牲非英语,要么为一致性优化而牺牲整体精度(Conneau et al. 2020 的"多语言诅咒"也表明加入更多语言会使总体性能趋于平台期)。现有缓解手段各有硬伤:智能提示依赖手工设计、跨模型不通用且对 prompt 风格敏感;对比学习需要高质量正负样本对和人工真值;架构级方案(如 LangBridge 用多语言模型提供嵌入)或精心构造多语言思维链微调成本高;而大多数多语言数据策展工作只做过滤和去重,属于被动筛选而非主动补弱。
本文的目标是本文从一个数据中心(data-centric)的视角出发提出折中路线:既然数据不平衡是错位根源,能否精心策划"后训练"数据,用一个模型教另一个模型,让它在六种语言(英、法、西、阿、葡、意)上都表现好、且不牺牲整体能力?具体目标是构建一个合成数据生成框架 HOTFIXR(Hardness-Optimized Training-data For Improving X-lingual Reasoning):训练一个"出题模型",让它依据学生模型的反馈信号,自动生成既能测出学生弱点、又附带可靠标签的多语言训练数据(5000 条),SFT 后学生模型在分布内任务上显著提升,同时在分布外任务和语言上几乎不发生灾难性遗忘。简言之,目标是在"英语路由"(性能好但丧失语言表达力)和"语言均衡训练"(一致但整体降级)之间走出第三条路:保语言表达力的同时双赢。
与已有工作不同的是,本文的独特切入是把"造什么训练数据"本身形式化为一个强化学习问题:不是从现有数据池里筛选(SelectionGT/Filtered 等被动方法),也不是让教师模型无视语言盲目按学生错误造数据(DataEnvGym),而是训练一个出题模型主动"爬山"——以学生模型的 lingual deficit 为奖励,用 GRPO 在数据空间中探测哪些样本最能激发学生的跨语言弱点(Figure 2 的直觉图)。奖励设计直接对准问题的理论根源:LAI(英语推理时的不确定性)捕捉"题目本身难不难",LSI(英语与目标语言推理轨迹的末层隐状态余弦距离)捕捉"跨语言表征是否错位",后者是把 Wendler 的英语锚定假说第一次直接转化为可优化的数据生成目标。另一个独特的实验设定是"自我教学":出题模型和学生模型是同一个 instruct 模型的两个微异实例(如 Qwen2.5-7B-Instruct 教 Qwen2.5-7B-Instruct),证明框架不依赖更大更强的心智模型,而是依赖针对性的信息注入。
核心方法
HOTFIXR 的整体思路可以先用直觉理解:把训练数据空间想象成一片地形,每个数据点的高度是它对学生的"信息量"(lingual deficit 分数),出题模型像一只探测器在这片地形上爬山,专门往能激发学生弱点的高峰区域生成数据。技术路线是一个四步闭环(受同作者的 AcquisitionSynthesis 启发):第一步,出题模型(初始化为与学生同款的指令模型,如 Qwen2.5-7B-Instruct)以 Nemotron-PTDv2 的种子样本为 in-context 参考,在指定语言(英/法/西/阿/葡/意轮换)下生成全新的 (问题, 推理, 答案) 三元组;第二步,学生模型对生成的问题作答两次——一次被要求"用英语推理"($R_{EN}$),一次被要求"用语言 L 推理"($R_L$),从中计算采集函数(lingual deficit = 语言无关缺陷 LAI + 语言特定缺陷 LSI);第三步,用 GRPO 以该分数为奖励更新出题模型参数;第四步,训练好的出题模型批量生成 5000 条数据集 $D_S$(六语言均衡),由 Qwen2.5-32B-Instruct 生成可靠标签,最后用 SFT 训练学生模型。整个过程的学生、出题器、标签模型分别取 7B/14B(Qwen2.5-Instruct)或 8B(Llama-3.1-Instruct)、同款模型、32B(Qwen2.5-Instruct)。
核心创新是 lingual deficit 奖励——它同时度量两类互补的弱点并把它们打包成一个可 RL 优化的标量。LAI(语言无关缺陷)衡量学生"在最强语言(英语)下都觉得难"的程度:用 token 级不确定度 $U(P, R) = 1 - \frac{1}{|R|}\sum_t p_\theta(R^{(1)}_t \mid P, R_{<t})$,即 1 减去每个位置最高概率 token 的平均概率,越不确定奖励越高。LSI(语言特定缺陷)衡量"换一种语言推理,内部表征就分叉"的程度:取 $R_{EN}$ 和 $R_L$ 各自最后一个推理 token(答案分隔符前那个 token)的最后一层隐状态,计算余弦距离,距离越大奖励越高——因为正确答案与推理语言无关,两条推理轨迹本应落在表征空间的邻近区域,相距远即代表跨语言表征错位。总奖励为 $\min(1, LAI) + \min(1, LSI)$。与已有方法的本质区别在于:它不需要任何人工标注的正确性判断( contrastive learning 需要正负对),不是逐题修错(DataEnvGym 针对特定数据集的错误),而是用学生模型的内部信号(置信度 + 表征几何)定位"又难、又跨语言不一致"的样本,从数据源头同时提升难度和对齐度。
方法步骤详情
完整流程如下。第一步(准备种子集 $D_{QG}$):从 Nemotron-PTDv2 的 STEM、MATH、CHAT 三个子集各取约 167 条、共 500 条样本,覆盖 agentic 推理、数学、对话三类任务。第二步(rollout 生成):以一条种子样本为 in-context 难度校准参考(附录 E 给出完整 prompt,要求生成 NEW、ORIGINAL、同等难度的新题,禁止复述改写),指定语言在英/法/西/阿/葡/意间轮换,出题模型生成包裹在特殊标记中的 (question, reasoning, answer) 三元组。第三步(采集函数打分):学生模型分别以"reason using English"和"reason using L"对生成的题目作答,L 在法/西/阿/葡/意间轮换;由 $R_{EN}$ 计算 LAI(token 概率不确定度),由 $R_{EN}$ 与 $R_L$ 在最后一个推理 token 上的末层隐状态余弦距离计算 LSI。第四步(GRPO 优化):以 $\min(1, LAI) + \min(1, LSI)$ 加格式奖励为 reward,用 GRPO 更新出题模型,只训练约 40 步、只用 500 条种子——多训会 reward hacking(生成器收敛到单一局部最优题反复输出)。第五步(批量造数):训练好的出题模型生成 5000 条数据集 $D_S$,六语言均衡。第六步(打标签):Qwen/Qwen2.5-32B-Instruct 为每条生成可靠的推理和答案(学生模型自己打标签的指令跟随能力不足,尤其无法稳定用指定语言输出,故用更大模型)。第七步(SFT 与评测):学生在 $D_S$ 上做 SFT,在 3 个分布内任务(Nemotron STEM/MATH/CHAT)和 3 个分布外任务(MMMLU、mHotPotQA、OPUS-100)、2 个分布外语言(德语、日语;RAG 任务为俄语、中文)上评测,所有结果为 3 次运行平均。成本:6 张 A100、约 8 小时训练出题器,约 0.96 分钟/训练样本,属一次性投入。
技术新颖性
技术新颖性体现在四个层面。其一,采集函数的角色转换:主动学习里 acquisition function 只用于从固定池选样本,本文把它升级为 RL 奖励去训练生成模型,实现从"被动筛选"到"主动合成"的跨越——消融意义上的对照是 Filtered 基线(用同样的 lingual deficit 给 1 万条真实数据排序取前 5000),其 ID 均分仅 48.9,远低于 HOTFIXR 的 56.2,直接证明合成的针对性数据优于筛选。其二,奖励的机理直指表征层:LSI 用隐状态几何距离而非表面答案一致性来定义跨语言缺陷,是对英语锚定假说的可操作化,这在此前的数据策展工作中没有先例。其三,奖励是 dataset-agnostic 的:出题器学到的是"学生的普遍弱点"而非"某个数据集上的错误模式",因此 OOD 任务泛化显著好于 DataEnvGym(OOD 任务上 HOTFIXR 64.7 vs 57.4)。其四,工程发现本身有贡献:作者系统记录了出题器的 reward hacking 模式(收敛到单一样本无限复制,即使更换 in-context 示例也输出同一题,导致学生训练后灾难性失败),并通过限制训练规模(500 样本、约 40 步 GRPO)规避——500 恰好是最大化奖励与避免作弊之间的甜点位。此外"同款模型自我教学"的设定也回答了一个重要问题:提升多语言能力未必需要更大的教师,需要的是定向的信息注入。
实验结果
实验覆盖 3 个学生模型(Qwen2.5-7B/14B-Instruct、Llama-3.1-8B-Instruct)、8 种方法(Base、EngReason、SelectionGT、SelectionGEN、Filtered、Untrained、DataEnvGym、HOTFIXR),除 Base 和 EngReason 外全部用 5000 条数据 SFT,结果取 3 次运行平均。发现一(分布内提升):HOTFIXR 相对 Base 总体提升 4.3%(Qwen7B +5.5%、Qwen14B +3.1%、Llama8B +4.4%),比最佳数据筛选方法高 6.0%,比最佳数据合成方法高 5.8%;Table 1 汇总 ID 均分 56.2,远高于 Base 的 51.9 和所有训练基线(48.9–50.4)。以 Figure 4 为例,Qwen7B 的 Nemotron STEM 准确率从 Base 的 56.4% 提到 62.2%,而所有基线都在 54.0%–57.0% 徘徊。发现二(OOD 任务遗忘最小):HOTFIXR 相对 Base 仅降 0.9%(三任务三模型平均),比其他训练基线平均好 5.6%,比 SelectionGT/SelectionGEN 好 6.4%,比 DataEnvGym 好 7.3%,比 Untrained 好 1.4%(说明合成数据本身无害但优化出题器仍必要,ID 上 HOTFIXR 比 Untrained 高 5.8%)。发现三(OOD 语言遗忘最小):Table 3 显示 HOTFIXR 相对 Base 平均仅 -1.4%(德 -2.6、日 -0.7、俄 -0.9、中 -1.3),而 SelectionGEN 掉 12.5%、DataEnvGym 掉 10.1%、Filtered 掉 9.9%——即 HOTFIXR 比 DataEnvGym 少遗忘 8.7%,比训练基线平均少遗忘 7.1%。发现四(多语言一致性):Table 4 的五种离散度指标(Range 19.4、Trimmed Range 14.6、Std 6.9、IQR 9.4、CV 0.11)均为数据生成方法中最优,也略好于 Base(如 Range 20.2、CV 0.12),一致性温和改善而非损害。发现五(奖励消融,Table 5):单独加 LAI 或 LSI 几乎无效(Qwen7B Nemotron:仅格式奖励 52.0,+LAI 50.9,+LSI 50.8),两者合并后跃升至 57.8(Qwen14B 58.3、Llama8B 52.5),证明难度信号和错位信号必须联合才有效。发现六(蒸馏对照,Table 10):用 Qwen32B 同时生成问题和标签(Distillation 32B)在 Qwen7B Nemotron 上只得 49.6(Base 52.3),而 HOTFIXR 得 57.8,说明增益主要来自定向出题而非更大模型的标签。发现七(持续学习,Figure 12):在已训练的学生上做第二轮 HOTFIXR(出题器从头训练),Qwen7B 在 Nemotron 任务再涨约 7%、OOD 任务再涨约 8%,seen 语言 +8% vs unseen 语言 +7%,框架可迭代叠加。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 分布内 Nemotron(STEM 准确率 / MATH 与 CHAT 为 LAJ,3 学生平均) | 平均分(%) | 56.2 | Base 51.9;最佳训练基线 Untrained 50.4;最佳筛选基线 SelectionGEN 50.2 | 相对 Base +4.3,相对训练基线平均 +6.0(9/9 设置全胜) |
| 分布外任务(MMMLU 事实 / mHotPotQA RAG / OPUS-100 翻译) | 平均分(%)(Accuracy / ROUGE-L / LAJ) | 64.7 | Base 65.6;最佳训练基线 Untrained 63.4;DataEnvGym 57.4 | 相对 Base 仅 -0.9(遗忘最小),相对训练基线平均 +5.6,相对 DataEnvGym +7.3 |
| 分布外语言(德/日/俄/中,跨模型跨任务平均) | 相对 Base 的性能变化(%) | -1.4(De -2.6 / Ja -0.7 / Ru -0.9 / Zh -1.3) | Untrained -3.1;Filtered -9.9;DataEnvGym -10.1;SelectionGEN -12.5 | 相对训练基线少遗忘 7.1%,相对 DataEnvGym 少遗忘 8.7% |
| 跨语言一致性(3 学生 × 3 多语言任务) | Range(最大-最小语言表现,%),越低越一致 | 19.4(Std 6.9 / IQR 9.4 / CV 0.11,均为生成类方法最优) | Base 20.2(Std 7.2 / CV 0.12);DataEnvGym 22.8 | 一致性温和优于 Base 与所有基线(Range -0.8,CV -0.01) |
| 奖励消融(Qwen7B,Nemotron 均分) | 平均分(%) | 57.8(+LAI+LSI) | 仅格式奖励 52.0;+LAI 50.9;+LSI 50.8 | 两个奖励分量单独无效、合并提升 5.8 点,证明组合必要性 |
局限与改进
作者明确承认三点局限:其一,语言覆盖限于高资源语言(英、法、西、德、日、葡、意,外加阿拉伯语),低资源语言需要特殊处理,留待未来工作;其二,研究只覆盖有明确对错的"可验证任务"(选择题、短答案、翻译),结论能否外推到开放式、不可验证的领域未知;其三,方法依赖强标签模型(Qwen2.5-32B-Instruct),作者试过让学生模型自己打标签,但它们的指令跟随能力不足(尤其无法稳定按提示语言输出标签),因此标签质量构成方法论上的外部依赖。我的补充观察:第一,ID 提升集中在 Nemotron 任务族上——这正是出题器的种子数据来源,而在同样属于 ID 语言但未见于种子的 MMMLU/翻译/RAG 上,HOTFIXR 相对 Base 有涨有跌(如 Qwen7B 事实 67.0→64.3,翻译 59.2→59.1,RAG 79.0→76.7),说明方法主要提升"被出题的任务域"而非全面通用能力;第二,一致性改善非常温和(spread 9.6→9.4),远达不到 EngReason 式的跨语言一致,作者也坦承目前不存在保证多语言一致性的 SOTA 数据策展法;第三,约一半指标依赖 LAJ(Prometheus-7B-v2.0),judge 自身的偏差会传导进结论,且 LAJ 打分 ≥4/5 即算对的二值化阈值较宽松;第四,reward hacking 靠"少训练"(500 样本、40 步)规避是经验性补丁而非机制性解决,限制了出题器的优化深度;第五,0.96 分钟/样本的生成成本若要造数十万级数据仍然昂贵;第六,8 个基线的强度不均——EngReason 无需训练就有 OOD 64.7 平起的表现,实际部署中"英语路由"仍是便宜的强基线。
独立分析的弱点
弱点一:"学生最强语言是英语"的假设内嵌于 LAI 设计(不确定性在英语推理下测量)。对英语能力本身较弱或以其他语言为中心的模型(如中文为中心的模型、低资源语言用户微调的模型),该假设失效,LAI 会系统性高估或错位。改进方向:先用小探针自动检测学生的最强语言,或对多个锚语言取平均不确定度。弱点二:LSI 只比较"英语 vs 单一语言 L"在最后一个推理 token 上的末层隐状态,粒度粗且位置单一——跨语言错位可能发生在早层、发生在推理中间步骤、或只影响特定 token 类型(数字、实体、习语),末端单点余弦距离可能漏检。改进方向:多层加权的表征距离、对推理链做逐 token 对齐后取显著差异位置的距离、或结合 probing 分类器直接度量概念一致性。弱点三:ID 评测任务(Nemotron STEM/MATH/CHAT)与出题器种子数据同源,存在"在评测域上出题"的循环风险,OOD 任务的提升部分被 ID 任务的窄化抵消。改进方向:引入与种子完全异构的 held-out 任务族做 ID 评测,或报告任务族间的迁移矩阵。弱点四:语言采样是均匀轮换,而非按学生的真实语言缺陷分布加权,对已经较强的语言浪费生成预算,对真正薄弱的语言又可能覆盖不足。改进方向:把 bandit/主动学习式语言选择并入 rollout 策略,按 per-language deficit 自适应分配采样。弱点五:防 reward hacking 靠限制训练步数,牺牲了出题器的优化深度;且生成多样性无显式保障,5000 条数据内部可能有语义重复。改进方向:在奖励中加入与已生成样本的最小距离正则(多样性奖励)、每步 rollout 后做 embedding 去重、或用更强的探索机制(如熵正则、基于外部记忆的去重)替代简单早停。
未来方向
作者提出的方向:一是把框架推进到预训练阶段——多语言表征主要在预训练期形成,若在预训练数据策展中引入 lingual deficit 信号,可能从根本上缓解英语锚定而非仅在末端修补;二是扩展到低资源语言,这需要对标签质量和评测基准做特殊设计;三是构建"合成 + 主动学习"闭环,让学生自己提出想被标注的问题,减少对 32B 标签模型的依赖并压低标注成本。基于本文成果可自然延伸的方向:其一,把 LAI/LSI 双信号从数据生成的奖励改造成偏好对(chosen/rejected)构造器,接入 DPO/RLHF 等偏好优化范式,可能比 SFT 更高效地利用同一信号;其二,与推理时方法正交结合——如用 HOTFIXR 训练的模型配合跨语言自洽性解码(对同一问题多语言采样后投票),验证数据层对齐与解码层对齐是否可叠加;其三,用 interpretability 工具(如 logit lens、跨语言概念神经元追踪)直接验证"LSI 高分样本训练后表征距离确实缩小",把相关性证据升级为因果证据;其四,探索防作弊的 RL 算法(多样性正则、基于信息增益的奖励)以允许出题器更深的优化,冲破 500 样本/40 步的天花板;其五,在真实业务多语言数据(客服、语音助手场景,契合 Uniphore 背景)上验证,检验从学术基准到产业的迁移。
复现评估
复现条件总体友好。开源情况:论文承诺接收后放出代码(撰写时未放出);但所有关键组件均可公开获得——种子数据 Nemotron-PTDv2(NVIDIA 开源)、标签模型 Qwen2.5-32B-Instruct、LAJ 评估器 Prometheus-7b-v2.0、评测集 MMMLU/mHotPotQA/OPUS-100 全部公开,附录 E 还完整给出了三类任务(MATH/STEM/CHAT)的出题 prompt。算力需求:训练出题器用 6 张 A100 约 8 小时(约 48 A100·时),批量生成 5000 条按 0.96 分钟/条约需 80 GPU·时,SFT 本身很轻,单节点 8×A100 的实验室规模完全可承担。数据量极小(500 条种子 + 5000 条生成),不涉及预训练。难度评估:中等。主要门槛不在算力而在实现细节:(1) 需要自己搭 GRPO 训练循环并接入"学生作答→隐状态提取→余弦距离"的奖励管道,隐状态要在答案分隔符前最后一个推理 token 上取末层,位置定义需严格对齐;(2) 对 reward hacking 高度敏感——复现者必须复刻 500 样本/约 40 步的超参组合,稍多训练生成器就会坍缩到单一样本,且这一现象的边界条件论文只给了经验描述;(3) 多语言评测流水线(含 LAJ 二值化阈值 ≥4/5、ROUGE ≥80% 的判定规则)需要按论文精确重建才能对齐数字。总体而言,对有多语言 SFT + RL 微调经验的团队约一到两周可复现核心结果;对个人研究者的主要成本是 A100 级算力和评测管道工程。
论文图表
柱状图对比 Qwen2.5-7B-Instruct(英语主导预训练)与 Aya-23-8B(语言均衡预训练)在多语言 HotPotQA 上的 pass@5(%),语言为英/中/俄/阿。Qwen 英语 84.3% 但非英语掉到 63.6%–65.7%;Aya 各语言 69.3%–74.4% 更一致但英语峰值低。
这是全文的问题陈述:一张图同时展示"英语主导→英语强但跨语言崩"与"均衡预训练→一致但峰值降"的多语言两难,是 HOTFIXR 要打破的 trade-off 的实验证据。