← 返回 2026-08-21

用低资源语言思考:SFT 建立什么、RL 修复什么、准确率看不见什么 Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See

Ayoub Kirouane, Christos Petrocheilos 📅 2026-08-18 👍 15 2026-08-26 18:30
LoRA MoE RLVR 低资源语言 实验方法论 希腊语NLP 推理微调 行为评测 评测噪声

SFT 让模型改用希腊语推理,RLVR 修好格式缺陷,而准确率基准被 7.7 分种子噪声淹没

前置知识

SFT(监督微调)

用(输入, 目标输出)成对数据继续训练预训练模型:对每条样本计算输出序列的负对数似然损失并反向传播,让模型模仿目标分布。本文在 118,092 行希腊语语料(推理半 + 直接半)上用 LoRA 做 SFT,目标是安装「用希腊语出声推理」这一行为。

论文标题前半「SFT 建立什么」就是对 SFT 能力边界的系统实测:它能装上语言习惯与语法,却修不好自身引入的格式回退与答案泄漏缺陷。

LoRA 低秩适配

冻结原模型权重,只训练注入目标层的低秩分解 $\Delta W = BA$(秩 $r \ll d$)。本文取 $r=32$、$\alpha=64$、学习率 $2\times10^{-4}$,适配器按专家步长 3 放置(每隔三个 MoE 层一个),共享专家永远包含。适配器挂载方式取决于专家的存储形态:Qwen 融合张量用 target_parameters(28 个张量),NemotronH 逐专家物化出 4,188 个张量。

所有结论的适用域都被 Limitations 限定为「LoRA on MoE」:种子方差可能有路由放大机制,稠密模型上 LoRA 触及每一层 FFN,行为可能不同。

MoE(混合专家)与激活参数

把前馈层替换为路由器加多个专家,每 token 只激活 $k/E$ 个专家;服务成本由激活参数(非路由参数 + $k/E \times$ 路由参数)决定,与总参数解耦。本文三家族激活参数 3.58–3.97B、总参 20.9–36.0B,路由分别是 8/256(Qwen)、4/32(Gpt-OSS)、6/128(Nemotron)。

论文按激活参数固定服务预算来选模型、按部署账单比较成本;不理解总参 1.7 倍差 vs 激活 11% 差这一对比,就读不懂 Table 1 和按家族符号分裂的 token 成本结论。

RLVR 与 GRPO

RLVR 用可验证奖励(正确性、格式、语言一致等确定性检查项,无需学习型奖励模型或 LLM 评审)做强化学习;GRPO 对每个提示采样一组补全(本文 8 个),用组内相对优势更新策略,本文不设 KL 项($\beta=0$)、学习率 $10^{-6}$、温度 0.7、补全预算 1,536 token。

论文预注册的 RLVR 轮回答「RL 修复什么」:四个奖励臂加随机奖励对照的设计,以及冻结于训练前的决策规则,是全文最严格的一组证据。

思维链轨迹与轨迹保真度

推理模型在最终答案前生成的可见推理文本称为轨迹(trace)。轨迹语言保真度定义为剥离代码与 LaTeX 后的希腊字母占比 $g(t) = \frac{|GR(t)|}{|GR(t)| + |LA(t)|}$;句级切换探针则对约 150 条轨迹逐句手工标注语言,以捕捉轨迹中途的「语言岛」(逐轨迹比例看不见它)。

「模型用哪种语言思考」是本文的第一等因变量:基座 0/1,000 条轨迹达到 $g\ge0.9$,微调后 97.4–98.7%,这是论文最大、最稳的效应。

种子方差与噪声底线

只改随机种子(LoRA A 矩阵初始化与数据打乱顺序)重训同一配置,所得分数的分布就是「什么都不做」的零假设带,任何效应都必须与之对照。要在 5% 显著性、90% 功效下检出差异 $\Delta$,每组约需 $n \gtrsim 2\left(\frac{(z_{\alpha/2}+z_\beta)\sigma}{\Delta}\right)^2$ 个种子。

本文测得 sd 4.4 pp、极差 7.7 pp,超过所有数据与配方效应——这是「准确率看不见」这一标题论断的直接证据,也解释了为什么行为维度才是可靠的测量对象。

数据污染与 n-gram 检查

评测题与训练文本共享长片段(本文用 13-gram 表面匹配)会让分数虚高,属于记忆而非推理;该方法的已知盲区是释义改写,对翻译语料尤其危险。检查还必须在训练语料涉及的所有语言上双向运行。

论文发现逻辑轴 38.9% 被污染(移除后各臂移动 0.7–22.2 pp),并揭示一个检查抓不到的新机制:评测翻译者与训练轨迹生成者是同一个商用模型家族,造成语域层面的隐性优势。

STaR 式答案门控

让 LLM 对每道题用目标语言重新解题并生成轨迹,仅当终答与金答案一致才保留该轨迹,错误轨迹直接丢弃而非修复(错误轨迹会教坏推理),本文典型产率 60–95%。配套的轨迹结构评分 $S = 0.40b + 0.25v + 0.25p + 0.10\ell$ 度量回溯、验证、流畅散文与长度。

98.5% 的希腊语推理语料靠它合成;翻译出来的人类轨迹 $S=0.27$(全是无回溯的整齐解说)对比重新生成的 $S=0.68$,说明「轨迹结构而非内容」才是有效信号。

分词器生育率(fertility)

每个词平均被切成的 token 数。希腊语在三个家族上都是英语的 2.32–2.51 倍,意味着同样 token 预算下希腊语的天花板更紧,词数上的节省必须先偿还这笔「生育率税」才可能变成真正的服务成本节省。

它是所有成本数字背后的隐形之手:Qwen 微调版每正确答案省 3.0 倍 token,NemotronH 打平(1.07 倍),Gpt-OSS 反而贵 1.6 倍——同一个配方,token 结论按家族变号。

研究动机

现有做法把推理微调的成败简化为一个准确率数字(微调前后各一个数)。对低资源语言,这个数字回答的是没人问的问题:它不说模型用哪种语言推理、烧多少 token、能否区分难题与易题、为此牺牲了什么。具体到希腊语:这个 EU 官方语言已有 Meltemi、Krikri 专用开源模型和成套翻译评测,但没有任何已发布 checkpoint 会用希腊语出声推理(基座在 1,000 条用户轨迹中 0 条达到希腊字符占比 0.9,中位占比仅 0.33,是英语脚手架的混合文字),也没有任何希腊语基准能区分「用希腊语推理的模型」与「用英语规划、结尾再翻译的模型」。更糟的是作者发现该规模的准确率评测本身近乎噪声:仅改变随机种子,分数就移动 7.7 分,超过他们测过的所有数据与配方效应;逻辑轴 38.9% 的题目与训练池共享 13-gram 而被污染;基座 Qwen 在 1,536 token 预算下 670/1,000 行永远产不出最终答案(得分 20.8,预算放到 4,096 才到 77.2),任何与它对比的标准评测测的都是预算而非能力。

本文的目标是本文的目标是把「让模型用希腊语思考」做成一个可安装、可测量、可修复的工程对象,并为低资源语言推理微调建立一套测量科学。具体包括:在固定每 token 激活参数(3.6–4.0B,即同等服务账单)的硬约束下,对来自 Alibaba、OpenAI、NVIDIA 的三个前沿稀疏 MoE 家族(四个 checkpoint)跑同一套配方、语料与仪器,从而把「微调做什么」与「某个架构恰好做什么」分开;在一切消融之前先测种子噪声底线;定义六个行为维度(推理语言保真度、推理预算、终止、推理步数、预算超支、正确率),每个都经过与轨迹长度的相关性门控;回答三个预注册问题(英语推理是否丢失、通用能力是否受损、直接模式是否还能用);最后预注册一轮 RLVR,验证强化学习能否修复 SFT 无法自修复的缺陷(格式回退、答案泄漏、指令服从),并确认纯准确率梯度不会侵蚀刚装上的语言属性。

与已有工作不同的是,本文的独特切入有四点。第一,把「模型用哪种语言推理、花多少预算、能否分辨难易、忘了什么」当作一等公民来测量,而不是准确率的附属品,且每个候选指标都要通过与轨迹长度相关性 $|r|\ge0.6$ 的门控(7 个原始维度因此被删掉 3 个,包括一个「微调循环少 29 倍」的纯长度伪影)。第二,把种子对照当作控制条件而非附加实验:先用只改种子的重训标定尺子精度,再读一切效应,结果五条已经写下来的结论被这条带杀死。第三,罕见地完整报告自己仪器说谎的六种方式——每个都被对照抓住,且每条都曾让作者相信过错误的东西。第四,把部署账单设为硬约束:比较按激活参数与词级预算进行,从而暴露出希腊语 2.3–2.5 倍分词生育率税如何让「词数省 3.7 倍」在不同家族上变成 token 省钱、打平或反而更贵 1.6 倍——这是任何准确率表都看不见、部署方却最关心的差别。

核心方法

直觉上,论文把「用希腊语推理」当作一个行为属性来工程化:先用 SFT 安装,再用仪器确认装上了什么、忘了什么,最后用可验证奖励的 RL 修复 SFT 自己修不了的缺陷。技术路线:选三个服务成本相同的稀疏 MoE 家族——Qwen3.6-35B-A3B(总参 36.0B/激活 3.97B)、Gpt-OSS-20B(20.9B/3.60B)、NemotronH-30B-A3B 与 Nemotron-3.5-Lightning(各 31.6B/3.58B,Mamba/MoE/注意力混合架构);用 LoRA($r=32$、$\alpha=64$、专家步长 3、1 epoch、有效批 32、单节点 8×B200、FSDP 无模型并行)微调。语料 118,092 行希腊语分两半:推理半 59,107 行(98.5% 合成:英文公开数据集的题目与金答案,由两个前沿商用模型用希腊语重新解题生成轨迹,STaR 式答案门控,产率 60–95%)与直接半 58,985 行(复用已发布的 Sophea-Titan-1 指令语料,含 9% 英语作防遗忘回放)。评测走五条独立泳道:5,156 题希腊推理基准(数学 1,345、常识 3,267、逻辑 544)、1,100 题英语对照、Titan-1 九希腊加五英语 NLU 套件(纯对数似然打分)、约 150 条轨迹的句级语言切换手工标注、18 任务 9,751 题的直接模式 NLU 套件。六个指标维度在 §3 先定义后使用,全部经长度相关门控。

核心创新不是新训练算法,而是一套测量学:行为维度 + 对照 + 预注册,替代单一准确率。与已有方法的本质区别有三层。其一,种子对照是控制条件:同配置三种子得 76.2/68.7/76.4(sd 4.4 pp、极差 7.7 pp),而同一三个种子的 trace-Greek 恒为 1.00/1.00/1.00、轨迹长度仅在 132–152 词间——准确率承载了几乎全部训练方差而行为维度纹丝不动,这种不对称性(作者指出这是种子方差文献里没测过的)让论文在噪声之上仍能测出可靠的东西。其二,把「语言锁」定位到指令通道而非默认行为:单向配方的微调在被明确要求用英语思考时 0/1,000 服从(基座反过来也半锁:要求希腊语仍 72% 说英语),而语言匹配训练对(每个希腊题+轨迹与英语原文+轨迹并排、门控防语言漂移)在所有家族恢复「问题语言跟随」默认,并在 4 个发布 checkpoint 中的 2 个上部分重开显式覆盖(44.8%/62.5%)。其三,立场上站在 DeepSeek-R1 一侧并更进一步:对低资源部署,轨迹就是产品,不透明英语轨迹是缺陷而非目标;属性可由纯 SFT 安装,而格式与泄漏缺陷 SFT 修不了(模仿目标看不见反事实)、RLVR 可修,且用随机奖励对照证明这些修复是学习而非引出。

方法步骤详情

完整步骤如下。第一步选型:按每 token 激活参数 3.6–4.0B 锁定四个 checkpoint,记录路由差异(Qwen 每 token 用 3.1% 参数、Gpt-OSS 12.5%、Nemotron 6/128 且大部分注意力换成状态空间层)。第二步语料:翻译题目与金答案,LLM 用希腊语重解生成轨迹并做答案门控;轨迹结构评分 $S=0.40b+0.25v+0.25p+0.10\ell$ 作语料诊断(翻译人类轨迹 $S=0.27$、0% 超 0.5;重生成后 $S=0.68$、97% 超 0.5)。第三步配方对比(§7 侧实验):One-Phase 一次过两半(均值 66.1、空轨迹 23.6%、fallback 12%);Two-Phase 先推理后混合(空轨迹降到 0–1.3% 但 fallback 升到 33–40%);Reasoning-only 只训推理半(均值 73.6、fallback 2–12%)。第四步六维度评测:锚定正确率(先解析所要求的答案行)与逻辑宏召回(类分布 891/270/165)、希腊字符比 $g(t)$、词级预算(中位词数与每正确答案词数)、终止率、推理步数、超支 $\{i: f(i)\ge0.8 \wedge w_a(i)\ge3\tilde{w}(i)\}$。第五步种子对照:三种子 76.2/68.7/76.4,由此推出检出 6.3 pp 效应需约 11 个种子/组。第六步预注册 RLVR:GRPO 8 采样/提示、$\beta=0$、lr $10^{-6}$、温度 0.7、预算 1,536 token(1,024 时约 90% 截断会饿死正确性项,是实测决策);2,000 提示池(每语言 800 配对 + 400 覆盖切片),四臂并行同硬件同种子只变奖励(正确+格式+终止 / +语言一致 / +覆盖服从 / 随机奖励对照);28 项对抗性预检先于训练跑通并抓住 3 个草稿奖励漏洞;中止条件与三分支决策规则全部冻结于第一个优化器步之前。

技术新颖性

技术新颖性体现在五个方面。第一,首次在 MoE + LoRA + 中资源语言规模量化种子方差,并指出其不对称性:已有文献(Dodge、Bouthillier、Madaan)工作在准确率或专家偏好空间,而本文显示行为维度在使准确率失效的同一扰动下稳定,这既是方法贡献也使小规模研究得以自洽。第二,发现并命名一个污染检查抓不到的新机制——同族翻译污染:用与训练轨迹同族的商用模型机器翻译基准,会让微调获得纯语域优势(基座在人译/机译差 −4.9 pp 即 −3.14σ,微调反而 +1.1~+2.8 pp),250 题人译对照即可抓住 3.1σ 伪影。第三,把语言可控性从「配方属性」降格为「逐 checkpoint 属性」:同语料同配方的四个 checkpoint 在显式指令服从上分裂为 62.5/44.8/0/0,既不随架构也不随配方,意味着必须实测。第四,RLVR 实验设计本身:随机奖励对照 + 冻结决策规则 + 对抗性预检 + 每项训练后断言(受 Spurious Rewards 一文启发),在低资源行为属性设定中罕见。第五,体系化的负结果:数据选择≈随机(−0.5 pp,0.31σ)、五个语料版本全在噪声带内、重复惩罚对基座 −0.4 pp 而对微调 −9.7 pp(说明「循环」在两个模型里是不同的东西:基座没话找话,微调的重复片段是论证的承重墙)。

fallback% by recipe and by language-matched checkpoint(按配方与语言匹配 checkpoint 的答案行缺失率)
Figure 1: fallback% by recipe and by language-matched checkpoint(按配方与语言匹配 checkpoint 的答案行缺失率)
The four withdrawn findings of this section, drawn: the effect as first believed (open circle) against the same quantity after its control (filled)(本节四个被撤回的发现:最初相信的效应对对照后的同一量)
Figure 8: The four withdrawn findings of this section, drawn: the effect as first believed (open circle) against the same quantity after its control (filled)(本节四个被撤回的发现:最初相信的效应对对照后的同一量)

实验结果

核心发现按维度展开。噪声底线:三种子 76.2/68.7/76.4(sd 4.4 pp、极差 7.7 pp),fallback 随之在 3–41% 摆动,而 trace-Greek 恒 1.00、轨迹长度 132–152 词。语言保真度:基座 0/1,000 条轨迹达 $g\ge0.9$(中位 0.33,仅 4.2% 纯英语),SFT 后各发布 97.4–98.7%(RLVR 版 98.27%);句级切换基座 16.4(Qwen)/9.7(Gpt-OSS)次/百句,所有微调臂为 0;所有臂在英语题上 100% 说英语。预算:等准确率(72.9 vs 72.9)下基座中位 1,010 词/轨迹、1,454 词/正确答案,推理-only 微调 150/239;token 级按家族变号——Qwen 省 3.0 倍(586 vs 1,788)、NemotronH 打平(638 vs 681)、Gpt-OSS 反贵 1.6 倍(640 vs 396)。预算纪律:基座在易题上超支 98.0% 且难易无差(98.0 vs 98.4),微调 0.2–12%,直答模式难易比 1.9–60 倍。准确率:15 臂最佳 76.5 vs 基座 77.2;没有任何微调在任何轴胜过自己的基座(条件于已输出答案行后差距大减:Qwen 95.8/78.8/39.5 vs 96.0/82.8/42.7);唯一存活的准确率效应是 reasoning-only 对 two-phase 的 +6.9 pp(73.6 n=6 vs 66.7 n=9,52/54 配对,排列 $p=0.0008$)。遗忘问题:Titan-1 上 Qwen ±0.1 内、Nano +3.8 希腊、Lightning +1.7 希腊、修复后 Sophea-OSS-v1 −3.2 希腊/+1.0 英语;曾出现在 12/12 臂的常识 −3.0 pp 在约束提示下反转为 +1.7 pp(格式伪影);语域控制不丢反升(两家 Nemotron 37→43、40→44/45),判定的语法正确性四家全升(NemotronH 13/58→27/57)。RLVR:fallback 24.1%→2.5%、泄漏 3.53%→0.00%,双双通过冻结阈值,随机奖励对照(22.1%/3.61%)证明是学习;指令服从 +9.1 pp(44.8→53.9%,对照调整后 +9.8 pp)但未达预注册可训练门槛(≥+15 pp 且 ≥60%);无语言保护臂保真度仍 98.22%,纯准确率梯度没有侵蚀语言属性。

Total and routed-expert parameters counted from the released tensors; active-per-token is non-routed + k/E of routed(从发布张量清点的总参与路由专家参数;每 token 激活 = 非路由 + k/E×路由)
Table 1: Total and routed-expert parameters counted from the released tensors; active-per-token is non-routed + k/E of routed(从发布张量清点的总参与路由专家参数;每 token 激活 = 非路由 + k/E×路由)
The reasoning half is math-heavy and thin on the axes we evaluate hardest(推理半语料偏数学,而在评估最重的轴上稀薄)
Table 2: The reasoning half is math-heavy and thin on the axes we evaluate hardest(推理半语料偏数学,而在评估最重的轴上稀薄)
Two-Phase continues the same adapter from Reasoning onto the hybrid mix; One-Phase never separates the two halves(Two-Phase 从 Reasoning 继续同一适配器;One-Phase 从不分开两半)
Table 3: Two-Phase continues the same adapter from Reasoning onto the hybrid mix; One-Phase never separates the two halves(Two-Phase 从 Reasoning 继续同一适配器;One-Phase 从不分开两半)
sd = 4.4 pp, range = 7.7 pp. Note the last column(标准差 4.4 分、极差 7.7 分;注意最后一列)
Table 4: sd = 4.4 pp, range = 7.7 pp. Note the last column(标准差 4.4 分、极差 7.7 分;注意最后一列)
Selection buys −0.5 pp (0.31σ); a 4× smaller pool costs nothing(筛选只换来 −0.5 分;小 4 倍的池子毫无代价)
Table 5: Selection buys −0.5 pp (0.31σ); a 4× smaller pool costs nothing(筛选只换来 −0.5 分;小 4 倍的池子毫无代价)
Per-domain results on the Greek think lane(希腊语 think 泳道的分域结果)
Table 6: Per-domain results on the Greek think lane(希腊语 think 泳道的分域结果)
Language-matching across the three families(三个家族的语言匹配结果)
Table 7: Language-matching across the three families(三个家族的语言匹配结果)
single-phase = one pass over both halves; two-phase = reasoning-only then hybrid; reasoning-only = the reasoning half alone(三种配方的均值、空轨迹率与 fallback)
Table 8: single-phase = one pass over both halves; two-phase = reasoning-only then hybrid; reasoning-only = the reasoning half alone(三种配方的均值、空轨迹率与 fallback)
The base is ~5 pp worse on our translations; every fine-tune is slightly better(基座在我们的机器翻译上差约 5 分;每个微调反而略好)
Table 9: The base is ~5 pp worse on our translations; every fine-tune is slightly better(基座在我们的机器翻译上差约 5 分;每个微调反而略好)
The one-directional fine-tune's traces are identical under both instructions(单向微调在两种指令下轨迹完全相同)
Table 10: The one-directional fine-tune's traces are identical under both instructions(单向微调在两种指令下轨迹完全相同)
Instructed-override compliance on the five released checkpoints(五个发布 checkpoint 的指令覆盖服从率)
Table 11: Instructed-override compliance on the five released checkpoints(五个发布 checkpoint 的指令覆盖服从率)
English questions get English traces from every arm measured(所有受测臂对英语题都输出英语轨迹)
Table 12: English questions get English traces from every arm measured(所有受测臂对英语题都输出英语轨迹)
Forgetting on the Titan-1 suite(Titan-1 套件上的「遗忘」)
Table 13: Forgetting on the Titan-1 suite(Titan-1 套件上的「遗忘」)
Every benchmark behind the macros of Table 13 (Titan-1 suite, non-reasoning mode; accuracy %)(Table 13 宏背后的每个基准)
Table 14: Every benchmark behind the macros of Table 13 (Titan-1 suite, non-reasoning mode; accuracy %)(Table 13 宏背后的每个基准)
Supported and unsupported configuration choices, each with its evidential basis(被证据支持与不被支持的配置选择,各附证据基础)
Table 15: Supported and unsupported configuration choices, each with its evidential basis(被证据支持与不被支持的配置选择,各附证据基础)
The pre-registered RLVR round, scored on the held-out instruments(预注册 RLVR 轮,在保留仪器上打分)
Table 16: The pre-registered RLVR round, scored on the held-out instruments(预注册 RLVR 轮,在保留仪器上打分)
Left: one configuration, three seeds, nothing else changed. Right: every accuracy effect we measured over the project, against that range(左:同一配置三个种子;右:项目测过的所有准确率效应对照该区间)
Figure 2: Left: one configuration, three seeds, nothing else changed. Right: every accuracy effect we measured over the project, against that range(左:同一配置三个种子;右:项目测过的所有准确率效应对照该区间)
Every accuracy effect we measured, against the 7.7-point seed-to-seed band(我们测过的每个准确率效应,对照 7.7 分种子带)
Figure 3: Every accuracy effect we measured, against the 7.7-point seed-to-seed band(我们测过的每个准确率效应,对照 7.7 分种子带)
The same two checkpoints on four dimensions, the base and the structure-selected reasoning-only arm (Subset), on the 1,000-item probe lane(基座与结构筛选推理-only 臂在四个维度上的对照,1,000 题泳道)
Figure 4: The same two checkpoints on four dimensions, the base and the structure-selected reasoning-only arm (Subset), on the 1,000-item probe lane(基座与结构筛选推理-only 臂在四个维度上的对照,1,000 题泳道)
Overrun = trace ≥3× the median trace for that item across arms. Easy = at least 80% of arms answer correctly(超支 = 轨迹 ≥3 倍该题跨臂中位长;易题 = 至少 80% 臂答对)
Figure 6: Overrun = trace ≥3× the median trace for that item across arms. Easy = at least 80% of arms answer correctly(超支 = 轨迹 ≥3 倍该题跨臂中位长;易题 = 至少 80% 臂答对)
Each point is an independently trained arm. Corpus version varies within both groups(每点是一个独立训练臂;两组内部都混有不同语料版本)
Figure 7: Each point is an independently trained arm. Corpus version varies within both groups(每点是一个独立训练臂;两组内部都混有不同语料版本)
Trace-language composition per lane, Qwen line(Qwen 线各泳道的轨迹语言构成)
Figure 9: Trace-language composition per lane, Qwen line(Qwen 线各泳道的轨迹语言构成)
Left: accuracy per axis on the 5,156-item benchmark for the Qwen recipe arms, with the seed-to-seed noise floor shaded. Right: the same arms' cost in words per correct answer(左:Qwen 配方臂在 5,156 题基准上逐轴准确率,带种子噪声底纹;右:同臂每正确答案的词数成本)
Figure 11: Left: accuracy per axis on the 5,156-item benchmark for the Qwen recipe arms, with the seed-to-seed noise floor shaded. Right: the same arms' cost in words per correct answer(左:Qwen 配方臂在 5,156 题基准上逐轴准确率,带种子噪声底纹;右:同臂每正确答案的词数成本)
查看结构化数据
任务指标本文基线提升
希腊语推理轨迹保真度(5,156 题基准) 达到 $g\ge0.9$ 的轨迹占比 97.4–98.7%(四个发布 97.4–98.1%,RLVR 版 98.27%,三种子 1.00/1.00/1.00) 基座 0.0%(0/1,000 条轨迹,中位字符比 0.33) 从零到近乎全覆盖(约 +98 pp),且在使准确率失效的种子扰动下完全稳定
1,000 题三轴希腊语探针(think 模式) 锚定准确率 15 臂最佳 76.5 基座 77.2 −0.7 pp,位于 7.7 pp 种子噪声带内:准确率上无可声称的收益
每正确答案的推理开销(Qwen 语言匹配版) 中位词数与 token 数/正确答案 239 词;586 token 基座 1,454 词;1,788 token 词级 3.7 倍(推理-only 臂 4.6–5.0 倍);token 级 Qwen 省 3.0 倍、NemotronH 打平、Gpt-OSS 反贵 1.6 倍
易题上的预算超支(≥80% 臂答对的题) 轨迹 ≥3× 跨臂中位长的题目占比 0.2–12%(各微调臂) 基座 98.0%(与难题 98.4% 无差别) 获得基座完全没有的难易分辨能力(直答模式难易开销比 1.9–60 倍)
答案格式回退(RLVR 轮,希腊 think 泳道) 未输出所要求答案行的比例 2.5% SFT 前该臂 24.1%;随机奖励对照 22.1% −21.6 pp,通过预注册阈值 ≤10%;对照持平证明是学习而非引出
答案通道泄漏(答案渗入推理轨迹) 泄漏行占比 0.00% SFT 3.53%(随机对照 3.61%;Gpt-OSS 家族高达 10.3%) 归零,通过预注册阈值 ≤1.5%;论文论证 SFT 的模仿目标原则上修不了它
推理语言指令服从(希腊题 + 指令「用英语思考」) 服从指令的轨迹占比 53.9%(RLVR 后,Qwen) 44.8%(语言匹配 SFT);单向配方 0.0% +9.1 pp(对照调整后 +9.8 pp),通过全部保持门但未达预注册可训练门槛(≥+15 pp 且 ≥60%)

局限与改进

作者承认的:全部模型是稀疏 MoE 且全部用 LoRA,没有稠密对照,无法区分「LoRA SFT 在此规模种子敏感」与「稀疏路由放大种子敏感」——而这是最便宜也最能锐化论文的实验;噪声底线来自 n=3(σ 的 95% 置信区间宽达 [2.3, 27.7] pp),把这条带引用到其他家族与配方是假设不是测量;除一个配置外全是单种子;LoRA 秩、步长、epoch 数从未变动;三根轴全是英语基准的希腊语译本,自建的本土希腊语常识探针天花板 96–97% 无区分力;逻辑轴去污染后最小且携带种子不稳定,所有臂对 False 类近盲(召回 14–16%),Unknown 类以 68.8% 先验充当决策阈值;希腊语是中资源语言,向真正低资源语言(缺强基座与语言定向语料)的迁移未测;除约 150 条轨迹的单人切换标注外无人读过轨迹,可审计性只以文字系统身份测量,未测流畅度、术语质量、可跟随性,并继承「轨迹忠实于计算」的 standing 假设;两个更便宜的替代(事后翻译基座英语轨迹、few-shot 希腊轨迹示例)未比较——「提示无法达到」的证据只覆盖裸指令;零切换目标把任何语码转换当缺陷,未测对术语保真度的代价(希腊技术语域惯借英语词)。我自己的观察:保留评估高度依赖自有的 Titan-1 套件与自有语料谱系,外部研究者难以独立复现同款对照;RLVR 结论是单家族(Qwen)、单种子、最终 checkpoint、未筛选池上的存在性证明;标题说 low-resource 而希腊语实际是基础设施雄厚的中资源语言,标题与证据范围之间有张力;+6.9 pp 的排列检验依赖「语料版本可交换」假设,作者自己也承认版本平衡的专门复制才能一锤定音。

独立分析的弱点

独立分析的弱点与改进方向。其一,无稠密对照:核心主张(种子方差大小、语言可安装性、行为稳定性)全部限定在 MoE+LoRA,而路由是种子方差的头号嫌疑机制——改进:在同级稠密模型上重跑三种子对照与语言匹配训练,把「LoRA 敏感」与「路由放大」分开。其二,噪声底线样本薄且单一:n=3 只在 Qwen 一个家族测得,却被携带到所有家族的解读中——改进:跨家族、跨配置分层重采样估计 $\sigma$,或采用配对多臂设计降低所需种子数。其三,RLVR 轮只在 Qwen 上做且单种子:指令通道为何在 Gpt-OSS 62.5%、Qwen 44.8%、两个 Nemotron 0% 之间分裂完全没有机制解释——改进:在 Gpt-OSS(天然 95% 可控)与 Nemotron(0%)上复制同一四臂 RLVR,把「可训练性」与「家族先验」解耦。其四,逻辑与常识轴测量质量差:宏召回近盲 False、本土探针天花板,等于在最弱的仪器上报告最弱的轴——改进:为希腊语构建有区分度的原生逻辑/常识基准(例如扩展作者团队自带的 MORFES 形态学基准思路)。其五,指令服从只推到 53.9%:残差 24.8% 全希腊加约 30% 混合脚本轨迹——改进:分析混合脚本轨迹的失败模式,尝试课程化奖励或指令措辞多样化训练。其六,格式修复是手工补丁(2% 剂量的 trace-less twins)且家族间泄漏差异(0.0–10.3%)未解释——改进:把格式项并入 SFT 课程,或用 DPO 类偏好目标统一处理,并系统性刻画泄漏的架构来源。其七,成本结论只覆盖三个家族的 fertility——改进:发布 fertility 校准工具与词级/token 级双报告规范,供其他低资源语言直接复用。

未来方向

作者明确提出或明显可延伸的方向:跑稠密模型对照(作者原话:这是最便宜且最能锐化本文的实验);向真正低资源语言迁移——那里既没有强基座也没有语言定向语料,六维度+对照+预注册的工具箱是否仍然成立是开放问题;引入人类评估者读轨迹,把「可审计」从字符比升级为流畅度、术语质量与可跟随性;测试两条更便宜的替代路线(事后翻译基座英语轨迹、few-shot 希腊轨迹示例),补全「提示 vs 微调」的边界;测量单语约束对术语保真度的代价(允许受控语码切换是否反而更准);解释指令通道开合的机制(62.5/44.8/0/0 的分裂既不随架构也不随配方);用更大预算或更好的课程把覆盖服从推过 60% 的可训练门槛,并检验 +language 臂增益最小这一排序背后的语言一致项与指令项的张力;检验 SFT 安装属性 + RL 保护在稠密模型上是否如文献先验那样被准确率梯度侵蚀(本文在其运行点上是反例);在 MoE 内部记录逐专家路由统计以定位种子方差的机制;把六维度指标、长度门控、种子对照、人译对照子集、locale 感知数值解析做成任何低资源语言可复用的开源评测工具包;以及用结构评分 $S$ 在线门控生成(而非仅做事后语料诊断),进一步抬高推理半语料的有效密度。

复现评估

开源情况:五个 checkpoint 在 HuggingFace KIEFERSA 集合公开(Sophea-Qwen3.6-v1、Sophea-OSS-v1、Sophea-Nemo-3-Nano-v1、Sophea-Nemo-3.5-Lightning-v1,以及通过全部保持门的 RLVR 版 Sophea-Qwen3.6-v1.1);Qwen 系发布附带基座的视觉栈与投机解码 MTP 头。算力:全部训练、合并与评测在单节点 8×B200(每卡 180 GB HBM3e,共 1.44 TB)完成,FSDP 分片、无模型并行——这是作者刻意保持的低资源可复现约束;RLVR 每臂约 78 GPU 时(2 卡 39 小时墙钟),SFT 同样单节点可行,对有单台多卡服务器的团队门槛不高。数据:语料 118,092 行且每行带来源字段,公开基准出处明确(ilsp/mgsm_greek 等);但轨迹语料与评测 harness 本身是否完整发布文中未明说,且语料生成依赖两个前沿商用模型(同族),这是复现的最大外部依赖——无法获得同族生成器时,「同族翻译污染」实验无法原样复制。难度评估:中高。除了算力与数据,复现者还要闯过论文 §13 逐条记录的工程地雷:Qwen 融合专家适配器无法用 PeftModel.from_pretrained 加载必须先合并、Gpt-OSS 的 harmony 通道必须按标记拆分(否则 95 行逻辑题被误判不可解析)、NemotronH 的三个沉默默认值(ddp_find_unused_parameters、model_accepts_loss_kwargs、trust_remote_code)与 mamba-ssm 安装、希腊语 locale 的数值解析(17.500 与 3,5 的分隔符反转)、以及评测前先跑种子对照与同日基线重生成。论文 Table 15 的「支持/不支持」清单本身就是最好的复现路线图。