技能问题:大语言模型技能的语言不变性探析 Skill Issue: Are Skills Language-Invariant in LLMs?
同一模型经不同语言接口自博弈对打,实力与策略系统性偏移,英语最强、希伯来语最弱。
前置知识
自博弈(self-play)
让同一个模型的两个实例互为对手对弈的评估方式。由于双方能力完全相同,胜负应接近随机均势;若某一方系统性地赢得更多,说明施加在该方身上的条件(此处为语言接口)因果性地改变了其真实表现。同语言对对战因此构成内建的零假设对照。
本文全部核心结论都建立在跨语言自博弈的胜负边际上:同语言对战给出基线分布,跨语言对战的系统性偏差就是语言效应的直接度量,理解该协议才能读懂所有实验。
跨语言知识区室化(factual compartmentalization)
指多语言模型通过语言A可提取的事实知识,换用语言B提问时可能检索不到,仿佛知识按语言分柜存放而非共享。X-FACTR、ECLeKTIC 等工作证实了这一现象,且跨语言迁移在共享文字系统的语言之间更强。
本文把该问题从「知识可及性」推进到「技能可及性」:Nim 实验证明同一最优策略在一个语言里能取出并执行、换语言就取不出来,正是区室化在技能层面的体现。
TextArena
一个开源(MIT 协议)的文本博弈环境集合,含 100+ 单人/双人/多人竞技游戏,接口遵循 OpenAI Gym 风格:环境输出文本观察,模型提交文本动作,环境按马尔可夫转移更新状态并给出胜负或累计得分。
本文的多语言扩展正是构建在 TextArena 之上;六款游戏(井字棋、Nim、SimpleTak、Colonel Blotto、Kuhn Poker、迭代囚徒困境)提供了规则严格固定、只变语言的受控实验场。
Nim 与 Nim-sum 最优策略
Nim 是有完全数学解的取物游戏:双方轮流从单一堆取至少一个物件,取走最后物件者胜。Bouton 证明必胜策略是把各堆数量的异或(Nim-sum)凑成零。它因此成为检验模型「是否拥有并能否使用」某条已知知识的理想探针。
论文利用 Nim 唯一最优首着的性质,分别统计各语言下策略提及次数与最优首着执行率,把「知道」与「做到」分离,是全文关于知识检索差异分析的关键。
Kuhn Poker 与条件动作概率
只含 J<Q<K 三张牌的极简不完全信息扑克,动作限 check/bet/call/fold。策略可按手牌解释:拿 J 下注是诈唬(BluffJ),拿 K 下注是价值下注(ValueK),面对下注弃掉 K 是严重失误(FoldK)。这些条件概率使「策略随语言改变」可被量化。
论文用 $P(\text{bet}\mid J)$、$P(\text{fold}\mid K)$ 等指标展示同一模型在不同语言下风险偏好差异超过两倍,是「语言改变策略行为」这一结论的核心证据来源。
角色池化胜负边际 Δ
对语言对 $(A,B)$,把 $(A,B)$ 与 $(B,A)$ 两种角色分配的结果从 A 视角合并,计算 $\Delta_{m,g}(A,B)=\frac{W-L}{N}\in[-1,1]$,平局计零。池化可抵消井字棋先手等结构性角色优势,且 $\Delta(A,B)=-\Delta(B,A)$;对全部对手取平均得语言强度 $\mu$,跨游戏宏平均得 $\bar\mu$。
论文所有热图、语言排名与敏感性指标($\max_\ell\mu_\ell-\min_\ell\mu_\ell$)都由该指标族导出,是理解文中一切数量结论的数学基础。
接口语言 vs 推理语言
接口语言是环境渲染游戏指令、棋盘与对手消息所用的语言;推理语言是模型生成中间思考链所用的语言。二者可解耦:保持弱语言界面不动,仅通过提示让模型换用更强语言思考,再观察性能恢复多少。
该干预实验是论文定位「语言在决策流水线哪一阶段起作用」的关键手段:井字棋、SimpleTak 大幅恢复说明瓶颈在推理阶段,Kuhn Poker 恢复有限则说明语言还作用于状态解读与动作选择。
研究动机
LLM 的多语言能力不均已被大量记录:Global MMLU、Belebele、XCOPA 等静态基准显示同一模型在不同语言上准确率可差十几个百分点,而既有解释几乎都集中在「知识可及性」——同一事实用语言 A 问得出、用语言 B 问不出(X-FACTR、ECLeKTIC、跨语言知识区室化研究)。但这些工作有两个局限:其一,它们基于固定输入加预设答案的静态评测,只能测「准确率随语言变化」,无法回答当模型作为智能体在多轮交互中解读状态、规划、决策时,是否在不同语言下拥有不同的「技能集」;其二,直接比较各语言的基准分数会把知识覆盖差异、任务翻译质量和真实技能差异混在一起,无法把语言对已实现行为(realized behavior)的因果贡献分离出来。换言之,「模型会不会因为换了一种语言就变得不会下棋、不会算牌」此前完全未被量化。
本文的目标是本文的目标是在排除模型、对手、规则、状态空间、动作空间等一切混杂因素后,单独量化「语言接口」对模型已实现技能的影响,从而把跨语言技能不一致(cross-lingual skill inconsistency)作为与知识差异、整体基准性能正交的独立维度加以测量。为此作者做了三件事:构建大规模多语言 TextArena 扩展(65 个游戏、约 193 种语言、四层翻译验证体系),并用手工校验的 6 游戏 × 8 语言子集,对三个 3-4B 开源模型进行合计 518,400 局的受控自博弈;系统刻画失败模式在空间推理、策略行为、已知知识检索上的语言差异;最后检验「用更强语言推理」能否恢复性能,并用静态多语言基准与公开网络语料可得性解释差异来源,为开发在各语言间表现更公平的模型提供诊断工具。
与已有工作不同的是,本文的独特切入是「跨语言自博弈」这一因果隔离设计:让同一模型的两个实例通过同一环境的两种语言版本对弈,棋盘状态、卡牌、数值信息、动作空间与规则全部保持不变,唯一变量是语言。若模型经两种语言表达相同技能,胜负应随机分布(如同语言自博弈的对角线);任何系统性偏差都可归因于语言本身。这与先前两条路线都不同:静态多语言基准(MMLU 类)固定输入比较语言间分数,混杂严重;自翻译/英语对齐(self-translate、question-alignment)只把它当作提示工程手段。本文更进一步把「环境接口语言」与「中间推理语言」解耦——固定弱语言界面、只切换思考语言——从而能定位语言究竟作用于状态解读、推理、知识检索还是动作选择哪个阶段,实现了从「知识跨语言可及性」到「技能跨语言一致性」的视角转换。
核心方法
直觉:想检验棋手「会不会下棋」,最干净的办法是让他跟自己下一局——若执不同语言时发挥不同,说明语言影响了表现。技术路线:先把 TextArena 扩展为多语言版本,翻译验证分四层——Tier A 共 8 种语言(英语、中文、西语、法语、德语、马来语、阿语、希伯来语)由 GPT-5.2/Claude Opus 4.8 翻译并经母语者校验;Tier B 42 种由 Llama-3.1-405B/Qwen2.5-72B 翻译并回译审核;Tier C 124 种与 Tier E 18 种用 NLLB-200 加双模型保真度判定(≥85% 认可才合格)。棋盘坐标、牌面与 [bet] 等动作记号刻意保持语言无关。随后在六游戏(TicTacToe、Nim、SimpleTak、Colonel Blotto、Kuhn Poker、迭代囚徒困境)上让 Gemma-4-E4B-it、Qwen3-4B、Ministral3-3B 以 8 种语言两两组合(含同语言)自博弈,每方向 400 局、双角色分配,共 518,400 局;模型经 vLLM+Ray 服务,temperature $=1.0$、top_p $=0.95$、top_k $=64$,动作写入 $\boxed{}$;最后用 $\Delta$、$\mu$、$\bar\mu$ 三级指标汇总,再做干预与归因分析。
核心创新是「跨语言自博弈」这一因果识别设计。以往跨语言评测比较的是不同语言下的绝对分数,混杂了知识覆盖、翻译质量、语言自身难度;本文让一切条件恒定、只变语言,胜负边际直接给出语言的因果效应,而且同语言对角线天然构成零假设分布——这是跨语言 NLP 中少见的内建对照。第二个创新是接口语言与推理语言的解耦干预:固定弱语言界面(如德语井字棋界面),只通过提示切换思考语言为英语,若性能大幅回升则语言效应主要发生在推理阶段;若回升有限(如 Kuhn Poker),说明语言还在状态解读或动作选择阶段起作用。第三个创新是把「策略知识可及性」做成可测量的对照实验:Nim 存在唯一数学最优解(Nim-sum 归零),于是可以分别统计各语言下「日志提到最优策略」与「真正执行最优首着」的比率,把知识存储与知识执行分开度量,甚至能捕捉模型中途自发切换到拉丁字母再调用策略的隐性行为。
方法步骤详情
第一步环境多语言化:基于 TextArena 的 Gym 式环境,把六游戏模板译成 8 种 Tier A 语言并经母语者校验;棋盘数字坐标、花色点数、\"[check]\" 等 token 保留原样以保证动作语法跨语言一致;无效动作允许更正一次,再错判负。第二步模型服务:三模型用 vLLM 部署、Ray 编排分布式 rollout,系统提示要求最终动作置于 $\boxed{}$,采样 temperature $=1.0$、top_p $=0.95$、top_k $=64$。第三步自博弈评测:每模型每游戏对全部语言对(含同语言、双角色分配)各玩 400 局,共 28,800 局/模型-游戏、总计 518,400 局;每个 run 用 2 块 H200、约 6 GPU 时(IPD 除外)。第四步按式 (1)-(3) 计算角色池化边际 $\Delta$、语言均值 $\mu$、模型级均值 $\bar\mu$。第五步失败模式分析:TicTacToe/SimpleTak 按行/列/对角线统计败因分布;Kuhn Poker 按 $P(\text{bet}\mid J)$、$P(\text{fold}\mid K)$ 等条件概率拆解策略;Nim 统计策略提及数与最优首着执行率。第六步干预实验:固定弱接口语言、切换推理语言,计算恢复率 $\frac{\mu-\mu_{weak}}{\mu_{best}-\mu_{weak}}$。第七步归因:与 Global MMLU、Belebele 分数及 FineWeb-2 各语言词数做 Pearson 相关并分析离群点。
技术新颖性
新颖性有四点。其一,评测范式:把「技能是否语言不变」从静态多选题搬到封闭博弈的交互式自博弈,是对 GameBench、GTBench 等交互评测的推广——它们在固定语言下比较模型,本文固定模型、比较语言,研究问题本身是新的。其二,因果识别:同模型自博弈+角色池化+动作语法语言无关,把语言设为唯一自由变量,用同语言对角线构造零假设,这一内建对照设计在跨语言评测中罕见,避免了知识、任务、翻译质量的多重混杂。其三,分析深度:不止于胜负率,而是把失败拆解到空间轴(行/列/对角败因)、具体牌面条件动作(BluffJ/ValueK/FoldK)和「策略提及 vs 策略执行」的分离,再用接口-推理语言解耦实验定位语言起效的决策阶段。其四,资源与方法贡献:TextArena 多语言扩展(65 游戏、约 193 语言、sentinel 占位符+parser-token oracle 的可验证翻译流水线)以 MIT 协议并入上游;其面向低资源语言的「无读者验证」方法论(双模型直接判官在人工对照上达 100% 灵敏度/特异度,批量判官仅能抓到约三分之一损坏翻译)对多语言数据构建本身就有独立价值。
实验结果
①总体层级:六游戏汇总后英语在三个模型上均为最强接口($\bar\mu$:Qwen +0.20、Ministral +0.19、Gemma +0.13),希伯来语一致最弱(−0.23/−0.12/−0.07);语言敏感性 $\max_\ell\mu_\ell-\min_\ell\mu_\ell$ 为 Gemma 0.28、Qwen 0.54、Ministral 0.56,Qwen 层级最陡。②游戏差异:Colonel Blotto 对三个模型都最敏感(平均差距 1.07,Qwen 达 1.48),Kuhn Poker 最不敏感(0.13),迭代囚徒困境仅对 Ministral 异常敏感(0.74)。③空间失败模式:Gemma 井字棋败局的行/列/对角分布在英语下为 28.5%/34.8%/36.7%,阿语为 20.3%/34.4%/45.3%,非拉丁接口系统性漏防列与对角线;SimpleTak 中德/阿/希语列失守约 57–60% 而英语仅 46.8%。④策略漂移:Kuhn Poker 中 Qwen 的弱牌诈唬率 BluffJ 从 22.5%(西语)到 47.4%(阿语)相差逾两倍,Gemma 的 BetQ 从 41.6%(马来语)到 63.3%(希伯来语),Ministral 的 FoldK 达 10.4–23.7%。⑤知识检索:Nim 最优首着执行率 Qwen 英语 80.8%、中文 74.3%、法语 24.6%、希语仅 4.0%;Ministral 希语策略提及从 538,093 跌至 2,753,且阿/希语提及的 70%/50% 来自自发切换拉丁字母的 3.7%/1% 片段;Gemma 各语言执行率均 99% 以上但胜率都在 50% 左右。⑥恢复干预:Gemma 德语接口井字棋 $\mu$ 从 −0.22 升至 +0.20(恢复 89.4% 可达差距),SimpleTak 恢复 60.5%,Kuhn Poker 仅 37.6–49.3% 且非单调,说明语言作用于状态解读、推理、知识检索、动作选择多个阶段。⑦归因:语言边际与 Global MMLU 相关 $r=0.73\sim0.92$、Belebele $0.71\sim0.79$、$\log_{10}$ FineWeb-2 词数平均 $r=0.79$;但基准均值不预测稳定性(Gemma MMLU 最低 49.9 却最稳定,Qwen 61.9 最高且波动最大),马来语(语料最少却全面胜过希伯来语)与中文(语料约英语 1/20 而 Qwen/Ministral 近英语、Gemma 近零)为系统性离群点,文字迁移与模型特异性共同起效。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 六游戏跨语言自博弈(总体语言敏感性) | 语言差距 $\max_\ell\mu_\ell-\min_\ell\mu_\ell$(跨游戏平均) | Gemma 0.28 / Qwen 0.54 / Ministral 0.56 | 同语言自博弈对角线(理论值≈0,随机均势) | 三模型均显著偏离 0,单项最大达 Qwen-Blotto 1.48,证明语言本身因果性地改变技能表达 |
| TicTacToe:德语接口+英语推理(Gemma) | 平均语言边际 $\mu$ | +0.20 | 德语接口+德语推理 $\mu=-0.22$ | 恢复 89.4% 的可达差距(英语接口天花板 +0.25),说明语言效应主要发生在推理阶段 |
| SimpleTak:德语接口+英语推理(Gemma) | 平均语言边际 $\mu$ | +0.05 | 德语接口+德语推理 $\mu=-0.21$ | 恢复 60.5%(德语接口+西语推理仅恢复 11.6%) |
| Kuhn Poker:中文接口+西/法语推理(Gemma) | 平均语言边际 $\mu$ 与恢复率 | zh/es 与 zh/fr 均 $\mu=-0.01$(恢复 37.6% / 49.3%) | zh/zh $\mu=-0.03$(天花板 es/es $+0.02$) | 恢复有限且非单调,说明语言在状态解读、动作选择阶段同样起效 |
| Nim 最优首着执行(Qwen3-4B) | 最优首着执行率 % | 希伯来语接口 4.0%、阿拉伯语 10.5% | 英语接口 80.8% | 语言接口造成高达 76.8 个百分点的知识执行损失;策略提及数(法语 159,675 vs 英语 150,005)与执行率严重脱节 |
| 语言边际与静态多语言基准的相关 | Pearson $r$(每模型,n=8 语言) | Global MMLU $r=0.73\sim0.92$;Belebele $r=0.71\sim0.79$ | 若语言边际与基准无关则 $r\approx0$ | Qwen×Global MMLU $r=0.92$($p=0.001$)最强;但基准均值无法预测跨语言稳定性 |
| 语言边际与网络文本量($\log_{10}$ FineWeb-2 词数) | Pearson $r$(每模型) | Gemma 0.68 / Ministral 0.84 / Qwen 0.86(平均 0.79) | 若强度与数据可得性无关则斜率为 0 | 正相关显著但马来语(语料最少)与中文(约为英语 1/20 语料却接近英语强度)为系统性离群点 |
局限与改进
作者承认的局限:其一,被评模型训练数据不公开,只能用 FineWeb-2 公开网络文本量作语言暴露量代理,无法直接测量各语言预训练配比;唯一公开数据配方方案的 Apertus 又因频繁无效动作无法产生可用分数,归因只能依赖假设与估计。其二,评测仅覆盖 3-4B 三个开源模型,虽使 50 多万局自博弈在算力上可行,但语言不一致是否随规模变化完全未知。我的补充:每方向仅 400 局且 temperature $=1.0$,热图中 ±0.02 量级的单格差异可能接近采样噪声,正文未对逐对边际报告显著性检验;「最优策略提及次数」只是知识代理,提及术语不等于理解;推理语言干预依靠提示词实现,模型实际遵循度未系统报告,恢复率可能被指令遵从差异污染;六个游戏均为小型抽象博弈(部分有完美解),对真实智能体任务(工具调用、网页操作、长时程规划)的推广性存疑;归因部分本质是相关性分析,文字系统迁移假说(马来语 vs 希伯来语)没有独立干预实验支撑;用 8 个语言点做相关($n=8$)统计功效有限。
独立分析的弱点
弱点一:知识测量代理粗糙。Nim 分析用「日志中是否出现最优策略字样」作知识指标,但模型可能理解策略却不用术语,或空谈术语却不执行;改进方向是对每种语言做受控探针——直接用该语言描述 Nim-sum 并要求给出下一步最优解——把陈述性知识与程序性执行分别测量。弱点二:恢复实验存在指令混淆。切换推理语言的提示同时改变推理长度与输出格式,应加入同语言不同提示强度的对照,或用激活分析确证推理实际使用的语言,否则恢复率可能部分来自格式效应。弱点三:统计功效不足。语言×游戏×模型组合的边际差异未报告置信区间或显著性检验,Colonel Blotto 的高敏感性可能部分来自同时行动游戏固有的高方差;应增加局数并做 bootstrap 置信区间。弱点四:游戏规模小且多有已解结构。井字棋、Nim 状态空间极小,语言效应在复杂任务中可能被放大或被能力冗余掩盖,需扩展到更大博弈或真实智能体基准以判断外部效度。弱点五:模型覆盖单一。仅 3-4B 开源模型,前沿闭源与 70B+ 模型的语言一致性可能截然不同,应补充 API 模型抽样验证。弱点六:解释止步于相关,可用受控数据配方的可复现训练直接检验「数据可得性→技能一致性」因果链。每个弱点都有明确补强路径,属工作量问题而非范式问题。
未来方向
作者提出的方向:其一,把多语言 TextArena 用作智能体训练环境,通过强化学习让模型在弱语言接口上练习以消除技能差距;其二,结合开源数据配方模型(如 Apertus 类)研究训练数据分布与技能一致性的因果关系,回答「同样语言数据量为何在不同模型上实现出不同强度」。基于其成果可延伸:其三,机制可解释性——定位语言条件化的技能回路,检验「知识按语言分区存储」在技能层面的对应物,例如观察 Nim-sum 计算在阿语/希语推理中的表征路径何处中断;其四,自适应语言路由——训练模型自主选择最强推理语言(把 self-translate 内生化),评估其在多语言智能体部署中的收益与代价;其五,把语言集扩展到已发布的 Tier B/C 共 160 余种语言,检验低资源语言的技能落差与跨文字系统迁移的边界;其六,把「接口-推理语言解耦」协议推广到代码生成、数学、工具调用等领域,构建系统的「语言条件化能力图谱」;其七,研究日志中观察到的自发语码转换(Ministral 在阿语日志 3.7% 的片段切到拉丁字母并贡献其 70% 策略提及)能否被主动诱导为低成本的性能恢复策略。
复现评估
复现条件在同类工作中相当好。代码与数据完全公开:TextArena 主仓库(MIT 协议,github.com/TextArena/TextArena)已并入多语言支持,65 个游戏 × 约 193 种语言的 locale 文件(64 个语言文件、约 1,000 条玩家可见字符串、350 个动作 token)与逐语言置信度记录随文发布,翻译流水线工具链保存在独立分支。被评模型均为开源权重(Gemma-4-E4B-it、Qwen3-4B、Ministral3-3B-Instruct),全程仅推理、无需训练。算力门槛低:单个主实验 run 只需 2 块 H200、约 6 GPU 时(IPD 除外),全量 18 个 run 约合 100+ H200 时,一般实验室可负担;单模型单游戏的小型复刻单卡即可。难度评估为中等偏低:主要成本在大规模 rollout 的工程编排(vLLM + Ray)及 Tier A 语言母语者校验(普通团队可用论文验证过的双模型直接判官替代,其灵敏度/特异度达 100%)。注意事项:实验经 OpenRouter/API 调用具体模型版本,随时间可能漂移;temperature $=1.0$ 采样会带来波动,复现时应固定随机种子并酌情增大 $n$ 以收窄置信区间。
论文图表
三张 8×8 热图(每模型一张),展示所有语言对的角色池化胜负边际,正色表示行语言击败列语言。最右列为各语言平均边际:英语在三个模型上最强(Gemma +0.13、Ministral +0.19、Qwen +0.20),希伯来语一致最弱(Gemma −0.07、Ministral −0.12、Qwen −0.23);对角线(同语言对战)接近 0 构成零假设;Qwen 的颜色梯度最陡。
这是论文的核心结果图,直接可视化「同一模型在不同语言下强弱悬殊」,且同语言对角线为全部结论提供了内建对照。
三张模型 × 游戏的语言强度热图,逐格给出每个游戏内各语言的平均边际。可见语言敏感性因游戏与模型而异:Colonel Blotto 差距最大(Qwen 从 +0.65 到 −0.83),Kuhn Poker 对 Gemma 几乎平坦,Qwen 在 Nim 与 Blotto 上语言层级分明。
把总体热图分解到游戏层面,是「语言敏感性依赖任务类型」结论的直接证据来源,支撑第 5.2 节的分技能分析。
井字棋败因按行/列/对角线的分布:Gemma 英语下为 28.5%/34.8%/36.7%(均衡),阿拉伯语 20.3%/34.4%/45.3%、马来语 20.7%/29.0%/50.3%(偏向列与对角线);Qwen 各语言较稳定仅希伯来语异常;Ministral 反而在英语下行失守最多(42.1%)。
空间失败模式语言化的定量证据,说明非拉丁文字接口下模型对特定空间关系(列、对角线)的追踪能力受损。
SimpleTak 中 Gemma 败因的行/列分布:英语为 53.2%/46.8%(接近均衡),德语 39.7%/60.3%、希伯来语与阿拉伯语均 42.8%/57.2%,非拉丁与部分非英语接口偏向列失守。
与井字棋互相印证的空间脆弱性证据,表明语言条件化的空间推理缺陷跨游戏稳定存在。
Kuhn Poker 按牌面的条件动作率:Gemma 最稳定(ValueK≥92.2%、FoldK≤2.0%、BluffJ≤2.4%,BetQ 41.6%–63.3%);Qwen 更激进且语言敏感(BluffJ 22.5%–47.4%,希语 FoldK 6.1%、无效动作 7.0%);Ministral 最不可靠(无效动作 8.8%–20.9%,FoldK 10.4%–23.7%,ValueK 低至希语 55.1%)。
以条件概率形式精确刻画「同一模型在不同语言下策略人格漂移」,是策略行为语言依赖性的核心数据表。
Nim 跨语言表现:Gemma 各语言胜率均在 49.3%–50.3%、最优首着执行率 99% 以上;Qwen 胜率从中文 69.8% 跌至阿语 32.4%,最优首着英语 80.8%、法语 24.6%、希语仅 4.0%,且策略提及数(法语 159,675 vs 英语 150,005)与执行率脱节;Ministral 希语策略提及从英语 538,093 骤降至 2,753、执行率 10.8%。
「知道策略」与「能执行策略」分离的直接证据,且揭示模型自发切换拉丁字母以调用策略的隐性行为,是知识可及性分析的核心表。
列出 Tier A 的 8 种核心语言(GPT-5.2/Claude Opus 4.8 翻译、母语者校验)与 42 种扩展语言(Llama-3.1-405B 或 Qwen2.5-72B 翻译、仅 LLM 审核),附 ISO 代码、文字系统、Joshi 资源等级与 Wikidata 使用人数。
完整披露翻译与验证工作流的分层细节,是评估多语言 TextArena 数据质量与复现实验语言子集的依据。
列出低资源层级语言(NLLB-200 翻译、双模型判官验证),附保真度与覆盖率百分比及认证标记(C = 保真度≥85%,E = 实验性),如北黎凡特阿拉伯语(保真度 98%、覆盖率 91%)至孟加拉语系诸语言等。
展示无母语审核条件下低资源语言本地化的质量量化方式,体现资源发布的方法论价值。
低资源语言清单续表(北库尔德语、塔吉克语、卢旺达语、维吾尔语等),继续给出层级、保真度与覆盖率,其中若干语言仅达 E 级(如 Tumbuka 保真度 72%)。
与 E.2 共同构成发布语言清单,标明质量边界与英文回退机制,供后续研究筛选语言。
低资源语言清单末段(威尔士语、萨摩亚语、意第绪语、Awadhi、Chokwe 等),含资源等级为 0 或无数据的语言,最低保真度如 Chokwe 63%。
完成整个 193 语言资源清单的披露,体现「发布逐语言置信度而非静默错误」的透明原则。