← 返回 2026-08-27

技能问题:大语言模型技能的语言不变性探析 Skill Issue: Are Skills Language-Invariant in LLMs?

Bobby Cheng, Adam Gaber, Zhengyuan Liu, Catherine Arnett, Omer Goldman, Cheston Tan, Leshem Choshen 📅 2026-08-26 👍 4 2026-09-01 18:30
LLM评估 多语言NLP 文本博弈环境 智能体评测 自博弈 跨语言一致性

同一模型经不同语言接口自博弈对打,实力与策略系统性偏移,英语最强、希伯来语最弱。

前置知识

自博弈(self-play)

让同一个模型的两个实例互为对手对弈的评估方式。由于双方能力完全相同,胜负应接近随机均势;若某一方系统性地赢得更多,说明施加在该方身上的条件(此处为语言接口)因果性地改变了其真实表现。同语言对对战因此构成内建的零假设对照。

本文全部核心结论都建立在跨语言自博弈的胜负边际上:同语言对战给出基线分布,跨语言对战的系统性偏差就是语言效应的直接度量,理解该协议才能读懂所有实验。

跨语言知识区室化(factual compartmentalization)

指多语言模型通过语言A可提取的事实知识,换用语言B提问时可能检索不到,仿佛知识按语言分柜存放而非共享。X-FACTR、ECLeKTIC 等工作证实了这一现象,且跨语言迁移在共享文字系统的语言之间更强。

本文把该问题从「知识可及性」推进到「技能可及性」:Nim 实验证明同一最优策略在一个语言里能取出并执行、换语言就取不出来,正是区室化在技能层面的体现。

TextArena

一个开源(MIT 协议)的文本博弈环境集合,含 100+ 单人/双人/多人竞技游戏,接口遵循 OpenAI Gym 风格:环境输出文本观察,模型提交文本动作,环境按马尔可夫转移更新状态并给出胜负或累计得分。

本文的多语言扩展正是构建在 TextArena 之上;六款游戏(井字棋、Nim、SimpleTak、Colonel Blotto、Kuhn Poker、迭代囚徒困境)提供了规则严格固定、只变语言的受控实验场。

Nim 与 Nim-sum 最优策略

Nim 是有完全数学解的取物游戏:双方轮流从单一堆取至少一个物件,取走最后物件者胜。Bouton 证明必胜策略是把各堆数量的异或(Nim-sum)凑成零。它因此成为检验模型「是否拥有并能否使用」某条已知知识的理想探针。

论文利用 Nim 唯一最优首着的性质,分别统计各语言下策略提及次数与最优首着执行率,把「知道」与「做到」分离,是全文关于知识检索差异分析的关键。

Kuhn Poker 与条件动作概率

只含 J<Q<K 三张牌的极简不完全信息扑克,动作限 check/bet/call/fold。策略可按手牌解释:拿 J 下注是诈唬(BluffJ),拿 K 下注是价值下注(ValueK),面对下注弃掉 K 是严重失误(FoldK)。这些条件概率使「策略随语言改变」可被量化。

论文用 $P(\text{bet}\mid J)$、$P(\text{fold}\mid K)$ 等指标展示同一模型在不同语言下风险偏好差异超过两倍,是「语言改变策略行为」这一结论的核心证据来源。

角色池化胜负边际 Δ

对语言对 $(A,B)$,把 $(A,B)$ 与 $(B,A)$ 两种角色分配的结果从 A 视角合并,计算 $\Delta_{m,g}(A,B)=\frac{W-L}{N}\in[-1,1]$,平局计零。池化可抵消井字棋先手等结构性角色优势,且 $\Delta(A,B)=-\Delta(B,A)$;对全部对手取平均得语言强度 $\mu$,跨游戏宏平均得 $\bar\mu$。

论文所有热图、语言排名与敏感性指标($\max_\ell\mu_\ell-\min_\ell\mu_\ell$)都由该指标族导出,是理解文中一切数量结论的数学基础。

接口语言 vs 推理语言

接口语言是环境渲染游戏指令、棋盘与对手消息所用的语言;推理语言是模型生成中间思考链所用的语言。二者可解耦:保持弱语言界面不动,仅通过提示让模型换用更强语言思考,再观察性能恢复多少。

该干预实验是论文定位「语言在决策流水线哪一阶段起作用」的关键手段:井字棋、SimpleTak 大幅恢复说明瓶颈在推理阶段,Kuhn Poker 恢复有限则说明语言还作用于状态解读与动作选择。

研究动机

LLM 的多语言能力不均已被大量记录:Global MMLU、Belebele、XCOPA 等静态基准显示同一模型在不同语言上准确率可差十几个百分点,而既有解释几乎都集中在「知识可及性」——同一事实用语言 A 问得出、用语言 B 问不出(X-FACTR、ECLeKTIC、跨语言知识区室化研究)。但这些工作有两个局限:其一,它们基于固定输入加预设答案的静态评测,只能测「准确率随语言变化」,无法回答当模型作为智能体在多轮交互中解读状态、规划、决策时,是否在不同语言下拥有不同的「技能集」;其二,直接比较各语言的基准分数会把知识覆盖差异、任务翻译质量和真实技能差异混在一起,无法把语言对已实现行为(realized behavior)的因果贡献分离出来。换言之,「模型会不会因为换了一种语言就变得不会下棋、不会算牌」此前完全未被量化。

本文的目标是本文的目标是在排除模型、对手、规则、状态空间、动作空间等一切混杂因素后,单独量化「语言接口」对模型已实现技能的影响,从而把跨语言技能不一致(cross-lingual skill inconsistency)作为与知识差异、整体基准性能正交的独立维度加以测量。为此作者做了三件事:构建大规模多语言 TextArena 扩展(65 个游戏、约 193 种语言、四层翻译验证体系),并用手工校验的 6 游戏 × 8 语言子集,对三个 3-4B 开源模型进行合计 518,400 局的受控自博弈;系统刻画失败模式在空间推理、策略行为、已知知识检索上的语言差异;最后检验「用更强语言推理」能否恢复性能,并用静态多语言基准与公开网络语料可得性解释差异来源,为开发在各语言间表现更公平的模型提供诊断工具。

与已有工作不同的是,本文的独特切入是「跨语言自博弈」这一因果隔离设计:让同一模型的两个实例通过同一环境的两种语言版本对弈,棋盘状态、卡牌、数值信息、动作空间与规则全部保持不变,唯一变量是语言。若模型经两种语言表达相同技能,胜负应随机分布(如同语言自博弈的对角线);任何系统性偏差都可归因于语言本身。这与先前两条路线都不同:静态多语言基准(MMLU 类)固定输入比较语言间分数,混杂严重;自翻译/英语对齐(self-translate、question-alignment)只把它当作提示工程手段。本文更进一步把「环境接口语言」与「中间推理语言」解耦——固定弱语言界面、只切换思考语言——从而能定位语言究竟作用于状态解读、推理、知识检索还是动作选择哪个阶段,实现了从「知识跨语言可及性」到「技能跨语言一致性」的视角转换。

核心方法

直觉:想检验棋手「会不会下棋」,最干净的办法是让他跟自己下一局——若执不同语言时发挥不同,说明语言影响了表现。技术路线:先把 TextArena 扩展为多语言版本,翻译验证分四层——Tier A 共 8 种语言(英语、中文、西语、法语、德语、马来语、阿语、希伯来语)由 GPT-5.2/Claude Opus 4.8 翻译并经母语者校验;Tier B 42 种由 Llama-3.1-405B/Qwen2.5-72B 翻译并回译审核;Tier C 124 种与 Tier E 18 种用 NLLB-200 加双模型保真度判定(≥85% 认可才合格)。棋盘坐标、牌面与 [bet] 等动作记号刻意保持语言无关。随后在六游戏(TicTacToe、Nim、SimpleTak、Colonel Blotto、Kuhn Poker、迭代囚徒困境)上让 Gemma-4-E4B-it、Qwen3-4B、Ministral3-3B 以 8 种语言两两组合(含同语言)自博弈,每方向 400 局、双角色分配,共 518,400 局;模型经 vLLM+Ray 服务,temperature $=1.0$、top_p $=0.95$、top_k $=64$,动作写入 $\boxed{}$;最后用 $\Delta$、$\mu$、$\bar\mu$ 三级指标汇总,再做干预与归因分析。

核心创新是「跨语言自博弈」这一因果识别设计。以往跨语言评测比较的是不同语言下的绝对分数,混杂了知识覆盖、翻译质量、语言自身难度;本文让一切条件恒定、只变语言,胜负边际直接给出语言的因果效应,而且同语言对角线天然构成零假设分布——这是跨语言 NLP 中少见的内建对照。第二个创新是接口语言与推理语言的解耦干预:固定弱语言界面(如德语井字棋界面),只通过提示切换思考语言为英语,若性能大幅回升则语言效应主要发生在推理阶段;若回升有限(如 Kuhn Poker),说明语言还在状态解读或动作选择阶段起作用。第三个创新是把「策略知识可及性」做成可测量的对照实验:Nim 存在唯一数学最优解(Nim-sum 归零),于是可以分别统计各语言下「日志提到最优策略」与「真正执行最优首着」的比率,把知识存储与知识执行分开度量,甚至能捕捉模型中途自发切换到拉丁字母再调用策略的隐性行为。

方法步骤详情

第一步环境多语言化:基于 TextArena 的 Gym 式环境,把六游戏模板译成 8 种 Tier A 语言并经母语者校验;棋盘数字坐标、花色点数、\"[check]\" 等 token 保留原样以保证动作语法跨语言一致;无效动作允许更正一次,再错判负。第二步模型服务:三模型用 vLLM 部署、Ray 编排分布式 rollout,系统提示要求最终动作置于 $\boxed{}$,采样 temperature $=1.0$、top_p $=0.95$、top_k $=64$。第三步自博弈评测:每模型每游戏对全部语言对(含同语言、双角色分配)各玩 400 局,共 28,800 局/模型-游戏、总计 518,400 局;每个 run 用 2 块 H200、约 6 GPU 时(IPD 除外)。第四步按式 (1)-(3) 计算角色池化边际 $\Delta$、语言均值 $\mu$、模型级均值 $\bar\mu$。第五步失败模式分析:TicTacToe/SimpleTak 按行/列/对角线统计败因分布;Kuhn Poker 按 $P(\text{bet}\mid J)$、$P(\text{fold}\mid K)$ 等条件概率拆解策略;Nim 统计策略提及数与最优首着执行率。第六步干预实验:固定弱接口语言、切换推理语言,计算恢复率 $\frac{\mu-\mu_{weak}}{\mu_{best}-\mu_{weak}}$。第七步归因:与 Global MMLU、Belebele 分数及 FineWeb-2 各语言词数做 Pearson 相关并分析离群点。

技术新颖性

新颖性有四点。其一,评测范式:把「技能是否语言不变」从静态多选题搬到封闭博弈的交互式自博弈,是对 GameBench、GTBench 等交互评测的推广——它们在固定语言下比较模型,本文固定模型、比较语言,研究问题本身是新的。其二,因果识别:同模型自博弈+角色池化+动作语法语言无关,把语言设为唯一自由变量,用同语言对角线构造零假设,这一内建对照设计在跨语言评测中罕见,避免了知识、任务、翻译质量的多重混杂。其三,分析深度:不止于胜负率,而是把失败拆解到空间轴(行/列/对角败因)、具体牌面条件动作(BluffJ/ValueK/FoldK)和「策略提及 vs 策略执行」的分离,再用接口-推理语言解耦实验定位语言起效的决策阶段。其四,资源与方法贡献:TextArena 多语言扩展(65 游戏、约 193 语言、sentinel 占位符+parser-token oracle 的可验证翻译流水线)以 MIT 协议并入上游;其面向低资源语言的「无读者验证」方法论(双模型直接判官在人工对照上达 100% 灵敏度/特异度,批量判官仅能抓到约三分之一损坏翻译)对多语言数据构建本身就有独立价值。

The six game environments and the primary skill each probes; full rules in App. D.
Figure 1: The six game environments and the primary skill each probes; full rules in App. D.
Illustration of Gemma-4-E4B-it playing TicTacToe with itself in German and English respectively.
Figure 3: Illustration of Gemma-4-E4B-it playing TicTacToe with itself in German and English respectively.

实验结果

①总体层级:六游戏汇总后英语在三个模型上均为最强接口($\bar\mu$:Qwen +0.20、Ministral +0.19、Gemma +0.13),希伯来语一致最弱(−0.23/−0.12/−0.07);语言敏感性 $\max_\ell\mu_\ell-\min_\ell\mu_\ell$ 为 Gemma 0.28、Qwen 0.54、Ministral 0.56,Qwen 层级最陡。②游戏差异:Colonel Blotto 对三个模型都最敏感(平均差距 1.07,Qwen 达 1.48),Kuhn Poker 最不敏感(0.13),迭代囚徒困境仅对 Ministral 异常敏感(0.74)。③空间失败模式:Gemma 井字棋败局的行/列/对角分布在英语下为 28.5%/34.8%/36.7%,阿语为 20.3%/34.4%/45.3%,非拉丁接口系统性漏防列与对角线;SimpleTak 中德/阿/希语列失守约 57–60% 而英语仅 46.8%。④策略漂移:Kuhn Poker 中 Qwen 的弱牌诈唬率 BluffJ 从 22.5%(西语)到 47.4%(阿语)相差逾两倍,Gemma 的 BetQ 从 41.6%(马来语)到 63.3%(希伯来语),Ministral 的 FoldK 达 10.4–23.7%。⑤知识检索:Nim 最优首着执行率 Qwen 英语 80.8%、中文 74.3%、法语 24.6%、希语仅 4.0%;Ministral 希语策略提及从 538,093 跌至 2,753,且阿/希语提及的 70%/50% 来自自发切换拉丁字母的 3.7%/1% 片段;Gemma 各语言执行率均 99% 以上但胜率都在 50% 左右。⑥恢复干预:Gemma 德语接口井字棋 $\mu$ 从 −0.22 升至 +0.20(恢复 89.4% 可达差距),SimpleTak 恢复 60.5%,Kuhn Poker 仅 37.6–49.3% 且非单调,说明语言作用于状态解读、推理、知识检索、动作选择多个阶段。⑦归因:语言边际与 Global MMLU 相关 $r=0.73\sim0.92$、Belebele $0.71\sim0.79$、$\log_{10}$ FineWeb-2 词数平均 $r=0.79$;但基准均值不预测稳定性(Gemma MMLU 最低 49.9 却最稳定,Qwen 61.9 最高且波动最大),马来语(语料最少却全面胜过希伯来语)与中文(语料约英语 1/20 而 Qwen/Ministral 近英语、Gemma 近零)为系统性离群点,文字迁移与模型特异性共同起效。

Languages by verification tier and resource class. We focus on the eight Tier-A languages.
Table 1: Languages by verification tier and resource class. We focus on the eight Tier-A languages.
Language sensitivity by game, measured as language gap, maxℓµℓ−minℓµℓ. Bold marks most language-sensitive model for each game. Bottom row shows the average across models.
Table 2: Language sensitivity by game, measured as language gap, maxℓµℓ−minℓµℓ. Bold marks most language-sensitive model for each game. Bottom row shows the average across models.
Role-corrected strength µ under each interface/reasoning language pair. The middle column reports the strongest reasoning language, followed by the second strongest, while holding the weak interface language fixed. Recovery is (µ − µweak)/(µbest − µweak). Kuhn, ST and TTT denote Kuhn Poker, SimpleTak and TicTacToe.
Table 3: Role-corrected strength µ under each interface/reasoning language pair. The middle column reports the strongest reasoning language, followed by the second strongest, while holding the weak interface language fixed. Recovery is (µ − µweak)/(µbest − µweak). Kuhn, ST and TTT denote Kuhn Poker, SimpleTak and TicTacToe.
Accuracy (%) on Belebele and 5-shot Global MMLU. Bold indicates the best-performing models for each language and benchmark average.
Table 4: Accuracy (%) on Belebele and 5-shot Global MMLU. Bold indicates the best-performing models for each language and benchmark average.
Relationship between within-model language strength and external measures of language capability and data availability. Each point represents one of eight languages for a given model, lines show per-model least-squares fits, and error bars show standard errors across the language's seven pairwise margins. In a, Pearson r is reported in the legend (n = 8). In b, highlighted points mark the largest deviations from the fitted trends. Margins are comparable across languages within, but not across, models.
Figure 4: Relationship between within-model language strength and external measures of language capability and data availability. Each point represents one of eight languages for a given model, lines show per-model least-squares fits, and error bars show standard errors across the language's seven pairwise margins. In a, Pearson r is reported in the legend (n = 8). In b, highlighted points mark the largest deviations from the fitted trends. Margins are comparable across languages within, but not across, models.
查看结构化数据
任务指标本文基线提升
六游戏跨语言自博弈(总体语言敏感性) 语言差距 $\max_\ell\mu_\ell-\min_\ell\mu_\ell$(跨游戏平均) Gemma 0.28 / Qwen 0.54 / Ministral 0.56 同语言自博弈对角线(理论值≈0,随机均势) 三模型均显著偏离 0,单项最大达 Qwen-Blotto 1.48,证明语言本身因果性地改变技能表达
TicTacToe:德语接口+英语推理(Gemma) 平均语言边际 $\mu$ +0.20 德语接口+德语推理 $\mu=-0.22$ 恢复 89.4% 的可达差距(英语接口天花板 +0.25),说明语言效应主要发生在推理阶段
SimpleTak:德语接口+英语推理(Gemma) 平均语言边际 $\mu$ +0.05 德语接口+德语推理 $\mu=-0.21$ 恢复 60.5%(德语接口+西语推理仅恢复 11.6%)
Kuhn Poker:中文接口+西/法语推理(Gemma) 平均语言边际 $\mu$ 与恢复率 zh/es 与 zh/fr 均 $\mu=-0.01$(恢复 37.6% / 49.3%) zh/zh $\mu=-0.03$(天花板 es/es $+0.02$) 恢复有限且非单调,说明语言在状态解读、动作选择阶段同样起效
Nim 最优首着执行(Qwen3-4B) 最优首着执行率 % 希伯来语接口 4.0%、阿拉伯语 10.5% 英语接口 80.8% 语言接口造成高达 76.8 个百分点的知识执行损失;策略提及数(法语 159,675 vs 英语 150,005)与执行率严重脱节
语言边际与静态多语言基准的相关 Pearson $r$(每模型,n=8 语言) Global MMLU $r=0.73\sim0.92$;Belebele $r=0.71\sim0.79$ 若语言边际与基准无关则 $r\approx0$ Qwen×Global MMLU $r=0.92$($p=0.001$)最强;但基准均值无法预测跨语言稳定性
语言边际与网络文本量($\log_{10}$ FineWeb-2 词数) Pearson $r$(每模型) Gemma 0.68 / Ministral 0.84 / Qwen 0.86(平均 0.79) 若强度与数据可得性无关则斜率为 0 正相关显著但马来语(语料最少)与中文(约为英语 1/20 语料却接近英语强度)为系统性离群点

局限与改进

作者承认的局限:其一,被评模型训练数据不公开,只能用 FineWeb-2 公开网络文本量作语言暴露量代理,无法直接测量各语言预训练配比;唯一公开数据配方方案的 Apertus 又因频繁无效动作无法产生可用分数,归因只能依赖假设与估计。其二,评测仅覆盖 3-4B 三个开源模型,虽使 50 多万局自博弈在算力上可行,但语言不一致是否随规模变化完全未知。我的补充:每方向仅 400 局且 temperature $=1.0$,热图中 ±0.02 量级的单格差异可能接近采样噪声,正文未对逐对边际报告显著性检验;「最优策略提及次数」只是知识代理,提及术语不等于理解;推理语言干预依靠提示词实现,模型实际遵循度未系统报告,恢复率可能被指令遵从差异污染;六个游戏均为小型抽象博弈(部分有完美解),对真实智能体任务(工具调用、网页操作、长时程规划)的推广性存疑;归因部分本质是相关性分析,文字系统迁移假说(马来语 vs 希伯来语)没有独立干预实验支撑;用 8 个语言点做相关($n=8$)统计功效有限。

独立分析的弱点

弱点一:知识测量代理粗糙。Nim 分析用「日志中是否出现最优策略字样」作知识指标,但模型可能理解策略却不用术语,或空谈术语却不执行;改进方向是对每种语言做受控探针——直接用该语言描述 Nim-sum 并要求给出下一步最优解——把陈述性知识与程序性执行分别测量。弱点二:恢复实验存在指令混淆。切换推理语言的提示同时改变推理长度与输出格式,应加入同语言不同提示强度的对照,或用激活分析确证推理实际使用的语言,否则恢复率可能部分来自格式效应。弱点三:统计功效不足。语言×游戏×模型组合的边际差异未报告置信区间或显著性检验,Colonel Blotto 的高敏感性可能部分来自同时行动游戏固有的高方差;应增加局数并做 bootstrap 置信区间。弱点四:游戏规模小且多有已解结构。井字棋、Nim 状态空间极小,语言效应在复杂任务中可能被放大或被能力冗余掩盖,需扩展到更大博弈或真实智能体基准以判断外部效度。弱点五:模型覆盖单一。仅 3-4B 开源模型,前沿闭源与 70B+ 模型的语言一致性可能截然不同,应补充 API 模型抽样验证。弱点六:解释止步于相关,可用受控数据配方的可复现训练直接检验「数据可得性→技能一致性」因果链。每个弱点都有明确补强路径,属工作量问题而非范式问题。

未来方向

作者提出的方向:其一,把多语言 TextArena 用作智能体训练环境,通过强化学习让模型在弱语言接口上练习以消除技能差距;其二,结合开源数据配方模型(如 Apertus 类)研究训练数据分布与技能一致性的因果关系,回答「同样语言数据量为何在不同模型上实现出不同强度」。基于其成果可延伸:其三,机制可解释性——定位语言条件化的技能回路,检验「知识按语言分区存储」在技能层面的对应物,例如观察 Nim-sum 计算在阿语/希语推理中的表征路径何处中断;其四,自适应语言路由——训练模型自主选择最强推理语言(把 self-translate 内生化),评估其在多语言智能体部署中的收益与代价;其五,把语言集扩展到已发布的 Tier B/C 共 160 余种语言,检验低资源语言的技能落差与跨文字系统迁移的边界;其六,把「接口-推理语言解耦」协议推广到代码生成、数学、工具调用等领域,构建系统的「语言条件化能力图谱」;其七,研究日志中观察到的自发语码转换(Ministral 在阿语日志 3.7% 的片段切到拉丁字母并贡献其 70% 策略提及)能否被主动诱导为低成本的性能恢复策略。

复现评估

复现条件在同类工作中相当好。代码与数据完全公开:TextArena 主仓库(MIT 协议,github.com/TextArena/TextArena)已并入多语言支持,65 个游戏 × 约 193 种语言的 locale 文件(64 个语言文件、约 1,000 条玩家可见字符串、350 个动作 token)与逐语言置信度记录随文发布,翻译流水线工具链保存在独立分支。被评模型均为开源权重(Gemma-4-E4B-it、Qwen3-4B、Ministral3-3B-Instruct),全程仅推理、无需训练。算力门槛低:单个主实验 run 只需 2 块 H200、约 6 GPU 时(IPD 除外),全量 18 个 run 约合 100+ H200 时,一般实验室可负担;单模型单游戏的小型复刻单卡即可。难度评估为中等偏低:主要成本在大规模 rollout 的工程编排(vLLM + Ray)及 Tier A 语言母语者校验(普通团队可用论文验证过的双模型直接判官替代,其灵敏度/特异度达 100%)。注意事项:实验经 OpenRouter/API 调用具体模型版本,随时间可能漂移;temperature $=1.0$ 采样会带来波动,复现时应固定随机种子并酌情增大 $n$ 以收窄置信区间。