← 返回 2026-09-09

测量机器人策略中的语言迁移:为 Cosmos3 视觉-语言-动作模型添加希腊语 Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy

Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos 📅 2026-09-07 👍 21 2026-09-12 18:30
世界模型 假阳性控制 机器人策略 视觉-语言-动作模型 评测方法学 跨语言迁移

加希腊语容易,证明有效难:五类常用指标全部失灵,需以构造性对照与多种子复现重建可信结论。

前置知识

视觉-语言-动作模型(VLA)

接收摄像头图像与自然语言指令、直接输出机器人动作块的通用策略模型。通常由预训练视觉-语言模型提供理解骨干(本文称文本塔),再接动作解码模块,用行为克隆在演示数据上微调,代表有 RT-2、π0、OpenVLA。本文用的 Cosmos3 栈由视频世界模型加动作策略组成,两者共享同一文本塔。

本文的全部问题就是 VLA 的语言条件通路能否支撑一门新语言,所有训练与评测对象都是这类模型,需要先知道指令在架构中走哪条路。

视频世界模型与文本塔

视频世界模型依据文本与图像生成未来视频帧;Cosmos3 以 Mixture-of-Transformers 实现,自回归推理与扩散生成共享多模态注意力层和 3D 旋转位置编码。文本塔是处理指令的语言编码器,继承自 VLM 预训练,其语言覆盖决定下游能教什么;本文对比英文中心 2B 塔与多语言 8B 塔。

核心结论『塔是瓶颈』正建立在对塔、生成通路与动作通路三者关系的分层检验上,不懂这个架构就读不懂两个 Study 的设计。

单目标与多目标基准(LIBERO)

LIBERO 是仿真桌面操作基准。LIBERO-10 每个场景只有一个被训练的目标,策略看场景即可行动,语言可被完全忽略;LIBERO-Goal 把十个目标放进同一场景,指令成为唯一的任务选择信号,才能检验语言理解;LIBERO-90 含 20 个场景 90 个任务,均匀机会 1.1%,仅凭场景先验约可拿 22%。

论文证明单目标套件无法归因语言能力,多目标套件加错误指令对照才是有效的测量仪器,这是理解全部实验数字的前提。

错误指令对照与构造性零假设

评测时除正确指令外,还给每个任务配一条其他任务的指令作为阴性对照:真读语言的策略在错误指令下应跌至机会水平。本文更进一步,用从未见过希腊语训练的同款策略提供『由构造保证为零』的参照,并按目标给出逐目标的零水平,而非笼统的 10% 机会率。

这是论文方法学支柱:84.6% 的希腊语成绩正是被 82.6% 的错误指令成绩揭穿为幻觉的,读结果时必须随时对照这条底线。

分词器膨胀率(tokenizer fertility)

同一句话在不同语言下被切出的 token 数之比。多语言塔对希腊语近乎字符级切分:十条评测指令英语共 72 token、希腊语 274 token,膨胀 3.81×;『把碗放柜顶』从 8 片变 24 片且多为单字母。膨胀高意味着序列更长、语义更碎,是候选失败机制之一。

3.81× 膨胀是论文讨论残余英-希差距的两个未解耦假说之一,也是选底座前可以免费检查的指标。

种子方差与配对比较

同一配方只换随机种子重训带来的成绩波动。本文希腊语成功率在十目标套件上跨种子波动 31.6 点而英语仅 1.0 点,因此跨配方比较必须改为策略内配对量(种子效应在同一 checkpoint 内抵消),跨策略则要求一个臂的每个种子都超过另一臂的每个种子(3v3 精确置换检验下限 p=0.100)。

不理解种子方差就无法理解论文为何撤回五条结论,以及为何反复强调『先复现、再相信』。

研究动机

机器人基础模型几乎完全用英语构建:演示语料是英文标注的,基准发英文指令,继承的语言塔也是英语最强。对其他语言使用者这是一堵硬墙——不存在希腊语机器人演示数据集,从头采集意味着遥控机器人数月,只为复现英语接口后已存在的能力。更麻烦的是测量:LIBERO-10 这类单目标套件上,先前工作(LIBERO-Plus)已发现 VLA 对语言变化『基本不敏感』,本文复现了该病症——同一策略在希腊语指令下成功率 84.6%,在故意错误的指令下仍有 82.6%,即基准根本分不清『听懂了』与『无视语言』。换句话说,从业者想确认翻译是否奏效时最先想到的五类工具(色彩直方图相似度、单目标基准、十目标小套件、训练损失、单次运行对比)全部会在没有成功的地方报告成功。

本文的目标是论文问两个问题。其一是实践问题:在完全不改架构、用机器把英文语料改写成希腊语(强制术语表+反直译规则+复检)的前提下,能否给开源 VLA 栈添加希腊语,代价与收益各是什么?其二是论文真正的主体——测量问题:对『策略遵循语言 L』这类断言,瓶颈既不在数据也不在模型,而在测量仪器。论文要建立一套带构造性零假设与多种子复现的评测协议,用它识别并公开撤回经不起对照的结论(共五条),最终沉淀为一份技术上便宜、可核查的操作清单:先建零假设、再建指标;先复现、再相信。

与已有工作不同的是,独特切入有三点。第一,用策略被独立证明不懂的语种作天然阴性对照:训练一个从不见希腊语的完全相同的策略,它在希腊语上必然处于机会水平,由此得到『由构造保证的零假设』,免去『指令改写该有多大影响』的争论,与 LIBERO-Plus 的扰动式控制互补而非替代。第二,多语言 NLP 文献止步于文本输出,机器人操作的语言迁移此前无人测量,论文把『少量多语言混合优于纯目标语言微调』的结论带入具身领域。第三,论文不求打败基线,而是把被自己的对照推翻的五条结论连同证据一并发表,把失败记录本身当作贡献——这在没有先验阴性结果可参考的机器人多语言化无人区尤其稀缺。

核心方法

直觉上给策略注入新语言有三条通道:换一个本来就懂该语言的底座文本塔、用该语言演示数据训练动作通路、或直接微调塔本身。论文用开源 Cosmos3 栈系统检验:Cosmos3 是统一 Mixture-of-Transformers 世界模型(自回归推理与扩散生成共享多模态注意力层与单一 3D 旋转位置编码),策略经同一文本塔接收指令、由动作适配器输出 16 步动作块。希腊语数据全部机器生成:kimi-k3 在强制术语表与反直译规则下把英文改写成希腊语祈使句,共 53,207 条唯一任务指令与 1,273 条 BridgeData V2 富场景描述(1,222 条过检,希腊字符比均值≥0.995);把希腊语变体以竖线分隔追加进指令字段,加载器每步均匀采样即得 50/50 双语训练,零代码改动。训练用原厂 SFT 训练器(8×B200、2,000 步、AdamW、学习率 $5\times10^{-5}$、余弦调度、批量每卡 1);评测为三路对照(正确英语、正确希腊语、错误希腊语指令),LIBERO 闭环、每任务 50 试次、每格最多 500 集。

核心不是新模型而是新测量协议,三个设计相互咬合。第一,分层定位迁移:Study 1 换塔后只读视频分支(世界模型生成),Study 2 冻结塔、只训动作适配器后读闭环动作分支——因为指令通路在架构上与世界模型共享,对一个分支的结论就是对另一分支的证据。第二,构造性零假设:从没用希腊语训练过的同款策略必然读不懂希腊语,它给出每个目标的逐目标零水平(而非笼统 10% 机会率),暴露聚合成功率对机制的掩盖。第三,一切比较改为配对:策略内量(希腊语成功率减自身错误指令底线)使占主导的种子效应在同一 checkpoint 内抵消;跨策略比较要求『一个臂的每个种子都超过另一个臂的每个种子』(3v3 时精确置换检验下限 p=0.100),并在附录 A 公布全部二十条推断比较、承认不做多重比较校正。

方法步骤详情

数据侧:LLM 流水线按强制术语表与反直译规则把英文改写为希腊语并复检,得到 53,207 条任务指令与 1,273 条富场景描述;希腊语变体以竖线分隔追加到指令字段,加载器均匀采样实现 50/50 双语。Study 1(世界模型):在 855 希腊语+367 英语描述上做剂量阶梯微调(塔冻结→塔 0.1× 学习率→全学习率三倍时长→100% 希腊语续训),发现英文塔下希腊语生成始终为噪声;换多语言 8B 塔后同一配方先小规模验证、再以 6,836 段 70/30 混合语料训练,即可生成连贯希腊语场景;随后用 VLM 评审 51 个留出场景/语言的连贯性与内容匹配。Study 2(策略):从基座动作策略检查点出发、塔冻结、只训动作适配器 2,000 步,比较双语采样、仅希腊语、仅英语(阴性对照)、解冻塔、世界模型热启动、每任务七种希腊语措辞等臂;在 LIBERO-Goal(10 目标/场景)与 LIBERO-90 上闭环评测四条件(正确英/希、独立译者希腊语、错误指令),三种子;另做失败模式分析(每集末对全部十个目标谓词打分)与 DROID 真机语料的动作预测代理评测。

技术新颖性

据作者所知这是首个训练并评测非英语 VLA 策略的研究(作者明确不做优先权声明)。技术新颖性有三层。其一,『由构造保证的零假设』是对扰动式控制(如 LIBERO-Plus 的指令删改、改写)的补充:换一门策略被独立证明不懂的语言,免除了改写强度的争论,代价是多训一个策略。其二,把多语言指令微调的结论带入具身领域并在 90 任务套件上以配对形式解决:双语策略每个种子的超出底线幅度(6.7–7.1 点)都超过希腊语-only 的每个种子(−0.3 到 2.7),完美分离。其三,量化机器译者的『个人习语』(idiolect)惩罚:换成独立译者平均掉 23.3 点而英文改写仅 3.9–4.7 点,且每任务七种措辞的训练把惩罚砍半(平均 12.3)并使其跨种子可预测(波动从 16.4 点收到 2.2 点)——揭示目标语言成绩很大程度在学翻译器的措辞习惯而非语言本身。

The Cosmos3 stack as this paper touches it.
Figure 1: The Cosmos3 stack as this paper touches it.
The Cosmos3 backbone, redrawn from the vendor's description.
Figure 2: The Cosmos3 backbone, redrawn from the vendor's description.
One command as the multilingual tower's tokenizer sees it
Figure 3: One command as the multilingual tower's tokenizer sees it
The ten Greek instructions as the policy saw them in training, beside the independently produced set used for the idiolect measurement.
Figure 7: The ten Greek instructions as the policy saw them in training, beside the independently produced set used for the idiolect measurement.

实验结果

塔是瓶颈:英文塔世界模型沿剂量阶梯(冻结塔直到全学习率三倍时长)希腊语生成始终为噪声;换 8B 多语言塔后 64% 希腊语提示生成连贯场景(英语 100% 连贯、90% 内容良好),但内容良好匹配 0%、部分匹配仅 30%——迁移停在场景级。热启动有害:热启动得英语 79.2%/希腊语 13.6%,从基座重训得 96.4%/48.6%(错误指令 4.4%)。单目标套件失效:LIBERO-10 上 84.6% 希腊语对 82.6% 错误指令。90 任务上双语策略三种子对底线裕度 +7.1/+6.8/+6.7(区间均不含零),希腊语-only 仅 −0.3/+0.7/+2.7,完美分离;十目标双语 48.6/80.2/55.2 对希腊语-only 20.4/66.6/23.8(p=0.300 不可判)。译者惩罚:独立译者平均跌 23.3 点,英语改写仅 4.7 点,七措辞砍到 12.3。解冻塔有害(82.4%/18.0%);六策略损失仅差 1.4% 而希腊语能力差 7.2 倍;种子极差十目标 31.6 点、90 任务 2.4 点;DROID 代理中希腊语与零假设无异。

Closed-loop task success, 50 trials per task (500 episodes per cell).
Table 1: Closed-loop task success, 50 trials per task (500 episodes per cell).
Per-goal success for the bilingual policy on the multi-goal suite (50 trials per goal).
Table 2: Per-goal success for the bilingual policy on the multi-goal suite (50 trials per goal).
The five retractions.
Table 3: The five retractions.
The recipe, in the order we would apply it, with the measurement behind each step and the number of training runs that support it.
Table 4: The recipe, in the order we would apply it, with the measurement behind each step and the number of training runs that support it.
Every inferential comparison in the paper, its family, its sampling unit, and whether it survives a Bonferroni threshold at α' = 0.0025.
Table 5: Every inferential comparison in the paper, its family, its sampling unit, and whether it survives a Bonferroni threshold at α' = 0.0025.
Per-goal success (%) on the ten-goal suite, 50 trials per cell.
Table 6: Per-goal success (%) on the ten-goal suite, 50 trials per cell.
Generation from the same held-out Greek caption (mid-clip frame).
Figure 4: Generation from the same held-out Greek caption (mid-clip frame).
Why single-goal benchmarks cannot test language.
Figure 5: Why single-goal benchmarks cannot test language.
Greek success against distance from the training translator, every run drawn.
Figure 6: Greek success against distance from the training translator, every run drawn.
The same rewording, in each language.
Figure 8: The same rewording, in each language.
What the policy does when it fails.
Figure 9: What the policy does when it fails.
The translator penalty, measured within each policy.
Figure 10: The translator penalty, measured within each policy.
Greek task success by training intervention.
Figure 11: Greek task success by training intervention.
The same four-condition protocol on a suite nine times larger, three training seeds per arm.
Figure 12: The same four-condition protocol on a suite nine times larger, three training seeds per arm.
Where Greek works, task by task.
Figure 13: Where Greek works, task by task.
The seed instability is a property of the small suite, not of the recipe.
Figure 16: The seed instability is a property of the small suite, not of the recipe.
查看结构化数据
任务指标本文基线提升
LIBERO-Goal 十目标套件·希腊语闭环成功率(双语配方:从基座训练、塔冻结) 任务成功率,每任务 50 试次(500 集/格) 48.6%(三种子 48.6/80.2/55.2,均值 61.3) 自身错误指令底线 4.4%;英语-only 对照的希腊语 9.0%(即其底线) 较错误指令 +44.2 点,较英语-only 约 +39.6 点;希腊语约为英语成绩的一半
LIBERO-90 九十任务套件·双语策略 vs 希腊语-only 策略 希腊语超出自身错误指令底线的配对裕度(三训练种子/臂) 双语 +6.9 点(27.4% 对 20.5% 底线,逐种子 6.7/6.8/7.1) 希腊语-only 裕度 −0.3/+0.7/+2.7(均值 1.0) 完美分离:双语每个种子超过希腊语-only 每个种子(设计下限 p=0.100)
译者习语惩罚(十目标套件,策略内配对比较) 换成独立译者后的希腊语成功率跌幅 单措辞臂平均 −23.3 点(−30.8/−24.8/−14.4);七措辞臂平均 −12.3 点 英语改写:仅改句法平均 −3.9 点,替换名词(7/10 条)平均 −4.7 点 措辞多样性把惩罚减半且波动从 16.4 点收到 2.2 点(唯一幸存复现的干预)
Study 1 世界模型·希腊语条件视频生成(51 个留出场景) VLM 评审的连贯性与内容匹配(英文源描述为参照) 多语言塔:连贯 64%、内容良好匹配 0%、部分匹配 30% 英文塔(任意剂量):无可辨识结构(0%);英语提示参考:连贯 100%、良好 90% 换塔使连贯生成从无到 64%,但内容级迁移为零,即场景级而非内容级
世界模型热启动 vs 从基座训练(LIBERO-Goal,英语/希腊语) 闭环任务成功率(单运行/臂,方向性证据) 从基座:96.4% / 48.6% 热启动:79.2% / 13.6%(希腊语统计上处于 10% 机会水平) 放弃热启动使希腊语 +35.0 点、英语 +17.2 点,视频生成微调侵蚀动作相关表征
训练损失 vs 希腊语能力(六个已完成策略) 后期训练损失极差 与 希腊语成功率极差 的对比 损失跨度仅 1.4%(0.780–0.791),且最优希腊语策略损失最高 希腊语成功率 9.2–66.6%,相差 7.2 倍;同损失 0.780 的两个策略差 14.6 点 证明行为克隆损失对语言条件作用结构性失明,训练曲线不能用于排序配方

局限与改进

作者承认的局限:单一语言(希腊语)、单一模型族(Cosmos3)、仅仿真;全部希腊语数据为机器改写,无任何人工希腊语,『独立译者』也只是另一个 LLM,故测得的是两个机器渲染之间的成本,是真实母语措辞成本的下界;真机 DROID 语料(57,639 集)因无物理 Franka 无法闭环评分,动作预测代理只在 5% 训练进度(500/10,000 步)下单次运行且无区间;跨策略比较在 3 种子/臂下精确检验下限 p=0.100,不能称显著,五个完美分离对比至少其一出自偶然的概率约 41%;残余英-希差距的原因(表征深度 vs 3.81× 分词膨胀)未解耦,且英文 2B 塔膨胀 2.08× 更粗却完全学不会,说明膨胀不充分;热启动负迁移混杂域偏移(BridgeData V2 真机 WidowX 对 LIBERO 仿真 Franka)。我的补充:64% 连贯但 0% 内容匹配使场景级迁移的实用价值存疑;术语表把 stove 固定为兼指厨房的歧义词,译者伪影与语言能力在训练数据内纠缠;发布的最佳检查点是三种子最大值(80.2%)而非期望值(61.3%),复现者需警惕。

独立分析的弱点

第一,统计功效受设计钳制:3 种子/臂的运行级检验下限 p=0.100,且二十条比较无多重比较校正,所有跨策略结论本质是排序声明而非效应量——改进方向是每臂增加种子(每种子仅一次训练即可压低下限)或用层次贝叶斯把种子当随机效应。第二,语言与架构双重单一:措辞多样性减半译者惩罚等结论未必外推到形态更丰富的语言或 RT-2/OpenVLA 架构,应做语言×架构的最小复制矩阵。第三,Study 1 只依赖单一 VLM 评审,且其校准集把希腊语提示的片段默认标为噪声,三级内容匹配判断未校准——应引入人工评审与多评审一致性。第四,策略只训 2,000 步(原定 10,000 步的 20%),DROID 代理在 5% 进度就判『希腊语无信号』,语言条件作用可能尚未涌现,作者也承认未测后期。第五,双语对希腊语-only 的『脚手架』效应在十目标上被撤回、在 90 任务上以配对形式恢复,说明效应小且对套件敏感,应补混合比例扫描(如 75/25、90/10)的专门消融。第六,逐目标失败身份随种子漂移,其 lexical 决定因素未被找到。

未来方向

作者列为开放的问题:(i) 语言混合比例是否在『有无目标语言数据』之外起作用——三种子只能给方向,把运行级检验压到 p=0.100 以下需要更多训练运行;措辞多样性收益是否超出十目标套件——需构建措辞多样的 90 任务训练集;(ii) 是否迁移到真机——希腊语 DROID 策略已训好但无硬件可评分,补齐物理 Franka 或高保真仿真即可解锁约三天算力的完整调度实验;(iii) 残余差距归因——需对冻结塔的编码做直接探针,或用音译/扩词表希腊语重训策略,以解耦表征深度与 3.81× 分词膨胀;更温和的塔适配(LoRA、强阻尼学习率)未测,『别碰塔』只对最大强度解冻成立;(iv) 为十目标指令收集母语者措辞只需一个下午,是作者最想补的第一件事。基于本文可延伸的方向:把构造性零假设推广到其他属性(空间关系、否定、数量),为多语言 VLA 建立强制错误指令对照的标准基准,以及研究种子方差本身在低资源语言上的成因。

复现评估

复现友好度较高但非开箱即用。已开源:策略检查点 Sophea-Nano-Policy-LIBERO-Greek-v1(HuggingFace safetensors,可直接载入 Cosmos3 策略服务器,模型卡同时报告错误指令对照与三路评测复现命令),以及脚本、剂量阶梯配置、训练配置与评测 harness;『独立』希腊语指令集与复现精确数字所需的指令集可邮件索取(限研究用途)。刻意不开源两件:希腊语化世界模型(内容匹配为 0,不该凭连贯性发布)与翻译语料。算力:8×B200,每臂 2,000 步 SFT,单次训练小时级,成本主要在三种子×多臂的评测(90 任务时每格 1,800 集×4 条件×3 种子)。难度中等:主要障碍是 Cosmos3 栈与 LIBERO 环境搭建;读者自己的译者必然不同于原作者,因此能复现协议与管道但不复现精确数字(作者明示这一点)。附录 A 的完整推断清单与 Table 4 的八步配方(含每步所需运行数)大幅降低了踩坑成本。