测量机器人策略中的语言迁移:为 Cosmos3 视觉-语言-动作模型添加希腊语 Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy
加希腊语容易,证明有效难:五类常用指标全部失灵,需以构造性对照与多种子复现重建可信结论。
前置知识
视觉-语言-动作模型(VLA)
接收摄像头图像与自然语言指令、直接输出机器人动作块的通用策略模型。通常由预训练视觉-语言模型提供理解骨干(本文称文本塔),再接动作解码模块,用行为克隆在演示数据上微调,代表有 RT-2、π0、OpenVLA。本文用的 Cosmos3 栈由视频世界模型加动作策略组成,两者共享同一文本塔。
本文的全部问题就是 VLA 的语言条件通路能否支撑一门新语言,所有训练与评测对象都是这类模型,需要先知道指令在架构中走哪条路。
视频世界模型与文本塔
视频世界模型依据文本与图像生成未来视频帧;Cosmos3 以 Mixture-of-Transformers 实现,自回归推理与扩散生成共享多模态注意力层和 3D 旋转位置编码。文本塔是处理指令的语言编码器,继承自 VLM 预训练,其语言覆盖决定下游能教什么;本文对比英文中心 2B 塔与多语言 8B 塔。
核心结论『塔是瓶颈』正建立在对塔、生成通路与动作通路三者关系的分层检验上,不懂这个架构就读不懂两个 Study 的设计。
单目标与多目标基准(LIBERO)
LIBERO 是仿真桌面操作基准。LIBERO-10 每个场景只有一个被训练的目标,策略看场景即可行动,语言可被完全忽略;LIBERO-Goal 把十个目标放进同一场景,指令成为唯一的任务选择信号,才能检验语言理解;LIBERO-90 含 20 个场景 90 个任务,均匀机会 1.1%,仅凭场景先验约可拿 22%。
论文证明单目标套件无法归因语言能力,多目标套件加错误指令对照才是有效的测量仪器,这是理解全部实验数字的前提。
错误指令对照与构造性零假设
评测时除正确指令外,还给每个任务配一条其他任务的指令作为阴性对照:真读语言的策略在错误指令下应跌至机会水平。本文更进一步,用从未见过希腊语训练的同款策略提供『由构造保证为零』的参照,并按目标给出逐目标的零水平,而非笼统的 10% 机会率。
这是论文方法学支柱:84.6% 的希腊语成绩正是被 82.6% 的错误指令成绩揭穿为幻觉的,读结果时必须随时对照这条底线。
分词器膨胀率(tokenizer fertility)
同一句话在不同语言下被切出的 token 数之比。多语言塔对希腊语近乎字符级切分:十条评测指令英语共 72 token、希腊语 274 token,膨胀 3.81×;『把碗放柜顶』从 8 片变 24 片且多为单字母。膨胀高意味着序列更长、语义更碎,是候选失败机制之一。
3.81× 膨胀是论文讨论残余英-希差距的两个未解耦假说之一,也是选底座前可以免费检查的指标。
种子方差与配对比较
同一配方只换随机种子重训带来的成绩波动。本文希腊语成功率在十目标套件上跨种子波动 31.6 点而英语仅 1.0 点,因此跨配方比较必须改为策略内配对量(种子效应在同一 checkpoint 内抵消),跨策略则要求一个臂的每个种子都超过另一臂的每个种子(3v3 精确置换检验下限 p=0.100)。
不理解种子方差就无法理解论文为何撤回五条结论,以及为何反复强调『先复现、再相信』。
研究动机
机器人基础模型几乎完全用英语构建:演示语料是英文标注的,基准发英文指令,继承的语言塔也是英语最强。对其他语言使用者这是一堵硬墙——不存在希腊语机器人演示数据集,从头采集意味着遥控机器人数月,只为复现英语接口后已存在的能力。更麻烦的是测量:LIBERO-10 这类单目标套件上,先前工作(LIBERO-Plus)已发现 VLA 对语言变化『基本不敏感』,本文复现了该病症——同一策略在希腊语指令下成功率 84.6%,在故意错误的指令下仍有 82.6%,即基准根本分不清『听懂了』与『无视语言』。换句话说,从业者想确认翻译是否奏效时最先想到的五类工具(色彩直方图相似度、单目标基准、十目标小套件、训练损失、单次运行对比)全部会在没有成功的地方报告成功。
本文的目标是论文问两个问题。其一是实践问题:在完全不改架构、用机器把英文语料改写成希腊语(强制术语表+反直译规则+复检)的前提下,能否给开源 VLA 栈添加希腊语,代价与收益各是什么?其二是论文真正的主体——测量问题:对『策略遵循语言 L』这类断言,瓶颈既不在数据也不在模型,而在测量仪器。论文要建立一套带构造性零假设与多种子复现的评测协议,用它识别并公开撤回经不起对照的结论(共五条),最终沉淀为一份技术上便宜、可核查的操作清单:先建零假设、再建指标;先复现、再相信。
与已有工作不同的是,独特切入有三点。第一,用策略被独立证明不懂的语种作天然阴性对照:训练一个从不见希腊语的完全相同的策略,它在希腊语上必然处于机会水平,由此得到『由构造保证的零假设』,免去『指令改写该有多大影响』的争论,与 LIBERO-Plus 的扰动式控制互补而非替代。第二,多语言 NLP 文献止步于文本输出,机器人操作的语言迁移此前无人测量,论文把『少量多语言混合优于纯目标语言微调』的结论带入具身领域。第三,论文不求打败基线,而是把被自己的对照推翻的五条结论连同证据一并发表,把失败记录本身当作贡献——这在没有先验阴性结果可参考的机器人多语言化无人区尤其稀缺。
核心方法
直觉上给策略注入新语言有三条通道:换一个本来就懂该语言的底座文本塔、用该语言演示数据训练动作通路、或直接微调塔本身。论文用开源 Cosmos3 栈系统检验:Cosmos3 是统一 Mixture-of-Transformers 世界模型(自回归推理与扩散生成共享多模态注意力层与单一 3D 旋转位置编码),策略经同一文本塔接收指令、由动作适配器输出 16 步动作块。希腊语数据全部机器生成:kimi-k3 在强制术语表与反直译规则下把英文改写成希腊语祈使句,共 53,207 条唯一任务指令与 1,273 条 BridgeData V2 富场景描述(1,222 条过检,希腊字符比均值≥0.995);把希腊语变体以竖线分隔追加进指令字段,加载器每步均匀采样即得 50/50 双语训练,零代码改动。训练用原厂 SFT 训练器(8×B200、2,000 步、AdamW、学习率 $5\times10^{-5}$、余弦调度、批量每卡 1);评测为三路对照(正确英语、正确希腊语、错误希腊语指令),LIBERO 闭环、每任务 50 试次、每格最多 500 集。
核心不是新模型而是新测量协议,三个设计相互咬合。第一,分层定位迁移:Study 1 换塔后只读视频分支(世界模型生成),Study 2 冻结塔、只训动作适配器后读闭环动作分支——因为指令通路在架构上与世界模型共享,对一个分支的结论就是对另一分支的证据。第二,构造性零假设:从没用希腊语训练过的同款策略必然读不懂希腊语,它给出每个目标的逐目标零水平(而非笼统 10% 机会率),暴露聚合成功率对机制的掩盖。第三,一切比较改为配对:策略内量(希腊语成功率减自身错误指令底线)使占主导的种子效应在同一 checkpoint 内抵消;跨策略比较要求『一个臂的每个种子都超过另一个臂的每个种子』(3v3 时精确置换检验下限 p=0.100),并在附录 A 公布全部二十条推断比较、承认不做多重比较校正。
方法步骤详情
数据侧:LLM 流水线按强制术语表与反直译规则把英文改写为希腊语并复检,得到 53,207 条任务指令与 1,273 条富场景描述;希腊语变体以竖线分隔追加到指令字段,加载器均匀采样实现 50/50 双语。Study 1(世界模型):在 855 希腊语+367 英语描述上做剂量阶梯微调(塔冻结→塔 0.1× 学习率→全学习率三倍时长→100% 希腊语续训),发现英文塔下希腊语生成始终为噪声;换多语言 8B 塔后同一配方先小规模验证、再以 6,836 段 70/30 混合语料训练,即可生成连贯希腊语场景;随后用 VLM 评审 51 个留出场景/语言的连贯性与内容匹配。Study 2(策略):从基座动作策略检查点出发、塔冻结、只训动作适配器 2,000 步,比较双语采样、仅希腊语、仅英语(阴性对照)、解冻塔、世界模型热启动、每任务七种希腊语措辞等臂;在 LIBERO-Goal(10 目标/场景)与 LIBERO-90 上闭环评测四条件(正确英/希、独立译者希腊语、错误指令),三种子;另做失败模式分析(每集末对全部十个目标谓词打分)与 DROID 真机语料的动作预测代理评测。
技术新颖性
据作者所知这是首个训练并评测非英语 VLA 策略的研究(作者明确不做优先权声明)。技术新颖性有三层。其一,『由构造保证的零假设』是对扰动式控制(如 LIBERO-Plus 的指令删改、改写)的补充:换一门策略被独立证明不懂的语言,免除了改写强度的争论,代价是多训一个策略。其二,把多语言指令微调的结论带入具身领域并在 90 任务套件上以配对形式解决:双语策略每个种子的超出底线幅度(6.7–7.1 点)都超过希腊语-only 的每个种子(−0.3 到 2.7),完美分离。其三,量化机器译者的『个人习语』(idiolect)惩罚:换成独立译者平均掉 23.3 点而英文改写仅 3.9–4.7 点,且每任务七种措辞的训练把惩罚砍半(平均 12.3)并使其跨种子可预测(波动从 16.4 点收到 2.2 点)——揭示目标语言成绩很大程度在学翻译器的措辞习惯而非语言本身。
实验结果
塔是瓶颈:英文塔世界模型沿剂量阶梯(冻结塔直到全学习率三倍时长)希腊语生成始终为噪声;换 8B 多语言塔后 64% 希腊语提示生成连贯场景(英语 100% 连贯、90% 内容良好),但内容良好匹配 0%、部分匹配仅 30%——迁移停在场景级。热启动有害:热启动得英语 79.2%/希腊语 13.6%,从基座重训得 96.4%/48.6%(错误指令 4.4%)。单目标套件失效:LIBERO-10 上 84.6% 希腊语对 82.6% 错误指令。90 任务上双语策略三种子对底线裕度 +7.1/+6.8/+6.7(区间均不含零),希腊语-only 仅 −0.3/+0.7/+2.7,完美分离;十目标双语 48.6/80.2/55.2 对希腊语-only 20.4/66.6/23.8(p=0.300 不可判)。译者惩罚:独立译者平均跌 23.3 点,英语改写仅 4.7 点,七措辞砍到 12.3。解冻塔有害(82.4%/18.0%);六策略损失仅差 1.4% 而希腊语能力差 7.2 倍;种子极差十目标 31.6 点、90 任务 2.4 点;DROID 代理中希腊语与零假设无异。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| LIBERO-Goal 十目标套件·希腊语闭环成功率(双语配方:从基座训练、塔冻结) | 任务成功率,每任务 50 试次(500 集/格) | 48.6%(三种子 48.6/80.2/55.2,均值 61.3) | 自身错误指令底线 4.4%;英语-only 对照的希腊语 9.0%(即其底线) | 较错误指令 +44.2 点,较英语-only 约 +39.6 点;希腊语约为英语成绩的一半 |
| LIBERO-90 九十任务套件·双语策略 vs 希腊语-only 策略 | 希腊语超出自身错误指令底线的配对裕度(三训练种子/臂) | 双语 +6.9 点(27.4% 对 20.5% 底线,逐种子 6.7/6.8/7.1) | 希腊语-only 裕度 −0.3/+0.7/+2.7(均值 1.0) | 完美分离:双语每个种子超过希腊语-only 每个种子(设计下限 p=0.100) |
| 译者习语惩罚(十目标套件,策略内配对比较) | 换成独立译者后的希腊语成功率跌幅 | 单措辞臂平均 −23.3 点(−30.8/−24.8/−14.4);七措辞臂平均 −12.3 点 | 英语改写:仅改句法平均 −3.9 点,替换名词(7/10 条)平均 −4.7 点 | 措辞多样性把惩罚减半且波动从 16.4 点收到 2.2 点(唯一幸存复现的干预) |
| Study 1 世界模型·希腊语条件视频生成(51 个留出场景) | VLM 评审的连贯性与内容匹配(英文源描述为参照) | 多语言塔:连贯 64%、内容良好匹配 0%、部分匹配 30% | 英文塔(任意剂量):无可辨识结构(0%);英语提示参考:连贯 100%、良好 90% | 换塔使连贯生成从无到 64%,但内容级迁移为零,即场景级而非内容级 |
| 世界模型热启动 vs 从基座训练(LIBERO-Goal,英语/希腊语) | 闭环任务成功率(单运行/臂,方向性证据) | 从基座:96.4% / 48.6% | 热启动:79.2% / 13.6%(希腊语统计上处于 10% 机会水平) | 放弃热启动使希腊语 +35.0 点、英语 +17.2 点,视频生成微调侵蚀动作相关表征 |
| 训练损失 vs 希腊语能力(六个已完成策略) | 后期训练损失极差 与 希腊语成功率极差 的对比 | 损失跨度仅 1.4%(0.780–0.791),且最优希腊语策略损失最高 | 希腊语成功率 9.2–66.6%,相差 7.2 倍;同损失 0.780 的两个策略差 14.6 点 | 证明行为克隆损失对语言条件作用结构性失明,训练曲线不能用于排序配方 |
局限与改进
作者承认的局限:单一语言(希腊语)、单一模型族(Cosmos3)、仅仿真;全部希腊语数据为机器改写,无任何人工希腊语,『独立译者』也只是另一个 LLM,故测得的是两个机器渲染之间的成本,是真实母语措辞成本的下界;真机 DROID 语料(57,639 集)因无物理 Franka 无法闭环评分,动作预测代理只在 5% 训练进度(500/10,000 步)下单次运行且无区间;跨策略比较在 3 种子/臂下精确检验下限 p=0.100,不能称显著,五个完美分离对比至少其一出自偶然的概率约 41%;残余英-希差距的原因(表征深度 vs 3.81× 分词膨胀)未解耦,且英文 2B 塔膨胀 2.08× 更粗却完全学不会,说明膨胀不充分;热启动负迁移混杂域偏移(BridgeData V2 真机 WidowX 对 LIBERO 仿真 Franka)。我的补充:64% 连贯但 0% 内容匹配使场景级迁移的实用价值存疑;术语表把 stove 固定为兼指厨房的歧义词,译者伪影与语言能力在训练数据内纠缠;发布的最佳检查点是三种子最大值(80.2%)而非期望值(61.3%),复现者需警惕。
独立分析的弱点
第一,统计功效受设计钳制:3 种子/臂的运行级检验下限 p=0.100,且二十条比较无多重比较校正,所有跨策略结论本质是排序声明而非效应量——改进方向是每臂增加种子(每种子仅一次训练即可压低下限)或用层次贝叶斯把种子当随机效应。第二,语言与架构双重单一:措辞多样性减半译者惩罚等结论未必外推到形态更丰富的语言或 RT-2/OpenVLA 架构,应做语言×架构的最小复制矩阵。第三,Study 1 只依赖单一 VLM 评审,且其校准集把希腊语提示的片段默认标为噪声,三级内容匹配判断未校准——应引入人工评审与多评审一致性。第四,策略只训 2,000 步(原定 10,000 步的 20%),DROID 代理在 5% 进度就判『希腊语无信号』,语言条件作用可能尚未涌现,作者也承认未测后期。第五,双语对希腊语-only 的『脚手架』效应在十目标上被撤回、在 90 任务上以配对形式恢复,说明效应小且对套件敏感,应补混合比例扫描(如 75/25、90/10)的专门消融。第六,逐目标失败身份随种子漂移,其 lexical 决定因素未被找到。
未来方向
作者列为开放的问题:(i) 语言混合比例是否在『有无目标语言数据』之外起作用——三种子只能给方向,把运行级检验压到 p=0.100 以下需要更多训练运行;措辞多样性收益是否超出十目标套件——需构建措辞多样的 90 任务训练集;(ii) 是否迁移到真机——希腊语 DROID 策略已训好但无硬件可评分,补齐物理 Franka 或高保真仿真即可解锁约三天算力的完整调度实验;(iii) 残余差距归因——需对冻结塔的编码做直接探针,或用音译/扩词表希腊语重训策略,以解耦表征深度与 3.81× 分词膨胀;更温和的塔适配(LoRA、强阻尼学习率)未测,『别碰塔』只对最大强度解冻成立;(iv) 为十目标指令收集母语者措辞只需一个下午,是作者最想补的第一件事。基于本文可延伸的方向:把构造性零假设推广到其他属性(空间关系、否定、数量),为多语言 VLA 建立强制错误指令对照的标准基准,以及研究种子方差本身在低资源语言上的成因。
复现评估
复现友好度较高但非开箱即用。已开源:策略检查点 Sophea-Nano-Policy-LIBERO-Greek-v1(HuggingFace safetensors,可直接载入 Cosmos3 策略服务器,模型卡同时报告错误指令对照与三路评测复现命令),以及脚本、剂量阶梯配置、训练配置与评测 harness;『独立』希腊语指令集与复现精确数字所需的指令集可邮件索取(限研究用途)。刻意不开源两件:希腊语化世界模型(内容匹配为 0,不该凭连贯性发布)与翻译语料。算力:8×B200,每臂 2,000 步 SFT,单次训练小时级,成本主要在三种子×多臂的评测(90 任务时每格 1,800 集×4 条件×3 种子)。难度中等:主要障碍是 Cosmos3 栈与 LIBERO 环境搭建;读者自己的译者必然不同于原作者,因此能复现协议与管道但不复现精确数字(作者明示这一点)。附录 A 的完整推断清单与 Table 4 的八步配方(含每步所需运行数)大幅降低了踩坑成本。
论文图表
色彩直方图相似度在两个微调配置间报告 2.8× 的『提升』,而帧检显示两个输出都是调色板漂向参考视频的无结构噪声。
『指标在没有成功处报告成功』的第一课:颜色统计不可用于评 coherence,必须先建零假设再信指标。
六个策略的后期训练损失 0.780–0.791(跨度 1.4%),希腊语成功率 9.2–66.6%(相差 7.2 倍);损失完全相同的两个策略希腊语差 14.6 点,最佳希腊语策略损失最高。
证明行为克隆损失被视觉与本体感觉先验主导,语言条件项太小而无法浮现——训练曲线永远不能用来排序语言能力。