超越数据规模:面向视觉-语言-动作模型的以表征为中心的持续预训练 Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
以表征为中心的持续预训练,用开源数据加16卡算力训出可迁移的VLA骨干
前置知识
VLA 模型(Vision-Language-Action)
以视觉-语言模型(VLM)为骨干、外接动作输出模块的机器人通用策略。输入相机图像与语言指令,输出动作块(action chunk)。代表系统有 π0、π0.5、GR00T N1/N1.5 等,通常在大规模机器人轨迹上做大规模训练,再针对任务微调。
本文研究的正是 VLA 的预训练范式:如何让 VLM 骨干在机器人数据上学到可迁移的动作表征,而不是单纯拟合动作。
动作头(Action Head):FAST / OFT / PI / GR00T
接在骨干之后、把隐表征解码成动作的模块,不同头有不同归纳偏置:FAST 把动作离散成 token,OFT 做连续回归,PI 用流匹配(flow matching),GR00T 用扩散式连续头。没有普遍最优的头,不同任务、具身和部署约束各有偏好。
论文的核心论点是预训练所用动作头会把骨干表征塑形成特定几何。理解四种头的差异,是读懂多头部协同监督设计的前提。
持续预训练(Continued Pre-training)
从一个已预训练好的模型(本文为 Qwen3-VL-4B)出发,在领域数据(多具身机器人轨迹)上继续大规模训练,之后再进入下游任务微调。π0、π0.5、GR00T 等通用 VLA 系统均采用这一范式,只是常称之为 VLA 预训练。
本文的全部设计都发生在持续预训练阶段;微调阶段与基线保持完全一致,以便把性能提升干净地归因于骨干表征本身。
头特定表征坍缩
指骨干与单一动作头联合优化后,动作相关信息被组织成只对该头的解码几何可用的形式:同头微调看似很强,换一个头性能骤降。试点实验中 OFT 预训练加 OFT 微调为 61.7%,换 GR00T 头掉到 28.9%,即典型症状。
这是论文动机部分最关键的失败模式,多头部连续协同监督正是针对它设计的解法。
跨具身动作空间
不同机器人(Franka 单臂、AgileX 双臂、GR-1 人形)自由度与运动学各异。常见做法是为每种机器人配独立动作头,或把低维动作补零对齐到统一维度;前者隔离了本可共享的监督,后者会把物理含义不同的坐标强行对齐。
论文提出部分统一布局——夹爪维度共享、机械臂维度按具身隔离并对不可用维度掩码——是其在跨具身任务上成功的关键设计。
研究动机
机器人数据的扩展性与互联网级图文数据有本质差异:轨迹必须在物理世界中通过遥操作等具身方式采集,成本高且稀疏地覆盖物理世界,即便 DROID、RoboCoin 等大规模开源数据集也远不能穷尽场景、物体、任务、具身与接触动力学构成的组合空间。因此在固定机器人数据预算下,继续预训练能否把有限轨迹转化为可迁移的视觉-动作知识,就成了核心瓶颈。论文用受控试点实验刻画了朴素做法的失败模式:固定 Qwen3-VL-4B 骨干、交叉变化预训练头与微调头后,在 RoboTwin-Clean 上 OFT 预训练加 OFT 微调得 61.7%(比从头训高 14.1),但同一骨干换 PI 头只有 55.1%(-5.4)、换 GR00T 头骤降到 28.9%(-22.3),说明单头监督导致头特定的表征坍缩;LIBERO-Plus 上离散 FAST 预训练可迁移到 GR00T 头(76.7 对从头训 75.9),但保留 FAST 头微调仅 61.4,暴露离散化带来的细粒度信息丢失。此外端到端更新还会侵蚀 VLM 从网络级语料学到的视觉-语言表征。
本文的目标是论文的目标不是继续堆数据或算力,而是回答:在固定机器人数据预算下,如何设计 VLA 继续预训练,使骨干学到强健、可迁移的视觉-动作表征。具体产出是名为 VLAct 的 VLA 导向 VLM 骨干:它保留 VLM 原有视觉-语言先验,把动作信息以头无关的形式编码,并在具身之间共享物理语义一致的动作监督;同时保持下游自由——用户可按需挂接任意任务专用动作头,在自有数据预算下微调。一条重要的实验纪律是所有对比固定动作头初始化、下游数据、优化器与微调预算,只更换骨干权重,从而把 7.6 至 21.4 个点的性能提升干净地归因于骨干表征。整个流程只用全开源数据(DROID、InternA1、RoboCoin、MolmoAct 加 caption 数据)和 16 张 GPU,与依赖闭源数据的 π 系列形成鲜明对照。
与已有工作不同的是,主流 VLA 工作(π 系列、GR00T 等)把进步主要寄托在数据与模型规模上,且常使用闭源数据,把 VLM 骨干当作从通用视觉-语言预训练继承来的固定组件。本文的独特切入是把骨干表征当作第一等设计变量:不再把机器人继续预训练看作大规模动作拟合,而是看作把轨迹蒸馏为骨干内可复用知识的过程。作者先单独操纵预训练动作头这一变量,用交叉实验量化出两条规律——离散监督可跨头迁移但经离散化丢失细粒度时序与幅值信息,连续单头监督虽然提升同头性能却造成头特定坍缩——再据此提出把头部多样性本身当作监督信号的训练配方,辅以浅层保护与部分统一动作空间。这一以表征为中心的视角让 16 卡、全开源的学术级配置也能与工业级 VLA 系统正面竞争,并把 VLM 骨干重新定义为 VLA 进步的独立维度。
核心方法
直觉上,一个好的 VLA 骨干应当像通用底座:下游无论接什么动作头、什么机器人,都能从中提取有用信息。技术路线分三步。第一步保护 VLM 先验:冻结视觉编码器与下半部分 LLM 层,只更新上层与动作头,并混入 caption 数据提供物体、属性、空间关系的密集监督,防止表征漂移,该策略在 LIBERO-Plus 与 AgileX 上分别带来 3.7% 与 3.4% 提升。第二步多动作头协同监督:在共享骨干隐表征 $z$ 上并联 OFT、PI、GR00T 三个连续动作头,对同一真值动作块 $a$ 计算损失 $\mathcal{L}_{action} = \mathcal{L}_{OFT} + \mathcal{L}_{PI} + \mathcal{L}_{GR00T}$,迫使动作信息以多种解码几何都能读取的形式存在。第三步部分统一跨具身动作空间:夹爪开合等物理语义一致的维度跨具身共享,机械臂维度按具身隔离并掩码不可用维度,对绝对关节角施加模 $360^\circ$ 的 wrap-aware 损失。微调时丢弃全部预训练头与 caption 流,重新初始化任务专用头并解冻全模型。
核心创新是把动作头的多样性本身当作表征学习信号。已有方法要么用单一动作头预训练导致头特定坍缩,要么引入专门的适配模块做跨具身对齐。VLAct 反其道而行:不发明新动作头、不加路由或适配器,而是让 OFT、PI、GR00T 三个归纳偏置不同的连续头同时回归同一动作块。三头共享同一次骨干前向和同一个隐表征 $z$,若骨干把动作信息编码成只利于某一头的几何,其余两头的损失就压不下去;要同时最小化三个损失,骨干必须暴露对所有参数化方式都可访问的动作特征。这样头部多样性起到双重作用:既改善跨头迁移,也作为正则化让同头微调优于单头预训练(附录 E 证实)。跨具身维度同理:只共享物理语义对齐的夹爪维度,不为不兼容自由度强行造坐标系,跨具身共享由动作空间中的共享坐标直接诱导,架构保持极简。这与试点实验的诊断精确对应——用监督多样性治疗监督单一性造成的坍缩。
方法步骤详情
训练分预训练与微调两阶段。预训练输入为混合数据流:Franka 单臂与 AgileX 双臂轨迹(DROID、InternA1、RoboCoin、MolmoAct,清洗见附录 H)加 caption 数据。视觉编码器与下半 LLM 层冻结,上层与动作头更新;每个机器人样本经共享骨干得到隐表征 $z$,OFT/PI/GR00T 三头同时对同一动作块回归并求和损失;动作维度按部分统一布局组织——夹爪维度(AgileX 2D、Franka 1D)跨具身共享,机械臂维度(12D/6D)按具身隔离并掩码不可用维度;绝对关节角用模 $360^\circ$ 的 wrap-aware 损失,把物理上仅差 $2^\circ$ 的 $179^\circ$ 与 $-179^\circ$ 正确拉近;caption 样本走标准描述任务。预训练共 16 张 GPU。微调:丢弃三个预训练头与 caption 流,按目标任务重新初始化动作头(如 LIBERO-Plus 用 OFT),解冻全模型,在与基线相同的优化器、数据、步数预算下训练;同一骨干可分别接三种头验证迁移性。
技术新颖性
新颖性有三层。第一,问题定义新:首次系统地把动作监督如何塑形骨干表征作为研究对象,用预训练头乘微调头的受控交叉实验量化头特定坍缩(OFT+OFT 61.7% 对 OFT+GR00T 28.9%),这在此前 VLA 文献中未被清晰刻画。第二,解法设计巧:多头部协同监督概念上类似多任务学习,但用在防止解码几何特化上是新用法;由于三头共享骨干前向,额外计算只是轻量的头部分支,几乎不增加训练成本。部分统一动作空间则介于每具身独立头与暴力补零统一之间,用掩码实现该共享的共享、不该共享的隔离,无需适配器、路由或具身条件解码器。第三,评估范式严谨:所有对比固定头部初始化、数据、优化器与微调预算,仅换骨干,把 7.6 至 21.4 点提升干净归因于表征;再用 20% 下游数据超过全数据基线证明数据效率来自表征质量而非数据规模,并跨 LIBERO-Plus、RoboTwin 2.0、真实机器人与两个未见具身多重验证。
实验结果
核心结论是仅更换骨干即带来 7.6 至 21.4 个点的稳定提升。LIBERO-Plus 上 VLAct 总分 82.6%,比同骨干 Qwen3VL-OFT(75.0%)高 7.6 点,超过 ABot-M0(80.5%)2.1 点,相机 73.9、噪声 86.0 等扰动维度领先最多。RoboTwin 2.0 双臂基准上,Base 设置 VLAct-OFT 达 80.5% Clean / 41.5% Random(Qwen3VL-OFT 仅 61.7% / 10.5%);Data Scaling 设置达 92.5% / 90.8%,超过 InternVLA-A1(89.4/89.6)与 π0.5(82.7/76.8),且三种头相差不超过 3.4 点,直接验证跨头迁移。真实机器人上单臂短程任务 92.5% 对基线 77.5%,舀豆 80.0% 对 33.3%,OOD 新物体 90.0% 对 65.0-73.3%,双臂协调 72.0% 对 44.0%。跨具身迁移上,仅用 Franka/AgileX 数据预训练的骨干迁到未见过的 GR-1 人形:20% 数据即达 49.5%,超过全数据 GR00T-N1.6(47.6%)。RoboDojo 42 个任务上得 10.66 分 / 7.60%,35 个策略中分列第 8 与第 6,超过全部指定 WAM(最强 X-WAM 仅 7.69 / 3.83%)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| LIBERO-Plus 鲁棒性操作基准(Franka 单臂) | 七扰动维度平均成功率 (%) | 82.6 | ABot-M0 80.5;Qwen3VL-OFT 75.0;π0-FAST 61.6 | 较 ABot-M0 +2.1,较同骨干 Qwen3VL-OFT +7.6 |
| RoboTwin 2.0 Base(双臂 AgileX,50 条干净轨迹/任务) | 成功率 (%),Clean / Random | 80.5 / 41.5(OFT 头) | Qwen3VL-OFT 61.7 / 10.5;X-VLA 70.0 / 39.0;π0.5 60.2 / - | Clean +18.8,Random +31.0 |
| RoboTwin 2.0 Data Scaling(2500 干净 + 25000 随机化轨迹) | 成功率 (%),Clean / Random | 92.5 / 90.8(OFT 头;PI 头 Clean 达 93.0) | InternVLA-A1 89.4 / 89.6;Being-H0.7 90.2 / 89.6;HoloBrain-0-QW 91.9 / 92.3 | 超过多数工业级系统,与最强者持平或接近 |
| 真实机器人单臂短程任务(Franka Research 3) | 平均成功率 (%) | 92.5 | Qwen3VL-4B-OFT(无预训练)77.5 | +15.0 |
| 真实机器人双臂协调(折叠、递接等) | 平均成功率 (%) | 72.0 | Qwen3VL-4B-OFT 44.0 | +28.0 |
| RoboCasa-GR1 跨具身迁移(未见 GR-1 人形,20% 下游数据) | 成功率 (%) | 49.5 | 全数据 GR00T-N1.6 47.6;全数据 Qwen3VL-OFT 48.8;π0.5 37.0 | 用 20% 数据超过全数据基线 +1.9;全数据时 54.0% |
| RoboDojo 官方榜单(ARX X5,42 任务,2026-08-24 快照) | 平均分 / 平均成功率 (%) | 10.66 / 7.60(35 个策略中分列第 8 / 第 6) | 最强指定 WAM:X-WAM 7.69 / 3.83;π0.5 11.41 / 6.91;DM0.5 24.90 / 19.34 | 较 X-WAM +2.97 分 / +3.77 点,超过全部指定 WAM |
局限与改进
作者承认且数据可佐证的局限:RoboDojo 上 Memory 任务几乎失效(0.66 分 / 0.56%,远低于 DM0.5 的 47.74 / 47.44),说明长时记忆与任务级规划能力缺失;榜单按分排第 8、按成功率排第 6,前 7 名中 6 个来自工业团队,且榜单不按训练算力归一化,因此开源 16 卡超越工业系统的说法需要谨慎解读;作者也明确不在 RoboTwin Data Scaling 上宣称绝对 SOTA。我自己的观察:其一,预训练具身只有 Franka 单臂与 AgileX 双臂,对灵巧手、移动底盘、腿式等形态的迁移性未验证;其二,部分统一动作空间的共享维度仅覆盖夹爪,遇到语义更异构的具身可能退化为完全隔离;其三,caption 混合的消融只在有限配比内进行,最优比例与算力规模的关系不明;其四,真实实验每任务仅 10 次试验、每模型 5 万步、8 张 H800,统计功效有限;其五,仿真对比依赖下游协议一致这一假设,不同方法的 checkpoint 选择策略差异论文也承认无法完全控制。
独立分析的弱点
第一,记忆与长时程推理短板:RoboDojo Memory 维度 0.66 分 / 0.56% 的成绩表明,表征为中心的预训练主要改善感知-动作映射,未触及跨时步记忆;改进方向是在预训练中加入需要记忆的数据(长时程示范、历史条件指令)或引入显式记忆模块。第二,部分统一动作空间表达力有限:只统一夹爪维度,遇到自由度语义冲突更多或带移动底盘的具身就只能退回隔离掩码;可改为学习维度级语义对齐(如关节嵌入软对齐)。第三,多头部协同监督的头集合是手工挑选的 OFT/PI/GR00T,未探索自动扩展头族;试点中离散 FAST 表现出可迁移性但信息有损,如何让离散监督也保留细粒度幅值与时序信息(如残差修正 token)值得研究。第四,浅层冻结是粗粒度的(冻结整个视觉编码器与下半 LLM),逐层自适应冻结或 LoRA 式低秩更新可能以更小代价保住先验。第五,真实世界每个设置只训两个模型、每任务 10 次试验,双臂模型仅在双臂数据上微调,预训练只含单臂数据却迁移到双臂的机制值得更细的消融。每个弱点都可与论文已有的消融框架(附录 C/D/E)对接验证。
未来方向
作者在结论与附录 K 中提出的方向:希望社区把 VLM 骨干当作 VLA 的第一等设计变量来研究,探索让基础 VLM 更适合物理任务的通用配方;未来可扩展到更多具身、更大骨干与更广开源数据。基于其成果可自然延伸的工作:其一,把多头部协同监督推广为解码器多样性蒸馏,纳入离散 token 头、隐式策略头甚至世界模型预测头,检验表征收益是否随头族扩大而单调增长;其二,把部分统一动作空间扩展到移动底盘、灵巧手与全身控制,引入维度语义嵌入做软对齐;其三,针对 Memory 短板,在预训练数据中加入长时程、多阶段任务与历史条件化,并结合记忆增强架构;其四,研究冻结策略与 caption-轨迹配比随算力规模的 scaling law;其五,既然 20% 数据即可超过全数据基线,可系统刻画预训练表征质量与下游数据需求之间的定量关系,为数据采集预算提供理论指导;其六,将该配方用于 VLM 侧持续学习,研究机器人数据与通用能力相互侵蚀的边界;其七,探索把预训练收益迁移到在线强化学习或世界模型联合训练中。
复现评估
复现条件在 VLA 前沿工作中相当友好。数据完全开源:预训练使用 DROID、InternA1、RoboCoin、MolmoAct 加 caption 数据,清洗细节在附录 H;算力仅 16 张 GPU 做持续预训练,真实世界微调用 8 张 H800 训 5 万步;代码基于开源的 StarVLA 训练框架,骨干为公开的 Qwen3-VL-4B;作者承诺开源全部训练脚本与模型权重,项目页为 https://starvla.github.io/。评测端:LIBERO-Plus、RoboTwin 2.0、RoboCasa-GR1、RoboDojo 均为公开基准,RoboDojo 提供官方排行榜可提交复核,基线数字多引自公开榜单或同协议重评。主要风险点:真实机器人部分需要 Franka Research 3 与 AgileX 硬件及专家遥操作数据,无设备实验室只能复现仿真;RoboTwin Data Scaling 设置中各方法训练算力与选点策略可能不一致,逐项对比需小心对齐协议;caption 数据配比需查附录 D。总体难度中等偏易,属于少见的学术算力可复现的 VLA 工作。
论文图表
试点实验柱状图,固定 Qwen3-VL-4B 骨干,交叉变化预训练头与微调头。LIBERO-Plus:从头训 GR00T 75.9%,FAST+FAST 仅 61.4%,FAST+GR00T 76.7(+0.8),GR00T+GR00T 80.8(+4.9);RoboTwin-Clean:从头训 OFT 61.7%,OFT+OFT 75.8(+14.1)但 OFT+PI 55.1(-5.4)、OFT+GR00T 28.9(-22.3),FAST+FAST 45.2(-16.2)。
整篇论文的实证动机:用交叉实验量化了单头监督导致的头特定表征坍缩与离散化的信息损失,直接推导出多头部协同监督的设计。