RoboSPA:面向细粒度空间推理与长程程序规划的VLA机器人操作诊断基准 RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?
280个难度分级任务系统诊断VLA模型:复杂空间与长程操作下最强模型成功率也跌至22.3%
前置知识
VLA 模型(Vision-Language-Action)
将视觉观测与语言指令映射为机器人动作的多模态大模型,通常由视觉语言骨干加动作生成头构成:早期方法如RT-1、OpenVLA把动作预测建模为离散token的自回归生成,后续的RDT、$\pi_0$、$\pi_{0.5}$等改用扩散或流匹配策略生成连续动作,$\pi_{0.5}$、GR00T N1等还引入层次化策略衔接高层语言理解与底层运动执行。这类模型先在大规模真机数据上预训练,再在下游任务微调。
本文的评测对象正是四类代表性VLA模型(RDT、GO-1、$\pi_{0.5}$、X-VLA),理解其感知-语言-动作统一架构、预训练加微调的范式,才能读懂实验设置以及为什么失败会集中在grounding、执行和记忆等环节。
域随机化(Domain Randomization)
在仿真中随机化光照、纹理、背景、桌面杂物、物体布局等视觉与物理因素,生成外观多样的场景,使策略不过拟合单一外观,从而缩小仿真与现实间的分布差距。RoboSPA的随机化场景在任务语义与成功条件完全不变的前提下,扰动背景外观、桌面杂物、桌面高度与光照条件四类因素。
RoboSPA同时提供clean场景(约463K轨迹)与域随机化场景(约64K轨迹)两套演示数据,这是理解其数据规模构成以及鲁棒性评测维度的前提。
行为克隆与单任务微调协议
模仿学习中最常用的训练方式:给定专家演示 $(o_t, a_t)$ 和指令 $\ell$,用监督目标 $\mathcal{L} = -\sum_t \log \pi_\theta(a_t \mid o_t, \ell)$ 拟合动作序列。本文采用单任务设定:每个基础任务用5个难度各50条共250条演示独立微调一个模型,评测时再按难度分层测试。
这是全部实验协议的核心:只有理解每个任务独立训练、难度混训、逐难度评测的设计,才能正确解读从L1到L5的性能下降究竟反映推理能力不足而非训练数据不够。
随机基线校正(Cohen's kappa 思路)
当场景中候选物体数为 $n$ 时,随机瞎选也有 $1/n$ 的成功率,直接比较成功率对不同难度不公平。借用心理学中Cohen's kappa的思想做 Chance 校正:$\text{ONTA}(n) = \frac{SR(n) - 1/n}{1 - 1/n} \times 100$,完美选择得100分,随机猜测为0分,低于随机则为负分。
ONTA(Object-Normalized Target Accuracy)是本文空间推理维度的核心指标,不理解 Chance 校正就无法理解大量负分数意味着模型选目标比瞎选还差这一关键结论。
长程任务与进度评分(Progress Score)
长程任务由 $T$ 个子任务组成,二元成功率无法区分差一步就成功与完全没做对。进度评分定义为 $PS = \sum_{i=1}^{N} \frac{c_i}{T} \times 100$,其中 $c_i$ 是第 $i$ 条回合中完成的子任务数、$N$ 是总回合数,取值0到100,度量部分完成程度。
论文用PS揭示出模型往往能完成大半流程却在中后段崩塌的现象,这是失败分析中遗忘、乱序、重复等错误类型的量化基础,也是理解累积误差问题的关键。
Sim-to-real 差距
仿真器的物理引擎、渲染与传感模拟与真实世界存在分布差异,在仿真中训练或评测的策略迁移到真机时性能往往显著下降。常见的缓解手段包括高保真物理仿真、大规模域随机化、真机数据微调与real-to-sim校准。
RoboSPA全部构建于SAPIEN仿真器之上,作者在局限性部分明确承认sim-to-real差距是首要限制,判断其结论能否外推到真机部署时必须带着这个前提。
研究动机
现有VLA模型($\pi_{0.5}$、RDT、GO-1、X-VLA等)虽然在LIBERO、RoboTwin 2.0等基准上表现亮眼,但这些评测主要停留在简单场景加短程指令的层面,与真实部署所需能力严重脱节。论文指出真实操作任务有三大挑战:细粒度目标消歧(要靠颜色类别之外的细微空间线索选对目标)、时间延展的多步执行(子目标多、误差会累积)、以及复杂度可扩展的具身推理(候选物、步数、场景多样性增加后grounding与规划失败被放大)。对照Table 1可见现有基准的具体缺口:LIBERO只有4类130个任务、6.5K轨迹,空间推理一栏为空;RoboTwin 2.0(50任务、至多137.5K轨迹)专注短程任务;RoboCasa(约100K轨迹)与MIKASA-Robo缺乏步级诊断;RMBench仅9个任务450条轨迹;几乎所有基准都没有可控的多级难度,无法分析性能如何随复杂度退化,且多数数据集规模小于20万条轨迹。
本文的目标是构建一个以推理为核心诊断目标的机器人操作数据集与基准,具体要做到:每个任务都携带明确的能力标签(细粒度空间推理5类加长程程序规划5类共10类);每个基础任务实例化为5个可控难度等级(空间任务增加候选物体、程序任务加长动作序列),共56个基础任务、280个变体;支持超越最终成败的步级评估;覆盖5种机器人本体(Aloha-AgileX、ARX-X5、Piper、Franka、UR5)与clean、域随机化两类场景;并达到足够规模(约527K轨迹、997小时视频、108M时间步、120类581种物体变体),从而系统回答当空间与程序复杂度上升时,VLA模型在哪里失败、为什么失败。
与已有工作不同的是,本文的独特切入有三点。其一,据作者所知这是首个把细粒度空间推理作为核心评测维度的VLA数据集:指令要求模型按几何属性、距离比较、行列序数(且计数方向可变)、参照物方位关系、跨视角变换来选择目标,而此前的LIBERO-Pro、Colosseum等只做扰动式鲁棒性测试,不把这类推理作为任务定义内的必然考察点。其二,每个基础任务5级难度构成了复杂度-性能曲线而非单点评测,使性能退化本身成为可分析的信号。其三,在二元成功率之外引入两个维度互补的指标:借用kappa思想按候选数校正随机基线的ONTA把选错目标与做错动作解耦,进度评分PS把最终成败与过程完成度解耦,再配合人工标注的8类错误类型,形成可归因的完整诊断闭环。
核心方法
直觉上,要诊断VLA模型会不会推理,就必须让指令选择的正确性依赖于细微空间线索、让执行正确性依赖于多步记忆与顺序控制,并且都提供从易到难的连续梯度,这样失败位置本身就携带诊断信息。技术路线上,作者基于SAPIEN仿真器与RoboTwin 2.0框架搭建整个基准:首先设计二级能力分类学(2个维度各5个类别),再由专家代码为每个类别定义任务(场景、执行流程、成功条件),每个任务实例化为5个难度变体;用GPT-5.2为每个任务生成60个互不重叠的语言指令模板(50训10测),在clean与域随机化场景下、于5种本体上执行专家脚本采集演示;最终形成56个基础任务、280个变体、527K轨迹的数据库,并配套SR、ONTA、PS三个指标与8类错误标注的诊断评估协议。
与以往把操作任务当作孤立实例的做法本质不同,RoboSPA把任务组织成能力乘难度的矩阵:任何任务变体都同时携带能力标签(测什么推理能力)与难度标签(推理负担多大),且难度是任务内生的——空间任务通过增加视觉相似候选物提高消歧难度,程序任务通过加长子目标序列提高规划与记忆负担。这使得评测输出从一个成功率数字升级为一条性能退化曲线加一组可解释的错误分布。另一关键创新是ONTA指标:借用Cohen's kappa把候选物数量 $n$ 引入的随机基线 $1/n$ 归零,即 $\text{ONTA}(n) = \frac{SR(n)-1/n}{1-1/n} \times 100$,使不同杂物程度下目标选择能力公平可比,负值直接暴露低于随机的grounding能力。
方法步骤详情
第一步,能力分类学:细粒度空间推理含GAC(按大小/高度/长度/底面积等几何属性选块)、SDE(按颜色加相对远近选目标)、CPI(按行列序数与计数方向选目标,如从右往左数第2大)、RRR(按与参照物的方位关系选目标)、CVR(跨视角理解如从桌子对面看最右边的物体);长程规划含RPF(重复操作指定次数并正确停止)、OFE(无序完成全部子目标不遗漏不重复)、OCE(按规定顺序执行,顺序错即失败)、CAC(跨阶段协调放置、按压、敲钟等异构技能)、MIP(先观察记忆、线索隐藏后再执行)。第二步,任务构建:10名受训研究生各负责一类、另2人交叉审校,专家代码定义场景/流程/成功条件,动作原语部分复用RoboTwin 2.0。第三步,难度分层:空间任务候选物从少到多,程序任务步数从短到长。第四步,指令生成:GPT-5.2生成60模板/任务,实例化后得100条训练与100条互不重叠的测试指令。第五步,数据采集:专家脚本在clean与域随机化场景、5种本体上执行,共约527K轨迹、997小时、108M时间步。第六步,评测:每变体100次rollout计算SR,长程任务按子任务完成度算PS,空间任务按 $n$ 校正算ONTA;并对两个最强模型人工标注约1,120段L5评测视频,归纳8类错误。
技术新颖性
技术新颖性体现在四个层面。维度上,细粒度空间推理(尤其CVR跨视角推理这类需要视角间坐标变换的设定)首次成为VLA操作评测的一等公民,与扰动式鲁棒性测试有本质区别:这里空间推理失败是任务定义内的必然考察点。结构上,5级受控难度与能力分类学构成可分解的性能曲面,附录的对照实验(Table 7)证明难度梯度确实来自细粒度推理而非基础感知——颜色grounding任务在L5仍有74.0%成功率,而对应细粒度任务跌至个位数到二十几。指标上,ONTA把心理测量学的kappa系数引入操作评测以消除候选数混淆,PS把课程式过程评估带入VLA诊断,两者都是该领域少见的细粒度度量。诊断闭环上,8类错误类型学(3类空间:Target Execution、No-Contact Grasp、Target Grounding;5类长程:Manipulation、Memory、Temporal Ordering、Redundant Repetition加Target Grounding)配合约1,120段视频的人工标注,把失败归因到选错、抓空、做砸、遗忘、乱序、重复的粒度,在机器人基准中相当罕见。
实验结果
核心发现是现有VLA模型在复杂度攀升下全面退化。(1) 总体成功率(Table 2,每任务混5难度训练250条演示、逐难度评测、每变体100次rollout):L1上 $\pi_{0.5}$ 领先(55.2%),到L5全线崩塌——$\pi_{0.5}$ 仅22.3%、X-VLA 19.9%、GO-1 8.8%、RDT 6.9%,最强与最弱模型分别下滑32.9和9.9个百分点,部分任务(如MIP类)降到0%。(2) 空间推理维度:X-VLA最好但从41.9%跌至23.9%;CPI(31.8%→8.8%)与RRR(40.4%→14.2%)跌幅最狠,说明序数计数与参照关系是最弱项;CVR相对抗跌(38.2%→36.6%)。(3) 长程规划退化更陡:$\pi_{0.5}$ 从71.2%跌到23.1%(降48.1点),OCE从77.4%跌至12.0%,MIP在L5四个模型全部0.0%。(4) ONTA(Table 3)揭示更严酷的真相:RDT与GO-1大量负值(L1平均-54.3与-34.1,即低于随机瞎选),$\pi_{0.5}$ 与X-VLA的L5平均也只有7.7和10.8,接近随机基线,说明空间选错目标是首要瓶颈。(5) PS(Table 4)显示过程好于结果:$\pi_{0.5}$ 的L5平均PS为45.4,远高于SR的23.1%,说明模型常完成大半流程后因累积误差、乱序或遗忘而失败;MIP的PS在L5也仅11.4。(6) 错误分析(Fig.7/8,约1,120段L5视频):空间任务中Target Grounding Error占72%($\pi_{0.5}$)与78%(X-VLA),No-Contact Grasp仅1-2%;长程任务中Manipulation Error约50%,RPF以重复错误为主、OCE以乱序为主、MIP以记忆错误为主。(7) 跨本体实验(Tables 11-12):X-VLA在5种本体上L5一律低于L1,例如MIP-3在Aloha-AgileX上从100%跌到0%,难度趋势跨本体一致。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 总体基准(280个变体平均) | Success Rate @L5 | π0.5 22.3%(最佳) | RDT 6.9%(最弱基线) | π0.5较RDT高15.4个百分点,但相对其自身L1的55.2%下跌32.9点,且训练数据已含全部难度 |
| 细粒度空间推理(5类平均) | Success Rate L1→L5 | X-VLA 41.9%→23.9% | RDT 9.5%→6.1% | 最佳与最弱模型L5相差17.8个百分点,但所有模型跌幅显著 |
| 长程程序规划(5类平均) | Success Rate L1→L5 | π0.5 71.2%→23.1% | X-VLA 58.8%→15.9% | π0.5在L1高12.4点、L5高7.2点,但其48.1点的绝对跌幅更大 |
| Memory-Intensive Planning(记忆密集规划) | Success Rate @L5 | 0.0%(四个模型全部) | 各模型L1为7.6%–54.0% | 全模型归零,暴露当前VLA在长程记忆保持上的结构性缺失 |
| 空间目标选择 | ONTA @L5(平均) | X-VLA 10.8 | RDT -11.0 | 最强模型仅略高于随机基线(0),最弱模型低于随机21.8分 |
| 长程任务过程完成度 | Progress Score @L5(平均) | π0.5 45.4 | 对应SR仅23.1 | PS约为SR的两倍,量化出做完大半却失败的累积误差现象 |
| 基础grounding对照(颜色/自我视角/简单序数) | Success Rate @L5 | 简单序数索引84.8% | 对应细粒度任务(如CPI)各模型L5仅8.8%–23.6% | 同物体数同候选数下,基础任务轻松通过,证明退化源自细粒度推理而非基础感知 |
局限与改进
作者承认三点局限:全部任务在仿真中构建,sim-to-real差距限制结论直接迁移到物理机器人;基准只覆盖桌面操作,未触及可形变物体、人机交互与开放式任务指令;虽然包含5种本体与域随机化场景,环境多样性仍然有限。我的补充观察有五点:其一,单任务微调协议(每任务仅250条演示)虽然控制了变量,但没有检验跨任务、多任务或语言层面的泛化,且指令由GPT-5.2按模板生成,语言多样性与真实性受模板质量约束;其二,演示由专家脚本采集,轨迹接近最优且无真机遥操作中的抖动与纠错行为,与真实训练数据分布不同,可能系统性高估或低估模型表现;其三,错误分析只覆盖 $\pi_{0.5}$ 与X-VLA两个最强模型且只针对L5,其余模型与其他难度的失败模式未知;其四,难度主要由候选物数量与步数这两个可枚举参数驱动,未系统变化遮挡、堆叠等3D空间复杂度,存在被未来模型过拟合表面模式的风险;其五,全部评测在仿真完成,虽有bootstrap 95%置信区间(Table 10)保证统计可靠性,但缺少哪怕小规模真机验证。
独立分析的弱点
第一,无记忆机制却考记忆:MIP在L5上全模型0%、PS也仅个位数到11.4,说明当前VLA基于当前观测的马尔可夫式动作生成从根本上无法完成先看后做类任务,改进方向是引入显式工作记忆或情景记忆模块(如MemoryVLA式感知-认知记忆、多尺度具身记忆),并把记忆读写纳入训练目标。第二,空间grounding低于随机:ONTA大量负值表明模型并未真正解析指令中的空间约束,而是学到了选最显著物体的捷径,改进方向是在预训练阶段加入物体中心的grounding监督、空间关系感知头以及指令-目标对齐损失。第三,长程任务的误差级联:PS远高于SR说明失败集中在中后段,改进方向是子目标分解的层次化策略、显式进度跟踪与执行监控(识别已完成步骤、避免重复),可借鉴LLM中规划器-执行器分离的范式。第四,基准的对抗性风险:难度由可枚举参数驱动,未来模型可能过拟合数物体、数步骤的表面模式而非真正推理,改进方向是引入属性、关系、视角的组合式held-out难度。第五,语言多样性有限:每任务60模板、100条测试指令可能被大模型的语言先验覆盖,改进方向是引入真实人类指令改写与多轮交互式纠错指令。
未来方向
作者提出的方向包括弥合sim-to-real差距(在真机上验证子集)、扩展到可形变物体操作与人机交互、探索开放式任务指令。基于本文成果还可延伸:(1) 把280个变体的难度梯度用作课程学习信号,系统研究难度递增训练是否优于难度混合训练;(2) 用VLM高层规划器加VLA低层执行器的分层架构,在OCE与MIP上做针对性评测,检验语言模型的序列推理能否补偿VLA的规划短板;(3) 把8类错误类型学升级为自动化诊断器,用VLM从rollout视频中自动分类错误,把失败分析从1,120段扩展到全量评测;(4) 研究跨视角推理能否通过训练时视角增广或引入3D表征(深度、点云)大幅改善——CVR是当前抗跌性最好的空间类别,值得深挖;(5) 把MIP类先观察后执行任务纳入预训练数据混合,探究记忆能力能否被规模化数据激发;(6) 利用性能退化曲线反推数据配比,量化哪种能力的演示数据边际收益最大,指导下一代VLA的训练数据建设。
复现评估
复现条件相当友好。数据与代码开源于 https://github.com/fanzhenxuan/RoboSPA,任务定义、基准代码、评测脚本与演示数据将以MIT协议发布;底层依赖全部开源——SAPIEN仿真器(Apache 2.0)、RoboTwin 2.0与RMBench的代码和资产(MIT),物体资产来自RoboTwin-OD库(120类581变体)。训练协议完全透明:每任务5难度各50条共250条演示,batch size 16,训练20,000步,从官方预训练权重全参微调。算力门槛低:X-VLA仅0.9B参数,单卡RTX PRO 6000每任务1.5小时;最大的 $\pi_{0.5}$(3.3B)也只需2卡6小时;全部56任务乘4模型合计约1,568 GPU小时,普通实验室一至两周即可复现主表。评测方面,同一检查点与种子下rollout基本确定,论文还提供L5结果的bootstrap 95%置信区间(Table 10)供统计校验。剩余难点在于:约1,120段视频的人工错误标注无法直接复用、跨本体实验需要5套本体配置与各自训练、以及逐任务明细(Tables 13-24)体量庞大需要一定工程整理。
论文图表
两个维度的全部56个基础任务清单与文字描述:空间维度24个任务(如按高度选块、按从右往左第2大的序数取物),长程维度32个任务(如先记住展示块颜色、隐藏后移动匹配块)。
任务设计的一手清单,是理解能力分类学具体落地和复现数据管道的必要材料。