像机器人一样看世界:面向视觉-语言-动作模型的机器人中心点云图 See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models
用机器人坐标系下的点云图给VLA注入3D几何,化解相机-动作坐标错配。
前置知识
视觉-语言-动作模型(VLA)
VLA模型从视觉观测(图像)和语言指令出发,预测机器人动作。动作通常定义在机器人自身的3D坐标系(如机器人基座系)中,例如任务空间的末端执行器位姿指令。代表模型如π0.5、SmolVLA等,通常以预训练的2D视觉-语言大模型为骨干。
本文的核心研究对象就是VLA,理解它观测在相机系、动作在机器人系这一'帧错配'问题是读懂全文动机的起点。
点云图(Pointmap)
点云图是一种保留图像H×W网格结构的表示,每个像素位置存储其对应场景点的3D坐标(XYZ)。它既包含稠密的3D几何信息,又保持了与RGB图像一一对应的像素排布,因此可以直接复用2D视觉编码器,并能与RGB特征做逐元素融合。
点云图是本文方法的基石,理解它与普通点云(无网格、需采样)和深度图(仍绑定相机系)的区别,是理解作者为何选择这种表示的关键。
相机内参与外参
相机内参K描述相机自身的投影属性(焦距、主点等),将像素坐标反投影为相机系3D射线;外参(旋转R和平移t)描述相机坐标系与机器人基座坐标系之间的刚体变换。本文用$K_c^{-1}$反投影,再用$R_c, t_c$将点从相机系转到机器人系。
构建机器人中心点云图依赖标定的内外参,本文方法的前提是训练和测试时都有可用的相机标定,这也是其局限之一。
末端执行器中心化
以机器人末端执行器当前位置为坐标原点,重新表示所有场景点:$P_c^{EE}(u,v)=P_c^R(u,v)-t^{EE}$。这样每个目标点表示的是'相对于当前末端执行器的位移',而动作本身就是末端执行器的运动,于是观测与动作空间共享同一原点。
这是本文一个关键的消融设计选择,消融实验表明它使评估在随机视角下几乎不掉点(仅−0.3),理解其几何含义才能体会为何能让视角鲁棒性大增。
Plücker射线
Plücker射线是一种6维编码,表示穿过每个图像像素的3D射线,由相机内外参决定。它告诉策略每个像素相对于相机在哪里、相机相对于机器人如何摆放。本文将其作为'让策略自己学坐标变换'的对比基线。
Plücker射线是与本文最接近的对比之一,理解它提供的是相机系几何线索而非预先算好的机器人系几何,才能看懂Table 1中3.1个百分点的差距来源。
逐元素融合(element-wise fusion)
将点云图编码后的token与对应位置的RGB token直接相加:$z_c=f_\theta(I_c)+g_\phi(P_c^{EE})$,不增加额外token序列。与之对比的是拼接(concat),把点云图token作为独立序列追加,丧失与RGB像素的空间对应关系。
Table 2显示加法(34.7)显著优于拼接(30.7),这是'保留图像网格'价值的直接证据,理解融合方式才能抓住本文最小化架构改动的核心思路。
研究动机
VLA模型预测的动作定义在机器人自身的3D坐标系(如基座系下的末端执行器指令),但绝大多数VLA的观测输入(RGB图像或深度图)却是在相机坐标系下,形成了'观测在相机系、动作在机器人系'的帧错配(frame mismatch)。在固定相机视角下这个错配是无害的,策略只需记忆单一的'观测到动作'映射;但随着大规模数据集(如DROID等)跨机构、跨相机配置聚合演示,训练数据覆盖了极其多样的相机视角,策略就必须额外学习'不同视角下的观测如何映射到机器人系动作',使泛化变得困难。评估时相机若与训练分布不同(部署视角漂移),问题会进一步放大。
本文的目标是本文的目标是修订VLA的输入观测:与其让策略从相机系观测去推断机器人系动作,不如直接提供一种既携带(1)操纵所需的3D空间信息、又(2)位于机器人自身坐标系中、且(3)保留预训练2D VLA所期待的稠密H×W网格结构的观测。这样既能以最小架构改动把机器人中心3D几何注入已有VLA,缓解训练时和部署时相机视角变化带来的帧错配,又能让策略复用大规模视觉-语言预训练的视觉通路,提升跨视角泛化与部署鲁棒性。
与已有工作不同的是,已有的三类方法各有缺陷:第一类只在相机视图图像周围喂入视角线索(Plücker射线、相机参数、相机系动作重参数化),策略的视觉输入仍是相机系图像;第二类靠生成模型合成新视角或规范化视角,但在远离训练视角时合成不可靠,鲁棒性有上限;第三类构建共享3D场景表示(点云),却丧失了预训练VLA期待的图像结构,且需要专门的点云编码器和体素化模块。本文的独特切入是'保留图像网格、同时赋予机器人系3D坐标',让稠密观测不退化、且无需专用编码器或额外推理阶段。
核心方法
整体思路是:对每个RGB-D观测,先在相机系内反投影成3D点云图,再乘以外参变换到机器人基座系,然后以当前末端执行器位置为原点重新中心化,得到一张'像素存机器人系3D坐标'的点云图。这张点云图与RGB共享同一H×W网格,用一个与RGB编码器同架构、从RGB编码器权重初始化的独立编码器$g_\phi$编码,把得到的token与RGB编码器$f_\theta$的输出逐元素相加,作为VLA的视觉输入。整个过程不加专用点云编码器、不做体素化、不引入额外token序列,仅在预训练VLA的视觉通路上叠加几何。
核心创新在于用一个'图像形态的机器人中心点云图'把3D几何注入预训练VLA。与现有方法的本质区别有三:其一,几何是预先算好并以机器人系提供的,而非把内外参当线索让策略自己学变换(Table 1隔离出3.1点的预计算收益);其二,几何保留H×W网格,能逐元素相加融合,而非点云那样丢网格、需拼接或专用编码器(Table 2中加法34.7优于拼接30.7、PTv3点云32.8);其三,以末端执行器为坐标原点,让相同运动模式的交互拥有相似的局部几何(Table 3下随机视角仅掉0.3点)。这三者共同把'观测与动作空间共享坐标系'落到了最小改动上。
方法步骤详情
第一步,相机系反投影:对相机$c$、内参$K_c$、像素$(u,v)$和深度$D_c(u,v)$,计算相机系3D点 $P_c^{cam}(u,v)=D_c(u,v)K_c^{-1}[u,v,1]^\top$。第二步,转到机器人基座系:$P_c^R(u,v)=R_c P_c^{cam}(u,v)+t_c$,其中$R_c,t_c$是相机到机器人基座系的旋转和平移,输出一张与RGB同H×W网格、每像素一个机器人系3D坐标的点云图。第三步,末端执行器中心化:$P_c^{EE}(u,v)=P_c^R(u,v)-t^{EE}$,$t^{EE}$为末端执行器在基座系的位置。第四步,编码融合:点云图$P_c^{EE}$经独立编码器$g_\phi$(从$f_\theta$初始化)得到与RGB token同形状的token,再逐元素相加 $z_c=f_\theta(I_c)+g_\phi(P_c^{EE})\in\mathbb{R}^{N_{tok}\times d}$,送入VLA。整个流程输入RGB-D与标定,输出融合后的视觉token,无需额外推理阶段。
技术新颖性
技术新颖性体现在'以最小代价把机器人系几何接到预训练视觉通路上':点云图作为现代3D视觉的标准表示虽已存在(from-scratch扩散策略[45,46]也用过),但其在预训练VLA内部的用法、以及'用哪个坐标系表达'此前未被充分研究。本文用独立但同构的编码器+元素相加,回避了点云专用编码器、体素化、几何专家模块、生成式重渲染、几何基础模型在线推理等种种额外负担,且因token相加而非拼接,零额外token开销。这种'保留网格+预计算机器人系+末端中心化'的组合及其系统化消融是此前缺失的。
实验结果
本文用四组设计消融和两组主实验系统验证。Table 1隔离预计算收益:提供深度+标定有用(RGB+Plücker+Depth 31.6),但预计算机器人系点云图更高(34.7),纯预计算贡献3.1点。Table 2证明保留网格的价值:点云图加法融合34.7优于拼接30.7及点云方案(MLP 24.2、PTv3 32.8)。Table 3显示末端中心化在随机视角几乎不掉点(36.9→36.6,−0.3),基座中心化掉2.0。Figure 6显示随训练视角变化增大,RGB跌9.6(34.5→24.9),点云图仅跌1.8(37.6→35.8)。主实验Table 4(RoboCasa 24任务):π0.5从55.3升62.9(+7.6),SmolVLA从37.2升41.4(+4.2),全面超过相机感知(KYC 59.1、OC-VLA 56.3)、3D增强(GeoVLA 57.1、PointVLA 57.3)及FP3(42.8)。真实世界Table 5:已见视角π0.5从73.3升78.3(+5.0),未见过视角从55.0升66.7,优势扩大到+11.7,RGB掉18.3而点云图仅掉11.6。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| RoboCasa 24任务平均成功率(π0.5骨干) | 成功率% | 62.9 | 55.3(π0.5 RGB-only) | +7.6点 |
| RoboCasa 24任务平均成功率(SmolVLA骨干) | 成功率% | 41.4 | 37.2(SmolVLA RGB-only) | +4.2点 |
| RoboCasa设计与基线对比(π0.5骨干) | 成功率% | 62.9(π0.5+点云图) | KYC 59.1 / OC-VLA 56.3 / GeoVLA 57.1 / PointVLA 57.3 / FP3 42.8 | 超越所有相机感知与3D增强基线 |
| 真实世界未见过相机视角(Franka四任务平均) | 成功率% | 66.7(π0.5+点云图) | 55.0(π0.5 RGB-only) | +11.7点(已见视角仅+5.0) |
| 训练时视角变化鲁棒性消融 | 成功率变化 | 37.6→35.8(−1.8, RGB+点云图) | 34.5→24.9(−9.6, RGB) | RGB跌幅是点云图的5倍以上 |
局限与改进
作者明确承认的局限:(1)未消融点云图注入位置相对于动作专家(action expert)的关系及其与预训练配方的作用;(2)点云对比只用单一采样预算,更大预算可能缩小差距;(3)点云图在训练和测试时都需要标定的相机内外参,局限于有标定的场景;(4)相机变化研究只聚焦相机放置/外参,未覆盖相机数量或视场角变化。我自己的观察:所有真实世界结果样本量小(每任务15次评估,共4任务×3训练配置×60演示),统计置信度有限;未见过视角只有单一放置点,泛化结论偏乐观;依赖RGB-D和标定使其在仅有RGB的自采集数据或未标定商用相机上难以直接落地;DP3在'关抽屉'任务上未见过视角仍达86.7甚至高于已见,提示任务难度分布不均,平均数可能掩盖单任务波动。
独立分析的弱点
第一,对标定的硬依赖:方法要求训练和部署都有准确的$K_c$和$R_c,t_c$,任何手眼标定误差都会直接污染点云图坐标。改进方向:引入在线自监督标定校正或不确定性建模,或学习对外参噪声鲁棒的表示。第二,单目场景缺失:方法依赖深度$D_c$,单RGB相机无法使用,限制了数据来源。改进方向:结合单目深度估计网络(如Depth Anything类)作为深度前端,并研究估计深度噪声的影响。第三,点云对比不够公平:只用单一采样预算对比点云。改进方向:系统扫点数预算并引入更强的点云骨干做严格对照。第四,未见过视角单一:真实世界只用一个held-out放置。改进方向:多角度、连续轨迹式视角漂移评估。第五,与动作专家的交互未探明:改进方向:消融点云图注入在diffusion action expert的不同位置(观测编码器内/外、去噪网络输入处)。
未来方向
作者提出的方向:扩展相机变化维度到相机数量和视场角变化、探索与动作专家及预训练配方的最优组合。基于成果可延伸:(1)把'机器人系几何'推广到多机器人/移动底盘场景,统一不同机器人基座系;(2)结合大规模自监督点云图预训练提升编码器质量;(3)探索点云图在长程视野规划与世界模型中的应用,例如预测未来机器人系点云图作为世界模型输出;(4)将末端执行器中心化思想推广到任务相关参考系(如被抓物体坐标系),进一步压缩同类交互的几何方差;(5)与可微标定联合训练,缓解对离线标定精度的依赖。
复现评估
复现评估中等偏上。有利因素:方法描述含完整公式(反投影$K_c^{-1}$、外参变换、末端中心化$-t^{EE}$、加法融合),骨干用公开的π0.5、SmolVLA、PaliGemma,数据集为开源RoboCasa,设计消融的设置(50 demo/任务、24任务、30k步、50评估回合/任务)写得很清楚,并承诺附录B.4给完整实现与训练细节、表8给逐任务结果。不利因素:KYC、OC-VLA、GeoVLA、PointVLA因官方代码不可用均为作者复现,引入复现偏差;截至论文未见开源代码/权重链接(仅提到project page),骨干π0.5的训练数据与配方细节可能受限;真实世界实验需Franka FR3+两台RealSense及精确手眼标定,硬件门槛和算力(微调π0.5级别VLA)对多数实验室不低。整体可在仿真上较易复现关键结论,真实世界复现较难。
论文图表
该图对比了深度图、点云和点云图三种3D表示在'保留2D网格/稠密观测/提供机器人中心3D几何'三个维度上的取舍:深度图保留网格但绑定相机系;点云提供机器人系几何但丢网格且变稀疏;点云图三者兼得。背景展示大规模训练数据来自机器人周围多样相机视角。
这是全文核心动机图,一眼点明点云图相比深度图与点云的独特优势,是理解作者为何选这种表示的入口。