BridgeVLA++:面向3D操作的数据高效、可泛化且记忆增强的视觉-语言-动作框架 BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation
用统一时空记忆把3D VLA扩展为同时高效、可泛化且支持记忆推理的操作框架
前置知识
视觉-语言-动作模型 (VLA)
把预训练视觉-语言模型 (VLM) 扩展到机器人控制的范式:输入图像和语言指令,输出机器人动作。它继承 VLM 在海量图文数据上学到的语义理解能力,再在机器人轨迹上演示微调,从而用更少演示学会复杂操作。代表方法有 RT-2、OpenVLA、π0、π0.5 等。
读懂本文必须先吃透 VLA 范式。整篇论文都在「VLM 预训练先验如何迁移到机器人动作」这条主线下展开:作者反复强调要用尽可能少的演示学会复杂操作、要在分布外保持稳定,本质上都是在追问「如何把 3D 几何塞进 VLA 还不破坏 VLM 学到的语义能力」。不理解 VLA 的输入是图像加语言、输出是动作这一基本接口,就无法理解后续为什么要把 3D 点云投影成 2D 正交图、为什么要把动作变成热力图——这些设计全是为了让 3D 操作学习留在 VLM 原生的 2D 图像-语言空间里,从而最大化迁移预训练先验、最小化分布漂移。
正交投影 (Orthographic Projection)
把 3D 点云从俯视、前视、侧视三个互相垂直的方向投影成 2D 图像,得到三张没有透视畸变的正交视图。这样既能保留 3D 空间结构,又把输入变成 VLM 原生处理的 2D 图像格式,避免直接处理点云的高昂计算开销,RVT、RVT-2 系列就采用这种三视图表示。
BridgeVLA 的整个对齐骨干都建立在三视图正交投影之上:观测端把 3D 点云渲染成俯视、前视、侧视三张 2D 图像送进 VLM,动作端把三视图热力图峰值反投影回 3D 平移。不理解正交投影,就无法理解 3D 几何如何无损地变成 VLM 能处理的 2D 输入,也无法理解为什么热力图峰值能精确定位 3D 末端位置。更重要的是,BridgeVLA++ 的空间记忆也依赖正交投影——它把初始点云按当前预测点和 zoom 重渲染成对齐视图,这一机制完全建立在正交投影的可重渲染性之上。
热力图动作预测 (Heatmap-based Action Prediction)
不把动作离散化成 token 序列自回归生成,而是为每个正交视图预测一张 2D 概率热力图,峰值对应目标位置。把三视图峰值聚合反投影就得到 3D 平移。热力图保留空间结构,比直接回归 3D 坐标提供更密集的监督,并与 VLM 的 2D 图像输入共享同一空间。
这是本文区别于 3D-VLA、SpatialVLA 等所有同类的核心设计,也是数据高效的根源。消融实验给出最直接的证据:把热力图解码换成参数量匹配的 Transformer 直接回归 3D 坐标,RLBench 平均成功率立刻从 90.5% 暴跌到 31.4%,而且变得极难优化——需要 3 倍 batch size (192 vs 64) 和精细的学习率调参。读懂这一概念才能理解为什么「输入-输出对齐」原则如此重要,以及为什么热力图相比 token 序列能同时提供更密集的监督、注入空间先验、并保持输入输出在同一空间。
粗到精细化 (Coarse-to-Fine Refinement)
策略分两步:第一遍在覆盖整个工作空间的视图上预测粗略目标位置;第二遍以该位置为中心裁剪放大局部点云重新渲染,用共享权重的同一模型预测精细位置。粗阶段管全局定位,精阶段管毫米级精度,RVT-2 等也采用这一范式。
BridgeVLA++ 的时空记忆正是分别注入到粗阶段 (时间记忆) 和精阶段 (空间记忆),这是全文最精妙的设计之一。不理解粗到精两阶段的分工——粗阶段在全工作空间定大方向、精阶段在局部裁剪区域定毫米级精度——就无法理解为什么时间记忆管「接下来做什么」、空间记忆管「到底往哪里动作」。消融也呼应了这种分工:去掉空间记忆在 RMBench 记忆任务上几乎无害,只在 RLBench 精度任务上掉点,证明两种记忆互补不冗余。读懂它才能抓住 BridgeVLA++ 区别于朴素记忆方案的本质。
关键帧策略 (Keyframe-based Policy)
策略不是逐帧连续输出动作,而是在稀疏决策点 (夹爪开合、机器人静止时) 预测下一个关键帧的末端位姿,中间轨迹交给运动规划器执行。这样大幅降低决策频率和轨迹建模复杂度,PerAct、RVT 等多任务 3D 操作方法都基于这一假设。
本文所有动作表示 $a_t=(x_t,R_t,g_t,c_t)$ 都定义在关键帧粒度,记忆缓冲也是在关键帧之间累积的。时间记忆里的「邻帧」($n=2$)、「子目标」概念,以及自适应子目标门预测「当前关键帧是否值得保留」,全都基于关键帧切分。不理解关键帧策略,就会误以为策略每帧都在决策、记忆在每帧累积,从而低估或高估记忆机制的作用。此外关键帧假设也意味着本文方案不直接适用于需要连续高频控制的场景,这是理解方法适用边界的前提。
PaliGemma 视觉-语言骨干
约 3B 参数的 VLM,由 SigLIP 视觉编码器和 Gemma Transformer 组成,预训练任务是给定图像和前缀文本自回归生成后缀文本;图像 token 与前缀文本 token 通过双向注意力交互,使每个输出图像 token 同时条件于视觉观测和语言查询。本文骨干有 2.92B 参数。
BridgeVLA 直接复用 PaliGemma 的 SigLIP+Gemma 结构作为骨干 (2.92B 参数)。不理解 PaliGemma 的关键机制——图像 token 与前缀文本 token 通过双向注意力交互、用因果注意力生成后缀文本——就无法理解一个核心设计:为什么能把图像 token 按原始 patch 位置重排成 2D 网格再经 convex upsampling 解码成热力图。正是因为图像 token 已经双向条件于视觉和语言,重排后的网格才同时承载了语义查询和空间定位信息。读懂它也才能理解微调时为什么冻结 SigLIP 和文本嵌入、只动骨干主体。
研究动机
构建能同时理解语言、感知 3D 场景、并输出精确机器人动作的策略是机器人操作的核心难题。主流 VLA 模型 (RT-2、OpenVLA、π0.5) 虽借助大规模预训练获得语义泛化,却只处理 2D 图像且需海量机器人演示 (依赖 Open X-Embodiment 这类大数据集)。另一条路线的 3D 操作策略 (PerAct、Act3D、RVT-2) 直接利用点云或体素的几何结构,样本效率更高、定位更精确,却缺乏语义泛化。已有融合两者的 3D VLA 方法 (SpatialVLA、3D-VLA) 把动作编码成 token 序列自回归预测,丢掉了 3D 观测与动作之间的空间对应;往 2D 预训练的 VLM 里硬塞 3D 输入还制造模态鸿沟,既限制 VLM 先验迁移又压制显式 3D 结构发挥——真实机器人上 SpatialVLA 即便用 50 条轨迹训练也仅 28.5%,远不如 RVT-2 的 90.0%。此外绝大多数 VLA 和 3D 策略遵循严格马尔可夫假设,只从当前观测预测动作,一旦正确动作依赖过去交互历史,或目标几何在执行中被机器人本体或被操作物体遮挡,策略就会失效。
本文的目标是本文目标是打造一个统一的 3D 视觉-语言-动作框架,让它同时具备三样本事:(1) 数据高效——每任务只用几十条甚至 3 条演示就能学会;(2) 强泛化——在颜色、纹理、光照、背景、新物体类别等分布外扰动下依然稳定;(3) 记忆推理——当正确动作依赖于过去的交互历史,或目标几何在执行中被遮挡时,策略仍能做出正确决策。作者希望这套能力能在仿真和真实机器人 (Franka、Dobot) 两种平台、单臂和双臂两种构型上同时成立,并且让记忆增强成为对基础策略「严格可加」的扩展——即加上记忆后不损伤原有的数据效率和泛化能力。整个框架要建立在单一的对齐原则之上,避免引入专门的 3D 编码器或修改 VLM 核心架构。
与已有工作不同的是,本文的独特切入点是「输入-输出对齐」原则:把 3D 观测渲染成多视角正交 2D 图像以匹配 VLM 的输入空间,把机器人动作表示成同一图像空间里的 2D 热力图以匹配 VLM 的输出空间,再用一个可扩展的物体定位预训练阶段教 VLM 预测热力图,这样预训练和下游操作学习落在完全相同的 2D 视觉定位空间里。更关键的是,BridgeVLA++ 把记忆问题分解到粗-精两个阶段:粗阶段用时间记忆 (锚点视图+历史关键帧+自适应子目标) 回答「接下来做什么」,精阶段用空间记忆 (重渲染初始点云的局部区域) 回答「到底往哪里动作」。这种「阶段分工+轻量注意力注入」的设计在 patch-token 空间完成,完全不动原有的热力图接口,因此记忆是严格可加的,且时间、空间两种记忆互补而不冗余。
核心方法
整体思路分三层。第一层是 BridgeVLA 的对齐骨干:RGB-D 相机重建彩色点云,按 RVT 的做法渲染成俯视、前视、侧视三张正交图像,连同语言指令送进 PaliGemma 骨干;骨干输出的图像 token 按原始 patch 位置重排成 2D 特征网格,经 convex upsampling 解码成每视图一张平移热力图;对工作空间均匀采样的候选 3D 点投影到三视图聚合分数 $s_t(x)=\sum_v \hat{H}_{t,v}(\Pi_v(x))$,取 argmax 得到末端平移;旋转、夹爪、碰撞标志由全局池化特征加局部 token 特征拼接后经三层 MLP 预测。第二层是粗到精:粗阶段覆盖全工作空间定大方向,精阶段围绕粗预测点裁剪放大局部点云重渲染,用共享权重再跑一遍定精细位置。第三层是 BridgeVLA++ 的时空记忆:在粗阶段 token 上做时间记忆交叉注意力,在精阶段 token 上做空间记忆交叉注意力,输出仍是 token 网格直接接原有解码头。整个前向 VLM 只吃图像和语言,不喂本体感知信号,以保持与预训练输入格式一致、减小分布漂移。
核心创新是三点。第一,用 2D 热力图替代 token 序列作为动作输出——这与 3D-VLA、SpatialVLA 等把动作离散化自回归生成有本质区别,热力图保留了观测与动作之间的空间对应,且与 VLM 原生的 2D 图像输入共享空间结构,消融显示这一项贡献了最大增益 (去掉后 RLBench 从 90.5% 掉到 31.4%)。第二,记忆按阶段分工而非混在一起:时间记忆只管「下一步该到哪个区域」注入粗阶段,空间记忆只管「局部精确定位时被遮挡的几何补全」注入精阶段,二者互补不冗余——在 RMBench 上去掉空间记忆几乎无害 (95.4% vs 96.0%),在 RLBench 精度任务上去掉它才掉点,证明这种分工是精准的。第三,空间记忆用初始点云 $P_0$ 按当前预测点的 zoom 重渲染并按视图对齐做交叉注意力,单一参考点云就能为整个回合不同局部区域提供对齐的几何参考,无需为每帧维护独立重建。
方法步骤详情
训练分两阶段。预训练阶段在 RoboPoint 12 万检测数据上,把每个目标框中心渲染成截断高斯概率图 $p_i(x)=\exp(-\|x-\bar{x}_i\|^2/2\sigma^2)$,多目标平均再归一化,用交叉熵训练骨干和解码头。下游微调用关键帧选择策略切分演示,采用两阶段调度:先冻结 PaliGemma 骨干只训外层模块,再解冻骨干联合训练,SigLIP 和文本嵌入始终冻结;RLBench 用 32×H20、100 演示训 130 epoch,学习率 $8\times10^{-5}$。前向推理分两路:粗阶段 token 先经时间记忆交叉注意力 (锚点块、$n=2$ 邻帧与子目标缓存) 得增强表示,预测粗平移热力图及旋转、夹爪、碰撞;再围绕粗点裁剪当前点云与初始点云 $P_0$ 重渲染,精阶段 token 经空间记忆交叉注意力预测精细平移;子目标门用可学习 query token 预测保留概率,超阈值的关键帧入缓存。完整目标为 $\mathcal{L}=\mathcal{L}_{base}+\lambda_{check}\mathcal{L}_{check}$。
技术新颖性
技术新颖性集中在几处。首先是热力图预训练的可扩展性:任何能转成空间目标 (中心点、关键点、分割区域) 的视觉-语言数据集都能用于预训练,不局限于检测数据。其次,记忆注入模块完全在 patch-token 空间操作 (维度 2048,每块 2 层 8 头注意力、头维 128、前馈扩展 2),不修改 VLM 骨干和热力图接口,三个注入块加门控共 269.77M 参数仅占骨干 2.92B 的 9.2%;推理延迟从 0.35s 增到 0.57s/步 (RTX 4090),相比观测传输和运动执行的小循环耗时几乎可忽略。第三,自适应子目标选择模块让记忆自我管理——它作用在记忆增强后的 token 上,只在当前观测提供已有记忆中没有的信息时才缓存,避免近重复帧稀释关键历史。第四,双臂扩展只需复制 action head,VLM 骨干、时间记忆、空间记忆、子目标门两臂共享,自然支持双臂操作且几乎不增算力。最后,连续 6D 旋转表示 (经 Gram-Schmidt 正交化恢复旋转矩阵) 替代会议版的离散欧拉角,规避万向锁奇异性,在高精度朝向任务上贡献 +2.3 个点。
实验结果
论文用五个仿真基准和两个真实平台全面评测。RLBench 18 任务上 BridgeVLA 达 90.5%、BridgeVLA++ 达 93.7%,比前 SOTA SAM2Act (86.8%) 高 3.7/6.9 个点。COLOSSEUM 14 个扰动设置上 BridgeVLA 64.0%、BridgeVLA++ 65.2%,比 RVT-2 (56.7%) 高约 7 点,外观类扰动 (桌面纹理/颜色/光照) 领先 11-15 点。RMBench 双臂记忆任务上 BridgeVLA 仅 18.9%,BridgeVLA++ 飙升到 96.0%,超最强记忆基线 MemoryWAM (83.0%) 13 个点。MemoryBench 单臂记忆达 99.7%。真实 Franka 平台 BridgeVLA 仅 3 条演示就达 95.4%、10 条达 96.9%,远超 π0.5 (20%) 和 SpatialVLA (28.5%),平均比 RVT-2 高 32%。真实 Dobot 双臂记忆 BridgeVLA++ 93.3% vs SAM2Act+ 30.0%。消融显示热力图解码和记忆贡献最大。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| RLBench 18任务一般3D操作 (每任务100演示) | 平均成功率 SR (%) | BridgeVLA++ 93.7% (BridgeVLA 90.5%) | SAM2Act 86.8% | +6.9 个百分点 |
| COLOSSEUM 14个分布外扰动设置 | 平均成功率 SR (%) | BridgeVLA++ 65.2% (BridgeVLA 64.0%) | RVT-2 56.7% | +8.5 个百分点 |
| GemBench 四级层次化泛化 | 平均成功率 SR (%) | BridgeVLA++ 51.1% (BridgeVLA 50.0%) | 3D-LOTUS++ 48.0% | +3.1 个百分点 |
| RMBench 9个双臂记忆任务 (每任务50演示) | 平均成功率 SR (%) | BridgeVLA++ 96.0% | MemoryWAM 83.0% / BridgeVLA 18.9% | +13.0 / +77.1 个百分点 |
| MemoryBench 单臂记忆任务 | 平均成功率 SR (%) | BridgeVLA++ 99.7% | SAM2Act+ 94.3% | +5.4 个百分点 |
| Franka真实机器人基本设置 (10演示) | 13任务平均成功率 SR (%) | BridgeVLA 96.9% (3演示95.4%) | RVT-2 90.0% | +6.9 个百分点 |
| Dobot真实双臂记忆任务 | 3任务平均成功率 SR (%) | BridgeVLA++ 93.3% | SAM2Act+ 30.0% / BridgeVLA 20.0% | +63.3 / +73.3 个百分点 |
局限与改进
作者与读者都能看到的局限。首先 BridgeVLA 在 Distractor 上落后 RVT-2 (51.8 vs 60.8),作者归因于 2D 预训练图像多为第三人称自然视角而非机器人正交渲染图,定位监督是物体定位而操作目标可能不在物体上。其次 GemBench L4 长时序任务 BridgeVLA 完全 0%、BridgeVLA++ 仅 8.2%,长程组合泛化仍未解决,PutItemsInDrawer、StackCups 等近乎全失败。第三,子目标门控 $\mathcal{L}_{check}$ 需要演示带每段语言标注 (仅 RMBench 提供),其他基准只能禁用门控,无法跨基准统一启用。第四,empty dishwasher、wipe desk、setup chess 等任务三种方法都接近 0%,对动态或高复杂度任务整体失败。第五,空间记忆只存初始观测 $P_0$,初始时目标若已被遮挡则无效。第六,方案依赖关键帧假设和正交投影,连续控制和高动态场景未必适用;记忆容量固定 (K=12),超长回合会驱逐旧帧。第七,双臂评测仅限 RMBench 和 Dobot。
独立分析的弱点
独立分析几处弱点及改进方向。(1) 子目标门依赖标注:可用自监督变化检测或对比学习替代,让模型自己判断哪些帧信息量大,从而跨基准统一启用门控,作者也把自监督子目标门列为未来工作。(2) 视角域鸿沟:预训练用第三人称自然图、下游用正交渲染图导致 Distractor 类设置掉点,可在预训练阶段就加入正交渲染合成数据,或用风格迁移弥合域差。(3) 长程组合泛化 (L4) 弱:可引入层次化规划或显式子任务进度跟踪,当前自适应子目标门容量可能不足,且 RMBench 之外 K=2 太小。(4) 空间记忆单一参考:可维护多个时序点云快照,或用神经辐射场、3D 高斯泼溅做持续场景重建,应对初始即遮挡的情况。(5) 动态任务全失败:当前关键帧加静态正交投影范式难处理动态物体,需引入时序体素或事件相机。(6) 记忆容量固定:可用可微分记忆管理或检索式记忆替代 FIFO 驱逐,让真正重要的关键帧不被覆盖。
未来方向
作者明确提出的方向:把预训练扩展到语义分割、关键点检测等更丰富的空间标注任务,让热力图预训练的语义能力更全面;采用更具表达力的动作解码器 (如扩散头) 替代热力图;用自监督方法替代标注依赖的子目标门。基于成果可延伸的方向:因为记忆注入在 token 空间且与时间尺度无关,作者特别指出可扩展到跨回合 (cross-episode) 或终身 (life-long) 记忆,让机器人持续积累、精炼、迁移操作技能,迈向能长期运营的具身智能体;可探索把时空记忆与具身大模型的世界模型结合,让记忆不仅存历史还能想象未来;在更多双臂和移动操作平台 (轮式、人形) 上验证;把热力图接口推广到力觉、触觉等多模态记忆;研究记忆的可解释性与安全性,避免错误记忆污染决策。
复现评估
复现评估整体较好但门槛高。论文提供项目网站 (bridgevla-plus.github.io),附录 A-F 给出网络结构 (每注入块 2 层 8 头注意力、头维 128、FFN 扩展 2、token 维 2048)、超参表 VII (各基准 epoch、学习率、batch、SE(3) 增强、槽位预算 K、邻帧数 n、子目标门权重和阈值)、训练数据准备 (关键帧选择、子目标标签来自每段语言最后帧、正样本占 9-15%) 和评估协议。算力开销:预训练 8×A100 约 2 小时;RLBench/COLOSSEUM/GemBench 微调 32×H20;RMBench 每任务 8×H20 单独训;真实机器人微调 8×A100 1.5 小时;评测单卡 RTX 4090。骨干是开源 PaliGemma,预训练用公开 RoboPoint 12 万检测数据。但代码与权重是否完整开源正文未明确,RMBench、MemoryBench 需特定仿真器和双臂环境,算力 (几十张 H20/A100) 对学术小组偏高,复现全部实验难度较大;核心模块和真实机器人流程相对可复现。
论文图表
整篇论文的总览图。左上对比「先前框架」与「本文框架」,展示 BridgeVLA 的 2D 预训练→热力图→3D 投影→动作流程;中上展示 BridgeVLA++ 在仿真 (RLBench 96.0、GemBench) 上的成绩条;右上是真实世界泛化示例 (≤10 条轨迹);底部分类展示四种动作 token 表示 (Text Token/2D Image Token/3D Scene Token/1D Feature Token) 与真实世界六种扰动设置 (Background/Lighting/Distractor/Combination/Height/Category)。
一图概括整篇论文的定位、流程和核心结果数字 (96.0/93.7/86.8/65.2/99.7/51.1),并把 BridgeVLA++ 与 Text Token、2D Image Token、3D Scene Token、1D Feature Token 四种动作表示法并列对比。读者能一眼看清本文在 3D VLA 领域中的坐标:它既不是单纯的 2D VLA 也不是单纯的 3D 策略,而是用 2D 热力图把两者对齐在统一空间里。这张图是建立全文心智模型的起点,配合 Fig. 2 的架构图就能快速掌握论文全貌。