AtlasVLA:面向视觉-语言-动作模型的持久世界-自我状态建模 AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models
用4D持久世界记忆+自我工作记忆,让VLA仅凭腕部相机打赢多视角基线的长时程操作
前置知识
VLA模型(Vision-Language-Action)
具身智能的主流范式:用一个大模型把图像观测、语言指令映射为机器人低层动作(7维末端位姿增量+夹爪开合)。代表工作OpenVLA把动作当成自回归token生成;π0、CogACT、DexVLA等则用扩散/流匹配动作头生成连续轨迹,通常先在OXE、AgiBot等跨本体大数据上预训练,再在下游任务的专家示教数据上微调。
本文的改进对象就是VLA:AtlasVLA直接以OpenVLA-7B为底座、以CogACT式的DiT为动作专家。理解基线架构,才能看清它在哪些环节动刀。
扩散模型与DiT动作头(含DDIM、CFG)
扩散模型通过逐步加噪、再学习逐步去噪来生成数据;DiT(Diffusion Transformer)把去噪网络换成Transformer。机器人领域用它生成多模态连续动作块:训练时对真实动作加噪并以MSE损失预测噪声 $\mathbb{E}\|\epsilon-\epsilon_\theta\|^2$;推理时从纯噪声出发,用DDIM迭代约10步得到动作序列,可用Classifier-Free Guidance放大条件影响。
AtlasVLA的动作输出就是一个DiT动作专家,其核心改动(每个去噪步内的步级双注意力条件注入)发生在去噪循环内部,不懂去噪过程就看不出这项设计的意义。
相机内外参与手眼标定
内参 $T_{in}$ 描述像素坐标与相机光线的投影关系;外参 $T_{ex}$ 描述相机坐标系到世界坐标系的刚体变换。手眼标定给出末端执行器到腕部相机的固定变换 $T_{h2e}$,于是腕部相机外参可由机器人正运动学实时算出 $T_{ex}=\psi(S_t)\cdot T_{h2e}$;反投影再利用深度图把每个像素还原成3D空间点。
本文把2D视觉token“抬升”到3D世界的整套流程都建立在这套几何之上:没有实时外参就无法做空间反投影,也就无法做跨视角的体素对齐与融合。
TSDF与体素哈希
TSDF(截断符号距离场)是KinectFusion开创的实时三维重建方法:把空间划成均匀体素(voxel),将多帧深度数据按相机位姿投影进全局网格,对命中同一体素的多次观测做加权平均融合,并累积置信度权重;体素哈希用哈希表只存非空体素,使大空间地图的内存可控。
AtlasVLA的世界记忆本质上是“latent版TSDF”:其更新公式直接借鉴这套置信度加权融合加滑窗淘汰的机制,理解TSDF才能理解它如何做到内存有界且抗深度噪声。
单目深度估计(Depth Anything v3)
从单张RGB图像预测每个像素的深度值。Depth Anything系列是当前最强的开源单目深度基础模型,v3版本支持流式多帧输入以提升时序一致性,并输出逐像素置信度,可在机器人腕部相机的剧烈视角变化下提供相对稳定的深度图。
腕部相机只有一个、无法双目测距,整条4D记忆管线完全依赖DAv3的深度图进行反投影、依赖其置信度设定融合权重,深度质量直接决定世界记忆的可靠性。
可学习查询与交叉注意力
DETR开创的范式:初始化一组可学习的query向量,让它们对编码器特征做交叉注意力(query与key算相关性、按权重对value求和),从而把海量token凝练成固定数量的latent表示,广泛用于检测、感知压缩与记忆机制。
AtlasVLA用4个意图查询 $Q_{ego}$ 把每一步的视觉与语言上下文压成任务进度latent,再用交叉注意力从ego记忆库检索历史——这是ego-working记忆得以“记住做到哪了”的基石。
研究动机
现有VLA(OpenVLA、π0、MemoryVLA等)本质上是反应式的:把瞬时观测直接映射为动作,没有任何内部状态。当部署在严格的“仅腕部相机”设定下时会暴露两个瓶颈。其一是感知遗忘:腕部相机随末端执行器移动,视场(FoV)不断变化,关键物体一旦离开视野即被“遗忘”,模型无法回答“箱子在哪”这类空间问题,在部分可观测环境中造成灾难性执行失败。作者的对比数据显示:π0和MemoryVLA从第三人称视角切换到腕部视角时,LIBERO平均成功率分别下降3.5%和2.5%(π0从94.2降到90.7、MemoryVLA从96.5降到94.0);在真实世界通用任务上,MemoryVLA失去第三人称相机后从70.7%跌至62.3%。其二是任务进度遗忘:在多步骤长时程任务(如按顺序整理物体、“Change Cubes”含5个子步骤)中,标准VLA缺乏历史上下文,不记得自己完成了哪些子目标,导致重复或遗漏关键子步骤,误差逐步复合。论文Figure 1用“遮挡压力测试”和“历史长度压力测试”直观演示了这两类失败。
本文的目标是本文的目标是让智能体摆脱“无记忆的观察→动作”反应式范式,建立持续更新的内部世界-自我状态,实现从被动反应到主动推理的转变,对应认知循环“局部观测→隐状态更新→持久世界状态→未来动作”。形式化地说,智能体在任意时刻 $t$ 只接收腕部RGB观测 $O^w_t$、本体感知状态 $S_t$ 和语言指令 $L$,学习策略 $\pi_\theta$ 生成动作块 $A_t\sim\pi_\theta(\cdot|O^w_t,S_t,L)$(每个动作是6自由度末端位姿+夹爪的7维向量),同时要求:空间上解决部分可观测性(物体离开视野后仍知道其在哪),时间上解决任务进度遗忘(始终知道做了什么、下一步做什么)。量化目标是仅凭一个腕部相机,在LIBERO、RLBench和真实世界基准上达到乃至超越使用多视角相机的SOTA方法,并在极端遮挡与长时程压力测试中保持鲁棒,最终在LIBERO-Long上取得+9.4%、真实长时程任务上取得+17.5%的绝对提升。
与已有工作不同的是,已有记忆增强VLA的切入角度偏“时间缓存”:MAP-VLA用记忆增强提示来上下文化动作生成,MemoryVLA用感知-认知记忆,ReMem-VLA用检索式视觉库与循环latent查询,MEM做多尺度具身记忆——它们都停留在时间维度的隐式缓存,缺少显式空间建模,无法解决腕部视角固有的部分可观测性。SOMA虽然尝试用空间表示处理视野外物体,但依赖操作前的静态实例快照,执行过程中场景不更新,无法支撑连续的腕部操作和超长时程任务;而4D-VLA、SpatialVLA等3D方案又依赖多视角输入或跨场景标定。AtlasVLA的独特之处在于把问题拆解成“世界(空间)”与“自我(时间)”两条正交的记忆线:用TSDF式体素哈希把瞬时2D观测持续融合成全局、可检索的4D潜在世界状态;用意图查询显式跟踪任务进度ego状态;再把两者以每个去噪步的解耦双注意力注入扩散动作专家。据作者所知,这是首次在严格腕部单目约束下、在LIBERO/RLBench/真实世界三个层面同时战胜多视角基线的系统性方案。
核心方法
直觉上,人类操作不需要全知视角的相机:大脑维持一张认知地图,物体离开视线后仍追踪其位置,同时心里记着任务清单的进度。AtlasVLA把这种认知循环形式化为“局部观测→隐状态更新→持久世界状态→未来动作”,由三个模块实现。第一,持久世界状态记忆:腕部RGB经冻结的DINOv2+SigLIP编码为2D token,微调的Depth Anything v3流式估计深度 $D^w_t$,外参由机器人状态与手眼矩阵推出 $T_{ex}=\psi(S_t)\cdot T_{h2e}$,反投影到3D潜空间后经体素哈希融合与时间滑窗,维护全局、容量有界(2048 token、体素0.025m)的4D世界状态,首帧永久锚定。第二,自我工作记忆:4个可学习意图查询 $Q_{ego}$ 经交叉注意力凝练任务进度latent,经冗余感知整合存入ego记忆库,防止意图漂移。第三,世界-自我引导动作生成:约300M参数的DiT动作专家在每个去噪步先做ego-working attention、再做world state attention,输出16步动作块。整体以OpenVLA-7B初始化,在8×A100上用FSDP训练。
核心创新是把“显式4D世界状态”作为一等公民引入VLA,并与“自我任务进度记忆”解耦建模。与MemoryVLA等只在时间维度做隐式latent缓存的方案不同,AtlasVLA的世界记忆带真实几何坐标:token被增强为 $\hat{m}_t=m_t+E_{spatial}(P_t)+E_{temporal}(t)$,跨视角观测按体素坐标对齐后置信度加权融合 $M_t(v)=\frac{W_{t-1}(v)M_{t-1}(v)+w_t m_t(v)}{W_{t-1}(v)+w_t}$,权重取自深度置信度——历史上看过但当前不在视野的物体依然可被检索,等效于赋予模型物体恒存性。第二个区别在条件注入:不同于标准扩散策略的全局一次性注入,DiT在每个去噪步内用两级解耦注意力(先ego后world)分别注入任务进度与几何上下文,符合“先知道做到哪一步、再看场景”的认知顺序。第三是首帧永久锚定:首帧视场最完整、准确反映初始布局,永不淘汰,为滑窗遗忘提供全局兜底。
方法步骤详情
流程分六步。(1)瞬时世界状态构建:腕部RGB经冻结DINOv2+SigLIP编码为2D token,微调的Depth Anything v3流式估计深度 $D^w_t$,由本体状态与手眼矩阵得外参 $T_{ex}=\psi(S_t)\cdot T_{h2e}$,反投影 $(m_t,P_t)=\mathrm{BP}(X^w_t,D^w_t,T_{in},T_{ex})$ 输出带3D坐标的局部世界状态。(2)时空嵌入:为token加上MLP参数化的3D空间编码与时间编码。(3)世界记忆更新:按0.025m体素哈希进全局网格,置信度加权融合并滑窗淘汰,容量2048 token,首帧永久锚定。(4)自我状态提取:4个意图查询对全部token交叉注意力得进度latent $Z_{ego}$,经冗余感知整合并入ego记忆库,库长16。(5)双路检索:先用2层交叉注意力从ego库取历史 $C^t_{ego}$,再以它为query、用4层注意力检索世界记忆得 $C^t_{world}$。(6)动作生成:DiT对16步动作块去噪,每步先ego注意后世界注意,损失 $\mathcal{L}_{act}=\mathbb{E}\|\epsilon-\epsilon_\theta(a_k,k,C^t_{ego},C^t_{world})\|^2$,条件dropout 0.1支持CFG(1.5),推理DDIM 10步。
技术新颖性
新颖性可从四个维度评估。(1)表征层面:把KinectFusion式TSDF体素融合从“融合几何”迁移到“融合latent特征”——传统TSDF融合截断符号距离值,这里对每个体素内的潜token做置信度加权平均,兼顾神经表征的语义性与体素地图的几何一致性,且通过滑窗+固定容量保证内存有界,这是与以往纯时间缓存记忆(MemoryVLA、ReMem-VLA、MEM)的本质区别。(2)机制层面:意图查询+冗余感知整合让“任务进度”首次成为显式、可检索的记忆对象,而非隐式循环状态。(3)条件注入层面:步级解耦双注意力是对扩散动作头设计的实质改动——ego先于world注入,消融显示去掉world state attention会使真实长时程成功率从69.5%跌到61.5%,证明该设计并非装饰。(4)实验定位层面:首次在LIBERO/RLBench/真实世界全部强制腕部单目约束并与多视角SOTA正面对比并胜出(97.6% vs 带第三人称+腕部双视角的π0的94.2%)。相对SOMA的静态快照方案,“执行中持续更新”是决定性差异;相对4D-VLA等需要跨场景标定的方案,本方法只需一次手眼标定,部署明显更轻。
实验结果
论文用四组实验支撑主张。(1)LIBERO(每任务50次rollout、取最终checkpoint):严格腕部单目下平均成功率97.6%(Spatial 99.4 / Object 99.8 / Goal 98.2 / Long 94.6 / 90 95.8),不仅全面超过腕部基线(MemoryVLA 94.0、CogACT 90.9、π0 90.7),还超过配备第三人称+腕部双视角的π0(94.2,+3.4)、OpenVLA-OFT(97.1)和GE-ACT(96.5);LIBERO-Long达94.6%,比腕部MemoryVLA高7.0%、比双视角π0(85.2)高9.4%。(2)RLBench(128×128腕部单目、6任务×20次):平均70.8%,超第三人称MemoryVLA(63.3)7.5%、超腕部MemoryVLA(55.0)15.8%,六项任务全部第一(如Umbrella Out 80%、Wine at Hanger 75%)。(3)真实世界Franka平台:6个通用任务平均78.7%(超第三人称MemoryVLA 8.0%、超其腕部版16.4%);4个长时程任务平均69.5%,比π0高17.5%、比MemoryVLA高9.0%(如Change Cubes 74% vs MemoryVLA 62%、π0 54%)。(4)消融(Table 5):去掉世界记忆后真实长时程从69.5%崩至54.0%(−15.5),去掉ego记忆−13.0%,用朴素累积替代体素更新−11.5%,去掉世界条件注入−8.0%,说明空间记忆是腕部操作的命门。运行效率上,单步延迟0.158s、吞吐101.3Hz、显存18.1GB,仅比MemoryVLA慢0.012s、多占1.4GB,满足实时闭环控制。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| LIBERO 五套件平均(腕部单目) | 成功率(%) | 97.6 | OpenVLA-OFT 97.1(第三人称+腕部);MemoryVLA 94.0(腕部) | +0.5 vs 最佳多视角配置;+3.6 vs 腕部最强基线 |
| LIBERO-Long | 成功率(%) | 94.6 | π0 85.2(第三人称+腕部);MemoryVLA 87.6(腕部) | +9.4 / +7.0 |
| RLBench 6任务平均(128×128腕部单目) | 成功率(%) | 70.8 | MemoryVLA 63.3(第三人称)/ 55.0(腕部) | +7.5 / +15.8 |
| 真实世界通用任务(6任务×50次,腕部单目) | 成功率(%) | 78.7 | MemoryVLA 70.7(第三人称)/ 62.3(腕部);π0 66.7(第三人称+腕部) | +8.0 / +16.4 / +12.0 |
| 真实世界长时程任务(4任务×50次,腕部单目) | 成功率(%) | 69.5 | π0 52.0;MemoryVLA 60.5 | +17.5 / +9.0 |
| 真实部署运行效率 | 延迟(s)/吞吐(Hz)/显存(GB) | 0.158 / 101.3 / 18.1 | MemoryVLA 0.146 / 109.5 / 16.7 | 延迟仅+0.012s、显存+1.4GB,换来真实任务+16.4%成功率 |
局限与改进
论文没有专门的局限性章节,但从文本可提炼:其一,世界记忆依赖“滑窗+首帧锚定”,隐含初始视场足够好、场景基本静态的假设,2048 token的容量上限对大场景或高度杂乱桌面可能不足;其二,整条管线建立在Depth Anything v3的单目深度与手眼标定之上,对透明、强反光物体的深度失效没有讨论;其三,所有评估基于Franka单臂桌面环境,未验证跨本体与移动操作;其四,长时程真实任务只有4个、通用任务6个,规模有限,且仍需每任务50-100条专家示教,未触及少示教泛化。我的补充观察:(1)融合公式只做加权平均、没有“删除”机制——若环境中有人挪动物体,过期token如何被纠正并未说明,动态干扰下记忆会变stale;(2)ego记忆仅4个token、库长16,对十余级的超长任务可能成为信息瓶颈(Table 8显示加到32真实任务只多0.3%);(3)检索纯靠特征相似度、缺少语义场景图,几何相邻但语义无关的token可能干扰检索;(4)101.3Hz吞吐对准静态抓放足够,但接触丰富任务(插销、理线)通常需要更高控制频率与力反馈,本方案未涉及。
独立分析的弱点
弱点一:静态世界假设。公式 $M_t(v)=\frac{W_{t-1}M_{t-1}+w_tm_t}{W_{t-1}+w_t}$ 只能加权融合,没有任何机制让记忆“遗忘被外力改变的场景”——现实中杯子被人挪走后,AtlasVLA会继续相信一个已不存在的位置。改进方向:引入物体级重识别与记忆失效检测(当腕部新观测与记忆冲突且观测置信度更高时,重置对应体素),或借鉴动态场景图/时变神经场的思路。弱点二:深度链路脆弱。整条4D管线以单目深度为地基,透明容器与强反光金属是单目深度的经典失败案例,而LIBERO/RLBench纹理丰富恰恰高估了深度质量。改进:显式建模深度不确定性做鲁棒融合,或用触觉/力传感交叉校验。弱点三:首帧锚定偏置。若首帧恰被手臂或人手遮挡,错误信息会被永久锚定。改进:按视场覆盖率与置信度动态选举锚定帧,而非固定 $t=0$。弱点四:示教效率低。每任务50-100条专家演示限制了向新任务的快速迁移,可引入自监督探索或仿真合成数据。弱点五:8×A100训练与18.1GB推理显存对实验室和边缘设备门槛不低,可对DAv3与DiT做量化蒸馏,压缩到消费级GPU。
未来方向
作者在结论中只把本工作定位为“从反应式控制走向鲁棒长时程操作的可扩展范式”,未列出具体后续方向。基于其成果可以自然延伸:(1)动态世界建模——把体素记忆从“观测融合器”升级为“预测器”,用世界模型预测遮挡期间物体的运动,实现真正的物体恒存性而非仅位置缓存;(2)语义-几何联合记忆——在4D体素上叠加开放词汇语义场(如CLIP特征),支持“把杯子放回刚才那个抽屉”这类指代消解与语义检索;(3)跨episode终身记忆——当前任务结束记忆即弃,可让ego记忆库跨任务持久化,支持“接着上次做到一半的活继续干”;(4)跨本体泛化——双记忆模块本体无关(只依赖手眼标定),可在多臂、多夹爪、人形平台上验证,并接入OXE/AgiBot类大数据集做预训练;(5)效率方向——蒸馏量化DAv3+DiT,冲击50Hz以上与10GB显存内,拓展到移动操作;(6)层级化长时程——用LLM先生成子目标序列写入ego记忆、再逐步执行校验,把能力从几分钟推向小时级任务。
复现评估
复现条件中等偏上。有利因素:所有基础组件均开源——OpenVLA-7B(基于LLaMA-2 7B)、DINOv2、SigLIP、Depth Anything v3、LIBERO/RLBench仿真环境,DiT动作专家沿用CogACT设计;论文附录给出完整超参表(Table 6:全局batch 256、学习率 $2\times10^{-5}$、action chunk 16、DDIM 10步、CFG 1.5、条件dropout 0.1、世界记忆容量2048、体素0.025m、ego检索2层+世界检索4层、ego token 4个、记忆长16)与训练细节(FSDP、8×A100、LIBERO每任务50条示教训练20k步、RLBench每任务100条80k步),评估协议明确(每任务50次rollout、报告最终checkpoint而非最优验证步)。不利因素:论文未附官方代码发布链接,微调DAv3流式深度与体素哈希融合的工程细节(如权重衰减系数 $\lambda$、滑窗淘汰顺序)披露不全;真实世界部分需要Franka 7自由度臂+RealSense D415+手眼标定+ROS环境。综合判断:仿真部分(LIBERO/RLBench)单机8卡A100即可复现核心结论,建议先复现Table 5消融验证各模块贡献;真实机器人部分依赖硬件,难度最高。
论文图表
三栏对比图。(A)部分可观测性:清洁桌面任务中腕部相机视场有限,物体离开视野后传统VLA无法回答“箱子在哪”而失败,需要持久的4D世界状态记忆;(B)任务进度遗忘:“Change Cubes”任务含5个子步骤(捡蓝块、放蓝块到桌面、捡黄块、放黄块到盘1、放蓝块到盘2),反应式VLA忘记已完成子目标而重复或遗漏;(C)AtlasVLA方案:腕部时序观测同时送入持久世界记忆(4D世界状态)与ego工作记忆(任务进度/自我状态),从反应式观测转向主动式长时程操作,在遮挡与历史长度两类压力测试中均保持成功。
这张图是全文的问题陈述与卖点总览,一眼看清两类失败模式(空间遗忘、时间遗忘)与双记忆架构的一一对应解法,是理解论文动机的钥匙。
三栏内容:(a)真实机器人平台——无第三人称相机,仅腕部RealSense D415;(b)真实世界任务挑战——大幅视角变化、“下一目标不可见”(黄色立方体在哪?盘子在哪?)与长时程轨迹;(c)“Clean Desk”与“Change Cubes”两个长时程任务的执行进度时间线,展示find targets→pick the can→place the can→clean up bottle→remove paper ball等子步骤按序完成。
把腕部约束的现实困难(视角剧变、目标不可见)与长时程任务的多步结构具体化,是理解真实实验设置与挑战的入口。
真实世界4个长时程任务(Change Cubes、Stack Cubes Order、Clean Desk、Pick Place Order)各50次试验的成功率。AtlasVLA平均69.5%,超MemoryVLA(60.5)9.0%、超π0(52.0)17.5%;任务级如Change Cubes 74% vs MemoryVLA 62%、π0 54%。MemoryVLA虽靠时间记忆优于π0,但在多阶段任务中仍缺足够空间上下文。
最能体现论文卖点的表:长时程+部分可观测的双重压力下,联合时空记忆带来的提升幅度最大(+17.5)。