Robostral Navigate:可扩展的单目RGB具身导航视觉语言模型 Robostral Navigate
仅用单目RGB即达具身导航SOTA的8B视觉语言模型
前置知识
具身导航(Embodied Navigation)
具身导航指智能体(机器人)在物理或仿真环境中,依据自然语言指令从起点移动到目标位置的能力。它不同于纯视觉问答,需要将语言理解、场景推理和运动控制耦合在一起,并且要在连续、长程的交互中累积决策。本文聚焦的 R2R-CE(Room-to-Room in Continuous Environments)和 RxR-CE 是该领域最主流的 benchmark,要求智能体在未见过的逼真环境中跟随指令导航,并报告成功率 SR、路径加权成功率 SPL、导航误差 NE 等指标。
理解具身导航的任务定义和评测协议,才能看懂本文为何强调传感器假设最小化、跨本体泛化,以及 R2R-CE/RxR-CE 上 77.4%/75.1% 成功率的分量。
视觉语言模型(Vision-Language Model, VLM)
VLM 是一类同时处理图像(或视频)和文本的大模型,通常由视觉编码器把图像编码为视觉 token,再与文本 token 拼接送入语言模型解码。本文使用的 8B 参数 VLM 专门针对空间定位(spatial grounding)任务设计,能够执行指向(pointing)、计数、物体定位等操作。导航被自然地视为定位能力的延伸:模型先理解场景中物体的位置,再学会如何朝它们移动。
本文的核心是把导航建模为'指向下一个目标位置',这一思路直接建立在 VLM 的空间定位能力之上,理解 VLM 的 grounding 能力是理解方法创新的钥匙。
指向式航点预测(Pointing-based Waypoint)
传统导航方法通常预测与特定机器人几何绑定的度量位移(metric displacement,如 $\Delta x, \Delta y, \Delta heta$)。而指向式方法让模型在当前相机视图中推断下一目标位置的图像坐标 $(u,v)$ 以及到达后期望的航向变化 $\Delta heta$。由于航点表达在图像空间而非度量坐标系,策略天然对相机内参和场景尺度变化鲁棒,便于在不同相机配置和机器人本体间迁移。
这是本文相对已有方法的本质区别——把输出从机器人专属坐标系搬到图像空间,是支撑'最小传感器假设'和'跨本体泛化'两大卖点的技术基石。
前缀树注意力(Prefix-Tree Attention Masking)
在序列决策中,每个时间步的历史都是前一步历史的扩展(指令加上累积的观测),因此相邻样本之间存在大量冗余前缀。前缀树把共享前缀合并成'主干',各自特有的后缀作为'分支'展开。配合树形注意力掩码——token $i$ 只能注意 $j<i$ 且 $j$ 位于主干或同一分支的 token——就能把整段 episode 压缩进单条训练序列,在一次前向中算出所有时间步的损失,把 token 复杂度从 $O(T^2)$ 降到 $O(T)$。
前缀树注意力是本文把训练 token 压缩 $22 imes$、训练时长从数月缩到数天的关键技术,也是读懂方法章节绕不开的核心。
扩散策略(Diffusion Policy)
扩散策略是一种用扩散模型学习连续控制动作分布的方法:以噪声和条件(观测、目标)为输入,迭代去噪生成一条动作轨迹。本文用一个约 121M 参数的扩散 transformer,把 VLM 输出的航点转化为未来 1 秒内 30 个相对位移 $(dx, dy, d heta)$ 组成的动作块(action chunk),交由底层运动控制器转为高频电机力矩。它容量小但足以胜任导航所需的几何理解。
VLM 负责高层推理、扩散策略负责低层执行的分层设计是本文系统架构的核心,理解扩散策略才能看懂'两级推理频率'(0.5Hz 与 10Hz)如何协同。
CISPO 在线强化学习
CISPO 是一种采用组相对优势估计(group-relative advantage estimation)的在线强化学习算法,能提供稳定、自校准的学习信号,常用于大模型后训练。本文在监督微调(SFT)之后用它在线交互仿真器,奖励为 $r = -\max(2, d_{ ext{goal}})$($d_{ ext{goal}}$ 为终点到目标的测地距离,截断在 2 米),并只在一个从 SFT 失败轨迹中筛选出的 35k 难任务子集上训练,以提升探索与失败恢复能力。
RL 阶段是本文性能从 SFT 基线跃升到 SOTA 的关键(R2R-CE 未见 $+4.03\%$),理解 CISPO 的奖励设计和难任务课程才能解释为何模型从'脆弱'变得'鲁棒'。
研究动机
当前最强的具身导航系统几乎都依赖额外的传感特权:深度相机、LiDAR、多相机阵列,或预建的环境地图(如 InternVLA-N1、NavFoM、ABot-N0、OmniNav、Qwen-RobotNav 等)。每一种额外的传感要求都会缩小可部署的机器人范围、抬升单机成本,并需要针对具体环境做标定。以 R2R-CE val unseen 为例,最好的单相机方法 Qwen-RobotNav-4B 只有 66.9% 的成功率,而即便引入深度或多相机,最强的 Qwen-RobotNav-8B 也只到 72.1%。随着机器人走向通用化(仓库轮式、配送无人机、足式),瓶颈不再仅仅是'做得更准',而是要找到一条可扩展的配方:传感器假设最小、能跨本体泛化、能从仿真高效训练。
本文的目标是本文的明确目标是设计一条以可扩展性为核心考量的导航配方,仅用单目 RGB 这一种'几乎所有机器人平台都天然具备'的传感器,就达到甚至超越依赖特权感知的方法。具体目标有三:一是把对传感器、机器人几何、相机标定的依赖降到最低,使同一套权重能部署到轮式、足式、空中等不同本体而无需重训;二是完全在仿真中训练,消除昂贵真实数据采集,并具备大规模数据生成能力;三是把训练算力从'数月'压缩到'数天',让快速迭代成为可能。最终在 R2R-CE 与 RxR-CE 上刷新 SOTA,同时验证跨本体真机迁移。
与已有工作不同的是,本文的独特切入角度在于把'输出空间'从机器人专属的度量坐标系搬到图像空间。已有方法多预测与特定机器人几何绑定的度量位移 $\Delta x, \Delta y, \Delta heta$,迁移时必须重标定;而 Robostral Navigate 用'指向'在当前视图里标出下一个目标位置 $(u,v)$,天然对相机内参和场景尺度鲁棒。其次,它把前缀树注意力(源自 Molmo2 的上下文共享)推进到嵌套的序列决策结构中,一次性编码整段 episode,配合树形掩码防止模型偷看历史 ground-truth 动作;再用 CISPO 在线 RL 弥补行为克隆的暴露偏差与协变量偏移。这套'最小传感器 + 仿真训练 + 高效编码 + RL 修复'的组合,是区别于以往工作的新配方。
核心方法
整体思路遵循'分层解耦'的直觉:导航任务被拆成两个难度不同的子问题——高层推理(理解指令、规划粗略路径)和低层执行(避开障碍、产生电机命令)。前者用一个 8B 参数、专为空间定位初始化的 VLM(Robostral Navigate)负责,后者用一个约 121M 参数的扩散策略负责,二者串联、以不同频率运行。VLM 以语言指令和历史单目 RGB 帧为输入,以 0.5Hz 输出航点(指向坐标或度量位移);扩散策略结合航点、机器人尺寸、上下文帧与当前帧,以 10Hz 输出未来 1 秒的 30 个相对位移动作块;最后由本体专属的运动跟踪控制器转为 100Hz 电机力矩。所有训练数据在仿真中生成(2.4M 轨迹、350k 场景),并用前缀树注意力把训练 token 压缩 $22 imes$。
核心创新点是'指向式导航 + 前缀树训练 + 在线 RL'的三位一体。与已有方法的本质区别有三:第一,输出表达在图像空间而非度量坐标系,使策略天然鲁棒于相机内参与场景尺度,从而跨本体迁移无需重训;第二,用前缀树把整段 episode 压成单条训练序列 $I|O_0|a_0|\ldots|O_n|a_n$,配合树形注意力掩码(token $i$ 仅注意主干或同分支的 token $j<i$)既避免冗余编码、又阻止模型在训练时偷看历史 ground-truth 动作,token 复杂度从 $O(T^2)$ 降到 $O(T)$;第三,在大 VLM 上把'物理仿真器 + vLLM 自回归生成 + 分布式训练'三个 GPU 密集工作负载并发编排,用 CISPO 做在线 RL,把行为克隆的脆弱策略升级为鲁棒导航器。
方法步骤详情
方法分四阶段:阶段一,数据生成:用最远点采样生成约 2.4M 条专家轨迹、覆盖 350k 场景,并对机器人高度(0.4–1.8m)、半径(0.15–0.45m)、相机高度(本体高度 70–100%)、俯仰(0–25°)随机化。阶段二,监督训练与前缀树:把 episode 编码为单序列 $I|O_0|a_0|\ldots|O_n|a_n$,目标可见时输出 $a_{vis}=(u,v,\Delta x,\Delta y,\Delta\theta)$,不可见时退化为 $a_{invis}=(\Delta x,\Delta y,\Delta\theta)$;树形掩码与逐时间步采样等价但 token 减少 $22\times$。阶段三,在线 RL:用 CISPO 以奖励 $r=-\max(2, d_{ ext{goal}})$(2 米截断)从 SFT 失败筛选的 35k 难任务上训练,按场景打包形成隐式视觉课程。阶段四,部署:VLM 0.5Hz 给航点,扩散策略 10Hz 给动作块,控制器 100Hz 给力矩,权重在 Galaxea R1 与 Hiwonder JetAuto 上零重训迁移。
技术新颖性
技术新颖性体现在四点。其一,首次把'指向图像空间'作为具身导航的主输出模态并系统验证其跨本体能力——同一套 VLM 与扩散策略权重直接部署到两台差异巨大的真机,只换底层控制器。其二,把 Molmo2 式的上下文共享前缀编码推进到嵌套的序列决策结构,提出 episode 级前缀树表示与树形注意力掩码,既压 token 又防数据泄漏,是 RxR-CE 这种长指令、长轨迹 benchmark 能高效训练的关键。其三,在大 VLM 上攻克在线 RL 的系统工程难题——同时调度渲染密集的物理仿真器、vLLM 自回归生成器与分布式训练节点,并用 CISPO 稳定收敛,这在此前以纯文本为主的 RL 设置里很少见。其四,端到端纯仿真训练即可超越依赖深度/多相机的特权方法,颠覆了'具身导航必须靠特权传感'的普遍认知。
实验结果
R2R-CE val unseen 上以单目 RGB 取得 77.4% SR、74.2% SPL、81.3% OS、3.20m NE,刷新全指标 SOTA——相对最强单相机 Qwen-RobotNav-4B(66.9% SR)领先 10.5 个百分点,相对最强特权方法 Qwen-RobotNav-8B(72.1% SR)领先 5.3 个百分点;val seen 达 79.4% SR。RxR-CE val unseen 达 75.1% SR、68.7% SPL、3.47m NE,相比单相机 SOTA Qwen-RobotNav-8B(73.4% SR)SR +1.7、SPL +5.2,并在 SPL 与 NE 上超越最强特权基线。RL 贡献显著:R2R-CE unseen 从 SFT 73.40% 升至 77.43%($+4.03\%$),seen 从 75.96% 升至 79.43%($+3.47\%$);RxR-CE 从 71.2% 升至 75.1%($+3.9\%$)。效率上前缀树把 token 压缩 $22\times$、训练从数月到数天。权重零重训迁移到两台真机。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| R2R-CE val unseen(成功率) | Success Rate (SR) ↑ | 77.4%(单目 RGB) | 66.9%(Qwen-RobotNav-4B,最强单相机)/ 72.1%(Qwen-RobotNav-8B,最强深度多相机) | 相对最强单相机 +10.5 个百分点,相对最强特权方法 +5.3 个百分点 |
| R2R-CE val unseen(路径效率) | SPL ↑ | 74.2% | 60.5%(Qwen-RobotNav-4B 单相机)/ 66.6%(Qwen-RobotNav-8B 深度多相机) | 全面领先,表明成功伴随高效路径、无冗余探索 |
| RxR-CE val unseen(成功率) | Success Rate (SR) ↑ | 75.1% | 73.4%(Qwen-RobotNav-8B 单相机)/ 76.5%(Qwen-RobotNav-8B 深度多相机) | 相对最强单相机 +1.7 个百分点,并在 SPL 与 NE 上超越最强特权方法 |
| 在线 RL 增益(R2R-CE unseen) | Success Rate (SR) ↑ | 77.43%(RL 后) | 73.40%(仅 SFT) | +4.03 个百分点,证明 RL 把脆弱策略升级为鲁棒导航 |
| 训练效率 | 训练 token 量 | 前缀树表示,token 减少 22×,训练从数月到数天 | 逐时间步独立样本,复杂度 $O(T^2)$ | 训练 token 压缩 22 倍 |
局限与改进
作者承认的局限与可观察到的局限并存。其一,主评测仍局限于 Habitat 仿真的室内 benchmark(R2R-CE、RxR-CE),且评测时用 Habitat pathfinder 在航点之间导航,并非完全由学习策略端到端执行,一定程度上削弱了'纯策略'的纯粹性。其二,跨本体声明(轮式、足式、空中)只在两台轮式真机(Galaxea R1、Hiwonder JetAuto)上做了演示,足式与空中机器人未见量化结果。其三,RL 奖励仅为距离型 $r=-\max(2, d_{ ext{goal}})$,缺少显式的探索塑形或指令遵循奖励,长程复杂指令下的失败模式未深入分析。其四,8B VLM 叠加仿真器与 vLLM 的训练栈对算力要求极高,小团队难以复现。其五,指向在目标超出视场(约 10% 场景)时必须退化到度量回退,这类场景的鲁棒性未单独报告。
独立分析的弱点
独立分析存在若干弱点并给出改进方向。弱点一:跨本体覆盖不足——虽声称支持足式与空中,却只验证轮式平台,建议补充足式(如四足)与无人机实测以坐实泛化主张。弱点二:评测对 Habitat pathfinder 的依赖使'端到端'打折扣,改进方向是把 pathfinder 替换为学习的局部规划器或联合训练低层控制。弱点三:目标超出视场时约 10% 依赖度量回退,在视野受限或遮挡密集场景可能退化,可引入全景记忆或主动转向策略缓解。弱点四:奖励函数过于单薄(仅距离),易在歧义指令或长程任务上失败,建议引入指令对齐奖励与探索内在奖励。弱点五:训练算力门槛高,可探索更小的蒸馏模型或异步流水线优化以降低复现成本。弱点六:评测场景均为仿真室内,未量化真实开放环境的 sim-to-real gap。
未来方向
未来方向分两类。作者明确提出的:把导航视为通具身智能体的第一步,扩展到更通用的具身任务;推广到足式与空中机器人(声明已给但缺量化);以及探索更大规模仿真与 RL 结合以进一步压低传感器需求。基于本文成果可延伸的:其一,把 VLM 与扩散策略从串联解冻为联合端到端训练,可能进一步降低延迟与误差;其二,引入更丰富的 RL 奖励(指令遵循、探索、安全避障)替代纯距离奖励;其三,构建真实世界动态、室外 benchmark 以检验泛化与 sim-to-real;其四,用模型蒸馏把 8B 压到边缘可部署规模;其五,把指向式范式推广到操作(manipulation)等其它具身技能,验证图像空间表达的普适性。
复现评估
复现评估偏中偏低。数据方面,2.4M 轨迹、350k 场景的生成流水线在论文中有较清晰描述(最远点采样、本体参数随机化范围明确),原理上可复现,但依赖 Habitat 等仿真资产与大量渲染算力。代码与权重方面,论文未明确承诺开源,仅给出项目网页(mistral.ai/news/robostral-navigate);完整作者列表显示这是 Mistral 大团队工作,方法细节(前缀树掩码规则、CISPO 超参、难任务筛选阈值)披露较细但缺关键超参表。算力方面,监督训练需把整段 episode 喂入 8B VLM 并做大 batch,RL 阶段需并发调度物理仿真器、vLLM 生成与分布式训练,是典型的集群级工程,普通实验室难以承担。综合看,方法可理解、可参照实现,但完整复现 SOTA 需要相当工程投入与算力门槛。
论文图表