TAMP-Nav:指点、思考、记忆与对齐的高效具身导航框架 Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation
以2D像素指点替代3D坐标回归,用选择性推理与双层GRPO对齐刷新具身导航SOTA
前置知识
视觉语言导航(VLN)与 VLN-CE
VLN 要求智能体理解自然语言指令并在真实 3D 环境中移动到目标位置。VLN-CE(Vision-Language Navigation in Continuous Environments)是该任务在 Habitat 模拟器中的连续控制版本:没有预设导航图,智能体只能看到第一视角 RGB 图像,需输出底层动作(前进 0.25 米、左右转、停止)。R2R-CE 和 RxR-CE 是其两个标准基准,Val-Unseen 划分用于测试泛化。
本文全部主实验、SOTA 对比与消融都在 R2R-CE/RxR-CE Val-Unseen 上进行,报告 NE/OS/SR/SPL/nDTW 等指标,不理解这套任务设定就无法读懂实验部分。
GRPO(组相对策略优化)
DeepSeek 提出的在线强化学习算法:对同一任务采样一组(group)轨迹,用组内 Z-score 标准化后的回报作为优势函数,从而省去价值网络。配合 PPO 式的 clip 目标和 KL 惩罚做策略更新。本文将其扩展为轨迹级与步级叠加的 Two-Level 版本。
论文的 Align 模块即 Two-Level GRPO,公式 (8)(9)(20) 全部建立在标准 GRPO 的组采样与相对优势概念之上。
思维链(Chain-of-Thought, CoT)
让大模型在给出答案前先生成中间推理文本,可显著提升复杂决策质量。在导航中若每一步都触发 CoT,推理延迟会随步数线性膨胀;而完全不推理又会损失规划能力,因此『何时触发推理』成为关键设计问题。
Think 模块的核心是选择性 CoT,实验通过 Dense/Fixed(1/3)/Auto 三种触发策略的 SR 对比(66.8%/60.1%/66.2%)来验证『按需推理』的价值。
旋转位置编码(RoPE)
通过复数域旋转变换把相对位置信息注入自注意力计算,是 LLaMA、Qwen 等主流 LLM 的标准位置编码。2D RoPE 可对平面坐标 (x,y) 编码,1D RoPE 编码序列时间索引,两者可拼接后经 MLP 融合为统一 token。
记忆模块中的时空指示器(STI)用 $\mathrm{RoPE}_{2D}(x,y)$、$\mathrm{RoPE}_{1D}(t)$、$\mathrm{RoPE}_{2D}(\sin yaw,\cos yaw)$ 显式编码位姿与时间,公式 (3) 是理解记忆机制的关键。
SPL 指标
Success weighted by Path Length:在导航成功的前提下,按实际走过的路径长度与最短专家路径之比对成功率加权,同时衡量『是否到达』与『走得多高效』。它是 VLN 领域比 SR 更严格的主流指标。
本文既报告 SPL 又直接把 SPL 作为 RL 全局奖励的一部分($\omega_2 r_{spl}$),理解该指标才能看懂奖励设计动机。
SLAM 与低层控制器
SLAM(即时定位与建图)从传感器数据估计机器人位姿并构建环境地图。本文真机部署采用 FastLIO 做激光惯性里程计、FAR Planner 做局部路径规划与动态避障,负责把高层模型输出的 3D 路标点转化为安全的具体运动。
理解『高层 VLM 指点 + 低层 SLAM 执行』的解耦架构是本文 Pixel-to-3D 动作空间的前提,真机实验的 60% SR 也依赖这套经典栈的可靠性。
研究动机
现有 VLM 导航方法暴露三大瓶颈。其一,动作空间的几何鸿沟:主流方法要么让模型输出『左转 30°』这类文本原子动作(NaVid、StreamVLN),要么直接回归 3D 空间坐标(DualVLN、NavFoM),但 VLM 的预训练语料以 2D 图文对为主,强迫其隐式学习复杂 3D 几何变换会导致空间幻觉和极低的样本效率。其二,推理性能与推理效率的两难:引入 CoT 能提升高层规划,但现有模型在每一步或固定间隔触发推理,密集推理带来严重的延迟——论文对比实验中 StreamVLN 平均每任务耗时 37.47 秒、DualVLN 达 41.46 秒(单张 A800),且交互步数约 30 步。其三,长时程记忆的信息丢失:保留全部历史视觉特征会导致注意力稀释与内存溢出,而无差别丢弃历史(NaVid 式压缩)或遗忘曲线(DualVLN)又会丢掉关键信息;更糟的是,现有架构缺乏显式时空坐标来组织历史信息,智能体难以对自身轨迹保持清晰认知。
本文的目标是本文目标是构建统一框架 TAMP-Nav,在 R2R-CE 与 RxR-CE 两个基准上同时取得 SOTA 精度和高运行/样本效率:让 VLM 只做其擅长的 2D 视觉语义定位,把 3D 几何交给确定性投影与经典 SLAM 控制器;让模型自主学会『何时值得深思』,只在关键拓扑节点触发 CoT;用显式时空编码组织记忆,在固定 token 预算内既保留关键锚点又维持完整运动轨迹;最终仅用 90k 训练轨迹(约 700k 交互)完成训练,把单任务推理时间压缩至 16.58 秒,并在四足机器人上零样本迁移验证可行性。
与已有工作不同的是,本文的独特切入是『对齐』而非『堆能力』。动作层面:不改造 VLM 去输出 3D 坐标,而是把导航重新表述为 2D 视觉提示——模型只当『指点者』在图像上选像素,使具身执行天然贴合 VLM 的 2D 预训练先验。认知层面:不设计固定推理时刻表,而是通过 RL 奖励(推理价值 + 推理密度约束)让模型自发涌现按需推理的元认知——SFT 模型在直走廊浪费 38% 的推理步,RL 对齐后降至 11%。优化层面:不依赖逐步专家强制(VLN-R1 式模仿),而是多分支 rollout 组采样,把轨迹级全局优势与步级局部优势叠加,用密集过程奖励解决长时程导航的稀疏反馈与信用分配难题。
核心方法
直觉上,论文把导航拆成四个对齐问题:指哪(Point)、想多久(Think)、记什么(Memorize)、怎么学(Align)。技术上,TAMP-Nav 以 Qwen2.5-VL-7B 为基座。每一步智能体接收覆盖 360° 视野的 4 张自我中心图像 $V_t=\{v_{t,1},...,v_{t,4}\}$,在由工作记忆与长期拓扑记忆拼接的上下文 $C_t$ 支撑下,先自主决定是否触发 CoT 深思,再选择最优视角并输出指向目标路标的 2D 像素 $a_t=(u,v)$;该像素经深度图与相机内参投影为局部 3D 点 $P_t = D_{t,i}(u,v) \cdot K^{-1}[u,v,1]^T$,变换到世界坐标后交给 SLAM 低层控制器执行。长期记忆由显式锚点 $A_k$(CoT 触发节点的 ⟨STI, 视觉特征, 规划信标⟩ 三元组)与纯时空 token 流 $T_k$ 交替构成。训练上先用自建 MultiNav-CoT 数据集(90k 轨迹)做 SFT 冷启动,再用双层 GRPO 强化学习:每条轨迹逐步从 4 个候选动作中软选择执行,8 条完整轨迹竞争全局优势,逐步 4 个候选竞争局部优势,两者标准化后叠加更新策略。
核心创新有三点。第一,Pixel-to-3D 动作空间:VLM 仅充当 2D『视觉指点者』,选中的像素由确定性投影公式转为 3D 路标点,低层执行完全交给固定 SLAM 控制器,从源头绕开 2D 预训练与 3D 动作之间的几何鸿沟——消融显示换成 NavFoM 式米制路标点回归会让 R2R-CE 的 SR 从 55.7% 暴跌至 30.9%,差 24.8 个点。第二,选择性推理 + 锚点-轨迹记忆:CoT 只在关键拓扑节点触发并存储为高保真显式锚点,冗余路段则压缩为只含 $E_{STI}$ 时空 token 的轻量流,同时解决『全存导致上下文溢出』与『稀疏采样丢失信息』的两难。第三,双层 GRPO:组内 8 条轨迹以全局奖励(成功/SPL/推理密度)竞争轨迹级优势,每步 4 个候选以局部奖励(接近/避撞/停止/推理价值/格式)竞争步级优势,$A_S^{(t)} = A_{global} + A_{local}^{(t)}$ 叠加后提供密集监督,配合退火引导采样,无需专家强制即可让模型学到『何时思考』的元认知。
方法步骤详情
完整流程分四阶段。阶段一(数据构建):从 VLN-CE 过滤出 90k 轨迹(剔除黑图与低质指令),用重要性分数 $S(t)=S_{sem}(t)+S_{vis}(t)$ 给每帧打分——$S_{sem}$ 是 CLIP 计算的指令-视觉语义相关度、$S_{vis}$ 是相邻帧视觉特征差(各做轨迹内 Min-Max 归一化);随后按分数贪心筛选、丢弃空间距离小于 $D_{min}=2$ 的候选,相邻节点间距超过 $D_{max}=6$ 时插入最高分中间帧,最终得到约占轨迹 30% 的关键节点集;再用 Gemini 2.5 Flash 按『任务阶段定位→当前观测分析→未来动作推理→融合润色』四段式 prompt 生成 CoT 标注。阶段二(SFT 冷启动):bf16 精度、峰值学习率 $5\times10^{-6}$ 训练 1 个 epoch,混入 10% GQA 数据防遗忘,约 160 GPU 小时。阶段三(在线决策):每步拼接工作记忆(当前步与最近锚点间均匀采样的 2 帧)与长期记忆 $M_{long}=\{A_1,T_1,...,A_m,T_m\}$,输出视角选择 + 像素坐标 + 可选 CoT + STOP 判定的结构化 JSON。阶段四(双层 GRPO):温度 0.7 采样 $M=4$ 个候选动作,按 $P_{select}(a_i)\propto\exp(\beta_k r_{app}(a_i))$、$\beta_k=2.0\cdot0.99^k$ 指数退火软选择实际执行者;$G=8$ 条轨迹完成后计算 $R_{global}=3.0r_{suc}+1.0r_{spl}+1.0r_{den}$,逐步计算 $R_{local}=0.5r_{app}+0.2r_{coll}+0.8r_{stop}+0.5r_{rea}+0.2r_{fmt}$,两级优势分别 Z-score 标准化后叠加,以 token 级 GRPO 损失(学习率 $2\times10^{-6}$)更新 800 步,约 600 GPU 小时。
技术新颖性
与已有工作的本质区别体现在四个维度。动作空间:NaVid/StreamVLN 输出文本原子动作、NavFoM/DualVLN 回归 3D 坐标,本文是少数让 VLM 纯以 2D 指点驱动 3D 执行的方案,且用受控消融证明该设计贡献高达 24.8 个 SR 点,而非仅是工程选择。推理时机:此前 VLingNav 虽提出自适应推理,但依赖粗粒度数据标注、未探索如何系统性地把元认知注入模型;本文设计推理价值奖励 $r_{rea}=h_t(r_{app}-\bar{r}_{app})$——只有当推理带来超过候选均值的好决策时才给正奖励——让『何时思考』成为 RL 内生学到的能力,并以热力图验证触发点聚集中在路口、门口和目标附近。记忆机制:StreamVLN/NavFoM 用 3D 体素化或隐式遗忘曲线压缩历史,可能丢掉关键细节;本文 STI 用 RoPE 显式编码位姿与时间、锚点保留原始视觉特征支持像素级回环检测,消融证明去掉 STI 后长时程 SR 从 49.8% 掉到 45.6%。RL 范式:VLN-R1 依赖严格专家动作匹配、纯轨迹级奖励方法有信用分配困难,本文的双层优势叠加 + 退火引导采样在稀疏与密集、探索与利用之间取得平衡,学习曲线显示 800 步内奖励收敛值从 0.59 提升到 0.68。
实验结果
逐项分析七个实验。①主基准(Table 1):R2R-CE Val-Unseen 上 NE 3.85 / OS 74.5 / SR 66.2% / SPL 58.8,全面超越 DualVLN(SR 64.3%、SPL 58.5)和 NavFoM(SR 61.7%);RxR-CE 上 SR 65.7% / SPL 56.9 / nDTW 72.4,超过 NavFoM 的 64.4% 与 DualVLN 的 61.4%。②效率:仅用 90k 轨迹(约 700k 交互)远少于 DualVLN 的 763k 轨迹和 NavFoM 的 3.37M 交互;Pixel-to-3D 使平均交互步数降到 9 步(对比模型约 30 步);单 A800 上每任务 16.58 秒,比 StreamVLN(37.47s)和 DualVLN(41.46s)快一倍以上。③长时程(Table 4):在 5927 条专家路径超 12.5 米(>50 个原子动作)的轨迹上 SR 49.8%,比 DualVLN(41.9%)高 7.9 点、比 StreamVLN(30.9%)高 18.9 点。④涌现式按需推理(Figure 3、Table 2):RL 后 CoT 占比仅 26.3% 即达 66.2% SR,几乎追平 Dense CoT 上限 66.8%,显著优于固定 1/3 触发的 60.1%;直走廊上的推理步占比从 SFT 的 38% 降到 11%。⑤组件消融(Table 5):Pixel-to-3D 贡献 +24.8 SR;双层 GRPO 比纯轨迹奖励高 6.9 点(局部优势 +4.1、退火引导 +2.8);AT-Mem 比全历史保留高 4.3 点、STI 贡献 2.6 点;Auto 推理比 Dense CoT 减少 73.7% 调用仅损失 0.6 SR。⑥教师质量敏感性(Table 6):Qwen2.5-VL-7B 自生成 CoT(SR 49.4%)竟低于无 CoT(50.6%),Gemini 2.5 Flash CoT 最优(55.7%),GLM-4.5V-108B 居中(54.4%),人工评审通过率分别为 94.0% 与 91.5%。⑦真机零样本(Figure 6):宇树 Go2 四足机器人 100 次试验 SR 60.0%,超 DualVLN(53.0%)与 StreamVLN(49.0%),且完全未经真机微调。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| R2R-CE Val-Unseen 导航 | SR(成功率) | 66.2% | DualVLN 64.3% / NavFoM 61.7% | +1.9 / +4.5 点 |
| R2R-CE Val-Unseen 导航 | SPL(路径加权成功率) | 58.8 | DualVLN 58.5 | +0.3 |
| RxR-CE Val-Unseen 导航 | SR(成功率) | 65.7% | NavFoM 64.4% / DualVLN 61.4% | +1.3 / +4.3 点 |
| RxR-CE Val-Unseen 导航 | nDTW(指令跟随度) | 72.4 | DualVLN 70.0 | +2.4 |
| 长时程导航(专家路径 >12.5m,5927 条) | SR(成功率) | 49.8% | DualVLN 41.9% / StreamVLN 30.9% | +7.9 / +18.9 点 |
| 真机四足导航(宇树 Go2,100 次试验) | SR(成功率) | 60.0% | DualVLN 53.0% / StreamVLN 49.0% | +7.0 / +11.0 点 |
| 推理效率(单 A800 每任务耗时) | 时间 | 16.58s | StreamVLN 37.47s / DualVLN 41.46s | 快约 56%–60% |
| 样本效率 | 训练轨迹数 | 90k(约 700k 交互) | DualVLN 763k 轨迹 / NavFoM 3.37M 交互 | 轨迹数减少约 88% |
局限与改进
作者承认的局限:系统强依赖深度信息(Pixel-to-3D 投影、STI 编码、坐标变换都用到深度)与可靠 SLAM 栈,虽然受控噪声实验显示 $\sigma=0.2$(16% 相对误差)仅掉 2.8 点 SR,但严重深度误差、累积里程计/SLAM 漂移、定位失败和高度动态环境会造成更大退化;GRPO 训练依赖模拟器特权信号(进度、成功、SPL、碰撞均可直接查询),无法在物理机器人上在线强化学习,真机只能零样本迁移冻结策略;关键节点挖掘靠语义相似度 + 视觉变化的启发式,当决策点视觉不显著或指令风格偏离 R2R/RxR 时可能欠选择关键状态;STI 只编码平面坐标 $(x,y)$ 与朝向,不含高度,无法区分楼层;推理密度奖励的 0.4/0.6 阈值是针对 R2R/RxR 调的,换域需重调。我的补充观察:平均 9 步交互的高效率部分来自『直行路段合并执行』,论文未报告复杂迷宫场景下的步数分布,优势可能随环境结构变化而缩水;真机评测虽有户外类别但仅 20 次试验,人流密集、玻璃/镜面等传感器失效场景未覆盖;数据构建依赖闭源 Gemini API,质量敏感(Table 6 证明差教师反而有害)且长期可得性存疑;推理价值奖励以候选均值为基线,当所有候选质量接近时信号噪声大,缺乏长训练周期下元认知稳定性的证据。
独立分析的弱点
弱点一:深度单点依赖。指点范式把 3D 几何全部押注在被选中像素的深度值上,而玻璃门、镜面、强反光表面上深度传感器常系统性失效,此时指点会投出穿墙路标,封闭-loop 校正也救不回;改进方向是融合 LiDAR 深度或让模型输出深度不确定性加权,低层控制器对不可信深度回退到安全探索行为。弱点二:STI 缺少高度维度,多楼层建筑中 $(x,y)$ 相同的不同楼层会被编码为同一位置,任务进度描述只能部分补偿;改进方向是扩展为 3D 位姿编码 $\mathrm{RoPE}_{3D}(x,y,z)$ 并引入楼梯/电梯检测 token。弱点三:元认知完全由启发式的 $r_{rea}$ 奖励塑造,基线取候选动作均值,候选质量方差小时奖励信号接近噪声,且 0.4/0.6 的推理密度阈值需要逐域重调;改进方向是引入学习到的过程奖励模型(PRM)替代手工奖励。弱点四:真机侧无法在线学习,策略无法适应部署环境的分布漂移(光照、家具变动);改进方向是用真机试验的成败信号做弱监督微调或离线 RL。弱点五:360° 视野依赖 4 相机环形排布的硬件假设,单前视相机的低成本平台上记忆与指点机制效果未验证;改进方向是将『主动转身查看』作为可学动作与记忆机制协同训练。
未来方向
作者明确提出的方向:把该框架从纯 VLN-CE 训练扩展到更广泛的具身任务和动态真实环境。基于成果可自然延伸的方向包括:① 将 STI 升级为全 3D 位姿并构建多楼层拓扑记忆,支持跨楼层长时程任务;② 构建真机在线/离线 RL 管线——用部署中的成败结果、人类纠偏或学习到的验证器替代模拟器特权奖励,打通 sim-to-real 的持续学习闭环;③ 把关键节点挖掘从 CLIP+视觉差的启发式换成可学习的触发判别器,与策略联合训练,缓解指令风格迁移时的欠选择;④ 迁移到 ObjectNav、指令跟随、多机器人协作等任务,检验『选择性推理』元认知的通用性;⑤ 结合世界模型在想象空间 rollout,进一步压缩真实交互样本需求(当前 GRPO 已需约 700k 交互);⑥ 用开源教师自举蒸馏或自我一致性过滤替代闭源 Gemini API,降低数据构建成本与合规风险。
复现评估
开源情况较好:代码已在 GitHub 开源(ZJU-OmniAI/Embodied-Omni),基座模型 Qwen2.5-VL-7B 开源,训练数据基于公开的 VLN-CE/Habitat 模拟器;但 90k 轨迹的 CoT 标注需调用 Gemini 2.5 Flash API——好在附录 G 完整给出四段式 prompt(指令过滤、阶段定位、观测分析、动作推理、融合润色),可自行复现数据。算力门槛不低:8×A800 80GB 集群,SFT 约 160 GPU 小时(20 小时墙钟)、GRPO 约 600 GPU 小时(75 小时墙钟),合计近千 GPU 小时,普通实验室需要租用算力。附录 H 披露了完整超参数(学习率 $5\times10^{-6}$/$2\times10^{-6}$、$G=8$、$M=4$、温度 0.7、$\beta_0=2.0$、$\alpha=0.99$ 等),奖励公式在附录 A 给出。复现难点集中在:RL 部分依赖 Habitat 特权信号的具体实现、真机部分需要宇树 Go2 + 4 个环形 RGB-D 相机 + Hesai XT16 激光雷达 + FastLIO/FAR Planner 的软硬件栈。总体评估:文档与配置齐全使复现可行,但 RL 训练稳定性调参和数据生成成本使实际难度为中等偏高。
论文图表