← 返回 2026-08-19

TAMP-Nav:指点、思考、记忆与对齐的高效具身导航框架 Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation

Hongyan Feng, Sunlai Chen, Xuanyu Liu, Miao Pan, Yangfan Xie, Yuxiang Cui, Zhongxiang Zhou, Rong Xiong, Wenqi Zhang, Jianwei Yin, Yueting Zhuang, Xuhong Zhang 📅 2026-08-18 👍 51 2026-08-24 18:30
GRPO强化学习 VLM sim-to-real 具身导航 视觉语言导航 选择性推理

以2D像素指点替代3D坐标回归,用选择性推理与双层GRPO对齐刷新具身导航SOTA

前置知识

视觉语言导航(VLN)与 VLN-CE

VLN 要求智能体理解自然语言指令并在真实 3D 环境中移动到目标位置。VLN-CE(Vision-Language Navigation in Continuous Environments)是该任务在 Habitat 模拟器中的连续控制版本:没有预设导航图,智能体只能看到第一视角 RGB 图像,需输出底层动作(前进 0.25 米、左右转、停止)。R2R-CE 和 RxR-CE 是其两个标准基准,Val-Unseen 划分用于测试泛化。

本文全部主实验、SOTA 对比与消融都在 R2R-CE/RxR-CE Val-Unseen 上进行,报告 NE/OS/SR/SPL/nDTW 等指标,不理解这套任务设定就无法读懂实验部分。

GRPO(组相对策略优化)

DeepSeek 提出的在线强化学习算法:对同一任务采样一组(group)轨迹,用组内 Z-score 标准化后的回报作为优势函数,从而省去价值网络。配合 PPO 式的 clip 目标和 KL 惩罚做策略更新。本文将其扩展为轨迹级与步级叠加的 Two-Level 版本。

论文的 Align 模块即 Two-Level GRPO,公式 (8)(9)(20) 全部建立在标准 GRPO 的组采样与相对优势概念之上。

思维链(Chain-of-Thought, CoT)

让大模型在给出答案前先生成中间推理文本,可显著提升复杂决策质量。在导航中若每一步都触发 CoT,推理延迟会随步数线性膨胀;而完全不推理又会损失规划能力,因此『何时触发推理』成为关键设计问题。

Think 模块的核心是选择性 CoT,实验通过 Dense/Fixed(1/3)/Auto 三种触发策略的 SR 对比(66.8%/60.1%/66.2%)来验证『按需推理』的价值。

旋转位置编码(RoPE)

通过复数域旋转变换把相对位置信息注入自注意力计算,是 LLaMA、Qwen 等主流 LLM 的标准位置编码。2D RoPE 可对平面坐标 (x,y) 编码,1D RoPE 编码序列时间索引,两者可拼接后经 MLP 融合为统一 token。

记忆模块中的时空指示器(STI)用 $\mathrm{RoPE}_{2D}(x,y)$、$\mathrm{RoPE}_{1D}(t)$、$\mathrm{RoPE}_{2D}(\sin yaw,\cos yaw)$ 显式编码位姿与时间,公式 (3) 是理解记忆机制的关键。

SPL 指标

Success weighted by Path Length:在导航成功的前提下,按实际走过的路径长度与最短专家路径之比对成功率加权,同时衡量『是否到达』与『走得多高效』。它是 VLN 领域比 SR 更严格的主流指标。

本文既报告 SPL 又直接把 SPL 作为 RL 全局奖励的一部分($\omega_2 r_{spl}$),理解该指标才能看懂奖励设计动机。

SLAM 与低层控制器

SLAM(即时定位与建图)从传感器数据估计机器人位姿并构建环境地图。本文真机部署采用 FastLIO 做激光惯性里程计、FAR Planner 做局部路径规划与动态避障,负责把高层模型输出的 3D 路标点转化为安全的具体运动。

理解『高层 VLM 指点 + 低层 SLAM 执行』的解耦架构是本文 Pixel-to-3D 动作空间的前提,真机实验的 60% SR 也依赖这套经典栈的可靠性。

研究动机

现有 VLM 导航方法暴露三大瓶颈。其一,动作空间的几何鸿沟:主流方法要么让模型输出『左转 30°』这类文本原子动作(NaVid、StreamVLN),要么直接回归 3D 空间坐标(DualVLN、NavFoM),但 VLM 的预训练语料以 2D 图文对为主,强迫其隐式学习复杂 3D 几何变换会导致空间幻觉和极低的样本效率。其二,推理性能与推理效率的两难:引入 CoT 能提升高层规划,但现有模型在每一步或固定间隔触发推理,密集推理带来严重的延迟——论文对比实验中 StreamVLN 平均每任务耗时 37.47 秒、DualVLN 达 41.46 秒(单张 A800),且交互步数约 30 步。其三,长时程记忆的信息丢失:保留全部历史视觉特征会导致注意力稀释与内存溢出,而无差别丢弃历史(NaVid 式压缩)或遗忘曲线(DualVLN)又会丢掉关键信息;更糟的是,现有架构缺乏显式时空坐标来组织历史信息,智能体难以对自身轨迹保持清晰认知。

本文的目标是本文目标是构建统一框架 TAMP-Nav,在 R2R-CE 与 RxR-CE 两个基准上同时取得 SOTA 精度和高运行/样本效率:让 VLM 只做其擅长的 2D 视觉语义定位,把 3D 几何交给确定性投影与经典 SLAM 控制器;让模型自主学会『何时值得深思』,只在关键拓扑节点触发 CoT;用显式时空编码组织记忆,在固定 token 预算内既保留关键锚点又维持完整运动轨迹;最终仅用 90k 训练轨迹(约 700k 交互)完成训练,把单任务推理时间压缩至 16.58 秒,并在四足机器人上零样本迁移验证可行性。

与已有工作不同的是,本文的独特切入是『对齐』而非『堆能力』。动作层面:不改造 VLM 去输出 3D 坐标,而是把导航重新表述为 2D 视觉提示——模型只当『指点者』在图像上选像素,使具身执行天然贴合 VLM 的 2D 预训练先验。认知层面:不设计固定推理时刻表,而是通过 RL 奖励(推理价值 + 推理密度约束)让模型自发涌现按需推理的元认知——SFT 模型在直走廊浪费 38% 的推理步,RL 对齐后降至 11%。优化层面:不依赖逐步专家强制(VLN-R1 式模仿),而是多分支 rollout 组采样,把轨迹级全局优势与步级局部优势叠加,用密集过程奖励解决长时程导航的稀疏反馈与信用分配难题。

核心方法

直觉上,论文把导航拆成四个对齐问题:指哪(Point)、想多久(Think)、记什么(Memorize)、怎么学(Align)。技术上,TAMP-Nav 以 Qwen2.5-VL-7B 为基座。每一步智能体接收覆盖 360° 视野的 4 张自我中心图像 $V_t=\{v_{t,1},...,v_{t,4}\}$,在由工作记忆与长期拓扑记忆拼接的上下文 $C_t$ 支撑下,先自主决定是否触发 CoT 深思,再选择最优视角并输出指向目标路标的 2D 像素 $a_t=(u,v)$;该像素经深度图与相机内参投影为局部 3D 点 $P_t = D_{t,i}(u,v) \cdot K^{-1}[u,v,1]^T$,变换到世界坐标后交给 SLAM 低层控制器执行。长期记忆由显式锚点 $A_k$(CoT 触发节点的 ⟨STI, 视觉特征, 规划信标⟩ 三元组)与纯时空 token 流 $T_k$ 交替构成。训练上先用自建 MultiNav-CoT 数据集(90k 轨迹)做 SFT 冷启动,再用双层 GRPO 强化学习:每条轨迹逐步从 4 个候选动作中软选择执行,8 条完整轨迹竞争全局优势,逐步 4 个候选竞争局部优势,两者标准化后叠加更新策略。

核心创新有三点。第一,Pixel-to-3D 动作空间:VLM 仅充当 2D『视觉指点者』,选中的像素由确定性投影公式转为 3D 路标点,低层执行完全交给固定 SLAM 控制器,从源头绕开 2D 预训练与 3D 动作之间的几何鸿沟——消融显示换成 NavFoM 式米制路标点回归会让 R2R-CE 的 SR 从 55.7% 暴跌至 30.9%,差 24.8 个点。第二,选择性推理 + 锚点-轨迹记忆:CoT 只在关键拓扑节点触发并存储为高保真显式锚点,冗余路段则压缩为只含 $E_{STI}$ 时空 token 的轻量流,同时解决『全存导致上下文溢出』与『稀疏采样丢失信息』的两难。第三,双层 GRPO:组内 8 条轨迹以全局奖励(成功/SPL/推理密度)竞争轨迹级优势,每步 4 个候选以局部奖励(接近/避撞/停止/推理价值/格式)竞争步级优势,$A_S^{(t)} = A_{global} + A_{local}^{(t)}$ 叠加后提供密集监督,配合退火引导采样,无需专家强制即可让模型学到『何时思考』的元认知。

方法步骤详情

完整流程分四阶段。阶段一(数据构建):从 VLN-CE 过滤出 90k 轨迹(剔除黑图与低质指令),用重要性分数 $S(t)=S_{sem}(t)+S_{vis}(t)$ 给每帧打分——$S_{sem}$ 是 CLIP 计算的指令-视觉语义相关度、$S_{vis}$ 是相邻帧视觉特征差(各做轨迹内 Min-Max 归一化);随后按分数贪心筛选、丢弃空间距离小于 $D_{min}=2$ 的候选,相邻节点间距超过 $D_{max}=6$ 时插入最高分中间帧,最终得到约占轨迹 30% 的关键节点集;再用 Gemini 2.5 Flash 按『任务阶段定位→当前观测分析→未来动作推理→融合润色』四段式 prompt 生成 CoT 标注。阶段二(SFT 冷启动):bf16 精度、峰值学习率 $5\times10^{-6}$ 训练 1 个 epoch,混入 10% GQA 数据防遗忘,约 160 GPU 小时。阶段三(在线决策):每步拼接工作记忆(当前步与最近锚点间均匀采样的 2 帧)与长期记忆 $M_{long}=\{A_1,T_1,...,A_m,T_m\}$,输出视角选择 + 像素坐标 + 可选 CoT + STOP 判定的结构化 JSON。阶段四(双层 GRPO):温度 0.7 采样 $M=4$ 个候选动作,按 $P_{select}(a_i)\propto\exp(\beta_k r_{app}(a_i))$、$\beta_k=2.0\cdot0.99^k$ 指数退火软选择实际执行者;$G=8$ 条轨迹完成后计算 $R_{global}=3.0r_{suc}+1.0r_{spl}+1.0r_{den}$,逐步计算 $R_{local}=0.5r_{app}+0.2r_{coll}+0.8r_{stop}+0.5r_{rea}+0.2r_{fmt}$,两级优势分别 Z-score 标准化后叠加,以 token 级 GRPO 损失(学习率 $2\times10^{-6}$)更新 800 步,约 600 GPU 小时。

技术新颖性

与已有工作的本质区别体现在四个维度。动作空间:NaVid/StreamVLN 输出文本原子动作、NavFoM/DualVLN 回归 3D 坐标,本文是少数让 VLM 纯以 2D 指点驱动 3D 执行的方案,且用受控消融证明该设计贡献高达 24.8 个 SR 点,而非仅是工程选择。推理时机:此前 VLingNav 虽提出自适应推理,但依赖粗粒度数据标注、未探索如何系统性地把元认知注入模型;本文设计推理价值奖励 $r_{rea}=h_t(r_{app}-\bar{r}_{app})$——只有当推理带来超过候选均值的好决策时才给正奖励——让『何时思考』成为 RL 内生学到的能力,并以热力图验证触发点聚集中在路口、门口和目标附近。记忆机制:StreamVLN/NavFoM 用 3D 体素化或隐式遗忘曲线压缩历史,可能丢掉关键细节;本文 STI 用 RoPE 显式编码位姿与时间、锚点保留原始视觉特征支持像素级回环检测,消融证明去掉 STI 后长时程 SR 从 49.8% 掉到 45.6%。RL 范式:VLN-R1 依赖严格专家动作匹配、纯轨迹级奖励方法有信用分配困难,本文的双层优势叠加 + 退火引导采样在稀疏与密集、探索与利用之间取得平衡,学习曲线显示 800 步内奖励收敛值从 0.59 提升到 0.68。

The architecture of TAMP-Nav. Given visual-textual inputs, the agent compresses long-horizon history into an Anchor-Trajectory Memory, autonomously triggering reasoning at critical nodes. As a visual pointer, it selects the optimal multi-camera view and predicts a 2D pixel, which is projected into 3D for SLAM execution. Finally, the policy is optimized via Two-Level GRPO.
Figure 1: The architecture of TAMP-Nav. Given visual-textual inputs, the agent compresses long-horizon history into an Anchor-Trajectory Memory, autonomously triggering reasoning at critical nodes. As a visual pointer, it selects the optimal multi-camera view and predicts a 2D pixel, which is projected into 3D for SLAM execution. Finally, the policy is optimized via Two-Level GRPO.
The Two-Level GRPO paradigm. TAMP-Nav superimposes trajectory-level rollouts (competing for global navigation success) with step-level candidate rollouts (exploring diverse 2D visual-spatial actions via VLM temperature sampling).
Figure 2: The Two-Level GRPO paradigm. TAMP-Nav superimposes trajectory-level rollouts (competing for global navigation success) with step-level candidate rollouts (exploring diverse 2D visual-spatial actions via VLM temperature sampling).
Visualization of STI token. We employ a clustering algorithm (McInnes et al. (2018)) to map high-dimensional embeddings into a 3D space.
Figure 8: Visualization of STI token. We employ a clustering algorithm (McInnes et al. (2018)) to map high-dimensional embeddings into a 3D space.

实验结果

逐项分析七个实验。①主基准(Table 1):R2R-CE Val-Unseen 上 NE 3.85 / OS 74.5 / SR 66.2% / SPL 58.8,全面超越 DualVLN(SR 64.3%、SPL 58.5)和 NavFoM(SR 61.7%);RxR-CE 上 SR 65.7% / SPL 56.9 / nDTW 72.4,超过 NavFoM 的 64.4% 与 DualVLN 的 61.4%。②效率:仅用 90k 轨迹(约 700k 交互)远少于 DualVLN 的 763k 轨迹和 NavFoM 的 3.37M 交互;Pixel-to-3D 使平均交互步数降到 9 步(对比模型约 30 步);单 A800 上每任务 16.58 秒,比 StreamVLN(37.47s)和 DualVLN(41.46s)快一倍以上。③长时程(Table 4):在 5927 条专家路径超 12.5 米(>50 个原子动作)的轨迹上 SR 49.8%,比 DualVLN(41.9%)高 7.9 点、比 StreamVLN(30.9%)高 18.9 点。④涌现式按需推理(Figure 3、Table 2):RL 后 CoT 占比仅 26.3% 即达 66.2% SR,几乎追平 Dense CoT 上限 66.8%,显著优于固定 1/3 触发的 60.1%;直走廊上的推理步占比从 SFT 的 38% 降到 11%。⑤组件消融(Table 5):Pixel-to-3D 贡献 +24.8 SR;双层 GRPO 比纯轨迹奖励高 6.9 点(局部优势 +4.1、退火引导 +2.8);AT-Mem 比全历史保留高 4.3 点、STI 贡献 2.6 点;Auto 推理比 Dense CoT 减少 73.7% 调用仅损失 0.6 SR。⑥教师质量敏感性(Table 6):Qwen2.5-VL-7B 自生成 CoT(SR 49.4%)竟低于无 CoT(50.6%),Gemini 2.5 Flash CoT 最优(55.7%),GLM-4.5V-108B 居中(54.4%),人工评审通过率分别为 94.0% 与 91.5%。⑦真机零样本(Figure 6):宇树 Go2 四足机器人 100 次试验 SR 60.0%,超 DualVLN(53.0%)与 StreamVLN(49.0%),且完全未经真机微调。

Comparison of different methods on R2R-CE and RxR-CE validation unseen splits.
Table 1: Comparison of different methods on R2R-CE and RxR-CE validation unseen splits.
Intervention Analysis. Comparing navigation success (SR) and reasoning density (CoT Ratio) on R2R-CE Val-Unseen.
Table 2: Intervention Analysis. Comparing navigation success (SR) and reasoning density (CoT Ratio) on R2R-CE Val-Unseen.
Success Rate (SR) under varying multiplicative depth noise levels (σ).
Table 3: Success Rate (SR) under varying multiplicative depth noise levels (σ).
Performance on long-horizon tasks and memory ablation study.
Table 4: Performance on long-horizon tasks and memory ablation study.
Controlled component-wise ablations under matched budgets. R2R-CE reports NE/OS/SR/SPL; RxR-CE reports NE/SR/SPL/nDTW.
Table 5: Controlled component-wise ablations under matched budgets. R2R-CE reports NE/OS/SR/SPL; RxR-CE reports NE/SR/SPL/nDTW.
Effect of the CoT supervision source under a matched SFT budget.
Table 6: Effect of the CoT supervision source under a matched SFT budget.
Spatial Heatmap of Reasoning (CoT) Triggers. Comparison between the SFT model (left) and the RL-aligned TAMP-Nav (right).
Figure 3: Spatial Heatmap of Reasoning (CoT) Triggers. Comparison between the SFT model (left) and the RL-aligned TAMP-Nav (right).
Performance distribution on long-horizon navigation tasks. The bars show the trajectory count in each length bin, and the curves show the Success Rate (SR) of the evaluated methods as trajectory length increases.
Figure 4: Performance distribution on long-horizon navigation tasks. The bars show the trajectory count in each length bin, and the curves show the Success Rate (SR) of the evaluated methods as trajectory length increases.
Learning curves of success rewards under different GRPO configurations. The plot illustrates the training progress over 800 steps for three variants: the full Two-Level GRPO, the version without annealed guided sampling (“without guidance”), and the standard GRPO using only trajectory-level rewards (“only trajectory reward”).
Figure 5: Learning curves of success rewards under different GRPO configurations. The plot illustrates the training progress over 800 steps for three variants: the full Two-Level GRPO, the version without annealed guided sampling (“without guidance”), and the standard GRPO using only trajectory-level rewards (“only trajectory reward”).
Real-world deployment results. (a) Visualization of the execution trajectory. (b) Success rate comparison.
Figure 6: Real-world deployment results. (a) Visualization of the execution trajectory. (b) Success rate comparison.
Examples of real-world experiments. The agent demonstrates zero-shot transferability across physical environments, executing multi-turn instructions by reasoning and outputting sequential 2D pixel coordinates.
Figure 7: Examples of real-world experiments. The agent demonstrates zero-shot transferability across physical environments, executing multi-turn instructions by reasoning and outputting sequential 2D pixel coordinates.
Visualization of a simulated navigation trajectory. The agent successfully executes the complex instruction: “Go up the stairs and turn left. Wait at the doorway to the bedroom straight ahead.” by triggering selective reasoning at key decision points and outputting point-and-click actions.
Figure 9: Visualization of a simulated navigation trajectory. The agent successfully executes the complex instruction: “Go up the stairs and turn left. Wait at the doorway to the bedroom straight ahead.” by triggering selective reasoning at key decision points and outputting point-and-click actions.
查看结构化数据
任务指标本文基线提升
R2R-CE Val-Unseen 导航 SR(成功率) 66.2% DualVLN 64.3% / NavFoM 61.7% +1.9 / +4.5 点
R2R-CE Val-Unseen 导航 SPL(路径加权成功率) 58.8 DualVLN 58.5 +0.3
RxR-CE Val-Unseen 导航 SR(成功率) 65.7% NavFoM 64.4% / DualVLN 61.4% +1.3 / +4.3 点
RxR-CE Val-Unseen 导航 nDTW(指令跟随度) 72.4 DualVLN 70.0 +2.4
长时程导航(专家路径 >12.5m,5927 条) SR(成功率) 49.8% DualVLN 41.9% / StreamVLN 30.9% +7.9 / +18.9 点
真机四足导航(宇树 Go2,100 次试验) SR(成功率) 60.0% DualVLN 53.0% / StreamVLN 49.0% +7.0 / +11.0 点
推理效率(单 A800 每任务耗时) 时间 16.58s StreamVLN 37.47s / DualVLN 41.46s 快约 56%–60%
样本效率 训练轨迹数 90k(约 700k 交互) DualVLN 763k 轨迹 / NavFoM 3.37M 交互 轨迹数减少约 88%

局限与改进

作者承认的局限:系统强依赖深度信息(Pixel-to-3D 投影、STI 编码、坐标变换都用到深度)与可靠 SLAM 栈,虽然受控噪声实验显示 $\sigma=0.2$(16% 相对误差)仅掉 2.8 点 SR,但严重深度误差、累积里程计/SLAM 漂移、定位失败和高度动态环境会造成更大退化;GRPO 训练依赖模拟器特权信号(进度、成功、SPL、碰撞均可直接查询),无法在物理机器人上在线强化学习,真机只能零样本迁移冻结策略;关键节点挖掘靠语义相似度 + 视觉变化的启发式,当决策点视觉不显著或指令风格偏离 R2R/RxR 时可能欠选择关键状态;STI 只编码平面坐标 $(x,y)$ 与朝向,不含高度,无法区分楼层;推理密度奖励的 0.4/0.6 阈值是针对 R2R/RxR 调的,换域需重调。我的补充观察:平均 9 步交互的高效率部分来自『直行路段合并执行』,论文未报告复杂迷宫场景下的步数分布,优势可能随环境结构变化而缩水;真机评测虽有户外类别但仅 20 次试验,人流密集、玻璃/镜面等传感器失效场景未覆盖;数据构建依赖闭源 Gemini API,质量敏感(Table 6 证明差教师反而有害)且长期可得性存疑;推理价值奖励以候选均值为基线,当所有候选质量接近时信号噪声大,缺乏长训练周期下元认知稳定性的证据。

独立分析的弱点

弱点一:深度单点依赖。指点范式把 3D 几何全部押注在被选中像素的深度值上,而玻璃门、镜面、强反光表面上深度传感器常系统性失效,此时指点会投出穿墙路标,封闭-loop 校正也救不回;改进方向是融合 LiDAR 深度或让模型输出深度不确定性加权,低层控制器对不可信深度回退到安全探索行为。弱点二:STI 缺少高度维度,多楼层建筑中 $(x,y)$ 相同的不同楼层会被编码为同一位置,任务进度描述只能部分补偿;改进方向是扩展为 3D 位姿编码 $\mathrm{RoPE}_{3D}(x,y,z)$ 并引入楼梯/电梯检测 token。弱点三:元认知完全由启发式的 $r_{rea}$ 奖励塑造,基线取候选动作均值,候选质量方差小时奖励信号接近噪声,且 0.4/0.6 的推理密度阈值需要逐域重调;改进方向是引入学习到的过程奖励模型(PRM)替代手工奖励。弱点四:真机侧无法在线学习,策略无法适应部署环境的分布漂移(光照、家具变动);改进方向是用真机试验的成败信号做弱监督微调或离线 RL。弱点五:360° 视野依赖 4 相机环形排布的硬件假设,单前视相机的低成本平台上记忆与指点机制效果未验证;改进方向是将『主动转身查看』作为可学动作与记忆机制协同训练。

未来方向

作者明确提出的方向:把该框架从纯 VLN-CE 训练扩展到更广泛的具身任务和动态真实环境。基于成果可自然延伸的方向包括:① 将 STI 升级为全 3D 位姿并构建多楼层拓扑记忆,支持跨楼层长时程任务;② 构建真机在线/离线 RL 管线——用部署中的成败结果、人类纠偏或学习到的验证器替代模拟器特权奖励,打通 sim-to-real 的持续学习闭环;③ 把关键节点挖掘从 CLIP+视觉差的启发式换成可学习的触发判别器,与策略联合训练,缓解指令风格迁移时的欠选择;④ 迁移到 ObjectNav、指令跟随、多机器人协作等任务,检验『选择性推理』元认知的通用性;⑤ 结合世界模型在想象空间 rollout,进一步压缩真实交互样本需求(当前 GRPO 已需约 700k 交互);⑥ 用开源教师自举蒸馏或自我一致性过滤替代闭源 Gemini API,降低数据构建成本与合规风险。

复现评估

开源情况较好:代码已在 GitHub 开源(ZJU-OmniAI/Embodied-Omni),基座模型 Qwen2.5-VL-7B 开源,训练数据基于公开的 VLN-CE/Habitat 模拟器;但 90k 轨迹的 CoT 标注需调用 Gemini 2.5 Flash API——好在附录 G 完整给出四段式 prompt(指令过滤、阶段定位、观测分析、动作推理、融合润色),可自行复现数据。算力门槛不低:8×A800 80GB 集群,SFT 约 160 GPU 小时(20 小时墙钟)、GRPO 约 600 GPU 小时(75 小时墙钟),合计近千 GPU 小时,普通实验室需要租用算力。附录 H 披露了完整超参数(学习率 $5\times10^{-6}$/$2\times10^{-6}$、$G=8$、$M=4$、温度 0.7、$\beta_0=2.0$、$\alpha=0.99$ 等),奖励公式在附录 A 给出。复现难点集中在:RL 部分依赖 Habitat 特权信号的具体实现、真机部分需要宇树 Go2 + 4 个环形 RGB-D 相机 + Hesai XT16 激光雷达 + FastLIO/FAR Planner 的软硬件栈。总体评估:文档与配置齐全使复现可行,但 RL 训练稳定性调参和数据生成成本使实际难度为中等偏高。