LightNav-0:激发VLM空间智能的通用具身导航模型 LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation
双通道指向当潜思考、RVQ三token出轨迹,4B VLM统一十大导航基准并零样本上真机
前置知识
视觉语言模型(VLM)
以视觉transformer把图像编码为patch token、以大语言模型为主干做自回归生成的多模态模型。以基座Qwen3-VL-4B为例:原生分辨率视觉编码器加36层语言模型,图像patch与文本统一在一条因果序列里由同一个输出头预测,因此只要扩充词表,模型就能“说出”新定义的符号。
LightNav-0的全部设计——指向token与RVQ动作token——都建立在“输出头就是原语言模型头”这一前提上;理解VLM才能理解为何全文不需要任何任务专用动作头。
具身导航三大任务与评测指标
指令跟随(VLN,按自然语言走到目的地,基准R2R/RxR)、目标物导航(ObjectNav/OVON,找指定类别或开放词汇目标,基准MP3D/HM3D)、具身视觉跟踪(EVT,持续跟随移动目标,基准EVT-Bench)。常用指标:SR成功率、SPL按路径长度加权的成功率、NE导航误差、nDTW轨迹相似度、TR跟踪率、CR碰撞率。
本文核心主张是单一模型统一三大任务族,全部实验表格和“10个公开仿真设置全SOTA”的说法都围绕这些任务与指标展开。
残差向量量化(RVQ)
用多级码本逐级逼近连续向量的量化方法:第一级在码本中找最近邻得到粗量化,残差再交第二级、第三级编码,最终向量等于各级码字之和。$k$级256条目码本可表达$256^k$种组合,级数越多精度越高,且任何非空前缀都能解码出一个可用结果。
这是把10步SE(2)轨迹压进3个语言token、同时保持0.72cm平均位移误差的关键技术,也是动作留在语言模型内部的前提。
GRPO(组相对策略优化)
DeepSeek系提出的免critic在线RL算法:对同一初始状态并行采样$G$条轨迹,用组内标准化 $A=(R-\mu_R)/(\sigma_R+\epsilon)$ 作为优势,配合PPO式clip目标与KL锚定更新。它要求优化器能拿到每个动作token的精确对数概率。
论文论证RVQ动作token让GRPO原封不动地适用于连续控制,这是“精度与RL可行性可以兼得”这一核心卖点的逻辑基础。
DAgger(数据集聚合)
缓解模仿学习分布漂移的算法:让当前策略自己执行并采集状态,把这些“策略才会走到”的状态交给专家重新标注后并入训练集,从而弥合专家演示分布与部署时自采状态分布之间的差距。
论文在SFT阶段用DAgger收集策略自诱导状态下的样本,是连接模仿训练与在线RL三阶段课程中承上启下的一环。
SE(2)航点轨迹
SE(2)是平面刚体运动群,一个航点为 $(\Delta x, \Delta y, \Delta\theta)$,即平面位移加朝向变化;10个连续航点构成短视距轨迹。它作为统一几何接口输出给各机器人自带的底层控制器,再转成里程计或速度指令执行。
这是LightNav-0唯一的动作输出格式,也是“具身无关”主张的落点:换机器人只需换执行层,高层策略与token接口不变。
研究动机
现有具身导航系统高度碎片化。模块化方案(VLFM、SG-Nav、InstructNav等)用手工接口串联感知、建图与规划,普遍依赖深度相机、里程计甚至全景多相机,任务、传感器或机器人平台一变就难以迁移;端到端方案则绑定单一任务——NaVid/Uni-NaVid主打指令跟随,TrackVLA专攻视觉跟踪,DualVLN与InternVLA-N1采用7B慢规划器加扩散快策略的双系统架构,参数大且把动作生成放在语言模型之外。动作接口彼此差异极大:NaVid式离散语言命令对运动量化粗糙;ETPNav、HNR等航点预测路线需要额外传感与显式地图;扩散、流匹配或回归动作头(TrackVLA、Qwen-RobotNav等)虽平滑,却使每个动作没有可用的token对数概率,GRPO这类可验证奖励RL无法直接使用。结果是感知、推理、动作被割裂在不同组件中,跨任务、跨具身的泛化和VLM的规模红利都无法继承。
本文的目标是构建一个紧凑(4B级)、不含任何任务或具身专属预测头的通用具身导航模型:不另造导航架构,而是直接激发预训练VLM已有的开放词汇识别、视觉定位、空间推理与时序视频理解能力,通过统一token接口——双通道指向加残差向量量化动作token——让指令跟随、开放词汇目标导航与具身视觉跟踪共用同一个自回归模型。量化目标是在覆盖三大任务族的10个公开仿真设置上全部取得单目最优成功率,同时零样本迁移到人形、四足、旋翼、轮式四类真实机器人本体,并保持VLM原有的空间智能不退化。
与已有工作不同的是,本文的独特切入是把“指向”升级为导航的潜在空间思维链。文本思维链(Nav-R1、OctoNav)每步解码长推理,延迟高且可能损害控制;双系统(DualVLN/InternVLA-N1)需要第二个大规划器加扩散执行器;AO-Planner则把执行外包给外部低层模块。LightNav-0改用通道专属的图像网格token表达affordance点(可行落点)与object点(任务目标),恰好复用而非取代backbone预训练的grounding先验,且定长只花2个token;再以RVQ把10步SE(2)轨迹装进3个token,平均位移误差0.72cm,同时整段轨迹共享语言模型的log概率,使GRPO无需MDP重构或额外critic即可优化。“亚厘米精度”与“RL可优化”这对在以往工作中二选一的矛盾,被同一个token接口同时化解——这是与所有前作的部署级本质区别。
核心方法
直觉上,一次导航决策等于先在当前画面上“指”出两件事——哪里能走(affordance点)、目标是什么在哪(object点)——再据此规划一小段可执行轨迹。技术上,LightNav-0以Qwen3-VL-4B-Instruct为基座,完全保留预训练架构,仅扩充词表:网格索引的$\langle\mathrm{aposi}\rangle$、$\langle\mathrm{oposi}\rangle$两个指向token族和3级各256码字的RVQ动作token,全部经原自回归头解码。每个决策步只输出5个token:2个指向加3个RVQ。视觉历史经时间感知压缩进固定像素预算(256K/576K/1M)。训练走三阶段课程:1300万样本的具身推理(ER)中期训练约170 H100·时,得到空间智能更强的LightNav-ER;520万样本SFT共训(77.6%导航+22.4%推理回放,含DAgger样本)约950 H100·时;最后GRPO在线强化学习(32种子×8条rollout,8×H100)。推理用vLLM单进程部署,RTX 4090上约4ms/token。
三个互相咬合的核心创新。(1) 双通道指向作为潜在空间推理:affordance通道表示可行方向或自由空间落点,object通道定位目标物,各自映射到当前视图 $H_g\times W_g$ 网格的单个索引token($i(p)=r(p)W_g+c(p)$),保留索引用于原地转、停止、目标不可见等情形;因果注意力使这个定长前缀成为显式空间思维痕迹,并与共享网格的指向/空间VQA监督同构,直接继承backbone的grounding先验。(2) 时间感知历史压缩:仿Ebbinghaus遗忘曲线,帧采样率 $f_s(i)=f_{s\max}\exp(-\Delta T_i/\tau_s)$ 随年龄指数衰减,池化步长 $s_i=\max(1,\exp(\Delta T_i/\tau_p))$ 随年龄增大——近处细、远处粗,时间戳token保住时序。(3) RVQ动作tokenizer:残差k-means用加权轨迹距离 $d_{traj}=\mathrm{ADE}+\lambda|\Delta\theta(z)-\Delta\theta(\hat z)|$($\lambda=0.3$)拟合三级码本,3个token表达 $256^3$ 种轨迹,任何非空前缀都可积分成可执行轨迹,可按算力截断。
方法步骤详情
完整流程五步。第一步观测编码:ego-RGB流按上述指数采样与自适应网格池化压缩,当前帧保留最细分辨率,历史分长/中/短三层分配token预算。第二步指向预测:模型在网格上输出$\langle\mathrm{aposi}\rangle$与$\langle\mathrm{oposi}\rangle$,构成潜在空间推理前缀。第三步轨迹解码:续写3个RVQ token,$\hat z_t=\sum_{\ell=0}^{L-1}e^{(\ell)}_{k_\ell}$ 重建 $z_t\in\mathbb{R}^{10\times3}$ 的10步SE(2)航点并积分。第四步执行:统一轨迹接口交给共享轨迹跟随器,转成各平台内置locomotion策略所需的里程计与速度指令——人形LIMX TRON 1、四足Unitree Go2、自研四旋翼、轮式LightBot-0共用同一高层策略。第五步训练与数据:相机随机化(FOV 90°–130°、高度0.5–1.5m、俯仰±15°)贯穿数据生成;INSIGHT-Bench用“采样视角→四朝向渲染→Molmo2指向→深度提升到3D→跨视角合并”自动标注;ER中期训练混36源,SFT配比指令跟随43.4%、VQA 12.2%、ObjectNav 22.0%、跟踪22.4%;GRPO按任务给终端奖励:跟踪=可见性/位置/持续性,指令跟随=对齐/到达/终止,搜索=发现/效率/进度。
技术新颖性
新颖性集中在“接口”而非堆模块。对比离散命令式(NaVid),RVQ把动作精度从语言粒度提升到亚厘米——0.72cm,对比单级K=4096的VADv2式轨迹词表2.48cm降低约71%;对比双系统(DualVLN、InternVLA-N1),不需要第二个规划器和扩散专家,视觉编码器与语言模型同进程vLLM部署;对比扩散/流匹配/回归动作头(TrackVLA、π系列),动作完全留在语言模型内,每个token有精确log概率,GRPO的组相对更新原封不动可用,无需把去噪过程重构为MDP或另设critic,且一条轨迹仅3个token使信用分配视野短、rollout便宜;对比VADv2式单token规划词表,残差结构保证“非空前缀即可执行”,支持资源受限时只解码1-2级。指向作为潜在CoT也与文本CoT本质不同:定长、常数开销、与动作同在token空间、共享同一个交叉熵损失 $\mathcal{L}_{CE}=-\sum_{j\in M}\log p_\theta(y_j|x,y_{<j})$,从而保留了显式推理的可解释性却免去了自由文本解码的可变延迟。
实验结果
逐实验看核心发现。(1) 空间智能保持:LightNav-ER在8个具身推理基准宏平均67.4,超基座Qwen3-VL-4B +4.3、以一半参数超8B Molmo2-ER +4.6,其中Where2Place +12.6(64.0→76.6)、RefSpatial +11.9,说明中期训练确实激发了指向与空间推理。(2) 指令跟随:R2R val-unseen单目SR 68.5、SPL 62.8、NE 3.91m全面领先单目;RxR SR 73.6、SPL 64.5;但nDTW 67.4低于DualVLN的70.0,成功率高而轨迹保真不占优。(3) 目标导航:MP3D SR 53.3(较CogNav +14.4%);HM3D v1 74.5/43.9(SPL较FiLM-Nav +17.7%)、v2 77.2/41.5,纯单目RGB反超多视角+深度+里程计系统。(4) 开放词汇:OVON synonyms SR 54.6(+21.3%)、unseen 47.0(+15.2%),优势在分布外类别上更大。(5) 自建INSIGHT-Bench:SR 43.7对JanusVLN 27.4(+59.5%)、SPL +72.9%;Direction指令类57.7(+94.3%)最突出,House-Direction 74.0%最高,Institution-Extremum 18.0%最低,暴露全局多实例比较短板。(6) 跟踪:单目标STT SR 91.7;分心DT SR 82.6超多视角CoMaTrack 74.2,CR较单目最优降16.2%,但TR仍逊于专精的ReferTrack。(7) 消融与扩展:去双通道指向平均SR -8.3(HM3D v1 -13.5)是最大效应量,ER初始化+2.5;2B→4B大幅提升而4B→8B退化,环境覆盖比数据量更值得投入(RxR SR +21.1对数据近饱和)。(8) 真实世界:同一检查点零样本部署人形/四足/旋翼/轮式4类本体,并跨4个游戏域定性有效。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 具身推理8基准(Point-Bench、RefSpatial、RoboSpatial等) | 宏平均(%) | 67.4(LightNav-ER,4B) | Qwen3-VL-4B 63.1;8B Molmo2-ER 62.8 | +4.3(+6.8%),以一半参数超过8B模型 |
| VLN-CE R2R Val-Unseen(单目RGB) | SR / SPL | 68.5 / 62.8 | Qwen-RobotNav-4B 66.9 / 62.3(此前最佳单目) | +1.6 / +0.5,NE同时从4.05降至3.91m |
| VLN-CE RxR Val-Unseen(单目RGB) | SR / SPL | 73.6 / 64.5 | Qwen-RobotNav-8B 73.4 / 63.5 | +0.2 / +1.0,NE 3.66m较4.16降10.5% |
| ObjectNav MP3D | SR | 53.3 | CogNav 46.6(最佳先前单目) | +6.7(+14.4%),SPL 21.2亦为单目最佳 |
| ObjectNav HM3D v1 | SPL | 43.9 | FiLM-Nav 37.3(使用深度+里程计) | +6.6(+17.7%),纯单目反超带特权几何的方法 |
| HM3D-OVON Val Seen Synonyms(开放词汇) | SR | 54.6 | MTU3D 45.0 | +9.6(+21.3%),unseen设置+6.2(+15.2%) |
| INSIGHT-Bench(1,097 episodes) | SR / SPL | 43.7 / 41.5 | JanusVLN 27.4 / 24.0 | +16.3(+59.5%)/ +17.5(+72.9%) |
| EVT-Bench DT(分心目标跟踪) | SR | 82.6 | CoMaTrack 74.2(多视角) | +8.4(+11.3%),CR 4.62较单目最优5.51降16.2% |
局限与改进
作者承认的局限:8B模型不升反降(R2R SR -1.6),说明该配方尚未把参数转化为性能,4B是当前甜点;SPL改善普遍小于SR,ER初始化对路径效率帮助有限且涨跌混合;R2R上nDTW 67.4低于DualVLN 70.0;EVT上ReferTrack保持更高TR、CoMaTrack单目标CR更低(0.90对1.87);真实世界与游戏域仅为定性展示,无统一成功率协议;当前是单决策通路,未区分高频局部控制与慢速语义思考。我的观察:INSIGHT-Bench由作者自建,其标注(Molmo2指向)、指令生成与到达验证同模型自身指向表示同源,可能存在隐蔽的表示亲和偏差,43.7%的优势幅度需第三方复估;GRPO的rollout池用监督策略成功/失败二分过滤,探索上限被SFT策略封顶;跟踪训练只含人类,对机器人、购物车的真实跟踪属分布外个例而非保证;4ms/token是单token延迟,大像素预算下视觉编码与prefill开销才决定决策频率,论文未报端到端Hz;RVQ截断省算力但未给1-2级解码时的成功率-延迟曲线。
独立分析的弱点
弱点一:单通路决策在动态密集环境中既可能慢又欠安全——每步5 token自回归加压缩历史,对突发障碍的反应延迟没有量化,也没有显式避障模块;改进方向是作者自己提出的双系统:给RVQ L0级粗轨迹配一个免VLM的轻量反应策略,仅在停滞点唤回慢规划。弱点二:RVQ短视距(10步)依赖高频调用,长走廊和大空间会累积漂移并反复询问模型;可引入自适应chunk长度或“粗长+细短”双层轨迹。弱点三:评测闭环同源——benchmark构建、到达检查、模型指向监督共用同一网格token与Molmo2系工具,自建基准的优势可能部分来自表示亲和;应发布人工标注子集并交叉验证。弱点四:8B退化提示瓶颈在数据与配方而非参数,当前RL学习率仅1e-6、组大小G=8,探索信号弱;可按任务分组归一化优势、课程化提升难度、加大G与更大模型重试。弱点五:真实世界部署无定量指标与失败统计,工程可用性难以评估;建议发布带标准协议的真实场景评估套件。弱点六:跟踪泛化到非人类目标属于无监督的“运气”,应扩充动态目标类别或引入类别无关的目标一致性目标函数,把个例变成能力。
未来方向
作者明确提出的两个方向:一是双系统架构,用轻量反应策略承担避障与频繁轨迹修正、慢速VLM规划器负责长视距推理;二是在互联网规模视频上加强预训练,扩展开放世界概念覆盖,见到比策划数据集中更稀有的场景、交互与运动模式。基于其成果可自然延伸的:其一,利用RVQ“非空前缀即可执行”的特性做自适应精度推理——用token熵或不确定性门控决定发射几级,把算力花在关键决策点;其二,把GRPO扩展为多任务混合奖励加跨具身并行rollout,检验RL信号是否是4B上限的真正约束;其三,在指向token之外增加深度/占据等3D一致的几何第三通道,针对性缓解Institution-Extremum这类需要全局多实例比较的失败模式(该格仅18.0%);其四,把INSIGHT-Bench的“场景×指令”两轴诊断法推广为社区标准细粒度评测协议;其五,把无参数的规则式历史压缩替换为可学习记忆或检索机制,在不膨胀token预算的前提下拉长有效视野。
复现评估
复现友好度较高但成本不小。开源:论文给出Project Page、GitHub与HuggingFace入口,INSIGHT-Bench(训练1,683场景/53,090 episodes,评测210场景/1,097 episodes,两套场景严格不相交)与模型权重的公开是最大资产;训练超参披露完整——ER中期训练lr 1e-5、batch 128、序列长10,240,SFT lr 1.5e-5、batch 320、序列长8,192,GRPO G=8、B=32、clip 0.2、KL 0.01、lr 1e-6,奖励超参如方位死区 $\alpha_0=0.14$ rad、距离带 $[1.5,3.0]$ m均有给出。算力:ER约170 H100·时、SFT约950 H100·时、RL为8×H100单节点,合计千级H100·时,中等规模实验室可承受;推理仅RTX 4090。难点:4K+小时、2K+场景语料依赖Habitat、HM3D/MP3D、自研Habitat-GS渲染器及Molmo2、Seed2.0等第三方模型的数据管道,许可证与工程门槛高;GRPO rollout基础设施细节多;36个ER源与16个导航源的采样权重需仔细对齐。总体判断:有工程团队的实验室约2-3个月可复现核心结果,单人复现全流程难度大。
论文图表
场景轴按功能布局分五类:公寓(紧凑房间多门)、住宅(多房间拓扑)、商业(开阔楼层重复物体)、机构(走廊与重复工位)、户外(开阔地标稀疏);指令轴分五类:Base、Direction(方位)、Relation(参照物)、Extremum(最值)、Ordinal(序数),每类配示例指令。
把单一成功率拆解为可解释的能力矩阵,是读懂Tab. VII与Fig. 12细粒度分析的钥匙。
三张曲线图:(a) 2B→4B大幅提升(R2R SR 59.9→68.5),4B→8B混合退化;(b) 数据从1/16到全量单调提升但近饱和(1/2→全量R2R仅+0.8);(c) 环境从1/8到全量每个增量都在涨(RxR SR +21.1),是最可靠的扩展轴。
给出“该往哪砸资源”的实证答案:环境覆盖>数据量>参数量,对后续资源规划极具参考价值。
行按场景类型(公寓120场景/239ep、住宅61/216、商业10/195、机构11/219、户外8/228),列按指令类型(Base 237、Direction 239、Relation 193、Extremum 250、Ordinal 178),总计210场景/1,097 episodes。
提供细粒度评测的分母:Relation与Ordinal格数偏少源于更严格的唯一性与排序门控,读Tab. VII前必看。
LightNav-ER(4B)与4B Qwen3-VL、4B Qwen3.5、8B Molmo2-ER在8个基准上的对比:LightNav-ER平均67.4居首(Point-Bench 64.5、RefSpatial 57.4、Where2Place 76.6、CV-Bench 88.4等),4项第一4项第二。
证明ER中期训练确实“激发”而非损伤VLM空间智能——比自家基座+4.3、以一半参数超8B对手+4.6。
按输入模态(单目RGB/全景/深度/里程计)分组对比约30个方法:LightNav-0单目R2R SR 68.5/SPL 62.8/NE 3.91/OS 73.7、RxR SR 73.6/SPL 64.5/NE 3.66,均列单目第一;全景方法(Qwen-RobotNav-8B 72.1/66.6)仍略高。
核心主表:单目RGB在最经典VLN基准上逼近甚至反超带特权输入的方法,同时诚实保留了nDTW 67.4低于DualVLN 70.0的短板。
LightNav-0在MP3D取得SR 53.3/SPL 21.2,HM3D v1 74.5/43.9,HM3D v2 77.2/41.5;对比多视角WMNav、Qwen-RobotNav与使用深度+里程计的VLFM、SG-Nav、FiLM-Nav、CogNav等。
第二个核心主表:纯单目策略在全部三个闭集设置上SR与SPL双第一,排除“视野或几何优势”这一替代解释。
Seen/Synonyms/Unseen三设置:LightNav-0 SR 55.3/54.6/47.0、SPL 31.2/29.6/24.2;对比多视角NavFoM、ABot-N0与深度+里程计的VLFM、DAgRL+OD、MTU3D及单目Uni-NaVid。
检验类别级泛化:同义词与未见类别的领先幅度(+9.6、+6.2 SR)大于seen(+0.3),说明优势正来自更好的空间接地而非记住类别。
LightNav-0 SR 43.7/SPL 41.5/NE 3.88m全面第一;JanusVLN 27.4/24.0/4.89、NaVid 26.9/23.0/4.25、Uni-NaVid 24.3、TAMP-Nav 16.0、InternVLA-N1 11.7、StreamVLN 11.6。
在含3D高斯泼溅场景的新基准上优势最大(+59.5% SR),是自建基准+模型互相印证的主结果。
按指令类型:LightNav-0 Base 45.1、Direction 57.7、Relation 37.8、Extremum 37.2、Ordinal 38.2,全部类型第一;按场景类型:Apartment 61.1、House 50.5、Commercial 42.1、Institution 29.2、Outdoor 34.2;六个基线在加入方位后全部跌破各自Base分。
定位优势与短板的来源:路线条件化监督使Direction类+28.0最猛,而Extremum需先检测多个候选再比较,是最难类型(37.2)。
STT(单目标):LightNav-0 SR 91.7/TR 87.7/CR 1.87,超ReferTrack 89.4/92.5/1.60中的SR但TR与CR略逊;DT(分心):SR 82.6/TR 80.1/CR 4.62,SR超多视角CoMaTrack 74.2,CR优于单目VLingNav 5.51。
展示统一模型在时间结构完全不同的跟踪任务上的竞争力,同时如实呈现专精跟踪器在TR/CR上的残余优势。
8个设置对比Qwen3-VL原始初始化与LightNav-ER初始化:平均SR 60.5→63.0(+2.5)、SPL 38.8→39.9,SR在全部8个设置提升,最大为MP3D +4.2、OVON Unseen +4.0、HM3D v1 +3.1。
把最终性能归因拆开:空间智能激发贡献约+2.5 SR,是三阶段课程中第一环有效性的直接证据。
去掉指向监督后8个设置全面退化:平均SR 54.7→63.0(+8.3,15.2%)、SPL 34.3→39.9(+5.6);HM3D v1退化最狠(SR 61.0对74.5,-13.5),MP3D SR 41.3对53.3(-12.0)。
消融中效应量最大的组件:证明“先指再走”的潜在空间推理是性能的主要来源,而非可有可无的辅助监督。