← 返回 2026-09-01

LightNav-0:激发VLM空间智能的通用具身导航模型 LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation

Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pan, Xinhang Liu, Yuntao Ma, Tingxiang Fan 📅 2026-08-31 👍 24 2026-09-01 18:30
GRPO强化学习 具身导航 残差向量量化 空间推理 视觉语言模型 跨具身迁移

双通道指向当潜思考、RVQ三token出轨迹,4B VLM统一十大导航基准并零样本上真机

前置知识

视觉语言模型(VLM)

以视觉transformer把图像编码为patch token、以大语言模型为主干做自回归生成的多模态模型。以基座Qwen3-VL-4B为例:原生分辨率视觉编码器加36层语言模型,图像patch与文本统一在一条因果序列里由同一个输出头预测,因此只要扩充词表,模型就能“说出”新定义的符号。

LightNav-0的全部设计——指向token与RVQ动作token——都建立在“输出头就是原语言模型头”这一前提上;理解VLM才能理解为何全文不需要任何任务专用动作头。

具身导航三大任务与评测指标

指令跟随(VLN,按自然语言走到目的地,基准R2R/RxR)、目标物导航(ObjectNav/OVON,找指定类别或开放词汇目标,基准MP3D/HM3D)、具身视觉跟踪(EVT,持续跟随移动目标,基准EVT-Bench)。常用指标:SR成功率、SPL按路径长度加权的成功率、NE导航误差、nDTW轨迹相似度、TR跟踪率、CR碰撞率。

本文核心主张是单一模型统一三大任务族,全部实验表格和“10个公开仿真设置全SOTA”的说法都围绕这些任务与指标展开。

残差向量量化(RVQ)

用多级码本逐级逼近连续向量的量化方法:第一级在码本中找最近邻得到粗量化,残差再交第二级、第三级编码,最终向量等于各级码字之和。$k$级256条目码本可表达$256^k$种组合,级数越多精度越高,且任何非空前缀都能解码出一个可用结果。

这是把10步SE(2)轨迹压进3个语言token、同时保持0.72cm平均位移误差的关键技术,也是动作留在语言模型内部的前提。

GRPO(组相对策略优化)

DeepSeek系提出的免critic在线RL算法:对同一初始状态并行采样$G$条轨迹,用组内标准化 $A=(R-\mu_R)/(\sigma_R+\epsilon)$ 作为优势,配合PPO式clip目标与KL锚定更新。它要求优化器能拿到每个动作token的精确对数概率。

论文论证RVQ动作token让GRPO原封不动地适用于连续控制,这是“精度与RL可行性可以兼得”这一核心卖点的逻辑基础。

DAgger(数据集聚合)

缓解模仿学习分布漂移的算法:让当前策略自己执行并采集状态,把这些“策略才会走到”的状态交给专家重新标注后并入训练集,从而弥合专家演示分布与部署时自采状态分布之间的差距。

论文在SFT阶段用DAgger收集策略自诱导状态下的样本,是连接模仿训练与在线RL三阶段课程中承上启下的一环。

SE(2)航点轨迹

SE(2)是平面刚体运动群,一个航点为 $(\Delta x, \Delta y, \Delta\theta)$,即平面位移加朝向变化;10个连续航点构成短视距轨迹。它作为统一几何接口输出给各机器人自带的底层控制器,再转成里程计或速度指令执行。

这是LightNav-0唯一的动作输出格式,也是“具身无关”主张的落点:换机器人只需换执行层,高层策略与token接口不变。

研究动机

现有具身导航系统高度碎片化。模块化方案(VLFM、SG-Nav、InstructNav等)用手工接口串联感知、建图与规划,普遍依赖深度相机、里程计甚至全景多相机,任务、传感器或机器人平台一变就难以迁移;端到端方案则绑定单一任务——NaVid/Uni-NaVid主打指令跟随,TrackVLA专攻视觉跟踪,DualVLN与InternVLA-N1采用7B慢规划器加扩散快策略的双系统架构,参数大且把动作生成放在语言模型之外。动作接口彼此差异极大:NaVid式离散语言命令对运动量化粗糙;ETPNav、HNR等航点预测路线需要额外传感与显式地图;扩散、流匹配或回归动作头(TrackVLA、Qwen-RobotNav等)虽平滑,却使每个动作没有可用的token对数概率,GRPO这类可验证奖励RL无法直接使用。结果是感知、推理、动作被割裂在不同组件中,跨任务、跨具身的泛化和VLM的规模红利都无法继承。

本文的目标是构建一个紧凑(4B级)、不含任何任务或具身专属预测头的通用具身导航模型:不另造导航架构,而是直接激发预训练VLM已有的开放词汇识别、视觉定位、空间推理与时序视频理解能力,通过统一token接口——双通道指向加残差向量量化动作token——让指令跟随、开放词汇目标导航与具身视觉跟踪共用同一个自回归模型。量化目标是在覆盖三大任务族的10个公开仿真设置上全部取得单目最优成功率,同时零样本迁移到人形、四足、旋翼、轮式四类真实机器人本体,并保持VLM原有的空间智能不退化。

与已有工作不同的是,本文的独特切入是把“指向”升级为导航的潜在空间思维链。文本思维链(Nav-R1、OctoNav)每步解码长推理,延迟高且可能损害控制;双系统(DualVLN/InternVLA-N1)需要第二个大规划器加扩散执行器;AO-Planner则把执行外包给外部低层模块。LightNav-0改用通道专属的图像网格token表达affordance点(可行落点)与object点(任务目标),恰好复用而非取代backbone预训练的grounding先验,且定长只花2个token;再以RVQ把10步SE(2)轨迹装进3个token,平均位移误差0.72cm,同时整段轨迹共享语言模型的log概率,使GRPO无需MDP重构或额外critic即可优化。“亚厘米精度”与“RL可优化”这对在以往工作中二选一的矛盾,被同一个token接口同时化解——这是与所有前作的部署级本质区别。

核心方法

直觉上,一次导航决策等于先在当前画面上“指”出两件事——哪里能走(affordance点)、目标是什么在哪(object点)——再据此规划一小段可执行轨迹。技术上,LightNav-0以Qwen3-VL-4B-Instruct为基座,完全保留预训练架构,仅扩充词表:网格索引的$\langle\mathrm{aposi}\rangle$、$\langle\mathrm{oposi}\rangle$两个指向token族和3级各256码字的RVQ动作token,全部经原自回归头解码。每个决策步只输出5个token:2个指向加3个RVQ。视觉历史经时间感知压缩进固定像素预算(256K/576K/1M)。训练走三阶段课程:1300万样本的具身推理(ER)中期训练约170 H100·时,得到空间智能更强的LightNav-ER;520万样本SFT共训(77.6%导航+22.4%推理回放,含DAgger样本)约950 H100·时;最后GRPO在线强化学习(32种子×8条rollout,8×H100)。推理用vLLM单进程部署,RTX 4090上约4ms/token。

三个互相咬合的核心创新。(1) 双通道指向作为潜在空间推理:affordance通道表示可行方向或自由空间落点,object通道定位目标物,各自映射到当前视图 $H_g\times W_g$ 网格的单个索引token($i(p)=r(p)W_g+c(p)$),保留索引用于原地转、停止、目标不可见等情形;因果注意力使这个定长前缀成为显式空间思维痕迹,并与共享网格的指向/空间VQA监督同构,直接继承backbone的grounding先验。(2) 时间感知历史压缩:仿Ebbinghaus遗忘曲线,帧采样率 $f_s(i)=f_{s\max}\exp(-\Delta T_i/\tau_s)$ 随年龄指数衰减,池化步长 $s_i=\max(1,\exp(\Delta T_i/\tau_p))$ 随年龄增大——近处细、远处粗,时间戳token保住时序。(3) RVQ动作tokenizer:残差k-means用加权轨迹距离 $d_{traj}=\mathrm{ADE}+\lambda|\Delta\theta(z)-\Delta\theta(\hat z)|$($\lambda=0.3$)拟合三级码本,3个token表达 $256^3$ 种轨迹,任何非空前缀都可积分成可执行轨迹,可按算力截断。

方法步骤详情

完整流程五步。第一步观测编码:ego-RGB流按上述指数采样与自适应网格池化压缩,当前帧保留最细分辨率,历史分长/中/短三层分配token预算。第二步指向预测:模型在网格上输出$\langle\mathrm{aposi}\rangle$与$\langle\mathrm{oposi}\rangle$,构成潜在空间推理前缀。第三步轨迹解码:续写3个RVQ token,$\hat z_t=\sum_{\ell=0}^{L-1}e^{(\ell)}_{k_\ell}$ 重建 $z_t\in\mathbb{R}^{10\times3}$ 的10步SE(2)航点并积分。第四步执行:统一轨迹接口交给共享轨迹跟随器,转成各平台内置locomotion策略所需的里程计与速度指令——人形LIMX TRON 1、四足Unitree Go2、自研四旋翼、轮式LightBot-0共用同一高层策略。第五步训练与数据:相机随机化(FOV 90°–130°、高度0.5–1.5m、俯仰±15°)贯穿数据生成;INSIGHT-Bench用“采样视角→四朝向渲染→Molmo2指向→深度提升到3D→跨视角合并”自动标注;ER中期训练混36源,SFT配比指令跟随43.4%、VQA 12.2%、ObjectNav 22.0%、跟踪22.4%;GRPO按任务给终端奖励:跟踪=可见性/位置/持续性,指令跟随=对齐/到达/终止,搜索=发现/效率/进度。

技术新颖性

新颖性集中在“接口”而非堆模块。对比离散命令式(NaVid),RVQ把动作精度从语言粒度提升到亚厘米——0.72cm,对比单级K=4096的VADv2式轨迹词表2.48cm降低约71%;对比双系统(DualVLN、InternVLA-N1),不需要第二个规划器和扩散专家,视觉编码器与语言模型同进程vLLM部署;对比扩散/流匹配/回归动作头(TrackVLA、π系列),动作完全留在语言模型内,每个token有精确log概率,GRPO的组相对更新原封不动可用,无需把去噪过程重构为MDP或另设critic,且一条轨迹仅3个token使信用分配视野短、rollout便宜;对比VADv2式单token规划词表,残差结构保证“非空前缀即可执行”,支持资源受限时只解码1-2级。指向作为潜在CoT也与文本CoT本质不同:定长、常数开销、与动作同在token空间、共享同一个交叉熵损失 $\mathcal{L}_{CE}=-\sum_{j\in M}\log p_\theta(y_j|x,y_{<j})$,从而保留了显式推理的可解释性却免去了自由文本解码的可变延迟。

LightNav-0总览:紧凑的通用具身导航模型
Fig. 1: LightNav-0总览:紧凑的通用具身导航模型
LightNav-0架构总览
Fig. 2: LightNav-0架构总览
自动双通道指向标注
Fig. 3: 自动双通道指向标注
层级残差向量量化动作tokenizer
Fig. 4: 层级残差向量量化动作tokenizer
两阶段具身推理数据课程
Fig. 5: 两阶段具身推理数据课程
SFT语料构成
Fig. 6: SFT语料构成
INSIGHT-Bench自动预标注流水线
Fig. 7: INSIGHT-Bench自动预标注流水线
INSIGHT-Bench数据生成与指令标注流水线
Fig. 8: INSIGHT-Bench数据生成与指令标注流水线
INSIGHT-Bench构成
Fig. 10: INSIGHT-Bench构成
在线多任务强化学习流水线
Fig. 11: 在线多任务强化学习流水线

实验结果

逐实验看核心发现。(1) 空间智能保持:LightNav-ER在8个具身推理基准宏平均67.4,超基座Qwen3-VL-4B +4.3、以一半参数超8B Molmo2-ER +4.6,其中Where2Place +12.6(64.0→76.6)、RefSpatial +11.9,说明中期训练确实激发了指向与空间推理。(2) 指令跟随:R2R val-unseen单目SR 68.5、SPL 62.8、NE 3.91m全面领先单目;RxR SR 73.6、SPL 64.5;但nDTW 67.4低于DualVLN的70.0,成功率高而轨迹保真不占优。(3) 目标导航:MP3D SR 53.3(较CogNav +14.4%);HM3D v1 74.5/43.9(SPL较FiLM-Nav +17.7%)、v2 77.2/41.5,纯单目RGB反超多视角+深度+里程计系统。(4) 开放词汇:OVON synonyms SR 54.6(+21.3%)、unseen 47.0(+15.2%),优势在分布外类别上更大。(5) 自建INSIGHT-Bench:SR 43.7对JanusVLN 27.4(+59.5%)、SPL +72.9%;Direction指令类57.7(+94.3%)最突出,House-Direction 74.0%最高,Institution-Extremum 18.0%最低,暴露全局多实例比较短板。(6) 跟踪:单目标STT SR 91.7;分心DT SR 82.6超多视角CoMaTrack 74.2,CR较单目最优降16.2%,但TR仍逊于专精的ReferTrack。(7) 消融与扩展:去双通道指向平均SR -8.3(HM3D v1 -13.5)是最大效应量,ER初始化+2.5;2B→4B大幅提升而4B→8B退化,环境覆盖比数据量更值得投入(RxR SR +21.1对数据近饱和)。(8) 真实世界:同一检查点零样本部署人形/四足/旋翼/轮式4类本体,并跨4个游戏域定性有效。

INSIGHT-Bench场景×指令联合能力矩阵
Fig. 12: INSIGHT-Bench场景×指令联合能力矩阵
跨游戏域零样本泛化
Fig. 13: 跨游戏域零样本泛化
机器人平台与通信框架
Fig. 14: 机器人平台与通信框架
真实世界零样本泛化
Fig. 15: 真实世界零样本泛化
查看结构化数据
任务指标本文基线提升
具身推理8基准(Point-Bench、RefSpatial、RoboSpatial等) 宏平均(%) 67.4(LightNav-ER,4B) Qwen3-VL-4B 63.1;8B Molmo2-ER 62.8 +4.3(+6.8%),以一半参数超过8B模型
VLN-CE R2R Val-Unseen(单目RGB) SR / SPL 68.5 / 62.8 Qwen-RobotNav-4B 66.9 / 62.3(此前最佳单目) +1.6 / +0.5,NE同时从4.05降至3.91m
VLN-CE RxR Val-Unseen(单目RGB) SR / SPL 73.6 / 64.5 Qwen-RobotNav-8B 73.4 / 63.5 +0.2 / +1.0,NE 3.66m较4.16降10.5%
ObjectNav MP3D SR 53.3 CogNav 46.6(最佳先前单目) +6.7(+14.4%),SPL 21.2亦为单目最佳
ObjectNav HM3D v1 SPL 43.9 FiLM-Nav 37.3(使用深度+里程计) +6.6(+17.7%),纯单目反超带特权几何的方法
HM3D-OVON Val Seen Synonyms(开放词汇) SR 54.6 MTU3D 45.0 +9.6(+21.3%),unseen设置+6.2(+15.2%)
INSIGHT-Bench(1,097 episodes) SR / SPL 43.7 / 41.5 JanusVLN 27.4 / 24.0 +16.3(+59.5%)/ +17.5(+72.9%)
EVT-Bench DT(分心目标跟踪) SR 82.6 CoMaTrack 74.2(多视角) +8.4(+11.3%),CR 4.62较单目最优5.51降16.2%

局限与改进

作者承认的局限:8B模型不升反降(R2R SR -1.6),说明该配方尚未把参数转化为性能,4B是当前甜点;SPL改善普遍小于SR,ER初始化对路径效率帮助有限且涨跌混合;R2R上nDTW 67.4低于DualVLN 70.0;EVT上ReferTrack保持更高TR、CoMaTrack单目标CR更低(0.90对1.87);真实世界与游戏域仅为定性展示,无统一成功率协议;当前是单决策通路,未区分高频局部控制与慢速语义思考。我的观察:INSIGHT-Bench由作者自建,其标注(Molmo2指向)、指令生成与到达验证同模型自身指向表示同源,可能存在隐蔽的表示亲和偏差,43.7%的优势幅度需第三方复估;GRPO的rollout池用监督策略成功/失败二分过滤,探索上限被SFT策略封顶;跟踪训练只含人类,对机器人、购物车的真实跟踪属分布外个例而非保证;4ms/token是单token延迟,大像素预算下视觉编码与prefill开销才决定决策频率,论文未报端到端Hz;RVQ截断省算力但未给1-2级解码时的成功率-延迟曲线。

独立分析的弱点

弱点一:单通路决策在动态密集环境中既可能慢又欠安全——每步5 token自回归加压缩历史,对突发障碍的反应延迟没有量化,也没有显式避障模块;改进方向是作者自己提出的双系统:给RVQ L0级粗轨迹配一个免VLM的轻量反应策略,仅在停滞点唤回慢规划。弱点二:RVQ短视距(10步)依赖高频调用,长走廊和大空间会累积漂移并反复询问模型;可引入自适应chunk长度或“粗长+细短”双层轨迹。弱点三:评测闭环同源——benchmark构建、到达检查、模型指向监督共用同一网格token与Molmo2系工具,自建基准的优势可能部分来自表示亲和;应发布人工标注子集并交叉验证。弱点四:8B退化提示瓶颈在数据与配方而非参数,当前RL学习率仅1e-6、组大小G=8,探索信号弱;可按任务分组归一化优势、课程化提升难度、加大G与更大模型重试。弱点五:真实世界部署无定量指标与失败统计,工程可用性难以评估;建议发布带标准协议的真实场景评估套件。弱点六:跟踪泛化到非人类目标属于无监督的“运气”,应扩充动态目标类别或引入类别无关的目标一致性目标函数,把个例变成能力。

未来方向

作者明确提出的两个方向:一是双系统架构,用轻量反应策略承担避障与频繁轨迹修正、慢速VLM规划器负责长视距推理;二是在互联网规模视频上加强预训练,扩展开放世界概念覆盖,见到比策划数据集中更稀有的场景、交互与运动模式。基于其成果可自然延伸的:其一,利用RVQ“非空前缀即可执行”的特性做自适应精度推理——用token熵或不确定性门控决定发射几级,把算力花在关键决策点;其二,把GRPO扩展为多任务混合奖励加跨具身并行rollout,检验RL信号是否是4B上限的真正约束;其三,在指向token之外增加深度/占据等3D一致的几何第三通道,针对性缓解Institution-Extremum这类需要全局多实例比较的失败模式(该格仅18.0%);其四,把INSIGHT-Bench的“场景×指令”两轴诊断法推广为社区标准细粒度评测协议;其五,把无参数的规则式历史压缩替换为可学习记忆或检索机制,在不膨胀token预算的前提下拉长有效视野。

复现评估

复现友好度较高但成本不小。开源:论文给出Project Page、GitHub与HuggingFace入口,INSIGHT-Bench(训练1,683场景/53,090 episodes,评测210场景/1,097 episodes,两套场景严格不相交)与模型权重的公开是最大资产;训练超参披露完整——ER中期训练lr 1e-5、batch 128、序列长10,240,SFT lr 1.5e-5、batch 320、序列长8,192,GRPO G=8、B=32、clip 0.2、KL 0.01、lr 1e-6,奖励超参如方位死区 $\alpha_0=0.14$ rad、距离带 $[1.5,3.0]$ m均有给出。算力:ER约170 H100·时、SFT约950 H100·时、RL为8×H100单节点,合计千级H100·时,中等规模实验室可承受;推理仅RTX 4090。难点:4K+小时、2K+场景语料依赖Habitat、HM3D/MP3D、自研Habitat-GS渲染器及Molmo2、Seed2.0等第三方模型的数据管道,许可证与工程门槛高;GRPO rollout基础设施细节多;36个ER源与16个导航源的采样权重需仔细对齐。总体判断:有工程团队的实验室约2-3个月可复现核心结果,单人复现全流程难度大。