← 返回 2026-08-10

面向航空图像目标导航的不确定性感知世界模型 Uncertainty-Aware World Model for Aerial Image-Goal Navigation

Deyi Zhu, Haoyu Fan, Yinan Zhu, Weichen Zhang, Shilin Ma, Xinlei Chen, Yansong Tang 📅 2026-08-06 👍 11 2026-08-15 18:30
不确定性建模 世界模型 分布外检测 图像目标导航 无人机导航

把轨迹打分重构为条件OOD检测,用不确定性子空间分离可解释与不可解释残差,提升无人机图像目标导航。

前置知识

导航世界模型 (Navigation World Model)

一类不直接预测控制指令,而是给定当前观测上下文与候选动作序列后预测其未来视觉状态(图像或视觉特征),再用预测状态与目标图像的相似度给候选轨迹打分、选出最优轨迹执行的世界模型。代表工作 NWM、One-Step WM、RAE-NWM 等。

本文正是在这一范式的打分环节上做创新,理解'预测-打分-选择'流程才能看懂 UA-NWM 改了哪一步。

图像目标导航 (Image-Goal Navigation)

给智能体一张目标图像,要求它在未知环境中导航到该图像对应的空间位置,而不提供精确坐标。本文聚焦无人机在三维户外城市场景下的设定,难度高于地面室内,因为长时序运动和遮挡会让未来观测高度不确定。

这是论文的任务定义,理解目标图像如何充当'隐式坐标'是理解打分机制的前提。

DINOv3 视觉特征与流形假设

DINOv3 是 Meta 提出的自监督视觉基础模型,其 ViT 输出的稠密 patch token(本文用 ViT-B/16,14×14=196 个,768 维)能刻画图像语义结构。流形假设认为真实图像特征集中在低维流形附近,本文据此把'多种合理未来'近似为确定性预测周围的一个低维不确定性子空间。

UA-NWM 的全部预测与打分都在 DINOv3 潜空间完成,理解 patch token 与特征流形是读懂 HEP 的基础。

分布外检测 (OOD Detection)

判断输入是否落在模型所学分布之内还是之外。传统方法用分类器置信度、能量函数或特征空间距离;本文把它扩展为'条件 OOD 检测':判断目标图像是否落在某条候选轨迹诱导的条件未来状态分布内,是则为分布内(可达),否则为分布外(不可达)。

这是论文最核心的方法论重构,看不懂这一点就无法理解为何要分解 e∥ 与 e⊥。

Delta Tokens 与 CEM 规划

Delta 表示借鉴 DeltaWorld:不直接预测下一帧完整潜状态,而是预测相邻帧之间的潜变化量(delta token),减少冗余、聚焦时变信息。CEM(交叉熵方法)是基于采样的黑盒优化器,本文用它对动作序列采样-打分-保留精英-更新分布,迭代 3 轮、每轮 32 样本、取前 16 精英。

delta 表示是骨干网络的关键设计(消融证明其重要性),CEM 则是把世界模型当打分器用于规划的标准做法。

研究动机

现有基于世界模型的图像目标导航方法在给候选轨迹打分时,通常只用一次或少数几次前向预测的未来状态去和目标图像匹配。在大规模户外场景(如城市无人机航空导航)中,长时序运动和尚未观测到的区域使得在相同上下文与动作下存在多种合理的未来外观,这种'未来状态不确定性'极为显著。论文图 1 给出直观例子:建筑遮挡让左侧区域的未来外观模糊——是树还是屋顶?图 2 进一步揭示两类范式的缺陷:确定性世界模型(如 LS-NWM、ReL-NWM)把多种合理未来塌缩成一个过度平滑的均值估计,该均值甚至可能落在真实分布的高密度区域之外,打分不可靠;随机世界模型(如 NWM、MWM、RAE-NWM)虽能采样多种未来,但要判断目标是否属于该分布需要足够多样本来逼近,计算代价高昂(NWM 在线规划每步约 191.71 秒),且只依赖一两个样本会让打分对采样随机性极其敏感。结果是面对未来不确定性,两类方法都倾向给本应被选中的优秀候选打低分而错误拒绝,显著降低导航成功率。

本文的目标是本文旨在为航空图像目标导航设计一个高效且对'未来状态不确定性'具备感知能力的世界模型 UA-NWM,使其能在一次前向传播内、不依赖多次随机采样的前提下鲁棒地为候选轨迹打分。具体目标包括:第一,把每条候选轨迹诱导的未来状态显式建模成隐式条件分布而非单个点;第二,在保持确定性骨干低延迟优势(毫秒级)的同时,区分'由不确定性引起的合理偏离'与'真正与目标不一致的残差误差',只对后者惩罚;第三,在作者新建的大规模户外无人机基准 AirGoal-10k 以及真实物理无人机上,全面超越现有确定性/随机世界模型与策略类方法,并验证从仿真到现实(sim-to-real)的零样本泛化能力。

与已有工作不同的是,本文的独特切入角度是把'轨迹打分'重新表述为条件分布外检测(conditional OOD detection)问题:每条候选轨迹在 DINO 特征空间定义一个条件未来状态分布,若该轨迹能到达目标,则目标状态是分布内的,否则是分布外的。由于该分布只能被隐式建模,直接判断目标是否落入其中很困难;作者既不采用确定性均值,也不进行昂贵的随机采样,而是用一个预测出的低秩'不确定性子空间'去近似该分布的局部支撑,再用目标到该子空间的正交距离来打分。这一视角把 OOD 检测从静态输入扩展到'依赖于上下文与动作的未来观测',是导航世界模型领域首次用条件 OOD 检测统一处理未来不确定性,填补了感知层不确定性与未来预测不确定性之间的方法论空白。

核心方法

UA-NWM 的整体思路可分两步直觉理解:先用一个轻量确定性骨干在 DINOv3 潜空间预测'最可能的未来外观',再承认这个预测会因为遮挡、长时漂移等原因偏离真实未来,于是额外预测一个'不确定性子空间',把目标与预测之间的总差异拆成'可被不确定性解释的部分'和'真正无法解释的残差',只惩罚后者。技术路线上,骨干由冻结的 DINOv3 ViT-B/16 提取 14×14=196 个 patch token,经 token 压缩器压成 $K=32$ 个潜 token;借鉴 DeltaWorld,用动作条件因果 Transformer 预测 $M=32$ 个 delta token 表示相邻帧潜变化,delta 解码器组合出下一状态,自回归滚动 $H=8$ 步;token 融合器把压缩状态解码回稠密 DINO 特征图 $\mu\in\mathbb{R}^{196\times768}$。HEP 模块基于该 $\mu$ 和上下文 token 预测多尺度低秩基,做单次前向的层次化误差投影,最终输出正交残差 $e^\perp$ 作为打分依据,整个过程不采样任何额外未来。

核心创新是把轨迹打分重构为条件 OOD 检测,并用'层次化误差投影(HEP)'在一次前向内近似该条件分布。设归一化后的总差异为 $e=\mathrm{norm}(x_g)-\mathrm{norm}(\mu)$,其中 $x_g$ 是目标图像的 DINO 特征。传统确定性方法惩罚整个 $e$;UA-NWM 则把 $e$ 分解为 $e^\parallel$(落在不确定性子空间 $S$ 内的可解释分量)和 $e^\perp$(正交残差),打分 $s=\frac{1}{N}\sum_i\|e^\perp_i\|_2^2$ 只用 $e^\perp$。这样当目标偏离主要源于合理不确定性方向(如遮挡带来的多种合理外观)时打分很低,当偏离无法被 $S$ 解释(如轨迹确实走错)时打分很高。关键点在于:HEP 不为每个条件存一个独立子空间,而是学一个从 $\mu$ 与上下文到局部基 $U_{g,c}$ 的条件映射——因为 $\mu$ 本身依赖候选动作序列,不同轨迹会诱导不同的不确定性方向。这与随机模型靠采样近似分布、确定性模型靠单一均值打分都有本质区别。

方法步骤详情

完整步骤如下:(1)冻结 DINOv3 ViT-B/16 对 $224\times224$ RGB 观测提取 196 个 patch token($D=768$)。(2)token 压缩器用 $K=32$ 个可学习查询做交叉注意力,得到 $32\times384$ 压缩潜 token $z_t$。(3)动作条件因果 Transformer 接收 $C=4$ 帧上下文(128 token)与归一化 4 维局部 delta 位姿嵌入,经 6 个带 AdaLN 调制的因果块预测 $M=32$ 个 delta token。(4)delta 解码器把 $\hat\delta$ 与 $z_t$ 拼接预测残差更新得 $\hat z_{t+1}$,滑窗自回归 $H=8$ 步。(5)token 融合器用 196 个输出查询做交叉注意力,输出稠密预测 $\mu\in\mathbb{R}^{196\times768}$。(6)算归一化差异 $e=\mathrm{norm}(x_g)-\mathrm{norm}(\mu)$。(7)HEP 在尺度 $G=\{1,2,7,14\}$ 上由粗到细分解:每尺度空间平均池化得 $m_{g,c}$,与上下文交叉注意力得 $q_{g,c}$,尺度专属 MLP 预测秩 $R=2$ 的基 $U_{g,c}$;对单元平均残差做岭正则最小二乘($\lambda=10^{-3}$)投影并减去可解释分量,残差传给更细尺度。(8)最细尺度后剩余场即 $e^\perp$,按 $s=\frac{1}{N}\sum_i\|e^\perp_i\|_2^2$ 打分。

技术新颖性

技术新颖性体现在四点:第一,首次把导航世界模型的轨迹打分表述为条件 OOD 检测,把'目标是否落在该轨迹诱导的未来分布内'作为判据,而非点到点距离。第二,HEP 用由粗到细的空间金字塔(尺度 $1/2/7/14$)配合低秩基($R=2$)近似条件分布局部支撑:粗尺度解释全局/区域一致的偏离(如色调漂移),最细的 $14\times14$ 尺度退化为逐 patch 低秩投影,能同时兼顾'对合理不确定性的容忍'与'对真实轨迹错误的判别'。第三,目标特征 $x_g$ 完全不参与基的预测,只在最后投影时使用——不确定性子空间仅由上下文与候选轨迹决定,避免把目标信息泄露进打分头。第四,训练用归一化损失 $\mathcal{L}_{HEP}=\frac{\sum_i\|e^\perp_i\|_2^2}{\sum_i\|e_i\|_2^2+\epsilon}$(幅度无关、防大误差样本主导),而推理用未归一化的 $e^\perp$ 能量以获得更锐利的候选区分;并在概率视角下证明当 $\tau^2\gg\sigma^2$(高各向异性)时仅惩罚 $e^\perp$ 正是高斯负对数似然的主导项。

UA-NWM 与已有导航世界模型在未来预测与轨迹打分上的对比
Figure 2: UA-NWM 与已有导航世界模型在未来预测与轨迹打分上的对比
不确定性感知打分示意与 HEP 模块整体流程
Figure 3: 不确定性感知打分示意与 HEP 模块整体流程
UA-NWM 的整体训练流程
Figure 4: UA-NWM 的整体训练流程

实验结果

离线轨迹排序(Table 1):UA-NWM 在 8/16/32 候选规模下均取最低 ATE/RPE,32 候选时 ATE=1.09、RPE=0.30,显著优于 NWM(1.37/0.37)、RAE-NWM(1.50/0.41)、One-Step WM(1.44/0.39)、MWM(1.59/0.43),且每帧仅 8.47ms,比 NWM 的 438.67ms 快约 45 倍。离线独立规划(Table 2):ATE=1.22、RPE=0.33,优于所有世界模型与策略类基线(GNM 1.29、ViNT 1.37、NoMaD 1.79、FlowNav 1.81、NaviBridger 1.58)。在线闭环(Table 3,100 集,平均起点-目标距离 57m):SR=76.0%、SPL=64.5%,超过 RAE-NWM(70.0%/57.8%)、NWM(63.0%/52.1%)及所有策略方法(最高 NoMaD 56.0%),每步 2.70 秒比 RAE-NWM 的 202.54 秒快两个数量级。消融(Table 4/5)表明去掉任一尺度都退化,14 尺度贡献最大、秩 $R=2$ 最佳;Table 6 显示训练 rollout=8 步最优;Table 7 证明分阶段训练+delta 表示缺一不可;Table 8 确定 $K=M=32$ 最佳。Table 9 显示在 2D 基准 RECON(ATE 0.92 vs NWM 0.99)与 GO Stanford(1.51 vs 2.11)上同样领先,证明可迁移性。真实无人机(MacBook Air M4 + 自组装四旋翼,Jetson Orin NX + Livox LiDAR + MicoAir 飞控)在 5 个任务上实现零样本 sim-to-real。

AirGoal-10k 轨迹排序任务上与世界模型方法的对比
Table 1: AirGoal-10k 轨迹排序任务上与世界模型方法的对比
AirSim 在线闭环导航对比
Table 3: AirSim 在线闭环导航对比
HEP 不同尺度成分的消融
Table 4: HEP 不同尺度成分的消融
未来预测的定性对比
Figure 6: 未来预测的定性对比
真实世界无人机实验示意
Figure 7: 真实世界无人机实验示意
查看结构化数据
任务指标本文基线提升
离线轨迹排序(AirGoal-10k,32 候选) ATE ↓ / RPE ↓ 1.09 / 0.30 RAE-NWM 1.50 / 0.41;NWM 1.37 / 0.37 相对 RAE-NWM ATE 降低约 27%,相对 NWM 降低约 20%;推理快约 45 倍
离线独立规划(CEM,AirGoal-10k) ATE ↓ / RPE ↓ 1.22 / 0.33 NWM 1.40 / 0.39;策略类最强 GNM 1.29 / 0.35 全面优于所有世界模型与策略基线
在线闭环导航(AirSim,100 集) SR ↑ / SPL ↑ / 每步时间 76.0% / 64.5% / 2.70s RAE-NWM 70.0% / 57.8% / 202.54s;NWM 63.0% / 52.1% / 191.71s SR 提升 6 个百分点,速度提升约 75 倍
2D 地面基准迁移(GO Stanford,×32 候选) ATE ↓ 1.51 NWM 2.11 ATE 降低约 28%,验证方法可迁移到 2D

局限与改进

作者在补充材料 H 节明确承认:不确定性子空间 $S$ 只是对条件未来状态分布的低维局部近似,并非其中每个点都落在真实分布的高密度区域。直接在 $S$ 内随机采样得到的状态虽能体现多样性、保留合理全局布局,但空间相干性有限——同一建筑的不同区域可能出现不一致颜色,解码图像像被打乱的拼图;这是因为层次化投影虽捕获了部分跨区域相关性,但仍不足以保证相关 patch 间完全一致的变化。HEP 本身是贪婪的顺序投影(先粗后细,前面分量不参与后续联合重优化),并非对全体尺度子空间直和的精确全局正交投影,因此最终残差应理解为'层次化投影后剩下的未解释分量',只是一个保守的兼容性近似而非完全校准的似然。我自己观察到的额外局限:打分只用了最终 horizon 那一步的状态,未利用中间多步预测;HEP 只建模未来不确定性,未处理当前观测本身的不确定性。

独立分析的弱点

弱点一:子空间采样的空间不相干。从 $S$ 随机采样会产生拼图式的不一致外观,影响其作为随机生成器的能力。改进方向是引入跨 patch 的显式相关性建模,如用图神经网络或对各 patch 共享低秩因子约束,使相关区域协同变化。弱点二:时间不相干。HEP 只在最终步打分,未对多步未来的时间一致性建模;长时漂移下中间步骤不确定性未被显式约束,可把 HEP 扩展为对整个 $H$ 步滚动序列的时空金字塔投影。弱点三:仅依赖作者自建基准 AirGoal-10k,缺乏与其他公开 3D 航空基准的直接横向比较(论文也指出本就不存在这样的公开基准),改进方向是开源基准供社区复现。弱点四:真实部署依赖外挂 MacBook,机载 Jetson Orin NX 仅做通信与底层控制,高水平规划仍在 MacBook 上跑,未真正实现单机全机载部署,可进一步压缩模型以适配边缘算力。弱点五:概率解释假设 $\tau^2\gg\sigma^2$ 的高各向异性 regime,若该假设不成立,仅惩罚 $e^\perp$ 会过于宽松,可引入自适应权重在 $e^\parallel$ 与 $e^\perp$ 间折中。

未来方向

作者提出的未来方向:探索更具表达力的不确定性表征,使其同时捕获跨 patch 的空间相干性与跨帧的时间相干性,从而能在一次前向内预测出完整的未来状态分布并采样多种未来,而不必为每个样本重新跑一遍模型——把 UA-NWM 从'导航判别器'升级为'高效的随机生成器'。基于本成果可延伸的方向:(1)把 HEP 的条件 OOD 打分思路迁移到其他具身任务(机械臂操作、自动驾驶轨迹评估)的世界模型中,因为'未来不确定性下的目标兼容性'是共性问题;(2)将不确定性子空间的残差能量用作主动探索或'不确定时求助'的信号;(3)结合生成式先验(如扩散模型)为 $S$ 提供更合理的样本分布,缓解随机采样的拼图问题;(4)把单步最终打分扩展为多步时序打分,显式建模长时漂移的不确定性累积;(5)在更大规模、更多气候/光照条件的数据上训练,进一步强化 sim-to-real 鲁棒性。

复现评估

复现友好度中等偏上。论文提供了项目主页(https://duryi.github.io/UA-NWM-Project-Page),并详细描述了 AirGoal-10k 基准的构建流程(基于 AirSim,从 AerialVLN/OpenFly 起止状态池重采样轨迹,渲染 $512\times512$ 并质量过滤),给出方向采样 $\theta\sim U(0,85^\circ)$、$\varphi\sim U(0,2\pi)$ 与积分细节。模型结构与超参数披露充分:DINOv3 ViT-B/16、$K=M=32$、$C=4$、$H=8$、$R=2$、四尺度 $G=\{1,2,7,14\}$、$\lambda=10^{-3}$;三阶段训练给出批大小 48、步数 10k/24k/8k、学习率 $10^{-4}/10^{-4}/5\times10^{-4}$ 等。算力需求:4×NVIDIA RTX 4090(离线)/4×RTX 3090(在线),HEP 阶段单卡即可。难点在于:(1)真实实验需自组装四旋翼硬件(Jetson Orin NX、Livox Mid-360 LiDAR、MicoAir NxtPX4v2 飞控)并配 MacBook Air M4,硬件门槛高;(2)DINOv3 为较新视觉基础模型,需自行冻结提取特征;(3)可视化用的 RAEv2 解码器需在 AirGoal-10k 上微调。代码与权重是否完全开源需查项目页确认。