← 返回 2026-07-22

轨迹感知的跨视角地理定位:基于序列观测统一处理视频与路径描述 Trajectory-aware Cross-view Geo-localization with Sequential Observations

Tianyi Gao, Jiayu Lin, Danielle Beaulieu, Nathan Jacobs 📅 2026-07-16 👍 7 2026-07-27 18:30
CLIP VLM标注 跨模态检索 跨视角地理定位 轨迹几何

用轨迹几何调制统一视频/文本跨视角地理定位,引入SeqGeo-VL数据集。

前置知识

跨视角地理定位(Cross-view Geo-localization)

一种将地面视角的观测(图像、视频或文本描述)与带有 GPS 标签的卫星图像数据库进行匹配的检索任务,本质上把定位问题转化为检索问题。给定一个卫星图库 $S=\{S_j\}_{j=1}^{M}$,目标是找到与查询最相似的卫星图像 $j^* = \arg\max_j \mathrm{sim}(\phi_q(O_{1:N}), \phi_s(S_j))$,再由匹配卫星图的地理标签推断位置。其精度受限于卫星分块分辨率,但覆盖广、存储成本低,是可扩展定位的重要途径。

这是本文的核心任务设定,理解它才能明白视频/文本查询为什么要与卫星图对齐、Recall@K 评估指标的含义,以及轨迹几何为什么能帮助解决感知混淆问题。

CLIP 与对比学习(Contrastive Learning)

CLIP 通过在大规模图文对上做对比学习,将图像编码器和文本编码器映射到同一嵌入空间,使匹配图文对的相似度高于不匹配对。其核心损失是 InfoNCE:$\mathcal{L}_{\text{ctr}} = \frac{1}{2N}\sum_i [\ell(q_i,k_i) + \ell(k_i,q_i)]$,借助温度系数与对称项拉近正样本、推开负样本。本文三个编码器(视频、文本、卫星)均由 CLIP ViT-L/14 初始化。

TrajLoc 完全建立在 CLIP 风格的双流/三流对比训练之上,两阶段课程、TrajMod 调制后的检索都依赖 InfoNCE 与余弦相似度。不理解对比学习就无法理解其训练目标和正则项 $\mathcal{L}_{\text{reg}}=1-\mathrm{sim}(f_s^{stage1}, f_s^{stage2})$。

特征级线性调制(FiLM)

FiLM(Feature-wise Linear Modulation)是一种条件化机制,用一个条件向量 $c$ 通过 MLP 预测仿射参数 $\gamma, \beta$,对特征 $f$ 做逐通道缩放与偏移:$f' = \gamma \odot f + \beta$。它参数极少却能让特征随条件信号动态调整,被广泛用于条件生成与多模态融合。本文的 TrajMod 正是 FiLM 的变体,条件信号是轨迹几何嵌入 $z_{\text{traj}}$。

理解 FiLM 是把握 TrajMod 核心创新的关键——本文正是用这种轻量调制把轨迹几何注入视觉语言嵌入,实现空间接地(spatially grounded)表示,这是相对 CLIP "词袋"缺陷的关键改进。

傅里叶位置/角度编码(Fourier Features)

对于周期性的角度信号(如航向角),直接输入标量不利于网络学习高频细节。傅里叶特征将角度 $\alpha$ 展开为多频正余弦基:$\Phi(\alpha)=[\sin(2^0\pi\alpha),\cos(2^0\pi\alpha),\ldots,\sin(2^{K-1}\pi\alpha),\cos(2^{K-1}\pi\alpha)]$,使其在高维空间中线性可分,类似 Transformer 的位置编码。本文用它编码航向角序列与起止方向角。

TrajMod 的条件输入 $z_{\text{traj}}$ 就是用傅里叶特征编码的航向和 OD 方向角拼接而成,理解这一步才能明白轨迹几何如何被表示成可微的连续嵌入。

研究动机

城市具身智能体(自动驾驶车辆、四足机器人)在城市密集环境中运行时,GPS 信号常因高楼与植被遮挡而严重噪化甚至完全失效,因此基于自我中心视觉观测或自然语言描述的精确空间定位成为刚需。跨视角地理定位把该问题建模为地面观测到 GPS 卫星图的检索,但单帧查询受困于感知混淆(perceptual aliasing):外观一致的建筑立面、重复的城市街区会导致灾难性的匹配歧义。为此近期工作转向序列视频查询(如 GaMa、SeqGeo、CVLNet),它们利用运动连续性、视角变化、路径级语义提供更丰富线索。然而这些方法忽视了路径描述(route description)这一互补模态——在人机协作场景中(如用户引导自动驾驶到接载点),抽象语言描述往往是唯一可用输入。同时,现有数据集只支持视频或单帧文本查询,没有任何视频–文本–卫星三元组,使得两种模态的潜在协同效应完全未被探索。

本文的目标是本文的目标有三:第一,构建首个支持视频与序列路径描述双模态查询的多模态基准 SeqGeo-VL,包含 38,863 条视频–文本–卫星三元组,统一评测跨视角视频与文本地理定位;第二,提出统一框架 TrajLoc,用共享的卫星编码器分别处理视频和路径描述查询,通过两阶段课程学习让两种模态互相强化,并在参数上比训练两套独立系统更经济;第三,把现代移动设备自带 IMU/罗盘可获取的轨迹几何(航向角、起止方向角)显式注入表示,提出轻量即插即用模块 TrajMod,弥合 CLIP/MLLM 嵌入在空间布局理解上的缺陷,产出空间接地的查询表示,从而在视频和文本两类跨视角定位任务上同时超越现有 SOTA。

与已有工作不同的是,本文的独特切入角度有三层:数据层面,此前没有视频–文本–卫星三元组数据集,作者用 VLM+LLM 渐进式标注流水线把 SeqGeo 扩展为 SeqGeo-VL,填补空白;方法层面,已有方法要么只做视频查询(SeqGeo、GARet、FlexGeo),要么只做单帧文本查询(CrossText2Loc),本文首次将两者纳入统一框架并用课程学习协同训练;表示层面,作者观察到 CLIP 类模型具有 "词袋"特性,难以区分空间排布,而绝大多数跨视角方法都丢弃了轨迹几何这一现成却关键的信号。本文用 FiLM 式的 TrajMod 把轨迹几何直接调制到查询嵌入上,比把轨迹信息塞进文本提示的朴素做法(仅 +1.34% R@1%)有效得多(+19.33% R@1%),这是本质上把抽象几何与视觉语言语义对齐到同一空间表示。

核心方法

整体思路先直觉后技术。直觉上:视频提供稠密视觉证据,路径描述提供抽象结构化语义,二者描述同一条轨迹、应互相强化;轨迹几何(航向、起止方向)是移动设备几乎免费可得却长期被忽视的信号,可告诉模型 "同样语义如何空间排布",缓解感知混淆。技术路线:TrajLoc 由三个 CLIP ViT-L/14 初始化的编码器组成——视频编码器把 $N$ 帧各自编码后均值池化得 $f_v=\frac{1}{N}\sum_i f_{v_i}$,文本编码器对约 129 tokens 长描述线性插值位置嵌入扩展上下文窗口(超 CLIP 默认 77),卫星编码器映射到共享检索空间。训练分两阶段课程:阶段一视频–卫星 InfoNCE 给卫星编码器强初始化;阶段二冻结视频、对齐文本–卫星并用余弦正则 $\mathcal{L}_{\text{reg}}=1-\mathrm{sim}(f_s^{stage1}, f_s^{stage2})$ 防漂移。最后冻结编码器训练 TrajMod 两个 MLP,以轨迹几何对 $f_v,f_t$ 做仿射调制得 $f_v',f_t'$。Adam,学习率 $1\times10^{-5}$。

核心创新点有两个本质区别于已有方法。第一是 "轨迹几何显式调制":作者不把定位简化为外观检索,而是把轨迹几何嵌入 $z_{\text{traj}}$ 用傅里叶特征编码航向角序列 $h$ 和起止方向角 $\theta_{OD}$,再用 FiLM 风格的 MLP 预测模态特定的 $\gamma_m, \beta_m = \text{MLP}_m(z_{\text{traj}})$,通过 $f_m' = \gamma_m \odot f_m + \beta_m$($m\in\{v,t\}$)调制查询嵌入。这与以往只靠时序聚合(SeqGeo 的 Temporal Module、GaMa 的 3D-CNN、GARet 的 Transformer adapter)或靠文本提示塞入轨迹信息的做法本质不同——它把几何锚定到同一空间表示上,让视频与文本能跨模态迁移知识。第二个核心是两阶段课程与协同训练:直接混合训练会让难对齐的文本拉偏共享的卫星编码器,作者先用易对齐的视频打牢卫星编码器基础,再冻结视频、用文本做软锚定对齐,并辅以 $\mathcal{L}_{\text{reg}}$ 防漂移。

方法步骤详情

完整步骤如下。数据准备:四级渐进标注把 SeqGeo 扩展为 38,863 三元组——Qwen3-VL-8B 生成单帧细粒度字幕、注入运动原语(左转、直行)、Qwen3-30B 蒸馏出连贯轨迹级叙述、3 名标注员对约 1%(400 条)子集打 OF/ST/RC 分,通过率 91.8%。编码器适配:视频用 ViT-L/14 逐帧编码后均值池化,文本对约 129 tokens 描述做位置嵌入插值,卫星用同一骨干。轨迹几何嵌入:对航向序列 $h$ 与 OD 方向角 $\theta_{OD}$ 做傅里叶展开 $\Phi(\alpha)=[\sin(2^0\pi\alpha),\cos(2^0\pi\alpha),\ldots]$ 沿通道拼接得 $z_{\text{traj}}$。TrajMod:用视频/文本各自 MLP 预测 $(\gamma_m,\beta_m)$ 做 $f_m'=\gamma_m\odot f_m+\beta_m$。训练:阶段一视频–卫星 InfoNCE 40 epochs batch 24;阶段二冻结视频、文本–卫星 40 epochs batch 24 加正则;最后冻结编码器训练 TrajMod 20 epochs batch 128。推理以 $f_v'/f_t'$ 或线性融合($\alpha=0.4$)与卫星库做余弦检索。

技术新颖性

技术新颖性体现在三方面。首先是任务与数据集新颖:首个支持序列路径描述查询的跨视角定位基准 SeqGeo-VL,38,863 条对齐的视频–文本–卫星三元组,并用 VLM+LLM 协同的渐进式标注流水线保证质量(91.8% 通过率),相比 CVG-Text 只描述单帧、SeqGeo 只支持视频都更进一步。其次是统一框架新颖:TrajLoc 用两阶段课程让视频和文本共享同一卫星编码器,避开了 "直接混训难模态拉偏共享编码器" 的优化陷阱,消融显示带 TrajMod 时协同训练让视频 R@1 从 9.69% 跃升到 12.09%(+2.40%),文本从 1.90% 到 2.52%,而无 TrajMod 时协同仅带来 0.40%/0.18% 的微小提升——说明 TrajMod 才是释放协同红利的关键。第三是表示新颖:TrajMod 把轨迹几何以 FiLM 方式注入表示,针对 CLIP 的 "词袋"缺陷做空间接地,相对朴素文本提示(+1.34% R@1%)实现 +19.33% R@1% 的巨大提升;这种轻量即插即用模块不依赖 POI 或路网等强元数据,假设弱、可迁移性高。

Word cloud and distribution of the extracted keywords within the SeqGeo-VL dataset.
Fig. 2: Word cloud and distribution of the extracted keywords within the SeqGeo-VL dataset.
Overview of the TrajLoc framework. Left: Encoder adaptation with a two-stage curriculum. Right: TrajMod conditions the video and text embeddings on trajectory geometry to produce spatially grounded representations.
Fig. 4: Overview of the TrajLoc framework. Left: Encoder adaptation with a two-stage curriculum. Right: TrajMod conditions the video and text embeddings on trajectory geometry to produce spatially grounded representations.

实验结果

实验在两任务上全面验证。视频定位(Table 2):TrajLoc 取 R@1=12.09%、R@5=35.77%、R@10=47.68%、R@1%=80.21%,大幅超越 SOTA;SeqGeo 从 VGG16 升到 ViT-L/14 后 R@1 从 1.80% 升到 8.14%,但 TrajLoc 用同骨干且计算预算更低仍领先约 4 个点;GARet 仅 3.34%、FlexGeo 3.51%、Qwen3-VL-Embedding(LoRA)5.44%,通用 VLM 缺乏空间接地。文本定位(Table 3):TrajLoc R@1=2.52%、R@1%=45.48%,R@1 是 CrossText2Loc 的 2.6 倍,R@1% 比 EVA2-CLIP 高 1.7 倍;扩大骨干或提分辨率增益有限,瓶颈在空间推理。帧数消融(Fig. 6):带 TrajMod 优势随帧数扩大(R@1 增益从 1 帧 2.6% 到 6 帧 5.6%)。协同消融(Table 4):有 TrajMod 时协同让视频 R@1 提升 2.40%、文本 0.62%。条件机制(Table 6):TrajMod +19.33% R@1% 远胜文本提示 +1.34%。序列必要性(Table 5):单视图 R@1% 仅 10.63%、序列对象 17.41%、完整 SeqGeo-VL 22.29%。

Comparison of cross-view datasets.
Table 1: Comparison of cross-view datasets.
Comparison of cross-view video geo-localization results.
Table 2: Comparison of cross-view video geo-localization results.
Comparison of cross-view text geo-localization results.
Table 3: Comparison of cross-view text geo-localization results.
Ablation study on co-training components and TrajMod.
Table 4: Ablation study on co-training components and TrajMod.
Comparison of trajectory conditioning mechanisms.
Table 6: Comparison of trajectory conditioning mechanisms.
Cross-view geo-localization with and without TrajMod. Blue highlights the spatial cues, while bold denotes the observed objects.
Fig. 5: Cross-view geo-localization with and without TrajMod. Blue highlights the spatial cues, while bold denotes the observed objects.
Video geo-localization performance with varying frame number and TrajMod.
Fig. 6: Video geo-localization performance with varying frame number and TrajMod.
Performance with different gallery sizes given a location prior.
Fig. 7: Performance with different gallery sizes given a location prior.
查看结构化数据
任务指标本文基线提升
跨视角视频地理定位 R@1 12.09% SeqGeo†(ViT-L/14 重实现)8.14%;SeqGeo(VGG16)1.80%;GARet 3.34%;FlexGeo 3.51%;Qwen3-VL-Embedding(LoRA)5.44% 相对最强基线 SeqGeo† 在 R@1 上提升约 3.95 个百分点(约 48% 相对提升),相对原始 SeqGeo 提升 6.7 倍
跨视角视频地理定位 R@1%(top-1%) 80.21% SeqGeo† 66.17%;SeqGeo 34.38%;Qwen3-VL-Embedding 61.16% 相对 SeqGeo† 提升 14.04 个百分点
跨视角文本地理定位 R@1 2.52% CrossText2Loc(ViT-L/14@336)0.98%;EVA2-CLIP(ViT-L/14@336)0.89%;CLIP(ViT-L/14)0.80%;Qwen3-VL-Embedding(LoRA)0.93% R@1 是 CrossText2Loc 的 2.6 倍
跨视角文本地理定位 R@1% 45.48% EVA2-CLIP(ViT-L/14@336)26.99%;CrossText2Loc(ViT-L/14@336)25.45% 相对 EVA2-CLIP 提升 1.7 倍
TrajMod 调制机制消融(文本定位 R@1%) R@1% 增益 TrajMod +19.33% 文本提示注入轨迹信息 +1.34% 显式几何调制比文本提示有效约 14 倍
协同训练消融(视频定位 R@1,带 TrajMod) R@1 协同训练 12.09% 仅 Vid2Sat 9.69% 协同训练带来 +2.40% 绝对增益

局限与改进

论文承认与可观察的局限主要有四。第一,覆盖范围有限:SeqGeo-VL 基于 SeqGeo,序列仅约 7 帧,泛化到全球尺度、更长序列或不同城市形态未被验证。第二,绝对精度偏低:文本定位 R@1 仅 2.52%、视频 12.09%,距实际部署仍有距离,论文也承认需位置先验缩小检索库(Fig. 7)才达实用精度。第三,轨迹几何假设依赖:TrajMod 需航向角与 OD 方向角,假设可从 IMU/罗盘获取,被动导航或历史视频回放场景可能缺失,此时退化为无 TrajMod 版本(增益消失)。第四,batch 较小(文本 24、TrajMod 128),更大 batch 或难负样本挖掘可能进一步释放潜力。我额外观察到:均值池化过于简单;仅用 Recall@K,未报告米级定位误差;标注流水线依赖开源大模型,91.8% 通过率仍有约 8% 不达标样本。

独立分析的弱点

独立分析的弱点与改进方向如下。弱点一:视频用均值池化聚合帧特征,丢弃帧间顺序与因果;可引入轻量时序 Transformer 或 Mamba 做因果聚合,与 TrajMod 互补。弱点二:轨迹几何仅用航向角与 OD 方向角,丢弃了公式 (1) 已定义的相对位移 $\Delta x_i,\Delta y_i$,也未用速度、高程、IMU 加速度;可把完整 waypoint 坐标做图卷积或序列编码后送入 TrajMod。弱点三:训练目标仅 InfoNCE,城市街区感知混淆严重,难负样本是主要瓶颈;可引入显式难负样本挖掘或预测轨迹形状的代理任务。弱点四:文本定位绝对精度太低(R@1 仅 2.52%),卫星图与抽象语言鸿沟巨大;可引入卫星图语义分割掩码或 POI 文本作辅助监督,或用大模型生成更细粒度空间关系描述。弱点五:评测局限于 SeqGeo-VL 内部,缺跨数据集泛化与真实机器人部署;可在 KITTI、BDD100K 上做迁移评测并在真实自动驾驶平台验证。

未来方向

作者明确提出的方向包括:扩展到更大规模、更广地理覆盖的数据集;探索更长的序列观测与更复杂的城市形态;把方法推广到完全无 GPS 的极端场景;结合位置先验在实用精度区间落地。基于本成果可延伸的方向我归纳为:第一,将 TrajMod 推广为通用的 "几何/运动条件化" 模块,应用到室内导航、AR 重定位、SLAM 闭环检测等任何需要自我中心–鸟瞰对齐的任务。第二,把视频–文本–卫星三元组训练扩展为视频–文本–音频–卫星等多模态,用更丰富的模态补足卫星图缺乏的细节。第三,结合具身智能的策略学习,让 TrajLoc 不仅做检索还能指导机器人主动选择观测视角以加速定位(主动感知)。第四,研究 TrajMod 的可解释性,分析哪些航向/方向组合最影响检索结果,从而给出可解释的定位证据。第五,探索无需轨迹几何监督的自监督版本,从视频自身估计相对运动作为弱监督信号,降低对 IMU 的依赖。第六,把方法与最近的空间感知基础模型(如 SpatialCLIP、SpatialRGPT)结合,进一步提升空间推理能力。

复现评估

复现评估整体较好。代码、模型权重与数据集已在 https://humblegamer.github.io/trajloc/ 发布。数据集细节披露充分:38,863 条三元组、80:20 划分、zoom level 20、约 7 帧/查询、文本平均约 129 tokens;标注流水线四阶段、所用模型(Qwen3-VL-8B、Qwen3-30B)与质量控制协议(400 条子集、OF/ST/RC 打分、91.8% 通过率)描述清楚。训练超参披露较完整:CLIP ViT-L/14、Adam 学习率 $1\times10^{-5}$、视频文本各 40 epochs batch 24、TrajMod 20 epochs batch 128。消融覆盖帧数、轨迹几何、协同训练、条件机制、位置先验等多维。挑战在于:训练三个 ViT-L/14 需可观算力(论文用 NSF 资助的 TGI RAILS 资源);部分基线引自原论文而非统一重训,骨干不一致可能影响公平性(作者已用 SeqGeo† 部分缓解);标注依赖特定版本开源大模型,迭代可能影响数据再生成一致性。整体属中高可复现度。