ReferTrack:先指代后跟踪的具身视觉跟踪方法 ReferTrack: Referring Then Tracking for Embodied Visual Tracking
将目标识别建模为索引候选框的单token选择,结合TVBI时序记忆实现单目具身跟踪
前置知识
具身视觉跟踪(Embodied Visual Tracking, EVT)
EVT 要求一个移动的智能体(如四足机器人或人形机器人)仅依赖机载视觉(通常是前向摄像头),持续跟随一个由自然语言描述的特定目标行人。每个时间步 $T$,给定语言指令 $L$ 和前向 RGB 观测流 $O_{1:T}$,智能体预测连续轨迹 $W_T$,每个航点 $w_i=(x,y,\theta)\in\mathbb{R}^3$ 表示地面坐标系下的自车位移和朝向变化。评判标准通常是智能体能否将目标维持在 1-3 米的跟随距离内并保持在视野中。
本文针对的任务正是 EVT,理解其评测设定(STT/DT/AT 三个分裂、SR/TR/CR 三个指标)才能理解论文实验的意义。
视觉-语言-动作模型(Vision-Language-Action, VLA)
VLA 模型将感知(视觉)、理解(语言)和控制(动作)统一进一个策略网络,借鉴大语言模型(LLM)的下一个 token 预测范式:把图像编码为视觉 token,与语言 token 拼接后输入 LLM,再由动作头解码出连续控制量。在 EVT 中,VLA 把目标识别和轨迹规划整合成单一端到端策略,代表方法如 TrackVLA、NavFoM、TrackVLA++。其优势是端到端联合优化,劣势是识别误差会直接污染规划。
ReferTrack 本身就是一个 VLA 模型(基于 Qwen3-4B 骨干),其创新正是针对现有 VLA 在目标识别这一环节的缺陷,理解 VLA 范式才能看清它的定位。
思维链推理(Chain-of-Thought, CoT)
CoT 指在模型给出最终答案(如动作)之前,先显式产生一个中间推理步骤。在 EVT 中,TrackVLA++ 在动作预测前引入了一个极坐标空间感知 token 作为 CoT,用抽象空间编码来表示目标位置。这种抽象 CoT 的好处是统一了空间表示,但缺点是与图像空间检测脱节、难以直接监督,在拥挤场景下视觉定位不准。
ReferTrack 的核心创新 Refer-CoT token 正是对这种抽象 CoT 的替代——它把推理从抽象空间拉回到图像空间的索引候选框选择,这是理解本文动机与方法的关键。
指代表达理解与候选目录(Referring & Candidate Catalog)
指代表达理解(Referring Expression Comprehension, REC)指根据自由形式的自然语言在图像中定位目标物体。受 RexSeek 等工作启发,本文把检测到的前向视图中的行人组织成一个索引候选目录 $C_T=\{\langle ped_1\rangle,\ldots,\langle ped_K\rangle,\langle NO\ EXIST\rangle\}$,每个候选对应一个由 MLP 投影器 $P_{bbox}$ 编码的归一化边界框 $b\in[0,1]^4$。模型从这些离散候选中选一个最匹配语言指令的,从而把识别问题转化为约束化的多选题。
候选目录是 ReferTrack 把识别任务'多选题化'的接口,也是 Refer-QA 共训练能迁移到在线跟踪的统一输入布局,贯穿全文方法设计。
时序-视角-边界框指示符(TVBI)
NavFoM 提出 TVI(temporal-viewpoint indicator)token 来组织视觉历史,明确编码时空上下文。ReferTrack 在此基础上扩展出 TVBI,在 TVI token 上叠加被指代目标的边界框几何特征:$E_{TVBI}(t)=E_{TVI}(t)+P_{bbox}(b_t)$,其中 $b_t$ 为第 $t$ 帧归一化目标框。若目标不可见则置 $b_t=[0,0,0,0]$ 作为'缺席哨兵'。这样就把通用的时空索引变成了目标条件化的记忆,持续注入被跟踪目标的运动线索。
TVBI 是 ReferTrack 把'指代决策'传播到几何历史、闭环跟踪的核心机制,也是消融实验中证明稳定目标跟随的关键组件。
研究动机
具身视觉跟踪(EVT)在拥挤动态环境中依赖两项紧密耦合的能力:目标识别(判断哪个行人匹配语言指令)和轨迹规划(生成无碰撞且保持跟随距离的运动)。传统流水线把两阶段割裂,视觉基础模型识别误差会逐级累积并污染规划。近期 VLA 模型虽统一了二者,但以 TrackVLA++ 为代表的方法在动作预测前引入的 CoT 推理运行在抽象空间潜变量(如极坐标 token)中,这类表示难以直接监督,且与图像空间的检测结果对齐薄弱——在复杂拥挤场景下视觉定位不准。同时,依赖大规模通用导航数据共训练或昂贵的强化学习(RL)来弥补识别能力,成本高昂且数据效率低。本文 Table 1 显示,即便用 7B 参数、三到四相机、甚至 RL 精修的方法(如 CoMaTrack、ABot-N0),在识别困难的 DT/AT 分裂上表现仍有限。
本文的目标是本文旨在用一个 4B 参数、仅前向单目相机、且仅做监督微调(SFT,不依赖 RL)的紧凑 VLA 策略,在 EVT-Bench 上取得单目视角下的 SOTA 性能,尤其要在目标消歧最困难的 Distracted Tracking(DT)和 Ambiguity Tracking(AT)分裂上大幅超越现有方法。具体目标是:让目标识别变得可解释、可监督、与 VLM 的视觉定位机制天然对齐,并通过时序记忆保持长期稳定跟踪,最终在真实四足机器人(Unitree Go2)和人形机器人(G1)上验证 sim-to-real 迁移能力。
与已有工作不同的是,本文的独特切入角度是把目标识别从'抽象空间 CoT'重构为'图像空间索引候选框的单 token 选择'——即先指代后跟踪。这本质上把识别变成了一个约束化的多选题,既与检测器天然输出的 bbox 表示对齐,又便于直接监督,还解锁了稀缺跟踪轨迹之外的监督来源:网络上有海量指代/定位数据,机器人与自动驾驶领域有大量带行人标注的具身视频。基于此,作者用同一 SYNTH-PEDES ReID 数据集(与 TrackVLA/TrackVLA++ 相同以保证公平)构造 Refer-QA,让静态问答中学到的指代能力迁移到动态在线跟踪,这是区别于以往专用 EVT 方法的核心切入点。
核心方法
ReferTrack 的直觉是:与其让模型在难以解释的抽象空间里推理目标位置,不如让模型像人一样'先用手指认'——从当前前向视图检测到的若干候选行人中,选出一个最匹配语言指令的索引框,再据此规划轨迹。技术上它是一个双分支 VLA:导航分支用 SigLIP+DINOv2 双视觉编码器经网格池化得到细 token $V^{fine}\in\mathbb{R}^{64\times C}$ 和粗 token $V^{coarse}\in\mathbb{R}^{4\times C}$,维持最近 $H$ 帧的滑动窗口,并用 TVBI token 在历史帧注入目标框几何;问答分支复用同一候选目录接口。检测器(YOLO11+ByteTrack)给出当前帧行人,按框面积排序取前 $K$ 个,加一个永久的虚拟索引 $\langle NO\ EXIST\rangle$ 组成候选目录。语言 token、目录 token、组织后的视觉 token 送入 Qwen3-4B 骨干,分两步前向:先产生 Refer-CoT token,再产生动作 token 供 MLP 动作头解码 $M$ 个航点。
核心创新点是'Refer-CoT'——把目标识别压成一个对索引 bbox 词表 $\{\langle ped_1\rangle,\ldots,\langle ped_K\rangle,\langle NO\ EXIST\rangle\}$ 的单 token 分类决策,而非像 TrackVLA++ 那样产生一个抽象极坐标 token。这一设计有三个本质区别:其一,识别结果直接落在图像空间的检测框上,与 VLM 的定位机制天然对齐,避免抽象瓶颈;其二,它是一个紧致、可直接用交叉熵监督的约束化多选题,监督信号清晰;其三,被选中的目标框会被推入容量 $H-1$ 的 FIFO 队列,并通过 TVBI token 注入未来历史视觉流($E_{TVBI}(t)=E_{TVI}(t)+P_{bbox}(b_t)$),从而把'指代决策'传播成'几何记忆',闭环跟踪。当前帧细 token 故意只用 TVI 不注入框,迫使模型凭历史 TVBI 与原始视觉自主定位,增强表示鲁棒性。
方法步骤详情
完整流程分四步。步骤1:对前向帧运行 YOLO11+ByteTrack 检测,行人按框面积取前 $K$ 个并加 $\langle NO\ EXIST\rangle$,每个候选为标识符 token 加 bbox token($b\in[0,1]^4$ 经 $P_{bbox}$ 编码)组成目录 $C_T$。步骤2:SigLIP+DINOv2 双编码器经网格池化得 64 个细 token 与 4 个粗 token,维持最近 $H$ 帧滑动窗口,历史帧用 TVBI 注入目标框、当前帧细 token 仅用 TVI。步骤3:两阶段 LLM 推理——$E^{refer}_T=\text{LLM}(L,C_T,E_{V_{1:T}})$ 产生单 token Refer-CoT($\langle NO\ EXIST\rangle$ 表示目标不在视野),再 $E_{A_T}=\text{LLM}(L,C_T,E_{V_{1:T}},E^{refer}_T)$ 经动作头解码 $W_T$。步骤4:把选中框推入容量 $H-1$ 的 FIFO 队列供下一时间步。训练全参数微调,$\mathcal{L}=\alpha\mathcal{L}_{traj}+\mathcal{L}_{refer}+\mathcal{L}_{text}$,$\alpha=10$,其中 $\mathcal{L}_{traj}$ 为航点 MSE、$\mathcal{L}_{refer}$ 为目标索引交叉熵,并随机往队列注入错误框以模拟跟踪误差。
技术新颖性
技术新颖性体现在四方面。其一,提出'先指代后跟踪'范式,把识别重构为对图像空间索引 bbox 的单 token 选择(Refer-CoT),与 TrackVLA++ 的抽象极坐标 CoT 形成本质区别,使推理可解释、可监督、与检测器对齐。其二,提出 TVBI token,把 NavFoM 的 TVI 时空索引升级为目标条件化记忆,将'指代决策'闭环传播到几何历史。其三,提出统一的索引候选目录接口,使导航数据与 Refer-QA 共享相同输入布局,1:1 共训练(各 1.3M 样本)后静态问答的指代能力可迁移到动态跟踪,缓解了稀缺闭环导航数据的瓶颈。其四,工程上证明仅 4B 骨干、纯 SFT、单目前向相机的紧凑策略,即可在识别困难分裂上超越多相机甚至 RL 精修的方法,挑战了'堆相机/堆参数/上 RL'的传统提升路径。
实验结果
核心结果在 Table 1 的 EVT-Bench。ReferTrack(4B、SFT、单目前向相机)取得 STT 89.4/92.5/1.6(SR/TR/CR)、DT 73.3/81.8/7.6、AT 74.1/85.7/7.7,整体最强。对比最强单目基线 TrackVLA++(7B),DT 上 SR +6.8、TR +13.0;AT 上 SR +22.9、TR +22.3。更值得注意的是,单目 ReferTrack 在 AT(74.1)甚至超越全部多相机基线(ABot-N0 67.3、CoMaTrack 57.5、TrackVLA++ 多目 55.9),DT(73.3)也超过 ABot-N0、NavFoM 多目方法,证明目标消歧为主瓶颈时显式指代比扩相机更有效。消融(Table 2,DT):完整 73.3/81.8/7.6;真值框 oracle 81.5/84.7/3.6,接近专家策略 85.1 SR,说明识别是主瓶颈;去 Refer-CoT&TVBI 暴跌至 55.7/71.4/9.4,仅去 TVBI 降至 70.4/80.8/7.5。真实部署在 Go2 与 G1 上 10.6 Hz 运行(检测 12 ms),验证 sim-to-real。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Single-Target Tracking(单目标跟踪,EVT-Bench,单目前向相机) | SR↑ / TR↑ / CR↓ | 89.4 / 92.5 / 1.6 | TrackVLA++(7B,单目)86.0 / 81.0 / 2.10;NavFoM 85.0 / 80.5 / - | SR +3.4、TR +11.5 相对 TrackVLA++ |
| Distracted Tracking(干扰跟踪,单目前向相机) | SR↑ / TR↑ / CR↓ | 73.3 / 81.8 / 7.6 | TrackVLA++(单目)66.5 / 68.8 / 4.71;RL 精修的 VLingNav 67.7 / 73.5 / 5.5 | SR +6.8、TR +13.0 相对 TrackVLA++;并超过多数多相机基线 |
| Ambiguity Tracking(歧义跟踪,单目前向相机) | SR↑ / TR↑ / CR↓ | 74.1 / 85.7 / 7.7 | TrackVLA++(单目)51.2 / 63.4 / 15.9;TrackVLA++ 多目 55.9 / 63.8 / 15.1 | SR +22.9、TR +22.3 相对 TrackVLA++ 单目;并超越全部报告的多相机基线 |
| 消融:识别 vs 规划瓶颈(DT 分裂,oracle 变体) | SR↑ / TR↑ / CR↓ | TVBI w/ GT bbox oracle 81.5 / 84.7 / 3.6(专家策略上限 85.1 SR) | 完整 ReferTrack 73.3 / 81.8 / 7.6;去 Refer-CoT&TVBI 55.7 / 71.4 / 9.4 | oracle 与专家仅约 3.6 SR 差距,证明识别是主瓶颈 |
局限与改进
作者承认及可观察的局限包括:第一,DT 上 oracle(真值框)与专家策略仍有约 3.6 SR 差距,识别错误仍是主瓶颈,说明检测器或 Refer-CoT 的判别精度仍有上限(消融显示完美识别可再提升约 8.2 SR)。第二,依赖离线检测器 YOLO11+ByteTrack 构造候选目录,检测遗漏或多人重叠时候选质量受限;若场景行人超过 $K$ 个,只能按框面积保留前 $K$ 个,远处或被遮挡的小目标可能被丢弃。第三,主要在 EVT-Bench 的行人跟踪场景和 SYNTH-PEDES 行人 ReID 数据上验证,对非行人目标、极端光照/天气、剧烈运动的泛化未充分检验。第四,DT 的 CR(7.6)和 AT 的 CR(7.7)高于 TrackVLA++(4.71/15.9 中 DT 较低),碰撞率并非全面最优,反映纯 SFT 而无 RL 在避障精细度上的不足。第五,真实世界仅给出定性结果(10.6 Hz、检测 12 ms),缺乏定量成功率与失败模式分析。
独立分析的弱点
第一,候选目录对检测器高度敏感。改进方向是用更强的开放词表检测/定位模型,或让模型端到端联合学习检测与指代,降低对外部 YOLO11+ByteTrack 的依赖。第二,TVBI 记忆仅维护最近 $H-1$ 帧 FIFO 队列,对目标长时间消失后再出现、长程身份一致性仍吃力。改进方向是引入可读写的显式记忆模块(如记忆层、外部记忆库)或更强的 ReID 指纹嵌入。第三,碰撞率(CR)不是最优,纯 SFT 缺乏避障奖励。改进方向是在 SFT 基础上叠加轻量 RL(如 PPO)专门优化 CR,或引入碰撞感知的安全动作头。第四,仅面向行人跟踪,扩展性有限。改进方向是把 Refer-QA 从行人 ReID 扩展到通用目标指代数据,验证对物体/车辆的迁移。第五,真实部署缺少定量评测。改进方向是建立真实 EVT benchmark 并报告 SR/TR/CR 与失败案例。
未来方向
作者明确提到将公开 ReferTrack 代码(https://github.com/MedlarTea/referTrack)以促进语言引导 EVT 研究,并把核心思想归纳为:显式图像空间指代加时序框记忆可弥补单目相机覆盖不足、缓解对昂贵 RL 的依赖。基于此可延伸的方向包括:其一,把候选目录接口推广到更多机器人场景(如自动驾驶跟随、仓储物流人机协作),验证指代-跟踪范式的通用性;其二,探索如何把网络海量指代/定位数据与机器人具身视频更系统地注入训练,进一步降低对闭环导航数据的依赖;其三,研究 RL 与 Refer-CoT 的结合——用识别信号作为 RL 奖励,既保留 SFT 的可解释指代又提升避障与长程性能;其四,把 TVBI 记忆扩展为可微分长程记忆,处理目标长时间遮挡与重识别;其五,将'先指代后跟踪'思想迁移到多智能体跟随、社交导航等更复杂任务。
复现评估
复现性总体较好但存在门槛。作者声明将开源代码(GitHub: MedlarTea/referTrack),架构基于开源的 OpenTrackVLA 代码库,LLM 骨干为 Qwen3-4B,检测器为 YOLO11+ByteTrack,均为公开组件,关键超参与实现细节放在附录。数据方面,导航数据为 1.3M 条 EVT-Bench 训练集专家轨迹(Habitat 3.0 模拟器内),Refer-QA 为 1.3M 条由公开 SYNTH-PEDES ReID 数据合成,数据来源清晰且与 TrackVLA/TrackVLA++ 相同以保证公平对比。训练采用两阶段 SFT 全参数微调,计算开销不小(需微调 4B LLM 外加视觉/动作模块),具体 GPU 规模与训练时长论文正文未充分披露,复现需较大算力。评测依赖 Habitat 3.0 与 EVT-Bench 标准 suite,指标(SR/TR/CR)定义明确,可复现。真实世界部署仅给出定性结果与频率(10.6 Hz、检测 12 ms/步),缺乏可复现的定量协议。综合看,算法与软件栈可复现,但完整训练复现需相当算力与工程量。
论文图表
该表是核心结果表,对比单目前向相机设定下 ReferTrack 与 IBVS、PoliFormer、EVT、Uni-NaVid、NavFoM、VLingNav、Qwen-RobotNav、TrackVLA、TrackVLA++ 等方法,并列出 ABot-N0、CoMaTrack、TrackVLA++ 等多相机参考。ReferTrack 以 4B/SFT 取得 STT 89.4/92.5/1.6、DT 73.3/81.8/7.6、AT 74.1/85.7/7.7,整体最优;单目 AT 甚至超越所有多相机基线。
该表承载论文最核心的定量结论(SR/TR/CR 全面领先、单目超多目、纯 SFT 超 RL),是评估方法有效性的决定性证据,对理解结果章节至关重要。