面向边缘部署的热红外无人机集群自适应运动学跟踪 Edge-Aware Thermal Infrared UAV Swarm Tracking
用自适应运动学卡尔曼滤波实现热红外无人机集群的边缘友好实时跟踪。
前置知识
卡尔曼滤波 (Kalman Filter, KF)
一种对线性高斯动态系统进行递归状态估计的最优算法,由预测步 $\hat{x}_{k|k-1}=F_k\hat{x}_{k-1|k-1}$ 与更新步 $\hat{x}_{k|k}=\hat{x}_{k|k-1}+K_k(z_k-H_k\hat{x}_{k|k-1})$ 组成,通过卡尔曼增益 $K_k$ 在运动预测与观测之间按不确定度加权融合。本文所有改进都围绕 KF 展开。
本文的核心创新 AKKF 就是在标准线性 KF 之上做状态相关的自适应改造,不读懂 KF 的预测-更新循环就无法理解 AAMD、PAVB、DMNE 三个组件到底改了什么。
Tracking-by-Detection (TBD) 范式
多目标跟踪的主流框架,先用目标检测器逐帧输出边界框,再用数据关联模块(如 ByteTrack、BoT-SORT)将跨帧检测框串成轨迹。检测器通常为 YOLO/DETR 系列,关联模块内部普遍嵌一个 KF 做运动建模。
本文实验的整条流水线就是 TBD:检测器选 YOLOv12/YOLO26/RF-DETR,关联器用 BoT-SORT,再把其内部的 KF 替换为 AKKF。理解这一嵌套结构才能看懂消融实验。
HOTA 指标
Higher Order Tracking Accuracy,一种把检测质量(DetA)与关联质量(AssA)几何平均的高阶跟踪评价指标,相比 MOTA、IDF1 更能反映身份保持能力。本文在 BSB 排行榜上主要以 HOTA 作为排序依据。
论文中所有主结果(如 RF-DETR Nano 1280 的 0.8437、TFPS 的 0.825405)都以 HOTA 报告,必须知道这是越高越好的综合跟踪分数才能正确解读提升幅度。
热红外 (TIR) 成像
通过捕捉物体自身发射的热辐射形成图像,在夜间、雾天、烟尘等可见光失效场景下仍能感知目标,但分辨率低、对比度弱、易受热杂波干扰,无人机目标在画面中往往只有几个像素。
TIR 的低外观线索、频繁遮挡、热杂波误检正是本文 TFPS、DMNE 等组件的直接动机,论文反复强调这是区别于普通 RGB 跟踪的关键场景。
研究动机
热红外(TIR)成像是无人机集群在夜间、恶劣天气等可见光失效场景下保持感知的关键手段,但在边缘设备上实现实时多目标跟踪极其困难:目标只有几个像素、外观线索极少、遮挡频繁、机动剧烈。现有的 Anti-UAV 系列基准驱动了大量方法,但它们几乎只追求精度,忽视真实部署所需的算力约束。在 BoT-SORT 等主流关联器中承担运动建模的标准卡尔曼滤波(KF)虽然算力友好,但其恒定速度假设在无人机高速机动和热传感器抖动下经常失效,导致轨迹漂移;而扩展卡尔曼滤波(EKF)、无迹卡尔曼滤波(UKF)等非线性变体虽更鲁棒,却因逐目标计算开销过大而极少被边界框 MOT 采用。这就造成精度与效率之间长期缺少兼顾的方案。
本文的目标是作者的目标是设计一条面向边缘部署的在线跟踪流水线,在几乎不增加计算开销的前提下,把标准线性 KF 升级为能够感知目标状态的‘自适应运动学卡尔曼滤波’(AKKF),并通过瞬态误检抑制(TFPS)和运动学预测滑行两项工程组件,改善 TIR 场景下轨迹的连续性与可靠性。更具体地,作者希望在公开的 BSB(Beyond Strong Baseline)基准上首次系统刻画不同检测架构、不同输入分辨率在精度(HOTA)与算力(FPS、显存)之间的权衡,为未来的真实边缘部署提供可参考的工程坐标,而非单纯刷榜。
与已有工作不同的是,本文的独特切入角度在于‘不换框架、只换运动模型’:既不像 KalmanNet 等工作那样用神经网络重写状态估计器引入额外算力,也不像 EKF/UKF 那样走非线性路线,而是在保持线性 KF 闭式递推结构的同时,让转移矩阵 $F_k$ 与测量协方差 $R_k$ 变成关于当前状态的函数 $F_k=F_k(x_{k-1})$、$R_k=R_k(z_k)$。这种状态相关的轻量自适应恰好填补了‘恒定速度太弱、非线性滤波太重’之间的空白。此外,作者把‘精度—算力权衡’本身作为一等公民纳入评估,这是已有 TIR UAV 跟踪基准所缺乏的视角。
核心方法
整体沿用 Tracking-by-Detection 范式:前端检测器(YOLOv12、YOLO26 或 RF-DETR)逐帧输出边界框,后端用 BoT-SORT 做数据关联,作者将其内部的标准 KF 替换为 AKKF,并在流水线层面追加 TFPS 与预测滑行两个组件。直觉上,无人机目标的运动学行为强依赖于它当前被观测到的状态——目标越小越可能在遮挡中漂移,目标正在远离时尺寸会塌缩,长宽比异常往往是热杂波误检。AKKF 正是把这些状态信号(面积、尺寸、长宽比)反馈到滤波器参数中,形成闭环自适应。状态向量定义为 $x_k=[x_c,y_c,w,h,v_x,v_y,v_w,v_h]^{\top}$,测量 $z_k=[z_{x_c},z_{y_c},z_w,z_h]^{\top}$,帧间隔 $\Delta t=1$。
核心创新是‘状态相关的运动学建模’:令转移矩阵与测量协方差都成为状态/测量的函数,即 $F_k=F_k(x_{k-1})$、$R_k=R_k(z_k)$。这与已有方法的本质区别在于:所有自适应项都以解析闭式直接改写 KF 的系数,不引入迭代优化、不引入神经网络,因此计算复杂度仍是 $O(n^3)$ 级别的线性 KF,却能在长遮挡、远离、热杂波三种典型失败模式下显著改变滤波器行为。这种‘把领域知识编码进线性滤波器系数’的思路,是对 EKF/UKF/KalmanNet 路线的另一种轻量回应。
方法步骤详情
完整流程包含五个步骤。第一步检测:YOLOv12/YOLO26/RF-DETR 输出边界框 $z_k$。第二步 TFPS:仅输出经时序确认的轨迹,滤除一帧即逝的热杂波误检,使基线 HOTA 从 0.82357 升至 0.825405。第三步 AKKF 预测:用 $F_k\hat{x}_{k-1|k-1}$ 与 $F_k P_{k-1|k-1}F_k^{\top}+Q_k$ 推先验,转移矩阵被三个组件改写——AAMD 把位置速度保持系数换成 $(1-D_{xy})$,$D_{xy}=\alpha A_{box}/(A_{box}+\beta)$,目标越小阻尼越强;PAVB 对尺度速度施加 $D_w=\gamma/\max(w(k-1),\epsilon)$、$D_h=\gamma/\max(h(k-1),\epsilon)$ 的制动,防止远离目标发生尺度塌缩;DMNE 按异常因子 $\rho=1+\kappa(|a_{meas}-a_{pred}|/a_{pred})^2$ 放大测量协方差 $R_k(z_k)=\rho R_k$,长宽比异常时让预测主导。第四步关联与更新:沿用 BoT-SORT 标准流程,命中检测时按 $\hat{x}_{k|k}=\hat{x}_{k|k-1}+K_k(z_k-H_k\hat{x}_{k|k-1})$ 更新。第五步预测滑行:若第 $k$ 帧无有效关联则跳过更新,令 $\hat{x}_{k|k}=\hat{x}_{k|k-1}$、$P_{k|k}=P_{k|k-1}$ 维持轨迹,滑行帧数 $\tau_{coast}=1$。
技术新颖性
新颖性体现在三处。第一,AAMD 借鉴空气动力学阻尼模型,把目标面积映射为位置速度衰减系数,这是首次把‘目标尺度 → 运动可信度’这一物理直觉显式编码进 KF 转移矩阵。第二,PAVB 针对‘远离导致尺度塌缩’给出解析制动项,把尺度速度的保持项与上一帧尺寸反相关,是对恒定尺度速度假设的直接修补。第三,DMNE 把‘长宽比一致性’转化为测量噪声放大因子 $\rho$,在不修改检测器的前提下抑制热杂波导致的几何不一致检测。三者都是对线性 KF 系数的闭式重写,整体不增加非线性求解开销,这是与 KalmanNet、EKF 路线的关键区分点。此外,把‘精度—算力权衡’作为一等评估维度并量化揭示‘检测-跟踪悖论’,也是该领域少见的工程视角。
实验结果
核心发现可归纳为五点。其一,TFPS 单独就把基线 HOTA 从 0.82357 提升到 0.825405,说明一帧即逝的热杂波误检危害显著。其二,主结果表显示 RF-DETR Nano 在 1280 分辨率下取得最高 HOTA=0.8437,AP@50:95=0.435,推理峰值显存仅 1.144GB;而 YOLOv12/YOLO26 即便 AP 更高(如 YOLOv12m 1280 达 0.483),HOTA 反而更低(0.713188),直接暴露‘检测-跟踪悖论’。其三,消融表显示完整 AKKF(AAMD+PAVB+DMNE 全开)在所有跟踪指标上最优,HOTA 达 0.826606、MOTA 0.636284、IDF1 0.688019,相比基线 HOTA 0.826116 有提升,但 FPS 从 132.03 跌到 94.92。其四,单组件贡献都很小(HOTA 增量 0.00004–0.0004 量级),但组合后稳定提升,说明三组件作用互补。其五,预测滑行实验表明标准 KF 与 AKKF 都在 $\tau_{coast}=1$ 时达峰,多帧滑行反降,提示长时间外推会失稳。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| TIR 多无人机跟踪(HOTA) | HOTA ↑ | RF-DETR Nano 1280:0.8437 | YOLOv12m 1280 + BoT-SORT:0.713188 | 绝对提升约 0.13 |
| TFPS 误检抑制(HOTA) | HOTA ↑ | TFPS 后:0.825405 | RF-DETR Nano 640 原始:0.82357 | +0.001835 |
| AKKF 消融(HOTA) | HOTA ↑ | AAMD+PAVB+DMNE:0.826606 | 标准 BoT-SORT+TFPS:0.826116 | +0.00049 |
| AKKF 消融(IDF1) | IDF1 ↑ | 完整 AKKF:0.688019 | 基线:0.687265 | +0.000754 |
| 效率(FPS) | FPS ↑ | 完整 AKKF:94.92 | 基线 BoT-SORT:132.03 | 代价 -28% |
局限与改进
作者自承的局限主要有三:一是尽管算力更友好,FPS 仍受检测器主导,真正部署到 Jetson 等边缘设备还需做模型压缩;二是 HOTA 提升幅度在绝对值上很小(约 0.0005 量级),实用价值需更多场景验证;三是仅基于 BSB 单一基准评估,泛化性存疑。我额外观察到:实验硬件是 Intel i7-12650H + RTX 4050 笔记本 GPU + 24GB 内存,并非典型边缘 SoC,‘edge-aware’这一标签更多是相对 H100 而言;消融表中 AAMD/PAVB/DMNE 单独开启时 HOTA 增量极小,统计显著性未讨论;超参数 $\alpha,\beta,\gamma,\kappa,\tau_{coast}$ 的敏感性也未系统给出,复现者需要自行调参。
独立分析的弱点
第一,AKKF 三组件的 HOTA 增益量级太小($10^{-4}$),在 BSB 测试集仅 98 条序列、1950 个框的规模下,很可能落在噪声内,建议补充 bootstrap 置信区间或跨多种子显著性检验,并在更大规模 TIR 数据集(如 Anti-UAV410)上复测。第二,‘边缘’定义偏宽:RTX 4050 笔记本 6GB 显存与真实 Jetson Orin Nano(8W/16GB 共享)差距大,FPS 94.92 主要被检测器拖累,AKKF 自身 CPU 开销占比未单独报告,应拆分并上 Jetson 实测。第三,超参数 $\alpha,\beta,\gamma,\kappa$ 缺乏敏感性曲线,工程落地者无从定标,应给出 HOTA-超参曲线及推荐取值。第四,未与 KalmanNet、Adaptive KalmanNet、GSP-KalmanNet 等数据驱动 KF 同台对比,难以判断‘解析自适应 vs 学习自适应’孰优。
未来方向
作者明确指出三个方向:模型剪枝/压缩(引用 Isomorphic Pruning、DepGraph 等)以把检测器压到边缘可承受的算力;更充分地利用时序信息做运动建模,因为在 TIR 下外观线索匮乏,时间是少数可挖掘的信号;在专用边缘设备上完成端到端验证。基于成果可延伸的方向还包括:把 DMNE 的长宽比异常因子推广为多维几何一致性度量(结合热强度、运动方向一致性);用学习方式离线拟合 $\alpha,\beta,\gamma,\kappa$ 而非手工设定;将预测滑行与 ReID 外观线索融合,突破 $\tau_{coast}=1$ 的限制;在 Anti-UAV、Anti-UAV410、Hit-UAV 等多基准上验证 AKKF 的跨数据集泛化能力。
复现评估
复现友好度中等偏上。有利因素:BSB 基准公开可下载,训练/测试切分(102/98 序列、77293/74537 帧)与 HOTA 评估协议在论文中明确给出;所用检测器 YOLOv12、YOLO26(Ultralytics)、RF-DETR 均为开源主流模型;硬件配置详尽(H100 80GB 训练,i7-12650H + RTX 4050 6GB 笔记本用于消融),训练 batch、峰值显存、训练时长(如 RF-DETR Nano 1280 训练 17:12:11)均有记录。不利因素:AKKF 与 TFPS、预测滑行的实现代码是否开源论文未明确提及,超参数取值未完整列出;AKKF 的 FPS 测量是离线 pipeline(截断两位小数)与在线 pipeline 的差异(0.8271 vs 0.8274)说明存在工程细节差异,复现者需仔细对齐。整体看,懂 BoT-SORT 与 KF 的工程师可在一两周内复现主结果,但精确复现消融表的小幅提升需要花精力调参。
论文图表
横轴为在线吞吐 FPS,纵轴为 HOTA,气泡大小代表算力占用,红色虚线标出 edge-aware 阈值,浅绿色区域为优选工作区。图中把不同检测器+AKKF 的配置画在同一坐标系,直观展示 YOLO26n@640 在精度-吞吐权衡上优于 YOLOv12n@640。
这张图是整篇论文‘精度-效率权衡’主旨的浓缩,理解它就理解了 edge-aware 的定义和论文核心卖点。