SULAND v2:面向 UAV/UGV 地表地雷检测的精修 RGB 数据集与域偏移目标检测基准 SULAND v2: A Refined RGB Dataset and Deep Learning Object Detection Benchmark for UAV/UGV-Based SUrface LANDmine Detection Under Domain Shift
精修 SULAND 标注并在 35 种检测器上系统评估 RGB 地雷检测的 OOD 鲁棒性。
前置知识
IoU(交并比)
Intersection over Union 衡量预测框与真实框的重合程度,定义为交集面积除以并集面积,取值 $[0,1]$。目标检测用 IoU 阈值判断一个预测是否算命中,例如 $\text{IoU} \geq 0.5$ 计为正确检测,论文中 mAP@50 即在此阈值下计算,mAP@50:95 则在 $0.50$ 到 $0.95$ 步长 $0.05$ 的多个阈值上平均。
本文反复讨论标注框定位质量,并用 Med. IoU、Med. ratio、%IoU<0.7 等指标量化 v1 到 v2 的几何修订,理解 IoU 才能看懂这些标注修订统计。
mAP(平均精度均值)
Mean Average Precision 是目标检测核心指标,先对每个类别按置信度排序绘制 PR 曲线求 AP,再对类别取平均。mAP@50 用宽松 IoU 阈值偏重召回与识别,mAP@50:95 用严格阈值偏重定位精度。论文同时报告二者,并辅以 precision/recall,给出全面评估。
全文所有性能比较都围绕 mAP@50、mAP@50:95、recall、precision 展开,不懂这些指标无法判断标注精修带来的 $+14.6\sim19.6$ 个百分点提升意味着什么。
IID 与 OOD / 域偏移(Domain Shift)
IID(in-distribution)指测试数据与训练数据同分布,OOD(out-of-distribution)指测试分布因地理位置、地形、光照、视角、目标外观等因素发生偏移。本文 IID 数据在意大利草地与碎石上采集,OOD 数据引入从意大利到美国的地理域偏移,并伴随植被、坡度、相机视角、距离、遮挡等额外变化。t-SNE 投影显示两类样本在 ImageNet 特征空间中明显分离。
本文核心论点是「IID 高精度不等于部署就绪」,全部结论建立在 IID/OOD 对照之上,不理解域偏移就读不懂为何要用两套评测协议、为何要谈排名翻转。
目标检测器家族(YOLO / Faster R-CNN / DETR)
一阶段检测器如 YOLOv8/YOLO11/YOLOv12/YOLO26 直接在特征图上回归框与类别,速度快;两阶段 Faster R-CNN 先由 RPN 生成候选区域再分类回归;基于 Transformer 的 RT-DETR、D-FINE、RF-DETR 用端到端集合预测。RF-DETR 还结合自监督 DINOv2 主干。论文评测 9 个家族共 35 种配置。
论文的基准横跨这些家族,要理解为何 RF-DETR-L 和 Faster R-CNN 在 OOD 上更鲁棒、而 YOLO 家族 IID 强但 OOD 跌得多,需要大致了解各家族的检测机制差异。
PFM-1 与 PMA-2 地雷
PFM-1 俗称「蝴蝶雷」(Butterfly),是一种彩色塑料外壳的散射式人员杀伤地雷;PMA-2 俗称「海星雷」(Starfish),也是塑料外壳的低金属地雷。二者外观小而隐蔽,易与石头、土块、植被混淆,是 RGB 可见光地表检测的典型挑战目标,也是 SULAND 数据集仅有的两个类别。
论文围绕这两类目标展开,所有类别级分析(per-class precision/recall)都针对 Butterfly 与 Starfish,理解目标视觉特性才能体会「小目标、视觉微妙、易被杂波混淆」这一任务难点。
研究动机
人道主义排雷极其缓慢、危险且资源密集,亟需遥感与计算机视觉提供决策支持。据 Landmine Monitor 2025,仅 2024 年地雷与战争遗留爆炸物就造成至少 6,279 人死伤,其中已知身份者中平民占 90%。UAV/UGV 搭载 RGB 相机成本低、重量轻、空间分辨率高,是地表地雷检测的现实选择。然而现有 RGB 地雷检测研究存在两个严重缺陷:一是绝大多数研究只评测同分布(IID)性能,忽略检测器在真实野外环境中遇到的地理迁移、土壤变化、植被季节变化、视角距离变化等域偏移;二是地表目标通常又小又隐蔽,极易与阴影、石块、土质纹理混淆,单点高 IID 精度根本无法证明部署就绪。更糟糕的是,公开的 UAV 低空 RGB 地雷数据集极为稀缺,受安全、准入和保密限制,每个数据集都对社区结论产生不成比例的影响,单个数据集的标注噪声足以扭曲整个研究领域的模型排名。
本文的目标是作者以 SULAND v1 为起点,目标是构建一个标注一致、可重复的 SULAND v2 基准,将「数据集精修」「基准验证」与「检测器对比」当作统一问题来处理。具体目标包括:(1)逐文件夹、逐帧审计 v1 全部发布标注,系统归类缺失标注、误标、定位偏差、可见性标准不一致、非代表性伪影、时序标注不一致以及 OOD 类别 ID 反转等七类问题;(2)在保留原图与原 IID/OOD 划分的前提下手动重新标注,得到标注实例从 10,843 增至 12,433 的精修版;(3)通过同版本与跨版本训练评估量化标注修订对 IID 与 OOD 性能的影响,并隔离类别 ID 反转这一因素;(4)在统一协议下横跨 9 个家族、35 种配置评测,弄清哪些检测器在域偏移下仍能保持目标回收能力,从而为 RGB 地雷检测给出可信的 IID/OOD 鲁棒性结论。
与已有工作不同的是,现有工作的独特切入角度是把「数据集质量本身」当作待评测对象,而非仅把数据集当训练/测试素材。以往研究要么只在 IID 上比较模型(Baur 等用 Faster R-CNN,部分留出测试 99.3% 到完全留出 71.5% 的大幅退化暗示对场景敏感),要么数据集规模小、不提供显式 OOD 划分(如 Drone Flyby 仅 390 样本、AMLID 无地理 OOD、MineInsight 无正式 RGB IID/OOD 划分)。作者首次把 SULAND 这一无价但带噪的稀缺数据集当作研究对象,既审计又精修又跨版本验证,把标注噪声从「真实检测器局限」中分离出来——例如仅用 v2 标注重打分同一批 OOD 预测,mean mAP@50 就从 10.1% 升到 35.0%,直接证明大量「泛化失败」其实是基准噪声而非模型无能。
核心方法
整体思路分三层。直觉上:在安全攸关的小目标检测任务里,基准的可靠性必须先于模型比较被证明,否则任何排名都不可信。技术路线因此是「审计→精修→跨版本验证→大规模基准评测」的闭环。第一步用自定义 Python 可视化脚本把作者提供的 YOLO 格式标注框叠加到每张图上,逐帧人工审计并记录问题;第二步把缺陷映射成七大类别,用 Label Studio 全量逐样本重标,三类审阅者多数投票通过接触印样(contact-sheet)做质控;第三步保留原图与划分,仅替换标注文件,得到 SULAND v2,随后导出 YOLO 格式并转 COCO 格式供实验;第四步设计同版本与跨版本矩阵,把训练标注与评测标注的耦合效应拆开,并隔离类别 ID 反转;最后在统一协议下训练 35 种检测器配置并统一用 Ultralytics 评测例打分,确保跨框架可比。
核心创新在于把标注修订的因果效应从模型能力中干净剥离,并用「同一批预测、不同标注打分」这一受控实验直接暴露基准噪声。具体做法是固定训练好的检测器,分别用 v1、v2 标注对同一组预测评分(如 $v1\to v1^*$ 表示用纠正类别 ID 后的 OOD 标注重打分),发现 mean OOD mAP@50 仅靠纠正类别映射就从 10.1% 跳到 35.0%。这与以往「换数据集就重新训一个模型」的做法有本质区别:它证明 SULAND v1 原报的大幅 OOD 退化有相当一部分源于类别 ID 反转这一基准 bug,而非检测器真的学不到泛化特征。此外,作者坚持保留原图与划分,使 v1/v2 可逐帧对齐,所有差异都只来自标注,这为因果归因提供了干净条件。
方法步骤详情
完整步骤如下:(1)选择 SULAND v1 作为对象,因其是少数提供显式 IID/OOD 划分且含真实 PFM-1、PMA-2 替代物的 RGB 数据集,IID 含草地碎石、晴阴影场景,OOD 引入意大利到美国的地理迁移。(2)用 ImageNet 预训练主干提特征做 t-SNE,独立于检测器地验证两分布存在可分性。(3)审计协议分两遍:第一遍逐帧在审计表里标记是否需修正并记录类别、错误类型、可见性、是否时序性;第二遍把缺陷归类为缺失/不完整标注、误检与传播错误、错位、可见性标准不一致、非代表性伪影、质量退化、类别 ID 反转七类。(4)精修原则:类别 0 全局统一为 PFM-1、类别 1 统一为 PMA-2;目标只要可见且类别可辨即标注;相邻帧交叉验证时序连续性;部分遮挡只标可见区域;含标记物但雷体可见则保留并收紧框;框贴可见外缘绘制。(5)质控:每条修订以 50 张裁剪接触印样排版,三位审阅者独立检视、多数投票通过。(6)跨版本实验:对 YOLOv8 五种尺度分别训 v1/v2,并在两种标注上评测,构成 $v1\to v1$、$v1\to v2$、$v2\to v1$、$v2\to v2$ 四组合,再对 OOD 预测做类别纠正重打分($v1^*$、$v2^*$)。(7)大规模基准:35 配置全部从 COCO 预训练权重微调,100 epoch(Faster R-CNN 50 epoch),batch 16(D-FINE-X/RF-DETR-L 降 8),种子 42,单卡 A100,按各家族默认优化器与分辨率,在 IID val 选 mAP@50:95 最优 checkpoint,最终在 IID test 与 OOD val 报告。所有非 Ultralytics 预测转统一格式后用同一套匹配规则打分。
技术新颖性
新颖性体现在三点。第一,首次对 SULAND 做系统审计、归类与精修,并把审计记录作为补充材料随数据集发布,使基准过程可追溯。第二,跨版本训练评测矩阵把训练标注与评测标注的耦合效应数学化地拆开:$v2\to v2$ 在 IID test 达 87.5%,而同样的 $v2$ 模型用 $v1$ 标注打分仅 43.0%,定量证明标注一致性差异足以解释约 44 个百分点——这远超通常模型改进幅度。第三,首次在统一 IID/OOD 协议下横跨一阶段、两阶段、Transformer 与开放词表四类范式评测 35 配置,并发现 IID 排名与 OOD 排名根本不同(YOLOv12-S IID 最强 0.908,RF-DETR-L OOD 最强 0.799),且模型规模增大并不一致提升 OOD 泛化,颠覆了「堆大模型就能更鲁棒」的直觉。
实验结果
核心发现可分四组。其一,标注精修效果巨大且一致:YOLOv8 五种尺度在 SULAND v2 上 IID test mAP@50 比在 v1 上高 $14.6\sim19.6$ 个百分点(如 Medium 从 69.2% 升到 88.8%),IID val 高 $10.3\sim16.4$ 个百分点;OOD 提升更夸张,从 $4.4\sim12.9%$ 升到 $30.7\sim48.6%$,其中 XLarge 从 4.4% 跃至 48.0%($+43.6$ pp)。其二,跨版本实验隔离因果:固定 v2 评测,训练标注从 v1 换 v2 使 IID test mean mAP@50 从 60.4% 升到 87.5%;固定 v2 训练模型,评测标注从 v2 换 v1 使 IID test 从 87.5% 跌到 43.0%;仅纠正 OOD 类别 ID 重打分,mean 从 10.1%($v1\to v1$)升到 35.0%($v1\to v1^*$),证明约 25 个百分点的「OOD 退化」其实源于类别 ID 反转这一基准 bug。其三,35 配置基准中 IID 最强为 YOLOv12-S 的 mAP@50=0.908、YOLO26-X 的 mAP@50:95=0.708;但 OOD 最强为 RF-DETR-L,mAP@50=0.799、recall=0.675、mAP@50:95=0.623、precision=0.883,其 IID→OOD 仅从 0.880 跌到 0.799,而 mAP@50:95 几乎不变(0.631→0.623);Faster R-CNN R-101/R-50 OOD mAP@50 也达 0.746/0.723;反观大多数 YOLO 配置 OOD mAP@50 低于约 0.53。其四,模型规模不是 OOD 鲁棒的可靠预测因子——同家族内更大配置并未一致超越小配置,鲁棒性更依赖架构与表示。类别级分析显示 OOD 下精度比召回更易保持,意味着检测器变得保守、漏检增多,对排雷这种漏检代价极高的任务尤其危险。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| YOLOv8 标注精修影响(IID test,各尺度) | mAP@50 | v2 上 84.7%–88.8%(Nano 到 X) | v1 上 68.4%–70.1% | +14.6 到 +19.6 个百分点 |
| YOLOv8 标注精修影响(OOD val) | mAP@50 | v2 上 30.7%–48.6% | v1 上 4.4%–12.9% | +17.8 到 +43.6 个百分点 |
| 类别 ID 反转纠正(仅重打分相同预测) | OOD mean mAP@50 | v1→v1* = 35.0%,v2→v1* = 38.2% | v1→v1 = 10.1%,v2→v1 = 10.5% | 约 +25 个百分点 |
| IID 最强配置(35 配置) | mAP@50 | YOLOv12-S = 0.908 | — | IID 排名第一 |
| OOD 最强配置 | mAP@50 / recall / mAP@50:95 | RF-DETR-L = 0.799 / 0.675 / 0.623 | 多数 YOLO 配置 OOD mAP@50 < 0.53 | IID→OOD mAP@50 仅降 0.081 |
| 两阶段 OOD 表现 | OOD mAP@50 | Faster R-CNN R-101 = 0.746,R-50 = 0.723 | — | 仅次于 RF-DETR-L 的强 OOD 鲁棒性 |
| v1 标注作为预测 vs v2 真值(IID 合并) | Precision / Recall / F1 | 62.1% / 51.1% / 56.1% | — | 量化两版本标注分歧的规模 |
局限与改进
作者明确承认的局限包括:(1)数据集仅含两类地表替代/惰性目标,主 OOD 评测限定在意大利到美国这一单一迁移,不能代表真实雷场的全部多样性;(2)结果可能无法直接迁移到其他地雷/未爆物类型、损坏或风化目标、密集排列、半埋、重度遮挡、季节性植被变化、不同相机系统或大不同高度视角;(3)RGB 仅限可见地表线索,无法处理全埋、重度遮挡或视觉不可辨目标;(4)精修虽遵循预设准则并经多审阅者质控,但本质仍以人工为主,对模糊、部分遮挡、弱对比目标存在主观判断,仍可能残留遗漏、定位不一致或类别错误,应视为「更一致的标注版本」而非「零误差真值」;(5)IID-OOD 差异的因素相互纠缠(地理迁移同时伴随地形、植被、光照、视角、目标呈现变化),t-SNE 只能作定性证据而非域散度的直接度量;(6)统一协议虽利于可比,但不一定对每个家族都是最优超参设置,FPS 依赖硬件软件实现应作比较性解读。我的额外观察是:35 配置中缺乏对每家族的受控消融(如固定主干换检测头),因此把 OOD 优势归因于「表示、多尺度、proposal、query 机制」仍属推测;且仅一个 OOD 域,无法检验排名在不同地理-季节迁移下的稳定性。
独立分析的弱点
弱点一:OOD 多样性不足。仅意大利→美国单一迁移,无法判断 RF-DETR-L 的 OOD 优势是普适还是恰好契合这一域。改进方向是引入多地理、多季节、多海拔、多相机几何的因子化测试集,每次只变一个条件,定位泛化失败来源。弱点二:标注仍以人工为主、缺量化标注者一致性。改进方向是引入 inter-annotator agreement(如 Cohen's κ)并发布版本化修订记录供社区持续校正。弱点三:架构归因未做消融。RF-DETR-L 用 DINOv2 自监督主干,Faster R-CNN 用 ResNet,YOLO 用标准主干,无法判定 OOD 优势来自主干、检测范式还是规模。改进方向是跨家族固定主干做受控消融。弱点四:仅在 F1 最优阈值报 precision/recall,与排雷「面向召回」的实际需求脱节。改进方向是补充面向召回的阈值、置信度校准、单位面积误报率等部署相关指标。弱点五:数据集严重类别不平衡(IID 仅约 20–23% 前景,OOD 约 79.5%),但未系统分析该不平衡对训练与排名的影响。改进方向是做平衡采样的对照实验。
未来方向
作者提出的未来方向:把基准扩展到更多地理区域、季节、海拔、相机几何、目标类型与可见度;做跨数据集评测以检验排名稳定性;用因子化测试集(每次变一个环境/采集条件)定位泛化失败源;方法学上研究域泛化、域自适应、测试时自适应、小样本学习、置信度校准与不确定性感知检测;用合成数据与 sim-to-real 扩充稀有目标与背景组合但需独立真实影像验证;将 RGB 与互补传感模态融合以超越可见地表线索。基于本文成果可延伸的方向:把 cross-version 重打分思路推广到其他带噪基准,形成「基准噪声审计」通用方法学;研究 RF-DETR-L/Faster R-CNN 为何 OOD 更稳,提炼出可迁移到 YOLO 的设计原则;构建「快速筛查 + 高鲁棒复核」的分层工作流并用本基准验证其端到端收益。
复现评估
复现性较高。数据集与代码均已公开:数据在 HuggingFace(SagarLekhak/SULAND v2 RGB Surface Landmine Dataset),包含原始 v1 标注、纠正类别 ID 的 v1 OOD 标注、精修 v2 标注及逐样本审计记录;代码在 GitHub(PrasannaPulakurthi/SULAND v2),含训练、评测与基准脚本。训练设置交代充分:35 配置均从 COCO 预训练权重微调,100 epoch(Faster R-CNN 50),batch 16(D-FINE-X/RF-DETR-L 降 8),种子固定 42,单卡 NVIDIA A100,各家族默认优化器与分辨率均列出,统一用 Ultralytics 评测例打分以保证跨框架可比,并附逐配置收敛曲线与「训练预算足够性」分析作为补充材料。主要门槛是算力:35 配置 × 100 epoch 在单 A100 上重跑成本不小,但参数量从 2.38M(YOLO26-N)到 135.16M(RF-DETR-L)跨度大,多数小配置个人可复现。主观标注环节难以完全复现,但审计记录与多审阅者质控提高了透明度。整体属于该领域可复现性较好的工作。
论文图表
展示两类目标雷的分割样例图:PFM-1「蝴蝶雷」呈薄翼片状,PMA-2「海星雷」呈圆饼带凸起。两雷体积小、外观朴素,颜色与泥土植被接近,直观说明为何这类小目标极易与背景杂波混淆。
理解论文任务前提必看:让读者建立对两类目标视觉特性的直觉,从而体会后续所有「小目标、视觉微妙、易混淆」讨论与类别级分析的物理基础。
用 ImageNet 预训练主干对 IID 与 OOD 各 3000 张样本提特征后做 t-SNE 投影,两簇在二维空间中明显分离,提供独立于任何检测器的视觉分布偏移证据。
为 IID/OOD 划分的合理性提供了检测器无关的定性支撑,是后续所有域偏移实验的前提依据。
按 IID train/val/test 与 OOD val 给出图数、前景/背景图数与标注实例数。例如 IID train 前景图从 5,234 增到 6,272、标注从 5,510 增到 6,714;总体标注从 10,843 增到 12,433(净增 14.7%);IID 前景占比约 20–23%,OOD 约 79.5%。
量化精修规模与前后景不平衡,是理解后续标注修订影响实验的基础数据。
给出各划分的 added/removed/tightened/class-fix 数量及 Med. IoU、Med. ratio、%IoU<0.7、%shrunk。IID train 加 3,134、删 1,930、收紧 3,580;IID 匹配框 Med. IoU 约 0.72–0.73,44–45% 的框 IoU<0.7,68–78% 变小;OOD val 3,162 处类别纠正、Med. IoU 0.82,说明 OOD 修订以类别纠正为主。
把精修拆成可量化的修订类型,证明精修不止「补漏」,还同时删误标、收框、纠类,是因果分析的关键支撑。
YOLOv8 N/S/M/L/X 同版本训测,IID val +10.3 到 +16.4 pp,IID test +14.6 到 +19.6 pp,OOD val +17.8 到 +43.6 pp。最有力的单表证据:标注质量对报出性能影响巨大。
直接量化标注精修的回报,是「基准可靠性」论点的核心数字证据。
四种训练-评测组合加 OOD 类别纠正重打分($v1^*$、$v2^*$)。Mean IID test:$v1\to v2$=60.4%、$v2\to v2$=87.5%;同一 v2 模型用 v1 标注仅 43.0%;OOD mean:$v1\to v1$=10.1%、$v1\to v1^*$=35.0%。
是全文方法论最关键的实验:把训练标注与评测标注的耦合效应拆开,并隔离类别 ID 反转,定量证明基准噪声可解释数十个百分点的「性能差异」。
35 配置的 mAP@50、mAP@50:95、recall、precision(IID/OOD 并列)加参数量与 FPS。YOLOv12-S IID mAP@50 最强 0.908;YOLO26-X IID mAP@50:95 最强 0.708;RF-DETR-L OOD 全面最强(0.799/0.623/0.675/0.883);Faster R-CNN R-101 OOD mAP@50=0.746。
全文主结果表,是所有 IID/OOD 排名、精度-速度折中、类别级讨论的数据出处,理解本文结论必读。