OVEarth-Bench:面向开放词汇遥感感知的类别广度与查询多样性评测基准 OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation
首个联合评测遥感类别广度与查询多样性的开放词汇基准
前置知识
开放词汇感知 (Open-Vocabulary Perception)
指模型能用自然语言描述的任意概念去定位图像区域,而不被固定标签集束缚。它依赖 CLIP 等视觉-语言对齐表示,把文本编码与图像 patch 编码做相似度匹配,从而支持训练时未见过的类别名词。在遥感场景下,这意味着用户可直接查询「直升机停机坪」「定日镜」等长尾概念。
本文核心就是评测这种「真正开放」的能力,理解它才能明白为何窄类集排行榜不可靠。
多模态大语言模型分割 (MLLM-based Segmentation)
用多模态大模型(如 LISA、Sa2VA、UniPixel)联合处理图像与语言查询,再通过 [SEG] token、掩膜解码器或坐标 token 序列生成像素级掩膜。相比纯对比学习的密集预测,它能理解组合式空间关系与隐式功能描述,因此对指代表达与推理查询更友好。
论文最核心结论是 MLLM 类方法占据排行榜绝大部分榜首,理解这一范式才能解读结果。
水平/旋转边界框 (HBB / OBB)
HBB (Horizontal Bounding Box) 是轴对齐的最小外接矩形;OBB (Oriented Bounding Box) 是任意朝向的最小外接四边形,通常用旋转卡壳算法从多边形求得。遥感目标(船舶、飞机、储油罐)常呈任意朝向,OBB 比轴对齐框更紧致、信息更丰富,但评测需用多边形 IoU 而非轴对齐 IoU。
本文同时提供 HBB 与 OBB 标注,但主表仅用 HBB,OBB 评测不完整,是理解其局限的关键。
马修斯相关系数 (Matthews Correlation Coefficient, MCC)
MCC 取值 $[-1,1]$,综合真正例 TP、真负例 TN、假正例 FP、假负例 FN 衡量二分类预测与真实标签的相关性,公式为 $\text{MCC}=\frac{TP\cdot TN-FP\cdot FN}{\sqrt{(TP+FP)(TP+FN)(TN+FP)(TN+FN)}}$。相比准确率,它在类别不平衡时仍稳健,0 表示无关联、1 表示完美。
本文用 MCC 把「存在性判断」从定位质量中解耦,揭示了精确定位不等于可靠拒绝幻觉这一关键现象。
零样本评测协议 (Zero-shot Protocol)
指模型在基准上不做任何训练、微调或阈值选择,直接用官方默认超参推理。每个查询独立提交,不暴露真值类别列表、掩膜或框。这能避免基准过拟合,更真实地反映模型的开放词汇泛化能力。
OVEarth-Bench 全部 49 个模型都在零样本下评测,这是其结论可信度的基础。
研究动机
现有开放词汇遥感 (Open-Vocabulary Earth Observation, OV EO) 评测存在系统性缺陷。首先,主流基准沿用封闭数据集,类别空间极窄:DOTA-v2 仅 18 类、DIOR 20 类、FAIR1M 37 类、NWPU 10 类、iSAID 16 类、OpenEarthMap 仅 9 类、LoveDA 仅 7 类。这些数据集虽刻画了遥感特有的尺度、朝向、密度挑战,但绑定预定义标签集,无法评估细粒度与长尾概念(如定日镜 heliostat、火山口 volcanic vent、船闸 navigation lock)。其次,多数基准只支持单一查询形式——RISBench、RRSIS-D、RefSegRS 仅评测指代分割,EarthReason、LaSeRS 仅评测推理,无法同时考察词汇短语、指代表达、功能推理三种能力。第三,这些基准反复复用公开图像,存在与基础模型预训练语料重叠的数据泄露风险,使零样本评估的真实性存疑。结果是现有排行榜只能反映模型在窄类集上的拟合,无法判断其是否具备真正的开放词汇遥感能力。
本文的目标是本文目标是构建首个同时评测类别广度与查询多样性的开放词汇遥感基准 OVEarth-Bench。具体而言,作者从两个维度扩展评估:类别广度上,建立覆盖 172 个类别的层次化分类法,提供 1,346 个唯一词汇串(含 425 个正例与 1,029 个反例短语);查询多样性上,同时生成 732 条指代表达与 1,056 条推理查询。基准提供全新采集的 520 张影像与 590 个人工掩膜标注,并派生 4,810 个水平/旋转边界框,统一在零样本协议下评测掩膜与框定位。最终作者希望据此对 49 个通用及遥感专用模型进行系统评测,揭示被窄类集排行榜掩盖的真实能力差异,并为未来 OV EO 方法的类别覆盖、查询理解、定位质量与存在性判断提供量化指导。
与已有工作不同的是,本文的独特切入角度在于「双轴联合评测」与「全新数据」。此前工作要么聚焦类别(DOTA、DIOR),要么聚焦查询形式(RISBench、EarthReason),从未在同一基准上同时考察两者;OVEarth-Bench 是首个在新采集影像上联合评测类别广度与查询多样性、并同时提供掩膜与框标注的 OV EO 基准。其次,作者引入正/反两类词汇短语,使存在性判断 (present/absent) 成为独立维度,并用 MCC 指标量化模型对反例的拒绝能力——这一点在以往排行榜中被完全忽略。此外,作者设计了类别子集稳定性分析方法(从 5 到 172 类逐步采样 1,000 次),首次实证证明窄类集会显著扰动模型排序(5 类时 Spearman $\rho$ 仅 0.84),为「为何需要广覆盖」提供了量化证据。
核心方法
直觉上,OVEarth-Bench 像一份覆盖多学科、多题型的综合试卷,而非单一窄科目的选择题——既考察「认不认识」(词汇),也考察「找不找得到」(指代) 与「能不能推理」(功能描述)。其技术路线分五步:先确立分类法决定采样范围,再以兴趣点 (POI) 检索全球采集全新影像,随后由标注员配合 SAM 2 完成多边形掩膜,再用「LLM 生成—模型核验—人工复核」三阶段流水线生成多样化查询,最后从掩膜派生 HBB 与 OBB。在评测端,作者把开放词汇任务拆为三个子任务(词汇、指代、推理),分别支持掩膜、HBB、OBB 三种模态,并以零样本方式评测 49 个模型变体。这种「先界定语义再采样、查询与标注协同生成、评测维度解耦」的思路,使基准既能广覆盖,又能精细区分模型在不同能力维度上的差异。
核心创新是「类别广度 × 查询多样性」的双轴评测框架,以及把存在性判断从定位质量中解耦出来。区别于以往只看定位 IoU 的范式,OVEarth-Bench 同时报告正向查询的 ma-P/ma-R/ma-IoU(宏观精确率/召回率/IoU)、micro-IoU,以及正反词汇查询的 MCC,从而能区分「能定位」与「能拒绝幻觉」两种截然不同的能力。第二项创新是数据驱动的分类法:综合中国国家土地利用标准 GB/T 21010-2017、EarthNets 中 200+ 遥感数据集的标签清单与 OpenStreetMap 标签,归纳出 7 个顶层域、172 类的层次结构,避免只采样易标注目标。第三项创新是类别子集稳定性分析:通过 1,000 次随机采样证明窄类集会让模型对比剧烈漂移,首次为「广覆盖才能稳定排序」提供定量证据。
方法步骤详情
完整流程分五阶段。**分类法设计**:以 GB/T 21010-2017、EarthNets 200+ 数据集清单、OSM 标签为输入,归纳出 plant、business/service/residential、industrial/mining/storage、transportation、terrain、water infrastructure、special 七域共 172 类,逐类确认在光学影像中可辨。**影像采集**:基于 QGIS 自研 POI 检索工具在六大洲采集,影像宽 692–4,713 像素、GSD 0.08–305.7 m/px(中位 0.30 m/px),存为 GeoTIFF 保留坐标。**掩膜标注**:简单目标用 SAM 2 初始化再人工校正,复杂目标手工绘制;区域类(农田、道路)只画区域不区分实例;管理员复核类别归属、边界与漏标,得 590 个掩膜。**查询生成**:GPT-5-mini 阶段一按掩膜与类别名生成正/反 OVS 短语、指代表达、推理查询;阶段二把原始影像与候选输入模型自检,3.9% 反例被标记为实际存在、28.6% 指代表达被自动纠错;阶段三由 3 位专家复核,57.3% 指代表达被改写或删除、16.0% 反例被修改,最终得 425 正例、1,029 反例、732 指代、1,056 推理。**框派生**:从实例化目标多边形生成轴对齐 HBB 与旋转卡壳 OBB,排除 cropland、road、railway 等 12 个非实例化类,得 4,810 个框(91.8% 占图像面积 <1%)。
技术新颖性
技术新颖性体现在三点。其一,OVEarth-Bench 是首个在新采集影像上联合评测类别广度与查询多样性的 OV EO 基准:对比 LaSeRS(122 类但复用图像、推理与框不联合)、EarthReason(28 类、不采新图)、RRSIS-D/RefSegRS(仅指代),其覆盖度与评测维度均显著更全。其二,引入正反词汇短语与 MCC 指标,把「存在性判断」从「定位精度」中解耦,揭示出 ma-IoU 与 MCC 几乎无相关(Spearman $\rho=0.107$)这一反直觉现象。其三,提出类别子集稳定性分析方法,量化证明窄类集对模型排序的扰动;并设计三阶段查询生成流水线(LLM+模型自检+人工),在 57.3% 指代表达被改写的严格质控下保证查询可靠性。这些设计共同使基准能暴露被封闭集排行榜掩盖的模型行为。
实验结果
论文围绕 49 个模型变体的零样本结果给出多项核心发现。**整体性能有限**:词汇、指代、推理三任务的最高 ma-IoU 分别仅 38.75%、41.32%、37.96%(均由 Rex-Omni+SAM 取得),框定位 mi-F$_{0.5}$ 最高 24.53%、35.56%、26.12%(LocateAnything),mi-F$_{0.5:0.95}$ 低至 14.23%、21.47%、14.91%。**MLLM 主导**:MLLM 类方法占词汇前十中的 9 席、指代与推理前十的全部 10 席。**遥感专用优势有限**:仅 1 个遥感专用模型进入词汇前十,指代/推理前十中无一;最佳遥感专用结果比任务最高分低 7.07–15.31 个分割点、7.46–23.58 个检测点。**窄类集扰动排序**:5 类时 Spearman $\rho$ 中位 0.84、Top-5 恢复率仅 0.6;20 类时 0.95 与 0.8;50 类时达 0.98。**存在性判断薄弱**:除 Qwen3-VL-4B+SAM 的 MCC=0.60 异常值外其余均 $\leq 0.35$,且词汇 ma-IoU 与 MCC 几乎无相关($\rho=0.107$)。**范式无定论**:Rex-Omni+SAM 比最佳直接分割模型高 5.44/1.11/1.88 ma-IoU,但次佳 LocateAnything+SAM 反低 7.87/2.99/4.12。**规模效应不稳定**:SELF1E-8B 比 2B 高 7.52–10.12 点,Sa2VA-Qwen3-VL-4B 比 2B 高 1.08–5.46 点,但 UniPixel-7B 反比 3B 低 3.46–6.04 点。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 开放词汇分割(词汇查询) | ma-IoU | Rex-Omni+SAM 38.75% | 最佳遥感专用 SegEarth-OV3 31.68%(Pi-Seg-v2-L 仅 21.55%) | 比最佳遥感专用高 7.07 点;最佳纯对比学习 MaskCLIP 仅 10.43% |
| 指代分割 | ma-IoU | Rex-Omni+SAM 41.32% | 最佳直接分割 SAMTok-Qwen3-VL-4B-co 40.21% | +1.11 点;MLLM 占据全部前十 |
| 推理分割 | ma-IoU | Rex-Omni+SAM 37.96% | 次佳 X2SAM 36.08% | +1.88 点 |
| 框定位(指代查询) | mi-F1_0.5 | LocateAnything 35.56% | Rex-Omni 17.11% | +18.45 点,LocateAnything 在框任务上反超 |
| 类别子集稳定性 | Spearman ρ(与全基准排序) | 5类→0.84,20类→0.95,50类→0.98 | Top-5 恢复率:5类仅 0.6 | 窄类集显著扰动排序,证明广覆盖的必要性 |
| 存在性判断 | MCC | Qwen3-VL-4B+SAM 0.60(异常值) | 其余 48 个模型均 ≤0.35 | 精确定位与拒绝幻觉几乎无相关(ρ=0.107) |
局限与改进
作者明确承认若干局限:分类法未穷尽开放世界;地理采样不均(亚/欧/北美密集,其余稀疏);推理查询仅覆盖功能与可见上下文,未涵盖完整地理推理;新影像虽降低记忆风险但无法保证完全未被预训练语料覆盖;当前评测仅在类别层级进行,未评估分类法不同层级;检测对比主要用 HBB,因为仅部分模型原生支持 OBB;受采集成本限制,部分类别(如特定飞行器)仅 1–2 个样本,其类别级结果对个体样本敏感。我额外观察到:590 个掩膜分摊到 172 类平均每类仅约 3.4 个,长尾类别的统计稳健性存疑;查询生成依赖 GPT-5-mini 闭源模型,57.3% 的指代表达被人工改写,提示流水线本身可靠性不足;评测为单模态光学 RGB,未纳入 SAR、多光谱、高光谱等遥感主流传感器;负例仅测试视觉/概念相似,未考察更深的语义混淆。
独立分析的弱点
基于独立分析,我发现若干弱点。**样本规模偏小**:590 个掩膜对 172 类而言平均仅约 3.4 个/类,长尾类(如 heliostat、fish raft house)甚至只有 1–2 个,类别级结论对个别样本高度敏感;改进方向是采用主动学习优先扩充稀疏类,结合 SAM 3 等基础模型半自动标注。**单传感器**:仅光学 RGB,而遥感实战常需 SAR(全天候)、多光谱、高光谱;改进方向是扩展为多传感器融合基准。**查询流水线可靠性存疑**:57.3% 指代表达被人工改写、16.0% 反例被修改,说明 LLM 生成质量不稳定;改进方向是用开源可复现模型 + 多模型投票 + 形式化空间关系校验。**对比存在混淆**:「遥感专用 vs 通用」结论可能不公平,因为遥感方法多在窄任务数据上训练,而通用 MLLM 在超大规模语料上预训练;改进方向是控制变量研究(同骨干、同数据量)。**OBB 评测不完整**:主表仅用 HBB,但 OBB 对遥感朝向至关重要;改进方向是补全 OBB 评测并加入朝向误差指标。
未来方向
作者提出:将通用 MLLM 的语义广度与遥感专用的空间能力结合;发展多尺度、高分辨率视觉编码以处理小目标;朝向感知的区域/掩膜解码;覆盖长尾类别、空间关系、功能描述、硬负例的遥感指令微调(且不损害通用语言能力迁移性);把存在性预测作为校准目标而非定位副产品,配合不确定性感知评测;开展控制变量研究,统一 MLLM 骨干、训练数据与推理预算,系统变化遥感适配与输出表示。基于成果可延伸的方向包括:扩展到 SAR、多光谱、高光谱等多传感器;引入时序/多图推理查询;扩充军事、宗教等特殊类别;与基础模型训练相结合,把基准作为持续演化的数据引擎;探索分类法层级评测(域→分支→叶类)以刻画层次化泛化。
复现评估
复现评估总体友好。作者开源了 ovearth-eval 评测包与基准数据(https://earth-insights.github.io/OVEarth-bench),所有 49 个模型均使用官方实现与默认超参,零样本协议意味着评测无需训练,仅需在 NVIDIA A100/4090 上推理;评测脚本与默认设置在附录 F 详述,掩膜与框标注、查询文本均可下载。但基准构造本身较难复现:查询生成依赖闭源 GPT-5-mini(付费 API、版本可能漂移),人工标注涉及 3 位专家与多轮 QC,POI 检索工具未完全开源。对希望「直接用」的研究者,复现门槛低(拉取数据+评测包即可);对希望「重建」基准的研究者,门槛较高,需替代 LLM 与标注流程。
论文图表
并排对比图。左侧 Previous EO Benchmarks 显示窄类别覆盖(airplane、ship 等少量类别)与查询形式不足;右侧 OVEarth-Bench 展示 172 类层次化类别(含 cropland、forest、greenhouse、stadium、factory、mine、solar panels 等精细与长尾类)与三种查询形式(1,346 词汇短语、732 指代表达、1,056 推理查询)。
一图直观说明本文核心动机——以往基准类别窄、查询形式单一,OVEarth-Bench 同时扩展两个维度,是理解全文的起点。