GEOID-Flood:用于洪水分割的大规模多模态基准数据集 GEOID-Flood: A Large-Scale Multi-Modal Benchmark Dataset for Flood Segmentation
大规模多模态洪水分割基准GEOID-Flood,证明训练设计比编码器更关键。
前置知识
合成孔径雷达(SAR)与Sentinel-1 GRD/RTC
SAR是主动式微波成像雷达,自带发射源故能穿透云层、夜间成像,是业务化洪水监测主力。Sentinel-1发射C波段VV/VH双极化信号;平静水面镜面反射使回波极低、呈暗色。GRD(地距探测)是原始多视幅度产品,RTC(辐射地形校正)进一步用地形模型做后向散射校正消除叠掩与阴影,常输出$\gamma^{0}$。
本文以SAR为核心模态并分发GRD与RTC两级别,必须理解二者差异及水体回波歧义,才能看懂模态消融(GRD为何略胜RTC)以及单景为何无法区分永久水体与瞬时洪涝。
地理空间基础模型(Geospatial Foundation Model)
在大规模地球观测语料(多卫星/分辨率/波段)上自监督预训练的通用编码器,如TerraMind、DOFA、OlmoEarth、Satlas、SSL4EO,目标是学习跨区域、跨传感器可迁移的表征再迁移到下游任务。本文比较其冻结特征与全微调两种用法,参数规模从12 M到357 M。
RQ1的核心就是评测这类基础模型相对ImageNet预训练编码器是否真有优势,理解其冻结/微调用法与规模差异是读懂Table 2排序与'基础模型仅温和优势'结论的前提。
双时相变化检测与早/中融合
利用灾前、灾后两时相识别变化区域:灾后为水但灾前非水的像素即瞬时洪涝。早融合把两时相沿通道堆叠送入单一编码器;中融合用双分支分别编码再对特征图做逐元素减法$\text{post}-\text{pre}$后共享解码器;洪涝变化损失则对这些变化像素施加二值交叉熵。
场景(ii)(iii)与RQ2/RQ3都建立在双时相与融合之上,理解早/中融合与事后差分三分类的区别,才能看懂为何'简单配对无效、端到端融合才有效'。
IoU与F1(语义分割评测指标)
IoU(交并比)=预测与真值交集面积除以并集面积,F1为精确率与召回率的调和平均,二者均∈[0,1]、越大越好。本文用$\text{IoU}_{\text{bin}}$/$F1_{\text{bin}}$评二值水体,$\text{IoU}_{\text{flood}}$评洪涝类,$\text{IoU}_{\text{avg}}$为宏平均,并以$\text{IoU}_{\text{flood}}$为洪水检测主参考。
全文所有表格都基于IoU/F1比较模型,尤其$\text{IoU}_{\text{flood}}$始终最低(≤0.521),是理解'洪涝类最难、需专门方法'这一结论的度量基础。
研究动机
洪水是波及人口最多的自然灾害,且随气候变暖加剧,亟需全天候快速制图。合成孔径雷达(SAR)能穿透云层成为业务化监测主力,但单景SAR存在内在歧义:开放水体、永久河流与新生洪涝区在后向散射上都呈现相近的低暗回波,单次获取无法区分永久水体与瞬时洪涝,必须依赖双时相(灾前/灾后)变化信息与区分性标注。然而现有洪水数据集普遍残缺:纯光学的WorldFloods v2(约586 618 km²)不含SAR;纯SAR的MMFlood、Kuro Siwo、S1GFloods缺光学;Sen1Floods11虽配对S1/S2却仅单时相无法做变化检测;OmbriaNet、CAU-Flood、STURM-Flood配对不完整或严重失衡(后者有2万余张S1却仅2 675张S2)。更关键的是没有数据集区分洪涝与永久水体,SAR处理级别混乱(原始GRD与地形校正RTC混用且无统一归一化),切分多采用瓦片级随机划分造成空间泄漏,永久水体来源不统一(OSM水文不全、JRC GSW为30 m分辨率漏掉窄河道),这些系统性缺陷会向洪涝标签传递噪声,使基础模型评测不可靠。
本文的目标是构建GEOID-Flood(Geospatial Earth Observation Imagery Dataset for Floods)——源于哥白尼应急管理服务(CEMS)快速制图激活的大规模多模态洪水分割基准:覆盖219场洪水事件、横跨65国与六大洲、时间跨度2016至2026年(十年),产出14 282个1024×1024像素、10 m分辨率的瓦片,总影响面积约1 141 749 km²,约为此前最大数据集的两倍。每个瓦片提供完整配准的(S1pre, S1post, S2pre, DEM)四元组,SAR同时分发GRD与RTC两种标准化处理级别以消除跨数据集归一化鸿沟,并附带由AlphaEarth Foundations(AEF)嵌入导出的永久水体层,将背景、永久水体、洪涝水体、无效四类显式分离。数据采用事件级70/10/20%划分且相邻AoI强制同分以杜绝边界泄漏,并保留2026年2-3月的时序不相交留出集专供跨数据集泛化实验。在此之上系统回答四个研究问题(RQ1预训练、RQ2时序、RQ3模态、RQ4泛化),比较地理空间基础模型与ImageNet预训练编码器。
与已有工作不同的是,本文的独特切入在于首次同时补齐四块短板:(1)双时相SAR与配准光学的联合且达到洲际规模——此前没有公开数据集同时提供灾前/灾后SAR、配准光学与事件级划分;(2)显式的永久水体层,绕开30 m JRC GSW与不全OSM水文在10 m分辨率下的系统性缺失,从年度AEF嵌入训练轻量化模型导出;(3)双标准化SAR处理级别(GRD+RTC)消除跨数据集归一化障碍,便于业务部署与横向比较;(4)手工筛选、优先采用SAR衍生产品的CEMS标注,规避云致光学噪声。配合事件级(而非瓦片级)划分、时序不相交留出集与可复现的从单图二分类到多时相多分类的训练评测协议,GEOID-Flood让表征质量与时序建模能在同一受控设定下被同时研究,这是以往数据集无法支撑的。
核心方法
方法分两支:先构建数据集,再用统一协议评测。构建走五阶段自动化、可复现流水线,直接操作公开哥白尼产品。任务被定义为逐像素语义分割,三分类(背景、永久水体、洪涝水体),并设计单图(将洪涝重映射为二分类水体)与多图(保留三分类)两种设定。评测围绕复杂度递增的三种训练场景:场景(i)单图,灾前/灾后作物当作独立样本,用交叉熵$\mathcal{L}_{\text{CE}}$训练重映射的二分类水体标签,作为冻结/微调基础模型与ImageNet编码器的主排序工具(RQ1),其二值预测也构成事后三分类基线(RQ2);场景(ii)配对双通,对配准灾前/灾后对分别前向、求和两个$\mathcal{L}_{\text{CE}}$并叠加洪涝变化损失(对灾后为水但灾前非水的像素施加二值CE);场景(iii)配对单通融合,两图一次前向、保留三分类目标,比较早融合(沿通道堆叠)与中融合(双分支编码后做逐元素相减$\text{post}-\text{pre}$再共享解码)。所有配置统一采用U-Net解码器,使模型差异只来自编码器或融合策略。
核心创新是数据集设计本身,而非某个模型架构。三个本质区别:第一,提供专用的永久水体层——把瞬时洪涝与永久水体显式分离,这是单景SAR歧义与既有30 m JRC GSW/不全OSM水文都解决不了的关键;第二,把双时相SAR(GRD+RTC两级别)、灾前配准光学、DEM与高质量CEMS标注在同一10 m网格上联合配准,达到此前最大数据集约两倍的1 141 749 km²空间范围与十年时序跨度;第三,事件级划分配合时序不相交留出集,从源头杜绝空间泄漏与时间泄漏。由此得到的基准性结论同样关键:训练设计比编码器更重要——基础模型仅具稳定但温和的优势,时序配对本身并不奏效,端到端的变化聚焦架构与光学-SAR融合才是胜负手。
方法步骤详情
构建五阶段:(1)空间分区——依据CEMS元数据把每个异构AoI切成对齐UTM网格的10 240 m正方形包围盒,保证跨事件一致足迹;(2)数据获取——经Sentinel Hub API取灾前/灾后Sentinel-1 GRD与RTC(VV/VH双极化),灾前取Sentinel-2 L2A并以事件日为中心3周窗口、最多3景做中位数合成去云,下载Copernicus GLO-30 DEM重采样到10 m;(3)有效掩膜——用OmniCloudMask在灾前S2上得逐像素clear/thin/thick云掩膜,再以AoI边界、影像足迹与瓦片包围盒交集生成有效像素掩膜;(4)标签合成——在ESW数据集上从年度AEF嵌入训练轻量模型产出10 m永久水体层,仅把CEMS中标为flood的多边形栅格化(剔除trace级),合并为背景/永久水/洪涝水/无效四类;(5)质量过滤——丢弃缺失模态、云过厚或影像与参考标签不一致的包围盒。切分按大洲分层70/10/20%采样、相邻AoI强制同分,得8 938训练/1 241验证/2 674测试瓦片,另留2026年后1 429瓦片做时序不相交测试。
技术新颖性
新颖性有三层。数据层:首个同时具备双时相SAR(双处理级别)、配准光学、DEM、专用水久水体层、手工核验CEMS标签与事件级划分的洪水基准,面积(1 141 749 km²)与时序(2016-2026)均为已知之最,且SAR双级别分发使跨数据集比较首次摆脱归一化障碍。协议层:给出从单图二分类到多时相多分类、再到早/中融合的可复现训练评测协议,并在跨数据集实验中对所有外部数据集用统一RTC管线($\gamma^{0}$地形平坦化、GLO-30 DEM、10 m)重处理以消除预处理混淆因素,使差异只来自训练集。发现层:以最严格方式证明基础模型对SAR水体分割优势有限($\text{IoU}_{\text{bin}}$差距多在0.04内)、时序配对无效、光学仅灾前有效、RTC与DEM无显著增益,为社区提供可操作的工程结论。
实验结果
RQ1(Table 2):单图S1-GRD下编码器差距极窄,除冻结Satlas Swin-B外$\text{IoU}_{\text{bin}}$全落0.844-0.884;微调TerraMind-L最优(0.884),32 M的Swin-T达0.873紧追大其十倍的基础模型,微调对弱骨架最显著(Satlas 0.751→0.861);洪涝类最难($\text{IoU}_{\text{flood}}$最高0.484),后续选TerraMind-B(101 M)。RQ2(Table 3):配对洪涝损失微调$\text{IoU}_{\text{flood}}$仅0.486略超基线0.479;微调早融合S2→S1最佳(0.521),端到端学变化才有效而非简单配对。RQ3(Table 4):灾前Sentinel-2最有效(+0.015至0.946),GRD略胜RTC、DEM无增益。RQ4(Table 5):2026留出集GEOID-Flood双体制最强(冻结$F1$ 0.911、$\text{IoU}_{\text{flood}}$ 0.590),全面领先外部来源,规模与多样性带来真实迁移收益。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 单图二值水体分割(S1-GRD, 场景i, 全编码器) | $\text{IoU}_{\text{bin}}$ | 0.884 (微调TerraMind-L, 323 M) | 0.751 (冻结Satlas Swin-B) | 编码器间最大差距仅约+0.133,多数模型集中在0.844-0.884 |
| 多分类洪涝分割(场景iii vs 场景i) | $\text{IoU}_{\text{flood}}$ | 0.521 (微调早融合 S2→S1) | 0.479 (单图基线 TerraMind-B FT) | +0.042,端到端融合显著优于事后差分 |
| 灾前模态消融(冻结TerraMind-B) | $\text{IoU}_{\text{bin}}$ | 0.946 (S1-GRD + 灾前S2) | 0.931 (仅S1-GRD) | +0.015,光学增益最大;GRD亦略胜RTC(0.931 vs 0.922) |
| 跨数据集泛化(2026留出集, 冻结) | 二值$F1$ / $\text{IoU}_{\text{flood}}$ | 0.911 / 0.590 (训练于GEOID-Flood) | 0.887 / 0.568 (训练于Kuro Siwo, 次优) | $F1$ +0.024,三分类指标同序,规模与多样性带来真实迁移收益 |
局限与改进
作者承认三类局限:地理分布偏向欧洲(219场中140场),影响全球均衡性与少见区域泛化;标签继承两重噪声——CEMS人工勾勒的残留误差与DL导出的永久水体层误差;洪涝水体作为最稀有类全程最难($\text{IoU}_{\text{flood}}$≤0.521),且跨数据集比较是用GEOID-Flood自身标签打分,故主张主要锚定在各来源约定较一致的二值水体勾画上。此外作者自陈在所测编码器下灾后光学不可得、灾前光学才有效,RTC与DEM无显著增益——这暗示结论对当前编码器有效,专用架构或能更好挖掘。我另观察到:单一U-Net解码器虽公平却可能限制了基础模型潜力;永久水体层依赖AEF嵌入本身是学习产物,存在自我参照风险;2026留出集仅83对事件-AoI(1 429瓦片)规模有限,统计稳健性有待更大验证。
独立分析的弱点
弱点一:地理偏倚——140/219事件在欧洲,对热带、季风区泛化证据不足,改进方向是主动补采非洲、南亚、东南亚事件并做区域分层报告。弱点二:标签噪声传递——永久水体层由AEF嵌入训练的模型导出、又用于评测自身,存在循环验证风险;CEMS勾勒在山洪等场景与采集时间错配,改进方向是引入独立人工复核子集与不确定性估计。弱点三:评测受限于单一U-Net解码器与冻结/全微调两体制,未探索LoRA、适配器等参数高效微调,可能低估基础模型上限,改进方向是加入PEFT与任务专用解码头。弱点四:灾后光学缺失使多时相光学融合无法评测,改进方向是用配准生成或晴空数据增强补全灾后光学。弱点五:留出集仅83对(1 429瓦片)、跨数据集比较以自身标签为锚,统计与客观性可进一步加强。
未来方向
作者明确提出保留全部模态(S1-GRD/RTC、S2、DEM)发布以支持未来工作,因为专用或更新架构可能更好地利用RTC与DEM(当前编码器未能挖掘其增益)。基于成果可延伸的方向包括:一是设计能显式吸收地形(DEM)与RTC几何校正的多模态/变化检测专用骨干,验证地形后向散射校正是否真无益;二是把方法推广到滑坡、林火、城市内涝等其它灾害的CEMS快速制图,复用同一管线与永久背景层思路;三是引入参数高效微调(LoRA、适配器)与不确定性建模,在弱骨架(如MMFlood失衡)上稳定全微调;四是扩充非欧区域以缓解地理偏倚,并构建更大、独立的时序留出集以加固泛化结论;五是探索灾后光学补全(生成式或晴空增强),填补多时相光学融合的评测空白。
复现评估
复现性较高。代码与数据声明开源(github.com/links-ads/geoid-flood),构建管线完全基于公开哥白尼产品(CEMS激活、Sentinel-1/2、GLO-30 DEM)与Sentinel Hub API,关键组件(OmniCloudMask云掩膜、ESW/AEF永久水体训练)均来自公开数据集,五阶段流水线自动化且可复现。评测协议明确:统一U-Net解码器、固定TerraMind-B、统一RTC重处理($\gamma^{0}$、GLO-30、10 m)消除预处理混淆。挑战在于:完整重训基础模型编码器动物园(TerraMind、DOFA、OlmoEarth、SSL4EO、Satlas等,最大323-357 M参数)需要可观GPU算力与遥感工程经验;要复现跨数据集实验还需重下载并重处理Kuro Siwo、MMFlood、WorldFloods v2、Sen1Floods11的全部S1影像,IO与处理成本不低。整体难度中高,但流程文档化良好。
论文图表
在同一区域上横向对比GEOID-Flood与多个文献数据集:上行为各自可用标签,下行为对应灾后模态。可见手工勾勒边界未必比精心策划的自动产品更干净,且各数据集标签质量与模态差异显著。
用同一事件的可视化对比论证既有数据集标注噪声与模态缺失问题,直接支撑构建新数据集的动机。