论文

地理空间基础模型的组合感知预训练框架

A Composition-Aware Pretraining Framework for Geospatial Foundation Models

模型训练预训练

摘要

地理空间基础模型已成为下游地球观测任务的最先进方法。然而,现有的预训练方法通过单一概念镜头处理图像,无法捕捉复杂卫星场景的高度组合性质。我们提出了一个组合感知预训练框架,该框架显式编码部分土地覆盖混合物。每个卫星图像单元都映射到代表其部分土地覆盖分布的直方图,我们将其称为“组成目标”。这些目标作为主要预测目标,并使用推土机距离提炼为骨干。实验评估表明,组合感知预训练在需要语义相似性判断的区域级理解任务(包括零样本图像检索和场景分类)上取得了实质性进展,同时在需要细粒度空间精度的任务(例如分割和对象检测)上保持了竞争力。我们的框架具有 3680 万参数主干,在大多数检索和场景分类设置中优于 SatMAE 和 Prithvi-EO-2.0,后者分别包含 303M 和 600M 参数。在细粒度的 ForestNet-12 数据集(构图辨别的严格测试平台)上,我们的方法将基线 mAP@10 从 0.279 提升到 0.434,相对提高了 55.6%,为显式构图建模的有效性提供了直接证据。代码实现可以在https://github.com/05kashyap/GFM_Composition_Pretraining找到