论文

SLED:通过 蒸馏 可扩展位置编码

SLED: Scalable Location Encoding via Distillation

摘要

大量现成的地理空间数据为了解地球的高质量表征提供了令人兴奋的机会,但地球观测 (EO) 的庞大规模、不同的模式和不同的传感器类型对此提出了重大挑战。位置编码器已成为将 EO 压缩为特定位置嵌入的有效方法。然而,当前最先进的位置编码器依赖于计算成本昂贵的 CLIP 式框架,该框架需要 16K--32K 范围内的大批量大小,受到假阴性样本的影响,并且通过附加模式扩展性很差。我们通过 蒸馏 (SLED) 引入可扩展位置编码器,这是一种基于 蒸馏 的位置编码器,它使用地理空间位置作为绑定模态,使用任何地理空间数据模态来预训练位置编码器。由此产生的位置编码器框架是轻量级的、模块化的,并且可以灵活地合并多种模式,同时消除了样本时空共同配准的需要。 SLED 具有高性能,批量大小小至 128,从而能够以当前最先进模型的一小部分运行时间和计算成本进行预训练。我们通过在 Sentinel-1、Sentinel-2 和 Landsat 图像上预训练单峰和多峰 SLED 模型来展示我们的方法。我们证明,单模态和多模态 SLED 模型在 19 项以人为中心的基准任务中均与现有方法保持同步或优于现有方法,并探索在预训练中使用其他模式的好处。