论文

UniverSat:与分辨率和模态无关的 Transformer 用于地球观测

UniverSat: Resolution- and Modality-Agnostic Transformers for Earth Observation

模型训练预训练

摘要

视觉 Transformer (ViT) 主导计算机视觉。然而,它们对刚性贴片投影仪的依赖阻碍了向地球观测 (EO) 的转移,因为地球观测的输入模式、尺度和分辨率差异很大。我们引入了 UniverSat,这是一种围绕通用补丁编码器构建的 ViT 风格主干,可将来自任意空间、光谱和时间分辨率以及光学和非光学传感器的补丁映射到具有一组共享权重的共享嵌入空间中。这使得能够通过自我监督在异构多模态语料库上训练单个模型,从而产生鲁棒的、与传感器无关的空间特征。我们在 GeoBench、PANGEABench 和 SpectralEarth 的标准 EO 基准上的分类和分割方面取得了出色的结果,从而验证了这种方法。我们的代码和模型可在 https://github.com/gastruc/UniverSat 获取。