论文

探索对比语言图像预训练在多源遥感数据中的潜力

Exploring the Potential of Contrastive Language-Image Pre-training for Multi-Source Remote Sensing Data

模型训练预训练

摘要

对比语言图像学习(CLIP)已成为遥感视觉语言理解的关键范例。然而,现有的遥感对比学习方法大多建立在面向RGB的CLIP架构上,使得很难利用SAR、多光谱成像(MSI)和高光谱成像(HSI)等异构传感器。为了解决这一限制,我们提出了 OmniRSCLIP,这是一种端到端对比学习框架,支持用于遥感视觉语言建模的多源传感器输入。关键思想是将 CLIP 扩展到其固定的 RGB 输入接口之外,而不破坏预先训练的视觉知识。为此,OmniRSCLIP 引入了频谱空间基础分解 (SSBD),它将任意通道适应制定为基础重组问题:预训练的 CLIP 补丁嵌入提供可转移的空间基础,而波长调节系数则在受限的视觉先验空间内跨越传感器特定的嵌入内核。这种设计避免了迫使异构传感器进入固定通道输入空间,同时将它们对齐在统一的图像文本语义空间中。我们进一步引入了一种基于光谱上下文感知掩模的对比学习方案,以抑制特定于模态的冗余特征并增强细粒度的图像文本对齐。最后,为了支持多模态训练,我们构建了OmniRS5M,这是第一个涵盖RGB、SAR、MSI和HSI的大规模遥感图文语料库。检索、零样本分类和语义定位实验表明,OmniRSCLIP 保留了强大的 RGB 域性能,同时有效地将 CLIP 扩展到异构遥感模式。