论文

GeoMeld:面向遥感的语义基础模型

GeoMeld: Toward Semantically Grounded Foundation Models for Remote Sensing

模型训练预训练

摘要

遥感中有效的基础建模需要空间对齐的异构模式以及基于语义的监督,但此类资源在规模上仍然有限。我们推出了 GeoMeld,这是一个大型多模式数据集,包含大约 250 万个空间对齐的样本。该数据集涵盖不同的模态和分辨率,并在统一的对齐协议下构建,用于模态感知表示学习。 GeoMeld 通过代理图像描述框架提供基于语义的语言监督,该框架合成并验证来自光谱信号、地形统计数据和结构化地理元数据的注释,在文本描述中编码可测量的跨模态关系。为了利用这个数据集,我们引入了 GeoMeld-FM,这是一个预训练框架,它结合了对齐模式上的多借口屏蔽自动编码、JEPA 表示学习和图像描述视觉对比对齐。这个联合目标使学习的表示空间能够捕获可靠的跨传感器物理一致性和基础语义。实验证明了下游传输和跨传感器鲁棒性的持续增益。 GeoMeld 和 GeoMeld-FM 共同建立了一个可扩展的参考框架,用于遥感中基于语义的多模态基础建模。