论文
月球遥感多模态多分辨率基础模型
Multimodal-Multiresolution Foundation Model for Lunar Remote Sensing
摘要
我们提出了一个用于月球遥感的多模态基础模型,在 SomBench 上从头开始进行预训练,SomBench 是一个地理分区的语料库,由近 200 万个共同配准的图块束组成,跨越两个空间尺度(1 m/像素和 100 m/像素)的 11 种模态。该模型采用了 TerraMind 掩码词元架构,具有两个特定于月球的扩展:获取几何图形作为显式上下文提供,米级和百米级图块进行联合训练,以便一组权重涵盖两种分辨率。 FlexiViT 补丁嵌入允许适应不同的补丁大小而无需重新训练,而模态输入则可以实现灵活的多模态微调。定性生成实验表明,该模型学习了有意义的跨模式对应关系,包括来自海拔的地形导数和来自几何的照明一致反射率。我们评估四个基准:WAC 和 NAC 尺度的陨石坑检测、不规则海斑 (IMP) 分割和极地冰前景回归。在各个任务中,预训练模型匹配或优于 ImageNet 预训练基线和架构相同的随机初始化控制。在多模态冰前景回归中,预训练变体取得了最佳结果,而随机初始化模型优于大多数基线,这表明架构和预训练都带来了收益。标签效率在 WAC 弹坑检测中非常显着,其中在 50% 的数据上训练的预训练模型超过了在完整数据集上训练的最强 ImageNet 基线。在适应策略中,LoRA 在陨石坑检测和 IMP 分割上匹配或超过完全微调,同时使用更少的可训练参数,而完全微调在冰前景回归方面表现最佳。我们发布了预训练的检查点、基准数据集和微调代码,以支持可重复的月球人工智能研究。