论文
MetaEarth-MM:采用以场景为中心的联合建模的统一多模态遥感图像生成
MetaEarth-MM: Unified Multimodal Remote Sensing Image Generation with Scene-centered Joint Modeling
摘要
多模态遥感图像对于地球观测至关重要,但在实践中往往缺乏完整的配对观测。现有的生成方法通常通过孤立的成对模态翻译来解决这个问题,但随着模态和生成任务数量的增加,它们的多功能性和可扩展性仍然有限。在这里,我们开发了一个用于多模态遥感图像的生成基础模型 MetaEarth-MM,能够在统一模型内跨五种模态进行配对联合生成和任意转换。认识到多模态观测背后的内在场景一致性,我们在 MetaEarth-MM 中引入了一种以场景为中心的联合建模范例。与以前依赖直接外观级跨模式映射的方法不同,我们的模型围绕底层场景内容组织生成。具体来说,MetaEarth-MM 采用解耦架构,首先从可用观察中推断出潜在场景表示,然后生成以此中间状态为条件的目标模态。为了支持训练,我们进一步构建了 EarthMM,这是一个大型数据集,包含 280 万张多分辨率全局图像和 220 万个对齐对。大量实验表明,MetaEarth-MM不仅在不同的生成任务中表现出强大的生成能力和鲁棒的泛化能力,而且还支持数据和表示级别的下游任务,凸显了其作为跨模态地球观测通用基础模型的潜力。代码和数据集将在 https://github.com/YZPioneer/MetaEarth-MM 上提供。