论文

地理嵌入:实现城市理解的统一多模态嵌入

Geo-Embed: Towards Unified Multimodal Embeddings for Urban Understanding

模型评测基准与评测资源

摘要

地理空间和城市应用越来越需要模型来比较街景图像、遥感观测、文本描述、区域建议和时间变化线索的异质证据。然而,现有的多模态嵌入模型和基准仍然主要围绕通用图像文本匹配进行设计和评估,尚不清楚统一的嵌入空间是否可以支持涉及空间关系、细粒度语义和时间变化的异构地理空间任务。为了解决这一差距,我们做出了三项关键贡献。首先,我们介绍 GeoMEB,这是一个大规模多模态嵌入基准,它标准化了涵盖检索、视觉问答、变化检测、分类和视觉基础的 45 个城市评估任务,以及包含 132 万个示例和 28.6 万个评估查询的训练集。其次,我们提出了 Geo-Embed,这是一种统一的嵌入模型,它使共享视觉语言主干适应异构地理空间输入(包括单个图像、多个图像、文本、区域和掩模)上的指令条件查询目标匹配。在 GeoMEB 上,Geo-Embed 在代表性多模态嵌入器中实现了最强的整体性能,比最强基线相对提高了 15.3%。这些结果激励未来的地理空间嵌入器围绕显式查询目标关系组织训练和评估,包括语义、跨视图、区域级和时间对应。