论文
GeoViSTA:用于多模式环境表示的地理空间视觉表格 Transformer
GeoViSTA: Geospatial Vision-Tabular Transformer for Multimodal Environment Representation
摘要
对地球观测图像的大规模预训练产生了自然和建筑环境的有力表示。然而,大多数现有的地理空间基础模型并不直接对通常以表格形式存储的结构化社会经济协变量进行建模。这种模式差距限制了他们捕捉完整总体环境的能力,这对于推理复杂的环境、社会和健康相关结果至关重要。在这项工作中,我们提出了 GeoViSTA(地理空间视觉表格 Transformer),这是一种视觉表格架构,可以从共同配准的网格图像和表格数据中学习统一的地理空间嵌入。 GeoViSTA 利用双边交叉注意力跨模式交换空间和语义信息,并由地理感知注意力机制引导,该机制将连续图像块与不规则的人口普查区标记对齐。我们使用自监督联合屏蔽自动编码目标来训练 GeoViSTA,迫使它使用局部空间上下文和跨模式线索来恢复丢失的图像块和表格行。根据经验,GeoViSTA 的统一嵌入提高了高影响下游任务的线性探测性能,在预测特定疾病死亡率和跨区域火灾危险频率方面优于基线。这些结果表明,对物理环境和结构化社会经济背景进行联合建模可以为整体地理空间推理产生高度可转移的表示。