论文

BEACON:通过三模态对比学习丰富 AlphaEarth 嵌入的行为和语义

BEACON: Behavioral and Semantic Enrichment of AlphaEarth Embeddings through Tri-Modal Contrastive Learning

模型训练预训练

摘要

AlphaEarth Foundation 等地理空间基础模型可生成紧凑且全球一致的地球表面表示,可有效地转移到各种下游任务。然而,由于这些模型主要是根据地球观测图像进行训练的,因此它们的嵌入主要捕获物理和光谱特征,而对人类活动和城市功能的编码却很弱。为了解决这个限制,我们提出了 BEACON,一个三模态对比学习框架,它结合了城市空间的三个互补视图:来自 AE 嵌入的物理表示、来自兴趣点 (POI) 文本的语义表示、以及来自每小时 POI 访问的人类行为表示,同时保持仅部署的表示图像。使用休斯顿都会区作为案例研究区域,我们使用超过五个种子的冻结线性和 MLP 探针,评估了 BEACON 框架在九个下游任务上的性能,包括针对六个基线(原始坐标、Space2Vec、SatCLIP、TESSERA、Clay 和 AlphaEarth)的七个回归和两个分类任务。在线性探测下,与 AlphaEarth 相比,BEACON 在肥胖患病率方面相对 R^2 提高了 43%,在心理健康状况不佳方面提高了 34%,在家庭收入中位数方面提高了 22%,同时在物理和环境变量的预测方面保持竞争力。这些发现凸显了利用语义和行为信号增强地理空间基础模型的价值,将其适用性从物理地球观测扩展到以人为中心的城市分析。