论文
文本监督增强视觉语言模型中的地理空间表示
Textual Supervision Enhances Geospatial Representations in Vision-Language Models
摘要
在用于图像地理定位和空间推理等任务的机器学习系统的开发中,地理空间理解是一个关键但尚未充分探索的维度。在这项工作中,我们分析了三个模型系列获得的地理空间表示:仅视觉架构(例如 ViT)、视觉语言模型(例如 CLIP)和大规模多模态基础模型(例如 LLaVA、Qwen 和 Gemma)。通过评估根据定位程度分组的图像集群(包括人物、地标和日常物体),我们揭示了空间准确性的系统差距,并表明文本监督增强了地理空间表示的学习。我们的研究结果表明,语言作为编码空间上下文的有效补充方式,而多模态学习作为推进地理空间人工智能的关键方向。