论文
视觉语言模型在哪里失败了?图像地理定位的世界尺度分析
Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
摘要
传统上,图像地理定位是通过基于检索的地点识别或基于几何的视觉定位管道来解决的。视觉语言模型 (VLM) 的最新进展在多模态任务中展示了强大的零样本推理能力,但其在地理推理方面的性能仍未得到充分探索。在这项工作中,我们仅使用地面视图图像对多个最先进的 VLM 进行国家级图像地理定位的系统评估。我们不依赖图像匹配、GPS 元数据或特定于任务的训练,而是在零样本设置中评估基于提示的国家/地区预测。所选模型在三个不同地理位置的数据集上进行测试,以评估其稳健性和泛化能力。我们的结果揭示了模型之间的巨大差异,突出了语义推理在粗略地理定位方面的潜力以及当前 VLM 在捕获细粒度地理线索方面的局限性。这项研究首次对用于国家级地理定位的现代 VLM 进行了集中比较,并为未来多模态推理和地理理解交叉领域的研究奠定了基础。