论文
GeoAgent:通过嵌入式导航评估 VLM 地理定位
GeoAgent: Evaluating VLM Geolocalization Through Embodied Navigation
摘要
现代视觉语言模型 (VLM) 在图像地理定位方面的表现远远高于人类基线,这是一项在灾难响应、OSINT 验证和位置隐私中至关重要的任务。然而,大多数研究人工智能在任务中的行为的努力仍然仅限于基于静态图像的检索、分类和预测。我们认为,忠实地重现任务应该涉及具体导航,即多模式智能体在提交预测之前自主探索周围环境以收集观察结果。为此,我们引入了 \textbf{GeoAgent},这是一种基于代理环境的基准,要求代理导航街景环境,通过顺序推理来完善其地理定位。我们的分析表明,现代 VLM 在成功进行国家和大陆级别的预测的同时,很难辨别区域模式。与基于静态图像的基线相比,代理导航显着提高了既定指标的准确性。我们还注意到,在发达/发展中地区的背景下,前沿模型架构存在严重偏差,并且在先验不正确的情况下,自我改进能力较差。总的来说,我们的工作确定了具体化导航和地理空间推理的挑战。我们公开发布我们的代码和 GeoAgent 环境:https://geoagent-benchmark.github.io