论文

ERGeoBench:多模态中的体现推理和地理定位的综合基准 大语言模型

ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 作为具身智能体显示出强大的潜力,但由于缺乏细粒度的评估,具身地理定位仍未得到充分探索。我们推出 ERGeoBench,这是一种视觉驱动的具体地理定位的诊断基准。 ERGeoBench 在三种渐进设置(单视图、全景视图和体现视图)下评估模型,其中代理可以通过偏航、俯仰和缩放的顺序变化主动获取观察结果。该基准包含 2,207 个全球分布的街景全景图,并衡量四种互补能力:基础感知、空间感知、常识推理和地理定位推理。对领先的专有和开源 MLLM 的评估表明,当前模型可以推断高级地理语义,但仍难以解决细粒度感知操作、度量本地化和跨视图的空间一致性。我们进一步观察到,地理定位与其他能力维度密切相关,这表明准确的定位取决于综合感知、空间推理和常识推理,而不是孤立的视觉识别。总体而言,ERGeoBench 提供了一个统一的框架,用于诊断和推进类人的具体地理定位。项目页面:https://kaixuewen.github.io/ERGeoBench/