论文

地点文字保留了什么:跨视图定位的零样本语言推理

What Words Keep of a Place: Zero-Shot Language Reasoning for Cross-View Geo-Localization

模型评测模型能力评测

摘要

跨视图地理定位通常作为图像检索问题来解决,通过联合训练的嵌入将地面图像与卫星图块数据库进行匹配。这些模型是准确的,但它们需要大量的配对监督,并且无法显示支持匹配的证据。在本文中,我们研究了一个不同的问题:这项任务中有多少可以仅通过语言来解决?我们提示多模态大语言模型 (MLLM) 将每个地面全景图和每个卫星图块描述为结构化文本,并通过比较这些描述进行本地化。没有组件经过训练。我们在三种环境下对来自美国四个城市的 9,826 对 VIGOR 进行了评估。首先,描述是忠实的,但不带有歧视性。他们在两种观点上非常一致,但通过描述相似性对整个池进行排名几乎永远不会返回正确的图块(0.39% 召回率@1)。其次,我们将池缩小到十个相邻的图块,就像粗略的先验一样。相同的描述现在变得有用:对结构一致性进行评分的 MLLM 法官使随机排名加倍,并匹配强大的词汇基线。它还说明了两种描述的哪些字段一致,哪些字段冲突,哪些字段是嵌入距离无法做到的,我们将其视为迈向可解释定位的一步。第三,我们将法官放在训练有素的视觉检索器上。在查询中,它排名错误,根据图像重新排名有效,而根据我们的描述重新排名则不行(23.5% 对 10.7% 召回率@1)。场景结构在转换成语言后仍然存在,而分隔附近地点所需的精细外观细节则不然。代码和提示可在 https://github.com/AyeshAbuLehyeh/GeoLingual. 上公开获取

地点文字保留了什么:跨视图定位的零样本语言推理:论文原图
图 1:研究概述。提示的 MLLM 将两种视图转换为结构化 XML 描述。然后在三个设置中使用相同的描述:在整个池中检索、在小地理邻域内逐点验证以及对经过训练的视觉检索器的前 10 名进行列表重新排序。没有任何组件经过微调。设置 3 是在视觉 top-1 错误的 591 个查询上得分的。