GeoContext:一个上下文阶梯,视觉语言地理定位中的两种故障模式:对用户提供的位置上下文的完全依赖和位置声明的错误确认
GeoContext: One Context Ladder, Two Failure Modes in Vision-Language Geolocation: Flat Reliance on User-Provided Location Context and False Confirmation of Location Claims
摘要
视觉地理定位基准通常会询问模型在何处捕获图像,而不考虑用户经常提供的位置上下文。我们引入了 GeoContext,这是一个支持两个互补任务的资源:GeoHint(给出真实但粗略的位置提示的开放式本地化)和 GeoVerify(对图像是否在距声明地点 150 m 范围内拍摄的图像进行二进制验证)。 GeoContext 通过根据距离和可参考性对附近的参考点进行分层来构建上下文阶梯,从而允许图像在提供的上下文变化时保持固定。该基准测试覆盖 30 个城市的 109 个站点,并使用 21,933 个 GeoHint 响应和 6,270 个 GeoVerify 响应评估了五种视觉语言模型。我们的评估揭示了三种主要模式。首先,提示重复在参考性等级之间仅变化 1.5 个百分点,在距离范围内变化不到 3 个百分点,而由此产生的定位误差随着提示距离的增加而稳定增加。其次,行为在很大程度上取决于无上下文性能:在无上下文准确度较低的网站上,定位误差与提示距离之间的中值比率约为 1.00,而在准确度较高的网站上,其范围为 0.24 到 0.69。在纠正站点分组过程引入的偏差后,五个模型中只有一个在给出附近提示时保留负准确度估计。第三,在 GeoVerify 中,对于立即超出 150 m 容差的诱饵,没有模型达到 d' = 1。当敏感性与响应偏差分开时,模型排名也会发生变化,并且 83.8% 的错误接受报告的置信度至少为 0.8。我们发布基准、构建管道、审核决策和评分代码。