论文

GeoRefer-Bench:从参考像素到可验证地理空间推理的基准

GeoRefer-Bench: A Benchmark from Referring Pixels to Verifiable Geospatial Reasoning

模型评测基准与评测资源

摘要

俯视图像中的参考分割本质上是相关的:查询可能会询问道路以北的建筑物或最靠近住宅区的池塘,因此正确的参考对象可以包含一个对象、多个对象或不包含任何对象。现有的基准主要对掩模重叠进行评分,无法验证模型是否真正解决了所述的空间关系。我们引入 GeoRefer-Bench,这是可验证的地理空间引用分割的基准。每个查询都由度量场景图上的可执行逻辑形式表示,并且使用精确查询成功(EQS)来评估预测,只有当返回的实例集与查询表示的集完全匹配时才满足该预测。 GeoRefer-Bench 包含 12.5 厘米和 25 厘米地面采样距离的 700 个完整 2048x2048 无人机场景 (2.94 Gpx)、26,217 个实例、142,796 个空间关系以及跨越五个推理级别的 20,916 个可执行查询。它还包括每个查询三个释义、24.0% 无法回答的查询、2,477 个反事实对和五个泄漏控制的评估分割。独立审计重新导出对象几何形状、掩码所有权、关系值、查询执行和分割来源,在所有 700 个场景中发现零问题。关系盲策略可以保留不平凡的 MIoU,同时总体达到最多 22.7 EQS,这表明仅重叠并不能证明关系基础。在 15 个当前模型中,最强的达到 74.1 EQS,但从 1 级的 98.9 下降到 5 级的 60.5,而 10 个模型在两跳查询上的得分低于 5 EQS。 GeoRefer-Bench 将地理空间参考分割从掩模匹配转变为可验证的参考分辨率。