论文
OVEarth-Bench:评估开放词汇地球观测的类别广度和查询多样性
OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation
摘要
开放词汇地球观测(EO)旨在本地化以自然语言而不是固定标签集指定的地理空间概念。然而,现有的基准通常涵盖狭窄的类别词汇表或有限的查询形式。为了填补这一空白,我们引入了 OVEarth-Bench,它将现有的评估扩展到两个方向:类别广度(通过积极和消极表达的广泛层次类别覆盖)和查询多样性(通过词汇、引用和推理查询)。该基准测试支持统一零样本协议下的掩模和框定位。我们评估了一系列广泛的通用方法和 EO 特定方法。评估结果表明:(1)当前方法的性能仍然有限,而更广泛的类别覆盖可以产生更稳定的模型排名; (2)基于MLLM的方法取得了最强的整体性能; (3) EO 特定方法通常表现不佳,并且很少能与最强方法相匹配。这些发现为未来开放词汇EO方法设计提供了指导,并强调了开发更现实、多样化、高质量和大规模基准以进行可靠评估的重要性。我们的数据和评估包发布于 https://earth-insights.github.io/OVEarth-bench。