论文
MultiGlobeQA:多语言且全球多样化的地理空间推理基准
MultiGlobeQA: A Multilingual and Globally Diverse Benchmark for Geospatial Reasoning
摘要
地理空间推理,即计算现实世界实体的距离、包含和其他空间关系,是导航和物流的核心,但 大语言模型 (LLM) 尽管存储了大量地理知识,但仍难以完成所需的几何和拓扑计算。现有的基准仅部分定位这些失败:它们是综合的或小规模的,大部分是单语的,并且对地理覆盖范围的控制有限。我们引入了 MultiGlobeQA,这是一个包含 46,060 个问答对的多语言基准,涵盖 14 个空间函数系列和 15 种答案格式,并在三个知识图上基于执行的 真值。它通过收入和密度分层抽样覆盖 201 个国家和地区,并用英语和另外 16 种高资源和低资源语言提出平行问题。在参数、推理和代理设置中,LLM 在需要网格索引和形状计算的任务上崩溃,而拓扑关系和方向表现最好。检索和工具的使用产生了可观的收益,但即使提供了标准事实,性能也稳定在三分之二以下,这表明计算而不是知识的获取才是瓶颈。模型在低收入地区的表现也不佳,标准事实扩大而不是缩小了这一差距。