论文

开放权大语言模型基于网络的空间上下文检索:扎根地理推理的忠实基准

Network-based Spatial Context Retrieval for Open-weight LLMs: A Faithfulness Benchmark for Grounded Geographic Reasoning

模型评测基准与评测资源

摘要

大语言模型(LLM)编码大量潜在的地理知识,但它们在空间上的推理能力很差,并且仅从坐标查询时并不可靠。仅当提示中提供结构化空间上下文时,才会出现有用的行为。这就提出了一个尚未检验的地理评估问题:一旦提供了正确的上下文,模型是否会从中进行推理,或者用自己的参数召回来覆盖它?我们通过基于网络的空间上下文检索的开放管道来解决这个问题。其中,选定点的周围环境由步行街网络定义,即实际上步行可达的区域。该管道仅使用开放数据和开放权重模型,从 OpenStreetMap 和 GHS-POP 人口网格中检索特征,用代码计算网络流域的指标,并将它们作为紧凑的空间简介注入。在此基础上,我们建立了诚信基准。它根据模型的来源(基于摘要或来自训练知识)及其正确性来标记模型提出的每个主张,并用摘要反驳的虚假前提来探究每个案例。我们在三个对比城市中评估了三个家族(Qwen、Gemma 和 Llama,Gemma 为两代)、四个规模类别以及思维模式和非思维模式(如果可用)的 16 个开放权重模型配置,对超过 10 个种子的每个案例进行了重新采样。结果表明,对种植前提的抵抗力随模型家庭和世代的不同而变化,而不是随规模的变化,而简读能力则形成了一个部分独立的维度。传统的世界正确性分数或单次评估无法捕获这些行为。我们在 github.com/perezjoan/NSCR-LLM 上将实施、空间简报、模型输出和声明级标签作为可重复的工作流程发布。