论文

GPSBench:大语言模型理解 GPS 坐标吗?

GPSBench: Do Large Language Models Understand GPS Coordinates?

模型评测基准与评测资源

摘要

大语言模型(LLM)越来越多地部署于与物理世界交互的应用,如导航、机器人或地图,使稳健的地理空间推理成为关键能力。尽管如此,LLM 对 GPS 坐标和真实世界地理的推理能力仍未被充分研究。我们提出 GPSBench,一个含 57,800 个样本、17 个任务的数据集,用于评估 LLM 的地理空间推理,涵盖几何坐标运算(如距离与方位角计算)以及坐标与世界知识结合的推理。聚焦模型内在能力而非工具使用,我们评估 14 个最先进 LLM,发现 GPS 推理仍然困难且任务间差异显著:模型在真实世界地理推理上普遍比几何计算更可靠。地理知识呈层级退化,国家级表现强而城市级定位弱;对坐标噪声的鲁棒性则表明模型确有坐标理解而非死记硬背。我们进一步表明,GPS 坐标数据增广可改进下游地理空间任务,而微调会在几何计算收益与世界知识退化之间带来权衡。数据集与可复现代码见 https://github.com/joey234/gpsbench

GPSBench:大语言模型理解 GPS 坐标吗?
图11:所有GPSBench任务按子区域划分的区域性能。Applied Track任务(上)表现出不同程度的地理偏差,其中Place Association的差异最强。Pure GPS Track任务(下)的区域差异极小,证实几何计算在很大程度上与区域无关。