论文

GeoBenchLLM:面向地理相关任务的大语言模型综合评测基准

GeoBenchLLM: A Comprehensive Benchmark for Evaluating LLMs on Geo-Related Tasks

模型评测基准与评测资源

摘要

在地理数据背景下,现有大语言模型往往是在同质化设置中被研究的,这极大限制了对它们泛化能力的认识。本文提出GeoBenchLLM,一个用于探究大语言模型在地理相关任务上表现的综合基准。我们精心选取了来自多样化地理相关任务与领域的十二个公开数据集,并使用该基准评估一组大语言模型在地理空间与时间理解方面的能力。我们的结果表明,推理能力与模型规模对整体性能有很强的影响。GeoBenchLLM已公开发布于 https://github.com/Rfr2003/GeoBenchLLM。