论文

GISAgentBench:来自实际从业问题的GIS智能体评测

GISAgentBench: A Practitioner-Sourced Benchmark for Evaluating LLM Agents on GIS Tasks

智能体系统Agent任务评测

摘要

地理信息系统(GIS)专业人士依赖多步空间分析工作流程来支持城市规划、灾难响应和环境监测中的决策。该过程繁琐、耗时且易出错。虽然最近的大语言模型(LLM)代理配备外部工具具有自动化地理空间分析的潜力,但它们在执行现实的GIS工作流程方面的能力尚未得到充分探索。现有的GIS代理基准测试数据集大多来自教科书、教程或LLM生成的种子,且在规模和轨迹深度上有限。更重要的是,它们缺乏真实输出。因此,它们依赖于诸如代码相似性、轨迹匹配或LLM和VLM判官等替代信号,这些信号可以将工作流程的相似性与任务正确性混淆。为解决这一差距,我们引入了GISAgentBench,这是一个从GIS Stack Exchange中精选的349个多步GIS任务的基准测试,这些任务在选定的六个国家地理区域上实例化了真实公共数据。每个任务都附有可执行的参考轨迹和精确的真实输出文件,使严格、确定性和容忍度高的输出匹配超越LLM判官。六种LLM模型的评估揭示了现实的GIS工作流程仍然具有挑战性:最好的代理仅完成32.7%的任务,尽管大多数模型生成的输出与真实情况非常接近。

GISAgentBench:源于从业者的LLM Agent GIS任务评测基准:论文配图
图 1:GISAgentBench 任务的说明性示例。