论文
GeoAgentBench:面向空间分析工具增强智能体的动态执行基准
GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis
摘要
大语言模型(LLM)融入地理信息系统(GIS)标志着向自主空间分析的范式转变。然而,由于地理空间工作流复杂的多步特性,评估这些基于LLM的智能体仍然困难。现有基准主要依赖静态文本或代码匹配,忽视了动态运行时反馈与空间输出的多模态特性。为弥合这一差距,我们提出GeoAgentBench(GABench),一个为工具增强GIS智能体量身定制的动态交互评估基准。GABench提供集成了117个原子GIS工具的真实执行沙箱,涵盖6个核心GIS领域的53个典型空间分析任务。鉴于精确的参数配置是动态GIS环境中执行成功的主要决定因素,我们设计了参数执行准确率(PEA)指标,采用“Last-Attempt Alignment”策略量化隐式参数推断的保真度。作为补充,我们提出基于视觉语言模型(VLM)的验证,以评估数据空间精度与制图风格符合度。此外,为解决参数错配与运行时异常导致的频繁任务失败,我们开发了新颖的Plan-and-React智能体架构,通过解耦全局编排与逐步反应式执行来模拟专家认知工作流。对七个代表性LLM的大量实验表明,Plan-and-React范式显著优于传统框架,在逻辑严谨性与执行鲁棒性之间取得最优平衡,尤其在多步推理与错误恢复方面。我们的发现凸显了当前能力边界,并为评估和推进下一代自主GeoAI确立了稳健标准。
