论文

GeoAgentBench:面向空间分析工具增强智能体的动态执行基准

GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis

智能体系统AI 基础设施Agent任务评测SandboxAgent Sandbox

摘要

大语言模型(LLM)融入地理信息系统(GIS)标志着向自主空间分析的范式转变。然而,由于地理空间工作流复杂的多步特性,评估这些基于LLM的智能体仍然困难。现有基准主要依赖静态文本或代码匹配,忽视了动态运行时反馈与空间输出的多模态特性。为弥合这一差距,我们提出GeoAgentBench(GABench),一个为工具增强GIS智能体量身定制的动态交互评估基准。GABench提供集成了117个原子GIS工具的真实执行沙箱,涵盖6个核心GIS领域的53个典型空间分析任务。鉴于精确的参数配置是动态GIS环境中执行成功的主要决定因素,我们设计了参数执行准确率(PEA)指标,采用“Last-Attempt Alignment”策略量化隐式参数推断的保真度。作为补充,我们提出基于视觉语言模型(VLM)的验证,以评估数据空间精度与制图风格符合度。此外,为解决参数错配与运行时异常导致的频繁任务失败,我们开发了新颖的Plan-and-React智能体架构,通过解耦全局编排与逐步反应式执行来模拟专家认知工作流。对七个代表性LLM的大量实验表明,Plan-and-React范式显著优于传统框架,在逻辑严谨性与执行鲁棒性之间取得最优平衡,尤其在多步推理与错误恢复方面。我们的发现凸显了当前能力边界,并为评估和推进下一代自主GeoAI确立了稳健标准。

GeoAgentBench:面向空间分析工具增强智能体的动态执行基准:论文配图
图 1:GeoAgentBench (GABench) 框架与现有范例相比的概述。上图说明了传统非交互式基准的局限性:LLM 生成通过词汇相似性(文本基本事实)进行评估的代码或计划,但在真实的 GIS 环境中经常遇到执行错误(例如,投影不匹配、拓扑异常),从而给用户留下未经验证且通常无法使用的脚本。下面板展示了 GABench 的动态闭环执行范例。我们的框架在交互式沙箱中集成了由 117 个原子 GIS 工具组成的库,使代理能够感知实时执行反馈(错误消息)并迭代地完善其轨迹。评估是在两个互补的层次上进行的:(1) 逐步度量(TAO、TIO、TEM 和创新的 PEA),用于验证工具调用操作的逻辑一致性; (2) 使用 VLM Evaluator 进行端到端多模态验证,将最终结果地图与 GT 地图进行比较,以确保数据空间准确性和制图质量,从而提供真正经过验证的地理空间产品。