论文

GeoNatureAgent:地理空间与环境任务Agent的上线前评测

GeoNatureAgent (GNA): A Framework and Benchmark for Pre-Production Evaluation of Tool-Using Agents on Geospatial and Environmental Tasks

智能体系统智能体互操作协议Agent任务评测MCP

摘要

在环境和地理空间工作流程中部署使用工具的 LLM Agent之前,团队需要证据证明Agent能够针对真实 API 可靠地选择正确的操作。我们引入了 GeoNatureAgent (GNA),这是一个用于使用工具的Agent进行预生产评估的框架:作为模型上下文协议 (MCP) 服务器发布的固定的 16 个工具地理空间接口,因此被测试的Agent是唯一的变量,根据相同的工具层、任务套件和确定性评分器进行评分。其旗舰实例是一个 103 任务基准(涵盖 18 个类别的 93 任务主套件加上 10 任务比较扩展),根据开放的、可自托管的地理空间 API 进行评估,该 API 服务于西班牙和葡萄牙的三个环境指标。我们评估了三个温度 1.0 种子下的九个LLM,报告能力和每个案例的成本作为正交轴。 (1) Claude Sonnet 4 实现了最高的能力(在所有 103 个任务上为 61.7% +/- 0.7%;在主套件上为 60.8%),紧随其后的是 DeepSeek V3.2 (57.9%),而没有其他模型超过 53%; (2) 成本准确性 Pareto 边界大部分是开放权重的,DeepSeek V3.2 以约1/11.3的标价成本提供了 Claude 93% 的能力; (3) 在严格的全检查评分下,最佳模型比通用 GIS 基准报告的 85-97% 低 24-36 分,而前四个模型的每次检查部分得分 (86-90%) 相当,因此这种差距在很大程度上反映了评分严格性,而不仅仅是任务难度。 MCP 服务器、评估工具、基准测试和 API 都是公开可用的;交换工具执行器和任务套件可为任何地理空间域实例化等效基准。