论文
GeoNatureAgent基准:跨前沿与开放权重基础模型的环境地理空间分析LLM智能体基准
GeoNatureAgent Benchmark: Benchmarking LLM Agents for Environmental Geospatial Analysis Across Frontier and Open-Weight Foundation Models
摘要
环境科学家在数据争论而不是分析上花费了过多的精力。新的人工智能代理可能是一个有用的工具,但没有基准来评估通过针对真实 API 的结构化工具调用来自动化环境地理空间工作流程的人工智能代理。我们推出了 GeoNatureAgent Benchmark,这是环境分析代理的第一个基准,通过对生产型地理空间 API 的结构化工具调用进行操作。该基准包括 18 个类别的 93 项任务。任务根据开放的、自托管的地理空间 API 进行评估,该 API 通过 16 个工具为西班牙和葡萄牙的三个环境指标提供服务。我们评估了九个前沿和开放权重大语言模型、报告能力和每个案例的成本作为正交轴。结果表明:(1)Claude Sonnet 4 的性能最高,为 60.8% +/- 0.8%,其次是 DeepSeek V3.2,为 56.3% +/- 3.1%,其他模型没有超过 51%; (2) 成本精度帕累托前沿主要由开放权重模型占据,DeepSeek V3.2 以低 11.6 倍的成本提供了 Claude 93% 的能力; (3) 针对真实 API 的结构化工具调用提供了对真实世界代理能力更具辨别力的衡量标准,其平均准确度比通用 GIS 基准报告的平均准确度低 25-35 个百分点。
