论文
TerraBench:智能体能推理异构地球系统数据吗?
TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?
摘要
气候和环境决策越来越需要对异构输入进行推理,包括网格物理数据、卫星图像、地理空间背景和模拟器输出。天气和气候基础模型可以很好地进行预测,但不能用语言进行交互推理,而大型语言模型(LLM)可以用语言进行推理,但不能直接对高维地球系统数据进行操作。因此,地球科学中真正的科学工作流程仍然得不到充分服务。我们介绍了 TerraBench,这是一个基于 TerraAgent 的基础地球科学推理基准,它是一个 ReAct 风格的可执行框架,它交织推理、工具调用和观察,将大语言模型规划与环境检索、地理空间处理、模拟和工件支持计算的科学工具结合起来。 TerraBench 将地球观测图像、网格数据、GIS 推理和模拟的分析统一在一个可执行界面中,而之前的基准测试将这些功能隔离为狭窄的单独任务。它也是该领域中第一个将流程级工具使用指标与公差感知数字评分相结合的产品。该基准测试包括 403 个广泛的代理任务,跨越三个轨道(基础、模拟器和文档验证)和 8 个应用程序域,包含 24,500 个经过验证的执行步骤。这些结果表明,可靠的地球科学代理必须超越工具访问来协调异构工作流程、精确参数化工具并保留工件来源。
