论文

GeoMMBench 和 GeoMMAgent:迈向地球科学和遥感领域的专家级多模态智能

GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 的最新进展加速了面向领域的人工智能的进展,但其在地球科学和遥感 (RS) 领域的发展仍然受到独特挑战的限制:广泛的学科知识、异构传感器模式和碎片化的任务谱。为了弥补这些差距,我们引入了 GeoMMBench,这是一个全面的多模式问答基准,涵盖不同的 RS 学科、传感器和任务,能够比以前的基准进行更广泛、更严格的评估。使用 GeoMMBench,我们评估了 36 个开源和专有的 大语言模型,发现了领域知识、感知基础和推理方面的系统性缺陷,而这些能力对于专家级地理空间解释至关重要。除了评估之外,我们还提出了 GeoMMAgent,这是一个多代理框架,通过特定领域的 RS 模型和工具战略性地集成检索、感知和推理。大量实验结果表明,GeoMMAgent 的性能显着优于独立的 LLM,强调了工具增强代理对于动态应对复杂的地球科学和遥感挑战的重要性。