论文

GeoR-Bench:评估地球科学视觉推理

GeoR-Bench: Evaluating Geoscience Visual Reasoning

模型评测基准与评测资源

摘要

地球科学情报有望理解、推理和预测地球系统的变化,以支持人类在灾害应对、气候适应和环境保护等关键领域的决策。尽管当前的研究在遥感解释、地理问答等特定地球科学任务上取得了有希望的进展,但现有的基准在很大程度上仍然是特定于任务的,无法捕捉开放式的现实世界地球科学问题。因此,目前尚不清楚当前的人工智能系统距离实现真正的地球科学智能还有多远。为了解决这一差距,我们提出了 \textbf{GeoR-Bench},这是一个 \underline{Bench} 标记,用于通过推理通知视觉编辑任务来评估 \underline{Geo}science 视觉 \underline{R} 推理。 GeoR-Bench 包含 440 个精选样本,涵盖 6 个地球科学类别和 24 个任务类型,涵盖地球观测图像和结构化科学表示(例如地图和图表)。我们从三个维度评估输出,包括推理、一致性和质量。 21 个封闭和开源多模态模型的基准结果表明,地球科学推理仍然是一个关键瓶颈。性能最高的模型总体严格准确率达到 42.7%,而最好的开源模型仅达到 10.3%。值得注意的是,输出的视觉一致性和图像质量经常超过其科学准确性。最终,这些发现表明,当前的模型产生了表面上合理的结果,但未能捕捉到潜在的地球科学过程。