论文

解码科学实验图像:感知、理解和推理的 SPUR 基准

Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning

模型评测基准与评测资源

摘要

我们推出 SPUR,这是一个用于科学实验图像感知、理解和推理的综合基准,由来自 1,084 张专家策划的图像的 4,264 个问答 (QA) 对组成。 SPUR 具有三个关键创新:(1)面板级细粒度感知:在六种细粒度面板类型上跨三个维度(数字、形态和信息定位)评估多模态 大语言模型 (MLLM) 的视觉感知; (2) 跨面板关系理解:利用平均每个样本 14.3 个面板的复杂图像来评估 MLLM 破译复杂的跨面板关系的能力; (3) 专家级推理:评估五种实验范式的定性和定量推理,以确定模型是否可以像人类专家一样从证据中推断出结论。对 20 个 MLLM 和四种多模态思想链 (MCoT) 方法的综合评估表明,当前模型明显低于科学图像解释的专家级要求,凸显了人工智能科学 (AI4S) 研究的关键瓶颈。