论文
SciVQR:高级科学推理评估的多学科多模态基准
SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation
摘要
科学推理是人类智能的一个关键方面,需要整合多模式输入、领域专业知识以及跨学科的多步骤推理。多模态 大语言模型 (MLLM) 的现有基准通常无法捕获严格评估所需的推理过程的复杂性和可追溯性。为了填补这一空白,我们引入了 SciVQR,这是一个涵盖数学、物理、化学、地理、天文学和生物学 54 个子领域的多模态基准。 SciVQR 包括特定领域的视觉效果,例如方程、图表和图表,以及将视觉理解与推理相结合的挑战模型。任务范围从基本的事实回忆到复杂的多步骤推理,其中 46% 包括专家编写的解决方案。 SciVQR 不仅评估最终答案,还检查推理过程,提供有关模型如何得出结论的见解。我们对领先的 MLLM(包括专有模型和开源模型)的评估揭示了处理复杂多模态推理任务的重大局限性,强调了改进多步骤推理和更好地整合跨学科知识以推动 MLLM 迈向真正的科学智能的需要。数据集和评估代码可在 https://github.com/CASIA-IVA-Lab/SciVQR 上公开获取。