论文

OmniMatBench:横跨 19 个材料科学子领域的人工校准多模态推理基准

OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields

模型评测基准与评测资源

摘要

随着多模态语言模型在科学研究中发挥日益重要的作用,材料科学因其跨学科、多模态与应用驱动的特性而提供了一个关键的试验场。然而,现有的材料学基准主要聚焦于性质预测、知识问答或表征理解,对从材料知识到应用的更广泛推理过程探索不足。为填补这一空白,我们提出 OmniMatBench,一个人工校准的材料科学多模态推理基准。OmniMatBench 包含 3,171 道由专家精选的问答与计算题,覆盖 19 个材料科学子领域,横跨基础材料知识、结构与工程材料、材料加工与制造以及功能与应用材料。我们评估了 13 个开源与闭源多模态大模型(MLLM),发现最好的模型总分仅为 0.372,暴露出当前材料科学推理能力的巨大差距。进一步分析显示,各子领域表现差异显著,模型存在固化的推理套路、材料知识参差不齐,并且在公式、检索与代码辅助设置下高层知识的应用能力有限。OmniMatBench 为认识当前 MLLM 的能力与局限提供了关键洞见,并为在材料科学研究中构建可靠的 AI 助手奠定了基础。

OmniMatBench:横跨 19 个材料科学子领域的人工校准多模态推理基准:论文配图
图1:OmniMatBench总览:展示19个材料科学子领域如何归类到四大领域的划分结构。