论文
Sci-MMR:多模态Agent的多步证据支撑科学推理基准
Sci-MMR: Benchmarking Multi-Step Evidence-Grounded Scientific Reasoning in Multimodal Agents
摘要
人们越来越期望自主研究机构能够搜索文献、分析实验证据并提出科学假设。这些能力需要多步骤的基于证据的推理,在得出结论之前逐步获取、整合和验证证据。然而,现有的多模态基准主要评估最终答案的准确性,而预测是否真正得到可追溯的科学证据的支持尚不确定。我们引入了 Sci-MMR,这是一个多步骤基于证据的科学推理的基准,建立在链接科学主张、基于引文的知识、视觉证据和支持区域的结构化论证图之上。 Sci-MMR 包含跨越四个科学学科的 235 个多跳推理任务,每个任务平均有 9 个图形面板。通过评估八个前沿多模态模型,我们发现答案准确性始终超过完整证据恢复率 20% 以上,揭示了仅答案评估在结构上无法捕获的巨大差距。通过受控干预,我们发现了两个基本瓶颈。首先,证据获取:模型难以从科学数据中提取完整的结构化证据,占失败的 57.2%。虽然裁剪工具产生的收益不大(+4.5 分),但提供黄金证据可将准确性提高高达 37.0 分,这表明收集完整的多区域证据存在困难。其次,证据整合:模型很难将现有证据转化为正确的结论,占失败的 31.8%,而即使有黄金证据,最强的模型在最困难的任务上也只能达到 69.1% 的准确率。这些发现表明,当前以答案为中心的基准大大高估了多模态研究智能体的循证推理能力