论文

PaperMind:多模式中科学论文的代理推理和批评基准 LLM

PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs

模型评测基准与评测资源

摘要

理解科学论文需要的不仅仅是回答孤立的问题或总结内容。它涉及一个综合推理过程,以文本和视觉信息为基础,解释实验证据,综合各种来源的信息,并批判性地评估科学主张。然而,现有的基准通常单独评估这些能力,因此很难将科学论文理解作为一组统一的相互作用的认知能力进行评估。在这项工作中,我们介绍了 PaperMind,这是一个旨在评估研究论文的集成和面向主体的科学推理的基准。 PaperMind 由七个领域的真实科学论文构建而成,包括农业、生物学、化学、计算机科学、医学、物理学和经济学。它由四个互补的任务系列组成,共同操作科学论文推理的不同认知方面,包括多模态基础、实验解释、跨源证据推理和批判性评估。通过分析跨多个任务的模型行为,PaperMind 能够对难以通过孤立的任务评估进行评估的综合科学推理行为进行诊断评估。对开源和闭源多模态 LLM 进行的广泛实验揭示了任务之间一致的性能差距,突出了综合科学推理和批评中持续存在的挑战。我们的基准测试和数据集可在 https://github.com/Yanjun-Zhao/PaperMind 获取。