论文

不是搜索,而是扫描:在扫描导向的学术论文推理上评测MLLM

Not Search, But Scan: Benchmarking MLLMs on Scan-Oriented Academic Paper Reasoning

模型评测基准与评测资源

摘要

随着多模态大语言模型(MLLM)的快速进步,AI 已能在文献检索与部分推理任务上表现良好,充当人类研究者的得力助手,但距离自主研究仍很遥远。根本原因在于,当前的学术论文推理工作大多局限于以预定目标为中心的搜索导向范式,推理建立在相关性检索之上,难以支持研究者式的全文理解、推理与核查。为弥合这一差距,我们提出 ScholScan,一个新的学术论文推理基准。ScholScan 引入一种扫描导向(scan-oriented)的任务设定,要求模型像人类研究者那样通读并交叉核查整篇论文,通过扫描文档来发现一致性问题。该基准包含 1,800 道精心标注的题目,来自 13 个自然科学领域 715 篇论文中的九类错误,并提供证据定位与推理轨迹的详细标注,以及统一的评估协议。我们在 24 种输入配置下评估了 15 个模型,并对 MLLM 在所有错误类别上的能力进行了细粒度分析。总体来看,检索增强生成(RAG)方法未带来显著提升,揭示了当前 MLLM 在扫描导向任务上的系统性缺陷,也凸显了 ScholScan 带来的挑战。我们期望 ScholScan 成为扫描导向任务范式的引领性与代表性工作。

不是搜索,而是扫描:在扫描导向的学术论文推理上评测MLLM:论文配图
图1:检索导向与扫描导向任务范式对比:后者不预设目标,要求模型主动通读全文、构建文档级证据视图再作答,考察MLLM的论文级推理能力。