论文
PaperScope:面向海量科学论文智能体深度研究的多模态多文档基准
PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers
摘要
利用多模态大语言模型(MLLM)加速前沿科学研究前景可观,但如何严格评估此类系统仍不明确。现有基准主要聚焦单文档理解,而真实的科学工作流需要整合来自多篇论文的证据,包括其文本、表格与图。因此,多模态多文档科学推理仍缺乏研究,也没有系统性评估。为填补这一空白,我们提出PaperScope,一个面向智能体深度研究的多模态多文档基准。PaperScope具有三大优势:(1) 结构化的科学根基。它建立在覆盖三年、超过2,000篇AI论文的知识图谱之上,为面向研究的查询提供结构化基础。(2) 语义密集的证据构建。它整合语义相关的关键信息节点,并采用优化的随机游走论文选择器抽取主题连贯的论文集合,从而保证足够的语义密度与任务复杂度。(3) 科学推理的多任务评估。它包含超过2,000个问答对,覆盖推理、检索、摘要与问题求解,支持多步科学推理的评估。实验结果显示,即便是OpenAI Deep Research与Tongyi Deep Research等先进系统在PaperScope上的得分也很有限,凸显了长上下文检索与深度多源推理的难度。因此,PaperScope既提供了严格的基准,也提供了构建大规模多模态多源深度研究数据集的可扩展流水线。
