论文

SciExplore:从科学导航到信息整合评估自主智能体

SciExplore: Evaluating Autonomous Agents from Scientific Navigation to Information Integration

智能体系统Agent任务评测

摘要

科学研究涉及跨异构来源的复杂信息获取与推理工作流。但现有基准主要强调通用域检索或静态科学问答,因此无法评估现实科研工作流所需的关键能力。我们提出SciExplore,一个评估LLM与智能体科学信息获取与推理能力的基准:含四类任务、覆盖十余个学科的103个专家精选任务——科学数据库导航、含糊文献检索、缺失参考文献补全与跨源结构化知识综合——探测从实体级推理、文档级识别到证据级落地与领域级综合的逐级更高能力。我们在SciExplore上评估十余个最先进LLM与自主智能体:性能差距显著,任务复杂度上升时表现骤降,最具挑战性的结构化综合任务上准确率极低。结果凸显当前模型与智能体在现实科学信息获取场景中的重大局限。

SciExplore:从科学导航到信息整合评估自主智能体:论文配图
图 1:SciExplore 概述。该基准将科学信息寻求评估为渐进的认知过程,涵盖四种任务类型,从 (A) 实体级推理,到 (B) 文档级文献识别,(C) 证据级参考基础,最后 (D) 领域级知识合成。