论文
SciExplore:从科学导航到信息整合评估自主智能体
SciExplore: Evaluating Autonomous Agents from Scientific Navigation to Information Integration
摘要
科学研究涉及跨异构来源的复杂信息获取与推理工作流。但现有基准主要强调通用域检索或静态科学问答,因此无法评估现实科研工作流所需的关键能力。我们提出SciExplore,一个评估LLM与智能体科学信息获取与推理能力的基准:含四类任务、覆盖十余个学科的103个专家精选任务——科学数据库导航、含糊文献检索、缺失参考文献补全与跨源结构化知识综合——探测从实体级推理、文档级识别到证据级落地与领域级综合的逐级更高能力。我们在SciExplore上评估十余个最先进LLM与自主智能体:性能差距显著,任务复杂度上升时表现骤降,最具挑战性的结构化综合任务上准确率极低。结果凸显当前模型与智能体在现实科学信息获取场景中的重大局限。
