论文

ScholarQuest:开放文学环境中代理学术论文搜索的分类学指导基准

ScholarQuest: A Taxonomy-Guided Benchmark for Agentic Academic Paper Search in Open Literature Environments

智能体系统Agent任务评测

摘要

学术论文搜索是科学研究的核心步骤,基于 LLM 的搜索代理正在成为迭代、意图驱动的文献探索的有前途的范例。然而,现有的基准不足以系统地评估现实开放文献环境下的代理学术搜索。我们提出了 ScholarQuest,一个大规模的、分类学指导的代理学术论文搜索基准。 ScholarQuest 由 1,000 多个计算机科学主题和四个代表性研究意图构建而成,包括面向方法、设置锚定、基于比较和范围控制的查询。它还提供可扩展的答案构建和共享检索后端 ScholarBase 以进行可重复的评估。基准测试结果表明,代理方法的性能优于单次检索基线,但性能最好的代理仅达到 0.314 Recall@100 和 0.355 Recall@All,这表明仍有很大的改进空间。此外,对搜索效率、意图级鲁棒性和失败案例的分析进一步凸显了该基准为学术论文搜索代理提供多维度评估信号的能力。