论文
ScholarCatalyst:激发新研究的论文检索基准
ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research
摘要
是什么让伟大的科学家变得伟大?即使人工智能系统开始在开放问题上取得进展,科学家们在感知新问题需要哪种先前的想法(埋藏在不断增长的研究档案中)方面仍然远远领先于他们。为了研究这项技能,我们聘请了研究人员,他们知道哪些早期工作推进了他们已完成的项目,并以论文作为其中思想的指导。使用我们的自动化管道,使作者注释可扩展,我们通过 207 篇最近的计算机科学论文的 184 位主要作者来构建 ScholarCatalyst,标记哪些候选人已经或可能推进了他们的项目,每个标签都有详细的理由。我们引入了一项由作者提供的判断的检索任务:给定一个初始研究问题,仅从项目开始时可用的文献中检索这些论文。尽管将相同的检索器作为工具调用,但 Agentic 搜索的效果并不比嵌入检索好(0.42 vs. 0.48 Recall@20)。即使是基于 Claude Fable 5.1 构建的智能体(可能在训练期间看过完整的论文)也只能达到 0.51 R@20。这些结果强调需要新的训练方法,为模型配备专家直觉来搜索广泛的语料库。我们设想 ScholarCatalyst 是迈向科学Agent的一步,它可以接受半成形的想法并指出它需要的先前研究。