论文

MUSES:前瞻性知识根源检索的基准

MUSES: A Benchmark for Prospective Intellectual-Roots Retrieval

模型评测基准与评测资源

摘要

科学发现依赖于寻找能够塑造未来的先前文献。现有的检索系统针对相关性和流行度进行了优化,通常会偏向中心论文,而不是后来证明具有生成性的不太熟悉的作品。我们引入了 \textbf{MUSES},这是一个在固定的 233 万篇论文语料库上进行前瞻性知识根检索的百万实例基准,每个熟悉度层大约有 14 万个测试实例。据我们所知,这是第一个具有共享检索任务和作者确认的论文级根标签的前瞻性基准。除此之外,\textbf{CiteRoots} 将本地引文文本上的可扩展修辞层(LLM 判断 $κ= 0.896$ 与人工标注参照)与论文级作者认可层(来自 753 篇焦点论文的 $n = 1{,}518$ 生成灵感对)配对。 MUSES 沿两个轴组织难度:\emph{熟悉度} 轴跨越 CiteNext、CiteNew 和 CiteNew-Isolated,\emph{功能} 轴跨越广泛引用、修辞根源和作者认可的根源。在 9 个方法类中,基于 SPECTER2 构建的精益多质心 检索器 是最强的。 Hit@100 从 CiteNext 上的 0.534 下降到 CiteNew 上的 0.424、修辞性 CiteNew 上的 0.205 和作者认可的 CiteNew 上的 0.171,下降了 3.1 倍。在注册的八镜头完整测试审核中,大约一半的广泛测试实例在 K=1{,}000 时仍未解决。修辞作用和作者背书是不同的:同一位法官同意背书 $κ= 0.037$。我们发布了 MUSES、两个 CiteRoots 层以及一个精炼的开放同伴评判者,用于未来的前瞻性检索和知识根源工作。