论文

PreScience:预测科学贡献的基准

PreScience: A Benchmark for Forecasting Scientific Contributions

模型评测基准与评测资源

摘要

在固定时间点接受科学记录训练的人工智能系统能否预测随后的科学进展?这种能力可以帮助研究人员确定合作者和有影响力的研究方向,并预测哪些问题和方法将成为接下来的核心。我们介绍 PreScience——一种科学预测基准,它将研究过程分解为四个相互依赖的生成任务:合作者预测、先前工作选择、贡献生成和影响预测。 PreScience 是一个精心策划的数据集,包含 98K 最近的 AI 相关研究论文,具有消除歧义的作者身份、时间对齐的学术元数据以及涵盖 502K 篇论文的同伴作者出版历史和引用的结构化图表。我们为每项任务制定基线和评估,包括 LACEScore,这是一种基于 LLM 的新颖的贡献相似度衡量标准,其性能优于之前的指标并近似于注释者间的一致性。我们发现每项任务都还有很大的空间——例如在贡献生成方面,前沿大语言模型与真实情况仅实现中等相似度(GPT-5,在 1-10 等级上平均为 5.6)。当对科学生产进行为期 12 个月的端到端模拟时,所得到的合成语料库在系统上不如同期人类撰写的研究那么多样化和新颖性。

PreScience:一个科学预测数据集与基准
(b) 先前工作预测命中率与论文作者先前引用该工作频率的关系。各方法难以预测新出现的参考文献,而对于被引较多的论文,Frequency 方法占优。