论文

用于评估科学新颖性度量的公理化基准

An Axiomatic Benchmark for Evaluation of Scientific Novelty Metrics

模型评测基准与评测资源

摘要

即使对于人类科学家来说,对科学论文的新颖性进行严格评估也是一项具有挑战性的任务。随着人们对人工智能科学家以及人工智能参与科学想法生成和论文写作的兴趣日益浓厚,这项任务的自动化和可靠也变得越来越重要,以免人类的注意力和计算token浪费在已经探索过的想法上。然而,由于量化真实新颖性的挑战,现有的科学论文新颖性指标通常会根据引用计数或同行评审分数等嘈杂、混杂的信号来验证其结果。这些代理可能会将新颖性与影响力、质量或审稿人偏好混为一谈,这反过来又使得评估给定指标对新颖性的实际评估效果变得更加困难。因此,我们提出了科学新颖性指标的公理基准。我们首先基于人类科学规范和实践,定义一组表现良好的新颖性指标应满足的公理,然后评估跨越人工智能研究三个领域的十项任务的现有指标。我们的结果表明,没有现有的度量能够一致地满足所有公理,并且度量在系统上不同的公理上失败,反映了它们的底层架构。此外,我们还表明,结合互补架构的指标可以实现基准的持续改进,每个公理的权重达到 90.1%,而最佳单个指标的权重为 71.5%,这表明开发架构多样化的指标是未来工作的一个有前途的方向。我们发布基准代码作为补充材料,以鼓励开发更强大的科学文献新颖性指标。