论文

Peerify:同行评审声明验证基准

Peerify: Benchmarking Peer-Review Claim Verification

模型评测基准与评测资源

摘要

同行评审在学术出版中发挥着核心作用,但验证审稿人的主张是否得到手稿证据的支持仍然是一个很大程度上手动且耗时的过程。我们推出 Peerify,这是一种以手稿为基础验证同行评审声明的管道。给定一份手稿和评论评论,Peerify 管道会将评论分解为原子声明,检索相关的手稿证据,并确定每个声明是否得到论文的支持。为了支持管道的开发和评估,我们构建了一个包含 800 项声明的基准,这些声明源自从 NeurIPS 2024 和 ICLR 2024 收集的真实同行评审交互,其中包括用于审核自动监督的 300 项手动标记子集。我们评估 Peerify 管道中最先进的语言模型和检索策略以及蕴含基线。我们的结果证明了以检索为中心的验证和声明分解的重要性,同时强调了模糊和解释性审稿人声明所带来的挑战。自动化标签在 90.3% 的经审计声明上与人类共识一致 ($\kappa = 0.87$),而现成的蕴含模型保持在 0.24 宏观 F1 以下。