论文
PRAIB:LLM 辅助审稿行为的同行评审 AI 基准
PRAIB: Peer Review AI Benchmark of Behaviour of LLM-Assisted Reviewing
摘要
投稿数量的持续增长促使人们探索将大语言模型(LLM)用作支持并增强同行评审流程的手段,尤其是在提升速度与可扩展性方面。然而,LLM 究竟是以与人类审稿人相同的方式处理科学稿件,还是仅仅生成看起来像审稿意见的文本,目前仍不得而知。为解答这一问题,我们提出同行评审 AI 基准(PRAIB),这是一个新颖的框架,包含严格定义的指标,用于衡量审稿意见的具体性、风格与投入行为。作为 PRAIB 框架的补充,我们开展了一项大规模实证研究,利用一个由五个专有与开源模型为 1,000 篇 ICLR 和 NeurIPS 论文生成的 11,000 份审稿意见组成的数据集。这些横跨 2021 至 2025 年的机器生成审稿意见,在不同提示策略下与原始的人类反馈进行对比,以识别系统性的行为差异。我们的分析显示,生成的审稿意见与人类审稿人提供的反馈差异显著:LLM 的评分波动更小、偏向正面且过度自信,其交叉引用模式依赖于具体模型,且与人类惯例不同。此外,在通过 PRAIB 评估时我们观察到,LLM 倾向于生成更长、更复杂的审稿意见,却经常忽视人类审稿人指出的原子级弱点。通过刻画 LLM 审稿行为在何处以及如何偏离人类规范,PRAIB 为学界提供了一个诊断工具,可用于识别 LLM 目前能够可靠支持同行评审流程的哪些方面,以及哪些方面在部署前仍需进一步发展。