论文

评估审稿人指南设计对基于 LLM 的自动同行评审的影响

Evaluating the Impact of Reviewer Guideline Design on LLM-Based Automated Peer Review

模型评测模型能力评测

摘要

同行评审是科学研究中的一个重要过程,但不断增加的工作量使得其自动化变得越来越必要。在本研究中,我们分析了不同类型的审稿人指南(例如官方会议指南和使用 LLM 从高质量人类审阅中生成的模仿审稿人指南)如何影响自动同行评审。我们的实验表明,官方会议指南产生的评审结果与人类判断最一致,这表明通过会议实践细化的评估标准也可以作为自动评审的有效指导。相比之下,模仿审稿人的指南通常不如官方会议指南有效。此外,执行严格的评分标准会持续降低绩效,这凸显了允许主观和整体评分的重要性。