论文
超越模仿审稿:用逻辑错误检出评测LLM同行评审
Beyond Imitation: A Framework and Benchmark for LLM-Assisted Peer Review
摘要
科学出版的快速增长给同行评审带来了压力,尤其是在机器学习领域,引发了人们对评审质量下降和审稿人工作量增加的担忧。大型语言模型(LLM)已被提议作为自动评审助手,但它们的评估主要集中在模仿人类撰写的评审上,而不是支持同行评审的核心功能。在这里,我们介绍了以验证为中心的LLM辅助同行评审视角,强调错误检测是一项关键且资源稠密型的任务。我们提出了一个可扩展的基准,评估评审系统识别逻辑矛盾的能力,通过将错误综合插入会议论文中构建,产生明确的评估目标并实现系统比较。我们进一步提出了一个多层评审(MLR)框架,该框架在评审生成之前优先考虑详细的手稿理解,与人类评审实践更加紧密地结合,同时提高token效率。在评估中,我们的方法表现出与 人工审阅分数,实现高错误检测性能,并提供审阅者关注点的补充观点。这些改进可归因于底层LLM的选择和我们系统的设计。与此同时,我们证实了对抗性操纵的持续漏洞,强调了自动审查系统稳健性的必要性。我们的研究结果强调了严格、以错误为中心的评估的重要性,以指导在同行评审和其他关键科学工作流程中负责任地部署基于LLM的工具。