论文
LLM 评审与人类同行评审的一致性如何?
How Closely Do LLM Reviews Align with Human Peer Review?
摘要
大语言模型 (LLM) 越来越多地用于生成科学评审,但现有的评估很少检查不同的提供者是否在同一受控环境中符合会议决策和人工评审优先级。我们将 OpenAI GPT-5.4、Google Gemini 3.1 Pro Preview 和 Anthropic Claude Opus 4.6 的评论与人类评论和最终决定进行比较,针对 300 篇主题匹配的 ICLR 2026 提交论文,平均分为口头论文、海报论文和被拒绝的论文。在删除决策信息后,每个模型都使用相同的说明和评分量表审查每篇论文。我们的研究对三个互补维度进行了跨提供商分析:与广泛和细粒度决策类别的一致性、推荐量表使用的差异以及已识别弱点的主题一致性。所有三篇 LLM 都区分了被接受的论文和被拒绝的论文,但没有一个重现了人类评分中口头与海报的区别。评分模式因提供者而异:Gemini 系统地分配了更高的评分,而 OpenAI 和 Claude 在拒绝论文和海报论文方面更接近人类,但对口头论文更挑剔。人类和 LLM 评论的侧重点也不同,LLM 更频繁地识别缺失的基线比较,而人类更经常提出计算效率问题。这些结果表明,广泛的决策一致性并不意味着与更精细的人类判断或审查优先事项一致。