论文
未经严格评估就不要自动化同行评审
Stop Automating Peer Review Without Rigorous Evaluation
摘要
大语言模型为同行评审危机提供了诱人的解决方案。本立场论文主张:今天的AI系统不应被用于产出论文评审。我们以ICLR 2026人写与AI生成评审的实证比较、以及自动论文改写对不同AI评审者影响的评估为依据。我们识别出两个关键问题:1) AI评审者表现出蜂巢思维效应——论文内与论文间的过度一致,降低了视角多样性。2) AI评审分数可被「论文洗白」轻易操纵:让LLM改写论文即可显著提高AI评审者的分数,说明LLM评审者易被文体改动而非科学结果所操纵。然而,不可操纵性与评审多样性只是自动化的必要而非充分条件。我们主张:解决同行评审危机需要一门「同行评审自动化的科学」,而不是部署未经严格评估的通用LLM。
