论文

未经严格评估就不要自动化同行评审

Stop Automating Peer Review Without Rigorous Evaluation

模型评测安全与风险评测

摘要

大语言模型为同行评审危机提供了诱人的解决方案。本立场论文主张:今天的AI系统不应被用于产出论文评审。我们以ICLR 2026人写与AI生成评审的实证比较、以及自动论文改写对不同AI评审者影响的评估为依据。我们识别出两个关键问题:1) AI评审者表现出蜂巢思维效应——论文内与论文间的过度一致,降低了视角多样性。2) AI评审分数可被「论文洗白」轻易操纵:让LLM改写论文即可显著提高AI评审者的分数,说明LLM评审者易被文体改动而非科学结果所操纵。然而,不可操纵性与评审多样性只是自动化的必要而非充分条件。我们主张:解决同行评审危机需要一门「同行评审自动化的科学」,而不是部署未经严格评估的通用LLM。

未经严格评估就不要自动化同行评审:论文配图
图 6:洗纸行为推动了知识单一文化。原始论文与洗白论文的论文嵌入(摘要+简介)之间的成对余弦相似度分布(n=6,903n=6{,}来自 60 篇论文的 903 个论文对)。原始论文:平均相似度=0.497=0.497。洗过的论文:平均相似度=0.529=0.529。相似度增加了 6.5%6.5\%,非常显着(t=84.8t=84.8,p<0.0001p<0.0001,Cohen’s d=1.02d=1.02),表明 AI 重写的论文趋向于同质风格。