论文

当AI评审科学时:我们能信任这位审稿人吗?

When AI reviews science: Can we trust the referee?

模型评测安全与风险评测

摘要

科学投稿的数量持续攀升,超过了合格人类审稿人的承载能力,并拉长了编辑处理的时间线。与此同时,现代大语言模型(LLM)在摘要生成、事实核查与文献甄别方面展现出令人瞩目的能力,使得将AI整合进同行评审日益具有吸引力——并且在实践中已不可避免。然而,早期部署与非正式采用已暴露出严重的失效模式。近期事件揭示,嵌入稿件中的隐藏提示词注入能够引导LLM生成的评审偏向毫无正当理由的正面判断。配套研究也证明了对对抗性措辞的脆弱性、权威与长度偏差以及幻觉性断言。这些事件为学术传播提出了一个核心问题:当AI评审科学时,我们能信任这位AI审稿人吗?本文对AI同行评审进行了以安全性与可靠性为中心的分析。我们梳理了覆盖评审全生命周期的攻击——训练与数据检索、初审(desk review)、深度评审、答辩(rebuttal)以及系统层面。我们在分层抽样的ICLR 2025投稿集上,通过四组处理-对照探针将该分类体系具体化,使用两个先进的基于LLM的审稿人,以隔离声望框架、断言强度、答辩谄媚与上下文投毒对评审分数的因果效应。这一分类体系与实验审计共同为评估和追踪AI同行评审的可靠性提供了基于证据的基线,并凸显了具体的失效点,以指导有针对性的、可检验的缓解措施。

当AI评审科学时:我们能信任这位审稿人吗?:论文配图
图3:AI同行评审流水线的威胁模型概览,详列多种攻击方法及其针对的具体评审阶段。