论文

大规模AI辅助同行评审:AAAI-26 AI评审试点

AI-Assisted Peer Review at Scale: The AAAI-26 AI Review Pilot

应用与实践科学研究

摘要

随着投稿量激增,科学同行评审面临日益沉重的压力,维持评审质量、一致性与时效性愈发困难。AI的最新进展促使学界考虑将其用于同行评审,但一个关键未解问题是:AI能否在真实会议规模下生成技术上可靠的评审。我们在此报告首次大规模AI辅助同行评审的实地部署:AAAI-26主赛道的每一份投稿都收到一份来自最先进系统且明确标识的AI评审。该系统在多阶段流程中结合前沿模型、工具使用与安全防护,在不到一天内为全部22,977篇进入完整评审的论文生成评审。对AAAI-26作者与程序委员会成员的大规模调查显示,参与者不仅认为AI评审有用,在技术准确性和研究建议等关键维度上实际上更偏好AI评审而非人类评审。我们还提出一个新基准,发现我们的系统在检测多种科学弱点上显著优于简单的LLM生成评审基线。综合来看,这些结果表明最先进的AI方法已能在会议规模上为科学同行评审做出有意义的贡献,为下一代人机协同的研究评估开辟了道路。

大规模AI辅助同行评审:AAAI-26 AI评审试点:论文配图
(a) SPECS 基准 (b) 逐级标准检测率 图 4:SPECS 审查基准管理和分析工作流程 (a) 以及根据 SPECS 标准评估 AAAI-26 AI 审查系统中每个阶段的逐级标准检测率 (b)。从场地会议记录中列出的已接受论文(在我们的案例中为 AAAI-25)开始,SPECS 管理系统会跨会议记录类别进行采样,将每篇论文与 arXiv 源版本进行匹配,并保留 LaTeX 源编译成功的论文。对于每一篇精选论文,LLM都会生成针对五个 SPECS 标准的受控源级扰动:故事、演示、评估、正确性和重要性。仅当引用的源范围与原始文件匹配并且编辑后的论文重新编译没有错误,并产生用于评估的可执行合成错误时,每个扰动才被接受。然后,完整的 AAAI-26 人工智能评审系统和以标准为目标的中间阶段在这些受到干扰的论文上运行,判断模型确定每个评审是否通过评审文本中的支持证据明确识别注入的错误。 (b) 中的按标准检测率矩阵总结了按标准检测行为:每行对应于一种扰动类型,而每列对应于 AAAI-26 AI 审查系统中的一个核心阶段。每个单元格独立计算为列级检测到的行标准的扰动分数;行的总和不等于 1,因为可以通过多个阶段(或无阶段)检测到扰动。对角线条目表示目标核心阶段和相应标准的标准对齐检测,而非对角线条目则揭示跨标准检测模式。目标裕度是行的对角线值与其最大非对角线值之间的差值,指示每个阶段检测其预期标准的强度比其他阶段强多少。