论文

论AI审稿人的局限性和机遇:与45位专家科学家一起回顾Nature家族论文的审稿

On the limits and opportunities of AI reviewers: Reviewing the reviews of Nature-family papers with 45 expert scientists

模型评测模型能力评测

摘要

随着人工智能能力的进步,人工智能审稿人开始被部署到科学同行评审中,但他们的能力和可信度仍然受到质疑:许多科学家只是将其视为概率系统,没有评估研究的专业知识,而其他研究人员在没有具体证据的情况下对他们的准备情况更加乐观。了解人工智能审稿人做得好的地方、不足的地方以及仍然存在的挑战至关重要。然而,现有对人工智能审稿人的评估主要集中在他们的判决是否与人类的判决相匹配(例如,分数对齐、接受预测),这不足以表征他们的能力和局限性。在本文中,我们通过一项大规模的专家注释研究弥补了这一差距,其中 45 名物理、生物和健康科学领域的科学家花了 469 小时对 82 篇《自然》系列论文的人工撰写和人工智能生成的评论中的 2,960 条个人批评(每条批评针对论文的一个特定方面)的正确性、重要性和证据充分性进行了评级。在所有三个维度的综合上,由 GPT-5.2 支持的审稿人的得分高于每篇论文评分最高的人类审稿人(60.0% vs. 48.2%,p = 0.009),而所有三个 AI 审稿人(包括 Gemini 3.0 Pro 和 Claude Opus 4.5)在每个维度上都超过了评分最低的人类审稿人。 AI 审阅者的准确批评通常也被认为是重要且证据充分的,并且提出了 26% 的非人类提出的问题。然而,人工智能审阅者的重叠程度远高于人类(交叉审阅者对的重叠率为 21%,而交叉审阅者对为 3%),并且表现出人类不共有的 16 个反复出现的弱点,例如有限的子领域知识、缺乏对多个文件的长上下文管理以及对小问题过于挑剔的立场。总体而言,我们的结果将当前的人工智能审稿人定位为人类审稿人的补充,而不是替代。