论文

游戏人工智能辅助同行评审给科学界带来新风险

Gaming AI-Assisted Peer Reviews Poses New Risks to the Scientific Community

模型评测安全与风险评测

摘要

人工智能越来越多地用于支持科学同行评审,从稿件筛选、审稿人协助到编辑分类。尽管此类系统有望减轻审稿人的负担并加速出版,但它们对战略操纵的鲁棒性仍然知之甚少。在这里,我们表明,人工智能介导的同行评审很容易受到简单、低成本的操纵:对手稿摘要的肤浅改写。在不改变底层科学内容和交流的情况下,甚至在不了解审稿模型的情况下,对抗性重写的摘要也能显着改善人工智能审稿结果。我们在各个学科和出版场所都看到了这一点,无论是人类撰写的论文还是人工智能生成的论文。我们最强的攻击实现了约 38% 的攻击成功率,将 Gemini 3 Flash 审阅者的接受评级提高了 +1.31,将 GPT 5.4 Mini 审阅者的接受评级提高了 +0.88(满分 10 分)。当原始AI审核建议“拒绝”时,成功率上升至50%以上。这种影响超出了总体分数膨胀的范围,提高了评审信心和核心科学标准的分数,例如健全性、重要性和感知贡献。这种攻击很实用,只需大约 5 分钟和 1 美元即可提交 10 页的 AI 会议论文,并且与普通的科学编辑很难区分。夸大的人工智能评论可能会给下游人类决策带来偏见,使编辑建议从拒绝转向接受。这些发现揭示了人工智能辅助科学评估的普遍弱点:当人工智能生成的审稿影响编辑决策时,作者可能会被激励根据人工智能判断而不是科学价值来优化手稿。我们的结果表明,如果没有系统的稳健性测试、透明的保障措施和仔细的人工监督,人工智能工具不应被视为高风险同行评审中的中立评估者。