论文

LLM-as-a-Reviewer:作为论文审稿人对他们的能力、分歧和即时注入阻力进行基准测试

LLM-as-a-Reviewer: Benchmarking Their Ability, Divergence, and Prompt Injection Resistance as Paper Reviewers

模型评测模型能力评测

摘要

大语言模型 (LLM) 越来越多地用于学术同行评审,但它们的可靠性、与人类判断的一致性以及对抗性攻击的鲁棒性仍然知之甚少。我们针对来自 NeurIPS 和 ICLR 的 898 篇论文提出了 LLM-as-a-Reviewer 的系统基准,沿着三个轴评估了 12 个 LLM:评级校准、与人类审稿人的分歧以及对通过不可见字体映射攻击嵌入的提示注入的抵抗力。我们发现,LLM 系统性地高估了较弱的提交内容,并且在主题强调方面与人类存在分歧,低估了清晰度并过度标记了可重复性,同时产生的评论时间延长了两到三倍,词汇多样性较低,词汇更加标准化。及时注射仍然非常有效。在相当一部分情况下,简单的隐藏指令可以将低分论文提升到接受级别评级,但不同模型系列的有效性差异很大。虽然 LLM 在构建评估方面具有实用性,但将其纳入同行评审需要防范内在偏见和对抗性风险。