论文

LLM偏袒LLM吗?量化同行评审中的交互效应

Do LLMs Favor LLMs? Quantifying Interaction Effects in Peer Review

模型评测模型行为与机制分析

摘要

越来越多的迹象表明,LLM不仅被用于撰写科学论文,还被用于同行评审过程。在这项工作中,我们对整个同行评审流程中LLM的使用进行了首次全面分析,特别关注交互效应:不仅是LLM辅助论文或LLM辅助评审在单独看时是否不同,还有LLM辅助评审是否对不同地评估LLM辅助论文。我们分析了来自ICLR、NeurIPS和ICML的超过125,000个论文-评审对。我们最初观察到看似系统性的交互效应:与最少使用LLM的论文相比,LLM辅助评审似乎对LLM辅助论文格外友好。然而,控制论文质量后呈现出不同的图景:LLM辅助评审只是对低质量论文普遍更宽容,而LLM辅助论文在较弱投稿中的过度代表造成了虚假的交互效应,而非对LLM生成内容的真正偏袒。通过用完全LLM生成的评审增广观察结果,我们发现完全LLM生成的评审表现出严重的评分压缩,无法区分论文质量,而使用LLM的人类评审则大幅减少了这种宽容。最后,考察元评审,我们发现给定相同的评审分数,LLM辅助元评审比人类元评审更可能做出接收决定,而完全LLM生成的元评审往往更严厉。这表明元评审者并非简单地将决策外包给LLM。这些发现为制定规范同行评审中LLM使用的政策提供了重要输入,并更广泛地表明LLM如何与现有决策过程交互。

LLM偏袒LLM吗?量化同行评审中的交互效应
图4:按质量分组(quality bucket)的回归系数。每个点代表对该质量分组内论文进行的一次独立回归。阴影区域为 95% CI。红色虚线显示完整回归的估计值以便比较。零由黑色点线标示。