论文

言辞如何奖励人工智能审稿人?剖析基于人工智能的同行评审中的修辞敏感性

How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review

模型评测鲁棒性、公平性与可信度评测

摘要

随着 大语言模型 越来越多地参与科学评估,我们研究了 奖励作弊 的一种潜在形式:当报告的科学内容被保留时,修辞选择如何影响人工智能评审判断,以及这些影响如何随着评估条件的不同而变化。我们构建了一个包含 4,200 份全文手稿的受控语料库,这些手稿源自 120 份匿名 ICLR 2026 提交材料。两名 LLM 重写者以相反的方向变换六个修辞维度,五名 LLM 审稿人根据标准和严格的协议评估最终的手稿。我们还测试联合、递归和审阅者指导的重写。我们的结果表明修辞敏感性是结构化的而不是统一的。证据框架和新颖性立场在总体评估中产生最大的正负对比,范围框架形成较弱的第二层;其余尺寸的影响较小或较不稳定。这种层次结构在人类评估的质量水平上仍然存在,但分数变动很大程度上取决于人工智能审阅者的原始分数:较低的分数往往会上升,较高的分数往往会下降,方向对比在中间范围内最清晰。更复杂的工作流程并不能可靠地产生更大的收益。联合重写强烈依赖于重写者,审稿人的指导并不总是优于无指导的第二遍,并且重复重写会产生递减的、依赖于配置的回报。在不同条件下,重写者主要确定对立变体之间的分离,而审阅者确定其评分效果的大小和符号。严格审查可将平均 OA 降低 1.36 分,而不会持续改变修辞敏感性。这些发现确定了修辞表达何时会影响人工智能科学评论,并激发评估系统对科学写作中内容保留变化的鲁棒性。