论文
Review Arcade:论LLM评审的人类对齐性与可博弈性
Review Arcade: On the Human Alignment and Gameability of LLM Reviews
摘要
由LLM生成的科学论文评审正获得相当大的关注,甚至已被主要会议正式试点。我们必须假设不仅审稿人在使用LLM辅助,作者也在投稿前使用LLM修改其论文。在本工作中,我们对2025年ACL Rolling Review(ARR)的论文进行实证实验,从作者与审稿人两个视角评估LLM评审。首先,我们发现LLM评审与人类评审之间的对齐是有限的。在最佳情形下,对齐程度尚属合理。然而我们还发现,LLM与人类评审的对齐程度在不同提示与模型之间差异巨大。最后,我们研究了作者使用迭代式草稿—修改工作流、根据LLM评审意见改进投稿的情形。我们发现这种对LLM评审的“博弈”在特定场景下可能有效,使多达35%的论文的总评分出现统计显著的提升。我们公开了代码:https://github.com/uhh-hcds/reviewarcade。