论文
不止模仿审稿人:LLM预投稿同行评审能力评价
More Than Mimicking Reviewers: Evaluating LLMs for Pre-Submission Peer Review
摘要
同行评审反馈往往来得太晚,作者无法做出有意义的修改。我们研究了一个面向作者的大语言模型系统,该系统在提交之前移动了部分压力测试:它生成大量的原子问题并将它们压缩成一份简短的报告。我们评估与历史评论的一致性,并分别评估他们忽略的问题的可能有效性。从 ICLR 2026 提交的 10,000 份稿件中,我们使用了 3,398 份稿件,这些稿件的无障碍版本已在审阅之前进行。在十篇论文诊断中,独立抽样涵盖了 44.9% 的历史问题;重复数据删除和填充达到 78.7% 的严格覆盖率和 84.9% 的严重性加权覆盖率,请求数量增加 3.6$\time$,Token数量增加 5.2$\time$。隐藏的 Top-32 Oracle 保留了 256 个候选池的 79.3% 加权覆盖率,但纯纸质选择器仅保留了 40--44%。因此,LLM 审查覆盖面广,候选人库大,但压缩率较差;消融将代表性选择和匹配器敏感性确定为这种差距的主要来源。