论文
情报不是瓶颈:根据同行评审结果验证 LLM 初稿稿分
Intelligence Is Not the Bottleneck: Validating an LLM First-Pass Manuscript Score Against Peer-Review Outcomes
摘要
大语言模型 (LLM) 系统越来越多地被提出来协助同行评审,但大多数评估判断的是机器生成的评审文本的散文,而不是系统分配的数字分数的有效性。我们验证 AIPR,它读取提交的手稿并根据主要机器学习场所的公共决策结果发出 5 个 0-100 质量维度和加权总分。 AIPR 通过单独提示进行评分,没有 微调 的评论或决策。在具有公共决策层和审稿人评级的 300 份 ICLR 提交文件中,在任何分数达到任何结果之前预先注册假设的冻结管道下进行评分,总体分数将拒绝的提交文件与已接受的提交文件分开(AUROC 0.82,95% CI 0.78-0.87),在各层之间单调上升,并跟踪平均审稿人评级。我们声称的信号是最强的:得分最低的第五名被拒绝远远高于基本率,并且没有口头论文。有效性主要来自模型:同一模型上的单段落提示几乎与整个管道一样具有区分性(小间隙有利于管道,但不满足预先声明的标准,p = 0.09)。工程增加的是可靠性和有根据的审查:AIPR 的分数在重复运行中几乎没有变化(纸质 SD 中的 0.7 分与 2.8 分),其中赤裸的提示发生波动,并且相同的传递返回一个标题结构的、基于证据的审查,而不是一个赤裸裸的数字,由人类保留决定。