论文

PRISM:评估 LLM 同行评审员的多维基准

PRISM: A Multi-Dimensional Benchmark for Evaluating LLM Peer Reviewers

模型评测基准与评测资源

摘要

机器学习场所提交的论文的快速增长给科学同行评审系统带来了压力,并增强了人们对基于 LLM 的自动同行评审员的兴趣。然而,这些系统实际上有多好,尤其是与人类评审员在发现科学差距方面相比,仍然知之甚少。在这项工作中,我们引入了 PRISM(通过结构化多维评估进行同行评审情报),这是一个基准框架,可从四个维度评估评审质量:分析深度、新颖性评估、缺陷识别和主要问题优先级以及多维建设性。与大多数现有的基于 ROUGE 和 BLEU 等表面指标的评估,或不受约束的 LLM 法官提示(将流畅性与严谨性混为一谈)不同,PRISM 将每个维度都基于论点挖掘、检索增强验证和基于共识的评分。我们应用 PRISM 在 ICLR、ICML 和 NeurIPS 的分层评论语料库上对五个领先的自动审稿系统和人工审稿人员进行基准测试。结果表明,LLM 可以在各个维度上匹配或击败人类审稿人:可比较的分析深度、更强的新颖性验证以及高度准确的批评优先级。然而,没有一个系统能够同时在所有维度上始终与人类基线的平衡性能相匹配。每个都表现出独特的专业化概况和特征盲点——聚合指标完全忽略的故障模式。这意味着 LLM 审阅者最好被理解为对人工审阅的有针对性的补充,在特定维度内有效,但作为独立替代品并不可靠。我们的演示和关键结果可以在 https://khanhthanhdev.github.io/prism-page/ 找到。