论文
超越评级:人工智能评论的综合评估和基准
Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews
摘要
大语言模型 (LLM) 的快速采用激发了人们对自动同行评审的兴趣;然而,目前进展受到主要将审查视为评级预测任务的基准的阻碍。我们认为评论的效用在于它的文本论证——它的论点、问题和批评——而不是标量分数。为了解决这个问题,我们引入了 Beyond Rating,这是一个整体评估框架,可以从五个维度评估 AI 审稿人:内容 忠实性、论证一致性、焦点一致性、问题建设性和 AI 可能性。值得注意的是,我们提出了一种最大召回策略来适应有效的专家分歧,并引入了一个经过严格过滤以消除程序噪音的高可信度评论的精选论文数据集。大量实验表明,虽然传统的 n 元语法指标无法反映人类偏好,但我们提出的以文本为中心的指标(尤其是对弱点论点的回忆)与评级准确性密切相关。这些发现表明,将人工智能批评焦点与人类专家结合起来是可靠的自动评分的先决条件,为未来的研究提供了可靠的标准。