论文
通过封面来判断评论:基于大语言模型的同行评审评估指标的可靠性分析
Judging a Review by its Cover: A Reliability Analysis of LLM-based Peer Review Evaluation Metrics
摘要
同行评审评估越来越多地通过大语言模型作为评判指标实现自动化,但这会带来衡量风险。一篇评论可能会因为它流畅、有组织且优美而获得高分,而不是因为它对论文提供了强有力的评价。这种风险在人工智能辅助审稿中尤其重要,审稿人可能会使用大语言模型来提高清晰度或表达能力,同时保留基本判断。我们提出了一个统计框架,用于测试同行评审评估指标是否能够捕捉到超越表面语言形式的实质性评审质量。该框架将原始的人工评论与忠实的大语言模型重写进行了比较,后者在改变措辞和表述的同时保留了相同的评估内容。使用由来自 ICLR 和 NeurIPS 的 674 条人工评论得出的 4,044 条意义保留重写组成的数据集,我们通过表面敏感性和鲁棒性的补充测试,评估了从四项先前作品中提取的 29 个内容导向的同行评审评估指标。尽管这些指标的目的是捕捉超出表面水平、依赖于写作的特征的评论属性,但我们发现对重写的敏感性是普遍存在的。根据我们的初步分析,23 个指标为保留评估内容的评论分配了显着不同的分数,而只有 6 个指标满足我们的稳健性标准。两个大语言模型法官模型的模式基本一致,表明该问题并非特定于单个法官。这些发现表明,许多同行评审评估指标部分地将评论质量与语言表达混为一谈,并表明在使用这些指标来比较人类撰写的、人工智能辅助的和人工智能生成的评论之前,应该验证保留意义重写的稳健性。