论文
CoCoReviewBench:面向人工智能审阅者的完整性和正确性基准
CoCoReviewBench: A Completeness- and Correctness-Oriented Benchmark for AI Reviewers
摘要
尽管人工智能审阅者发展迅速,但评估此类系统仍然具有挑战性:指标更倾向于与人类审阅重叠,而不是正确性。然而,由于人工审查通常只涵盖突出问题的一部分,有时还包含错误,因此它们作为黄金参考并不可靠。为了解决这个问题,我们构建了特定类别的基准子集,并在缺少相应的人工评论时跳过评估,以加强完整性。我们还利用审稿人-作者-元审稿讨论作为专家注释,并相应地过滤不可靠的审稿以增强正确性。最后,我们介绍 CoCoReviewBench,它整理了 ICLR 和 NeurIPS 的 3,900 篇论文,以便对 AI 审稿人进行可靠且细粒度的评估。分析表明,人工智能审稿人的正确性仍然有限,并且容易产生幻觉,并强调推理模型是更有效的审稿人,这为改进人工智能审稿人提供了进一步的方向。基准和模型可在 https://github.com/hexuandeng/CoCoReviewBench 获取。