论文

超越最终决策:以流程为中心的透明人工智能辅助同行评审基准

Beyond Final Decisions: A Process-Centric Benchmark for Transparent AI-Assisted Peer Review

模型评测基准与评测资源

摘要

同行评审是科学质量控制的核心。然而,现有对人工智能辅助同行评审的评估主要关注生成评审的整体质量或最终决策的准确性。因此,他们提供的关于模型决策是否得到充分且可靠的审查证据支持的证据有限。我们引入了一种以流程为中心的诊断基准,用于人工智能辅助同行评审。它使用(x,$z_s$,$z_c$,$z_r$,y)来表示论文内容、摘要、批评、建议和决定。我们将来自 PeerRead、NLPeer ARR-22 和 OpenReview-ICLR 的异构评审记录转换为流程一致的数据。我们的基准使用论文内容的直接决策预测(Direct)作为基准。比较Gold过程变量和预测过程变量的决策值,并进行阶段级评估、链一致性评估和干预敏感性分析。三个数据集和六个模型的实验表明,黄金过程变量通常具有更高的决策价值。对于主要分析模型,黄金预测差距在数据集和随机种子中保持稳定。这种差距也出现在大多数模型-数据集组合中。尽管模型生成的中间评论文本在相邻阶段表现出相对较高的局部一致性,但最终的决策并没有得到先前评论证据的一致支持。我们的基准旨在帮助而不是取代人类审阅者的人工智能系统。它提供了一个透明且可审计的诊断工具,用于评估其审核流程的可靠性。

超越最终决策:以流程为中心的透明人工智能辅助同行评审基准:论文配图
图 1:从独立任务评估到以流程为中心的人工智能辅助同行评审基准。