论文

什么样的AI审稿才是好审稿?面向AI同行评审的关注点级诊断

What Makes a Good AI Review? Concern-Level Diagnostics for AI Peer Review

模型评测评测方法与指标

摘要

以结论一致性来评估AI生成的审稿被普遍认为是不充分的,然而现有替代方案很少审计系统识别出哪些关注点、如何为它们排序优先级,以及这些优先级是否与塑造最终评估的审稿理由相符。我们提出关注点对齐(concern alignment),一个在关注点层面而非仅在结论层面评估AI审稿的诊断框架。该框架的核心数据结构是匹配图(match graph),即官方关注点与AI生成关注点之间的二部对齐,并标注匹配类型、严重程度和回复(rebuttal)后的处理情况。基于这一产物,我们推导出一个评估阶梯,从二值准确率递进到关注点检测、按结论分层的行为、决策感知的校准以及考虑rebuttal的分解。在对四个公开AI审稿系统、六种配置的初步研究中,关注点层面的分析表明,仅凭检测并不能决定审稿质量;校准往往才是真正的约束。各系统能检测出不小比例的官方关注点,但大多数系统将录用论文上25%–55%的关注点标记为决定性的,而按照我们的操作化定义,录用论文上没有任何官方关注点被视为决定性阻碍。相同的总体结论准确率可能掩盖了倾向拒稿的行为与低召回特征之间的差异,而整稿审稿中较低的虚假决定性率可能部分反映的是关注点稀释而非经过校准的优先级排序。大多数系统不原生输出录用/拒稿结论,而从审稿语气推断这一结论对方法敏感,这更加凸显了对跨推断选择保持稳定的关注点级诊断的需求。其贡献是一个可复用的评估框架,用于审计AI审稿人识别了哪些关注点、如何为它们赋权,以及这些优先级是否与决定论文最终评估的审稿理由相符。

什么样的AI审稿才是好审稿?面向AI同行评审的关注点级诊断:论文配图
图 1:已接受论文的匹配图。官方关注的问题(左)带有严重程度标签和 AC 治疗徽章;代理关注(右)带有严重性和决定性的标志。边缘显示匹配类型:严格指标的精确计数和部分计数;相关的被排除。官方的担忧是空前的;无与伦比的代理担忧只是幻影。六个代理问题中有两个是错误的决定性标志(33%);第三个决定性标志 (A1) 正确识别了其修复在审阅的 PDF 中不可见的弱点。