论文
更多批评并不意味着更好的评审:EquiReview-R
More Criticism Does Not Make a Better Review: EquiReview-R
摘要
人工智能审稿人现在可以提出许多具体的批评,但更多的批评不一定是更好的审稿。审查可能会遗漏相应的缺陷或保留现有证据不支持的指控。这些失败需要相反的纠正,但以生成为导向的系统和总体措施模糊了区别。因此,我们将人工智能辅助审查重新定义为以证据为指导对结构化关注点进行细化,将遗漏和过度批评视为单独的风险。在此基础上,我们引入了 EquiReview-R,它解决了对本地证据的现有担忧,从独立和审查条件的角度搜索缺失的问题,并返回停止、继续或推迟。为了揭示激发这种设计的失败模式,我们构建了一个与证据相关的轨迹语料库。其回顾性分析表明了为什么修订必须先于进一步的搜索:高召回率审查中的几乎所有关注点都缺乏明确的证据处理,而早期的细化机制无法修改它们。在一组以前未见过的冻结论文中,EquiReview-R 满足预先指定的重大遗漏非劣效性标准,将重大过度批评从 15.5% 减少到 8.1%,并达到 9.9% 的单方面遗漏上限,同时停止在 52.4% 的论文上。计算匹配的控制、受控对和消融表明,增益来自修正,而不是额外的推理或更短的输出。我们将语料库发布为 ReviewTrace,这是一种与证据相关的资源,用于研究评论修订、分歧和出处。
