论文
人工智能审稿能改善论文起草吗?对 20 份计算机体系结构提交的实证研究
Can AI Review Improve Paper Drafting? An Empirical Study on 20 Computer Architecture Submissions
摘要
人工智能 (AI) 的研究进展速度比以往任何时候都快;相应的研究论文也是如此。人工智能生成的论文数量激增,给同行评审带来了压力,导致人工智能生成的评审的使用范围可能广泛但又很隐蔽。然而,人们提出了有关保密性、质量和公平性的相关伦理问题,并且广泛的研究界尚未达成共识。我们预计争论会持续一段时间,但与此同时,我们提出一个替代性的实际问题:\textit{AI 审稿能否改进论文起草?}我们研究了 20 篇具有不同级别提交谱系的计算机架构论文,以揭示 AI 审稿与人类审稿的一致性程度,并通过我们定义的一组指标进行量化。为了进行案例研究,我们构建了一个 Web UI 集成工具 \emph{AI-Paper-Review},它可以生成草稿论文的结构化 AI 审查,可在 https://github.com/unarylab/ai-paper-review 上获取。该工具从不同的人工智能审阅者池和集群中选择几位人工智能审阅者,并根据审阅评论的共性和重要性对他们的评论进行排名。它还允许将人工智能评论与人类评论结合起来,以促进基于指标的验证。案例研究表明,人工智能审查可以涵盖大部分人类提出的问题,但也提出了人类审查中缺失的问题。本文的目的并不是鼓励现阶段使用人工智能进行同行评审,而是研究(1)人工智能评审如何改进论文起草以及(2)基于人工智能的同行评审的潜力和局限性。该工具和案例研究数据的发布旨在激发对该主题的未来研究。滥用同行评审将违反主要学术场所的道德政策。