论文
AppliedScientist:通过迭代式AI评审实现科学论文自动修订
AppliedScientist: Automated Scientific Revision Through Iterative AI Reviewing
摘要
自动化评审系统越来越被评估其生成评审的质量。然而,只有当采纳评审能带来论文可测量的改进时,评审才有价值。我们提出了AppliedScientist,这是一个闭环系统,结合了自主AI科学家与AI评审员,并通过迭代修订来自不同研究领域的被拒论文进行评估。为模拟人类作者在草稿基础上不断改进的过程,AI科学家在修订时可访问其先前版本。然而,为避免前期判断带来的偏见,每次评审均独立生成,评审员无法记忆或参考之前的反馈或评分。我们对比了三种修订设置:一种初始使用原始会议评审意见,一种初始使用AI生成的评审意见,以及使用相同固定提示进行自主自修订。由于评审员既引导又评估修订过程,我们还使用Stanford Reviewer作为独立评估者,对人类初始化的修订进行评估。结果显示,由评审员引导的修订比固定提示自修订效果更优,且Stanford Reviewer也给予后期修订更高评分。AppliedScientist解决了150个与执行相关的缺陷中的128个(85.3%),但仅解决了18个与创意相关的缺陷中的2个(11.1%),表明迭代修订在提升实验和实现方面效果显著,但在改变新颖性或重要性类问题上效果有限。
