论文
从被动生成到调查:主动的科学同行评审代理
From Passive Generation to Investigation: A Proactive Scientific Peer Review Agent
摘要
大语言模型 (LLM) 在自动化科学同行评审方面表现出了希望。然而,现有的方法往往难以产生有具体证据支持的深入审查。我们认为,一个关键的限制是缺乏灵活性,无法像人类审稿人那样根据积累的证据主动调查论文中的可疑部分。在本文中,我们探讨了如何使基于 LLM 的审核代理能够执行此类主动调查。我们发现这可以自然地表述为马尔可夫决策过程(MDP),并提出了 ProReviewer,这是一种科学同行评审代理,可以在维护的结构化评审日志的指导下主动评审论文。结构化审核日志充当代理的工作空间,用于跟踪审核期间收集的证据和中间结果。实验表明,具有 8B 主干的 ProReviewer,由有监督的 微调 训练并通过强化学习进行优化,在五个质量维度上取得了最高的平均分数,比具有更大前沿 LLM 的基于提示的方法高出 39%,相对最强的微调基线高出 16%。它还在人类评估基准中获得了最高的胜率。