论文

AutoSupervision:基于证据验证论文修订,闭合科学工作流的反馈循环

AutoSupervision: Closing the Feedback Loop in Scientific Workflows with Grounded Revision Verification

模型评测基准与评测资源

摘要

大语言模型 (LLM) 的最新进展使人工智能系统能够协助科学研究和同行评审。然而,可靠的人工智能辅助科学工作流程的一项基本功能仍未得到充分探索:验证审稿人的反馈是否会带来有意义且有证据支持的稿件改进。我们引入了自动监督,它可以通过有根据的证据来评估科学稿件的修订是否真正解决了审稿人的担忧。自动监督利用透明的同行评审记录作为监督的自然来源,审稿人的评论指定了科学问题,作者的回复描述了所声称的解决方案,修订后的手稿提供了更改的证据。考虑到审稿人的评论、作者的回应和修订后的手稿,模型必须描述审稿人的担忧,确定担忧是否已得到解决,并确定支持手稿的证据。我们根据 56,000 篇《Nature Communications》文章和相应的审稿记录构建了 AutoSupervision。然后我们在LLM上进行了实验、消融研究和案例研究。我们的结果表明,虽然 LLM 在表征审稿人关注点方面表现良好,GPT-5.5 得分为 0.754,但基于证据的验证仍然是主要瓶颈,表现最好的模型仅达到 0.501。