FirstPass:在多轮编辑结果中奠定人工智能科学判断的基础
FirstPass: Grounding AI Scientific Judgment in Multi-Round Editorial Outcomes
摘要
用于同行评审的人工智能系统在三个方面失败:它们仅在计算机科学和机器学习场所进行训练,忽略验证科学的迭代对话,并根据风格模仿而不是真正的编辑判断进行评估。我们引入了 FirstPass,一个解决所有这三个问题的数据集和微调模型。我们在《自然通讯》五个科学领域(生物学、化学、神经科学、物理学和地球科学)中策划了 3,668 场完整的多轮同行评审对话,利用强制性透明同行评审(2022 年 11 月实施)并通过自动审核验证 100% 内容完整性。我们通过低秩适应 (LoRA) 在三个任务上对 Qwen2.5-7B-Instruct 进行微调:审稿生成、审稿人更新和修订周期预测。我们的主要发现是,仅响应损失掩蔽是先决条件,而不是优化:没有它,准确度为 62.0%,低于大多数基线;有了它,FirstPass 在预测编辑结果(标准与扩展修订周期)方面的准确率达到 80.5%,F1-macro 达到 78.2%,比 Gemini-3.1-flash-lite-preview 零样本高出 10.4 个百分点,并且所有基线都具有统计显着性(McNemar p < 0.001)。在生成时,FirstPass 生成的评论平均为 1,187 个单词,比任何基线都更接近人类参考(2,155 个单词),达到 ROUGE-L 0.154,比 Qwen 和 DeepSeek 零样本有显着提升(p < 0.001)。 FirstPass 作为预期科学合著者部署在提交前循环中,在提交前模拟专家评论并预测修订周期结果,为作者提供值得信赖的同事提供的判断,并在五个学科中保持一致的跨领域性能。