论文
训练人工智能科学家复制研究
Training AI Scientists to Replicate Research
摘要
论文的可重复性是科学知识的基石,确保现有结果的可靠性并为进一步的实验提供基础。复制行为通常会阐明以前未明确说明的细节,因此需要与开放式研究类似的假设驱动探索。在这项工作中,我们开发了 Replica,一个用于纸张复制的可扩展任务空间。为了提供奖励信号,我们引入了一种自动生成的基于评分标准的判断,该判断具有低噪声并且与人类对复制质量的评估一致。我们对 Faraday 进行后训练,这是一个 27B 参数的“AI 科学家”代理,它利用 编码智能体 作为工具,在保留复制任务上超越了 Claude Opus 4.8 和 GPT-5.5 的性能。对单次执行轨迹的定性分析表明,法拉第采用了更科学原则的方法。我们相信,我们的结果为人工智能代理提供了一个踏脚石,能够在不需要复杂的控制的情况下进行长期科学创新。