论文

ScientistOne:通过证据链迈向人类水平的自主研究

ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence

智能体系统Agent Harness

摘要

自主研究智能体能产出有竞争力的方案和看似专业规范的稿件,但其输出包含表层评估无法察觉的可验证性失效:伪造引用、不可复现的分数以及与实现相脱节的方法描述。我们通过三项贡献来解决这一问题。其一,证据链(Chain-of-Evidence, CoE),一个要求每条论断都可追溯至其证据来源的可验证性框架。其二,ScientistOne,一个端到端自主研究系统,在文献综述、方案发现与论文写作全过程中从构建机制上维护证据链。其三,CoE Audit,一种事后审计,其四项完整性检查——分数验证、规格违反、引用验证与方法-代码对齐——统一适用于所有系统。在覆盖五个系统、五项前沿研究任务的75篇论文中,每个基线都至少表现出一种系统性失效模式:幻觉引用率最高达21%,分数验证通过率最低仅42%,方法-代码对齐率介于20%至80%。ScientistOne实现零幻觉引用(0/337)、满分分数验证(12/12)以及最高的方法-代码对齐率(14/15),并在全部五项任务上达到或超越人类专家表现。ScientistOne还推广到涵盖医学影像、细粒度识别、3D感知与语言建模的六项额外任务,在Parameter Golf上取得最先进结果,并在基线完全失败的MLE-Bench任务上获得金牌。

ScientistOne:通过证据链迈向人类水平的自主研究:论文配图
图 1:ScientistOne 管道。第一阶段通过检索到的 PDF 为文献奠定基础;第二阶段探索并评估跨并行分支的解决方案;第三阶段编写并验证论文,并使用声明验证器在生成最终输出之前根据其证据来源检查每项声明。