论文

ScientistTwo:面向问题驱动研究的自主多Agent框架

ScientistTwo: Pioneering the Human Knowledge Frontier with Autonomous AI

智能体系统Agent 协作

摘要

科学发现由识别现有知识边界并探索未知领域的能力定义。科学AI的终极愿景是问题驱动的自主研究:人类专家给出基础挑战,AI独立探索科学领域,发现理论与实证瓶颈,系统扩展知识前沿。本文提出旨在实现这一愿景的全自主多智能体框架ScientistTwo。它接收初始问题,建立当前最佳基线,提出新假设,并协调专门智能体,在无人干预下组织端到端发现循环。框架还使用多样数据集与指标开展实验,通过自动消融改进方法,并以闭环模拟同行评审答辩引擎验证研究发现。为对照高水平人类科研标准,我们以ICLR、ICML和NeurIPS等顶会接收的论文进行基准评价。结果中,ScientistTwo自主生成作者认为达到专家级、可发表水平的论文及经过完整验证的可执行代码库。其方案持续优于人类当前最佳模型,在自动AI评审下的平均评分也高于人类论文。作者据此认为ScientistTwo不只是辅助工具,而是能够推进人类发现前沿的自主科研系统。项目网站通过文中链接提供。

ScientistTwo:面向问题驱动研究的自主多Agent框架:论文配图
图 1:预告片。 ScientistTwo 通过生成出版质量的论文和经过充分验证的代码库,在不同的研究领域(例如LLM、机器人、神经科学、语音、鲁棒性、强化学习、博弈论、隐私、优化和时间序列)推动人类知识的前沿,所产生的方法始终优于人类最先进的基线。具体来说,ScientistTwo 改进了 107 篇论文中的 86 篇(成功率 80.4%),与人类最先进的方法相比,平均相对改进为 25.2%。此外,ScientistTwo 生成的论文超过了斯坦福 Agentic Reviewer 在 ICLR 2026 和 NeurIPS 2025 上接受的论文的平均分数,证明了其撰写达到顶级 AI 场所的经验接受标准的手稿的能力。