论文

迈向AI研究的端到端自动化

Towards End-to-End Automation of AI Research

应用与实践智能体系统Agent Harness科学研究

摘要

科学自动化是人工智能领域长期以来的抱负。尽管学界在自动化科学过程的各个单独环节上已取得重大进展,但能自主走完整个研究生命周期——从构思到发表——的系统始终遥不可及。本文给出了迄今朝着端到端自动化整个流程迈进的最有力演示。我们提出The AI Scientist,它能创建研究想法、编写代码、运行实验、绘图与分析数据、撰写完整的科学手稿,并执行自己的同行评审。其想法、执行与呈现的质量足以产出一篇由AI系统生成、通过某大型机器学习会议研讨会首轮同行评审的手稿。该研讨会的录取率为70%。我们的系统在复杂智能体系统中利用现代基础模型。我们在两种设置下评估The AI Scientist:一种是聚焦模式,使用人类提供的代码模板作为初始脚手架,就特定主题开展研究;另一种是无模板的开放式模式,借助智能体搜索进行更广泛的科学探索。两种设置都能产生多样的想法,并自动对其进行测试、报告与评估。这一成果展示了AI不断提升的科学贡献能力,并预示着科研方式的潜在范式转变。与任何具有影响力的新技术一样,它可能带来重大风险,包括加重本已不堪重负的评审系统的负担、给科学文献增添噪音。然而,若以负责任的方式发展,此类自主系统有望大幅加速科学发现。

迈向AI研究的端到端自动化:论文配图
图 1:AI 科学家工作流程。答:人工智能科学家由不同的阶段组成,涵盖自动创意生成、基于树的实验、手稿撰写和审阅。实验阶段采用代理树搜索来生成和完善代码实现。这分为四个阶段:(1) 初步调查,(2) 超参数调整,(3) 研究议程执行,(4) 消融研究。从一个实验阶段到下一个实验阶段,都会选择性能最佳的检查点来为树搜索的下一阶段提供种子。 B. 论文质量随着基础模型的发布日期不断提高(由自动审阅者判断),这表明随着基础模型的改进,未来的改进将持续不断。观察到的相关性具有统计显着性(pp 值<0.00001<0.00001)。阴影区域代表标准误差。完整的实验细节,包括模型版本和复制计数,在补充部分 A.2.9 中提供。 C. 自动审核员的性能可与人工审核员相媲美,并通过过去会议的公开决策进行验证(表 1)。误差线代表 95% 自举置信区间。