论文

AI Agent能否开展开放式科学发现?Station的实验结果

Can AI Agents Make Open-Ended Scientific Discovery? Evidence from Station

智能体系统应用与实践Agent 架构与控制循环智能体自我改进科学研究

摘要

当给定明确的指标时,最近的人工智能系统在科学发现方面取得了快速进展,但它们是否能够自主地进行开放式科学发现仍不清楚。我们研究了人工智能在 Station 中处理开放式任务的能力,Station 是一个开放世界环境,其中多个Agent模拟科学生态系统。为了应对开放式任务特有的挑战,我们建议通过两种机制来增强 Station:监督机制和定期元反射,即使在缺乏中间指标的情况下,它们也会鼓励持续探索。我们根据最近在 ICLR 上发表的三篇口头论文构建了开放式任务。我们向Agent提供每篇论文中研究的主要研究问题,同时保留论文结果并禁用网络访问。然后,我们测量有多少原始发现(划分为单独的标准)Agent重新发现。我们发现 Station 平均重新发现了 62.7% 的标准,而 Codex Multiagent-v2 为 15.4%,AI Scientist-v2 为 14.4-20.6%。消融和行为分析表明,将两种机制结合在一起可以提高研究的覆盖范围和连续性。我们进一步在两个没有预言论文的开放式任务上评估 Station,发现智能体做出的一些发现与知识截止日期后研究人员报告的发现非常匹配。总之,这些结果表明,合适的环境可以使智能体在开放式科学发现中自主取得有意义的进展。