论文
智能体如何在自动研究中失败:对 100 个现实世界前沿研究任务的端到端诊断评估
How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks
摘要
长期以来,人工智能一直在协助科学研究,但 LLM 和代理支架的快速发展正在重塑这一格局;现在,单个系统可以进行从最初的假设一直到最终发表的论文的全阶段研究,这是现在称为自动研究的范例。现有的评估很少揭示这些代理如何运作或在何处崩溃。任务范围狭窄,评估衡量性能而不是流程,故障诊断缺乏系统覆盖或工件级可见性。为了弥补这一差距,我们推出了 AutoResearchEval,其中包含 100 项基于已发表的前沿科学的任务,涉及 7 个科学领域和整个研究生命周期,包括构思、检索、执行、分析、写作和评审。评估 8 个Harness模型组合可生成 800 个自动研究代理轨迹,并带有流程级注释。我们将这些见解整理成 AutoResearch 失败分类法或 ARFT,这是一个包含 45 种基于经验的失败模式的框架。为了实现可扩展的细粒度归因,我们利用人工校准的代理作为法官管道来检查完整的轨迹和中间工件。失败模式集中在一个单一的总体限制上,即当前的代理缺乏元认知循环,这需要能够根据他们发现的内容检查他们产生的结果,当它不成立时进行修改,并质疑他们所采取的路径是否正确。相同的模式在所有 8 个Harness模型组合中重复出现,包括测试的最强模型,将缺陷定位在模型级别而不是任何特定的支架上;编排层面的干预是否可以解决这个问题是一个悬而未决的问题,这项工作没有测试。我们公开发布 AutoResearchEval 和 ARFT,以促进自主科学发现的持续研究和开发。