论文

评估AI智能体在神经科学数据到发现管线上的案例研究

A case study of evaluating AI agents on a neuroscience data-to-discovery pipeline

智能体系统Agent任务评测

摘要

Agentic AI 为自动化科学研究流程中的软件开发瓶颈提供了一条有希望的途径,特别是对于领域专家需要数天到数月才能构建的阶段,以及正确性和稳健性比实现细节更重要的阶段。我们对飞行光遗传学数据发现管道上的通用编码剂进行了实证研究。我们评估代理的任务和数据集远远大于基于领域专家标准的现有基准和评估标准。我们证明代理可以解决多个管道阶段,这表明阶段级自动化是易于处理的。通过分析代理的代码迭代,我们表明,在没有预定义标准的情况下,他们最困难,因为他们必须使用科学判断来评估当前的解决方案。模仿科学家,他们有时会尝试对中间输出进行目视检查以进行自我评估,但很大程度上无法解释他们所看到的内容或对其采取适当的行动。解决端到端管道需要将所有阶段的成功串联起来,这超出了代理目前的能力。我们发现了现有基准中基本上不存在的挑战,包括计算资源管理和对保留数据的泛化。最后,我们提炼出构建科学任务的原则和开放式问题的严格评估标准。

评估AI智能体在神经科学数据到发现管线上的案例研究:论文配图
图 1:我们对 7 阶段果蝇光遗传学数据到发现流程的分析概述。我们评估和分析任务级别以及整个管道的端到端代理。