论文

没有无聊的神经数据:数据重用的代理人工智能基准测试

Neurodata Without Boredom: Benchmarking Agentic AI for Data Reuse

智能体系统Agent任务评测

摘要

神经科学数据在实验室、格式和实验范式中高度分散,重复使用通常需要大量的手动工作。数据重用和集成的一个持久障碍是需要破译定制和多样化的数据格式选择。作为回应,人们提出了通用数据格式,但该领域仍然面临着一个根本性的矛盾:足够灵活以适应不同实验的格式很少具有足够的描述性以使其不言自明,而充分描述性的格式需要详细的文档和管理工作,而很少有实验室能够维持。 Agentic AI 是解决这个问题的天然候选者:LLM 可以更快地阅读代码和文本,并持续关注人类容易忽略的低级细节。为了衡量代理人工智能在这项任务上的表现,我们选择了最近八篇研究大规模小鼠神经群体记录的论文,这些记录共享数据和代码,涵盖不同的记录模式、行为范式和数据集格式(例如,NWB、专用 API 和通用 Python 或 MATLAB 文件)。我们为代理提供了数据、代码和论文,并提示他们加载、理解和重新格式化数据以执行常见的下游任务:训练从神经活动到任务或行为变量的解码器。科学家常用的通用 编码智能体 在每个子任务上都表现良好,但很少组合成完全无错误的端到端解决方案。我们描述了智能体所犯错误的类型以及引发这些错误的数据集属性,并提出了智能体人工智能时代的数据共享最佳实践。我们进一步发现,代理作为法官在捕获错误方面并不可靠,尤其是在没有 真值 参考的情况下,因此交互式、人机交互编码仍然是必要的。