论文

BIABench:评估人工智能Agent在现实世界生物图像分析任务中的表现

BIABench: Evaluating AI agents on real-world bioimage analysis tasks

智能体系统Agent任务评测长程任务评测

摘要

人工智能(AI)Agent有望实现生物图像分析的自动化,但没有基准评估它们是否可以端到端地进行现实世界的分析。此类分析对于Agent来说很困难,因为 2D 图像、3D 体积和延时序列通常太大而无法作为上下文读取,因此Agent必须通过代码、专用软件和渲染视图来选择和运行分析。已发表的研究使这种能力可以测试,因为每个研究都将原始图像与同行评审的结果配对。我们引入了 BIABench,这是根据已发表的生物学研究重建的 16 项任务的基准,保留了其科学问题、成像数据和基本事实。这些任务涵盖从 H&E 组织学到单分子定位显微镜的 11 个分析子任务和模式。每次提交都会收到一个结果分数(使用现场标准指标将输出文件与真实情况进行比较)和一个过程分数(其中视觉语言模型根据专家编写的评分标准来判断方法选择和质量控制)。我们跨多种语言模型评估了通用和生物学特定Agent,并重复运行每项任务。常规二维任务得到了很好的解决,但在一些添加三维或时间轴的任务上,没有智能体得分高于 0.19。无论是生物学专业化、更强大的模型还是详细的专家指导都无法弥补这一差距。这些Agent也不可靠,一个Agent重复运行之间的分数变化比不同Agent之间的分数变化更大,并且如果没有基本事实,就无法通过其过程分数或所花费的时间来区分正确的运行和错误的运行。 BIABench 以其数据和代码公开发布,提供了一个可验证的框架,用于评估并最终训练Agent进行可靠的长时域生物图像分析。