论文

BioAgent Bench:一个面向生物信息学的AI智能体评估套件

BioAgent Bench: An AI Agent Evaluation Suite for Bioinformatics

智能体系统Agent任务评测

摘要

本文介绍了 BioAgent Bench,这是一个基准数据集和评估套件,旨在测量 AI 代理在常见生物信息学任务中的性能和鲁棒性。该基准包含精心策划的端到端任务(例如,RNA-seq、变体调用、宏基因组学),并带有指定具体输出工件以支持自动评估的提示,包括受控扰动下的压力测试。我们跨多个代理工具评估前沿闭源和开放权重模型,并使用基于 LLM 的评分器对管道进度和结果有效性进行评分。我们发现前沿代理可以完成多步骤的生物信息学流程,而无需复杂的定制脚手架,通常可以可靠地生成所需的最终工件。然而,稳健性测试揭示了受控扰动下的故障模式(损坏的输入、诱饵文件和提示膨胀),这表明正确的高级管道构造并不能保证可靠的步骤级推理。最后,由于生物信息学工作流程可能涉及敏感的患者数据、专有参考文献或未发布的知识产权,闭源模型可能不适合严格的隐私约束;在这种情况下,尽管完成率较低,但开放重量模型可能更可取。我们公开发布数据集和评估套件。

BioAgent Bench:一个面向生物信息学的AI智能体评估套件
图1:BioAgent Bench 概览。LLM 智能体的输入包括任务提示、输入数据与参考数据。在解决给定任务时,智能体可以使用通用软件包或专门的生物信息学工具。智能体完成生成后,LLM judge 将其输出与 ground truth 比较并产生评估结果。除了标准的“vanilla”输入外,我们还尝试不同的扰动以对智能体进行压力测试。我们将评估聚焦于生物信息学中的 10 个任务(每个任务围绕不同的生物体、病毒或整个生态系统设计)和 10 个模型(5 个开放权重模型与 5 个闭源权重模型)。