论文
BioAgent Bench:一个面向生物信息学的AI智能体评估套件
BioAgent Bench: An AI Agent Evaluation Suite for Bioinformatics
摘要
本文介绍了 BioAgent Bench,这是一个基准数据集和评估套件,旨在测量 AI 代理在常见生物信息学任务中的性能和鲁棒性。该基准包含精心策划的端到端任务(例如,RNA-seq、变体调用、宏基因组学),并带有指定具体输出工件以支持自动评估的提示,包括受控扰动下的压力测试。我们跨多个代理工具评估前沿闭源和开放权重模型,并使用基于 LLM 的评分器对管道进度和结果有效性进行评分。我们发现前沿代理可以完成多步骤的生物信息学流程,而无需复杂的定制脚手架,通常可以可靠地生成所需的最终工件。然而,稳健性测试揭示了受控扰动下的故障模式(损坏的输入、诱饵文件和提示膨胀),这表明正确的高级管道构造并不能保证可靠的步骤级推理。最后,由于生物信息学工作流程可能涉及敏感的患者数据、专有参考文献或未发布的知识产权,闭源模型可能不适合严格的隐私约束;在这种情况下,尽管完成率较低,但开放重量模型可能更可取。我们公开发布数据集和评估套件。
