BioEVAL:跨机构生物工程实验推理基准
BioEVAL: A global, multi-institutional benchmark of large language and multimodal models for bioengineering
摘要
大型语言模型 (LLM) 在生物医学科学领域取得了早期成功,在一般推理方面取得了历史性突破。然而,现有的大语言模型基准测试强调事实回忆,对前沿和多模式任务的模型性能提供的洞察有限。我们组建了 BioEVAL(人工智能和大语言模型的生物工程验证),这是一项全球性、多机构计划,旨在评估生物工程 (BE) 子领域的实验推理能力。 BioEVAL 涵盖 11 个主要 BE 子领域和一组未分类项目,汇集了 22 个研究小组,创建了包含 608 个评估项目的博士级基准:1)380 个多项选择题(MCQ,审核后保留 359 个),2)218 个文献综合任务,以及 3)10 个实验图像解释的多模态问题。基准项目在评估前经过编写组专家评审和集中质量控制。评估后,对最高和最低准确度 MCQ 项目进行了盲法跨组共识审核,标记了 21 个问题需要修改或删除;这21题被暂时剔除,所有报告的 MCQ 结果都是根据 359 个保留的项目计算的。我们评估了各种云规模基础/多模式模型(例如 ChatGPT、Gemini 和 Grok)以及适合在消费级 GPU 上进行推理的本地可部署模型。模型在 MCQ 上的准确率最高可达 90%,在文献综合上的相似度得分为 0.72,在小样本多模态推理问题上的准确率达到 80%,各个子领域的性能差异很大。排行榜排名描述了所评估的 BE 任务类别的当前能力、局限性和开发优先级。 BioEVAL 被维护为一个可扩展的基准,具有标准化协议,用于持续的专家项目贡献和模型评估。