论文

BABE:生物学竞技场基准

BABE: Biology Arena BEnchmark

模型评测基准与评测资源

摘要

大语言模型(LLM)的快速演进使其能力从基础对话扩展到高级科学推理。然而,现有的生物学基准往往未能评估研究人员所需的一项关键技能:将实验结果与背景知识整合以得出有意义结论的能力。为填补这一空白,我们推出 BABE(Biology Arena BEnchmark),一个旨在评估生物 AI 系统实验推理能力的综合性基准。BABE 独特地由同行评审的研究论文和真实世界的生物学研究构建而成,确保任务反映真实科学探究的复杂性与跨学科性。BABE 挑战模型执行因果推理与跨尺度推断。我们的基准为评估 AI 系统能否像执业科学家那样推理提供了稳健框架,为其助力生物学研究的潜力提供了更真实的度量。