论文

ABC-Bench:面向生物安全的智能体生物能力基准

ABC-Bench: An Agentic Bio-Capabilities Benchmark for Biosecurity

智能体系统Agent任务评测

摘要

大型语言模型(LLM)正在迅速获得与生物研究相关的能力,从文献合成到实验数据的解释。越来越多的大语言模型智能体也可以执行以前需要经验丰富的人类生物学家才能完成的计算机生物学任务。这些新兴的人工智能功能为科学发现和生物医学进步提供了新的机遇,但它们也改变了生物安全风险的格局。为了解决这个问题,我们引入了代理生物能力基准(ABC-Bench),这是一套用于衡量代理生物安全相关能力的任务。 ABC-Bench 在良性和双重用途生物学任务上评估 LLM 代理:编写操作液体处理机器人的代码、设计用于体外组装的 DNA 片段以及逃避 DNA 合成筛选。这些任务需要生物学和软件专业知识的结合。所有经过测试的大语言模型智能体在所有三项任务上的表现均优于人类基线专家的中位数。代理在利用已发表的知识和详细记录的协议的任务上表现出色,而在需要新颖的生物信息学推理的任务上表现较差。在三个湿实验室验证实验中,我们发现 OpenAI 的 o4-mini-high 生成的脚本在 OpenTrons 液体处理机器人上运行时,可以成功组装具有预期序列的 DNA。

ABC-Bench:面向生物安全的智能体生物能力基准:论文配图
图 1:ABC-Bench 的液体处理机器人任务。 A. 我们 (1) 向客服人员提示任务指示; (2)为代理人提供完成任务并检查其工作的相关软件和研究工具; (3)允许代理人提交最终答复; (4) 根据预先指定的标准通过算法检查代理的答案。 B. 在适用的情况下,我们在现实环境中验证任务性能(运行 GPT-o4-mini 编写的 Gibson 汇编代码的 OpenTrons Flex 机器人的照片)。