论文
ABC-Bench:面向生物安全的智能体生物能力基准
ABC-Bench: An Agentic Bio-Capabilities Benchmark for Biosecurity
摘要
大型语言模型(LLM)正在迅速获得与生物研究相关的能力,从文献合成到实验数据的解释。越来越多的大语言模型智能体也可以执行以前需要经验丰富的人类生物学家才能完成的计算机生物学任务。这些新兴的人工智能功能为科学发现和生物医学进步提供了新的机遇,但它们也改变了生物安全风险的格局。为了解决这个问题,我们引入了代理生物能力基准(ABC-Bench),这是一套用于衡量代理生物安全相关能力的任务。 ABC-Bench 在良性和双重用途生物学任务上评估 LLM 代理:编写操作液体处理机器人的代码、设计用于体外组装的 DNA 片段以及逃避 DNA 合成筛选。这些任务需要生物学和软件专业知识的结合。所有经过测试的大语言模型智能体在所有三项任务上的表现均优于人类基线专家的中位数。代理在利用已发表的知识和详细记录的协议的任务上表现出色,而在需要新颖的生物信息学推理的任务上表现较差。在三个湿实验室验证实验中,我们发现 OpenAI 的 o4-mini-high 生成的脚本在 OpenTrons 液体处理机器人上运行时,可以成功组装具有预期序列的 DNA。
