论文

LABBench2:面向执行生物学研究的AI系统的改进基准

LABBench2: An Improved Benchmark for AI Systems Performing Biology Research

模型评测基准与评测资源

摘要

用AI加速科学发现的乐观情绪持续增长。当前AI在科学研究中的应用包括:在科学数据上训练专用基础模型、Agentic 自主假设生成系统,以及AI驱动的自主实验室。相应地,衡量AI系统在科学领域进展的需求不仅必须加速,还须日益把重心转向更贴近真实世界的能力。也即要超越死记硬背的知识、甚至仅是推理,走向实际测量完成有意义工作的能力。先前工作提出了语言代理生物学基准 LAB-Bench,作为测量这些能力的初步尝试。本文介绍该基准的演进版本 LABBench2,用于测量执行有用科学任务的AI系统的真实世界能力。LABBench2 包含近 1,900 个任务,在大部分内容上是 LAB-Bench 的延续,测量类似的能力,但处于更真实的情境中。我们评估了当前前沿模型的表现,结果显示:尽管 LAB-Bench 与 LABBench2 所测能力已大幅提升,LABBench2 带来了显著的难度跃升(各子任务的模型准确率差异在 -26% 到 -46% 之间),并凸显出仍有持续的性能提升空间。LABBench2 延续 LAB-Bench 作为AI科学研究能力事实基准的传统,我们希望它继续助力推动这些核心研究功能所需AI工具的发展。为便于社区使用与开发,我们在 https://huggingface.co/datasets/futurehouse/labbench2 提供任务数据集,并在 https://github.com/EdisonScientific/labbench2 提供公开评测工具。

LABBench2:面向执行生物学研究的AI系统的改进基准
图 4:SeqQA2 和 CloningQA 性能。 (A) 按序列输入方式(内联、文件或检索)划分的总体性能细分。请注意,GPT 5.2 Pro 不接受具有响应 API 的适当文件类型,从而人为地降低了文件模式性能。 (B) 跨模型子类别的 SeqQA2 性能热图。这些结果是在默认注入模式下的结果