论文

BixBench3:在研究课题规模的计算生物学任务上评测AI智能体

BixBench3: Benchmarking AI agents on research-study-scale computational biology tasks

智能体系统Agent任务评测

摘要

人工智能(AI)有望通过自动化计算分析来加速生物研究。然而,AI智能体以完整研究课题的规模开展计算生物学的能力尚未得到系统评估。我们在此介绍BixBench3,一个衡量AI智能体从原始生物数据处理直到产出科学结果的完整能力的基准。我们将BixBench3任务设计为模拟科学家向智能体委派工作的过程:科学家选定研究问题与高层次方法,然后将所有分析的实现委托给智能体。在每个任务中,智能体会收到一个研究目标、方法学指导以及源自一项已发表科学研究的原始数据,并必须执行一系列分析以达成研究目标。这些分析产生的数据产物——如峰值识别矩阵或差异表达表——会与原始研究中生成并报告的相应产物进行程序化比对评分。在涵盖138个独立产物生成的20个BixBench3任务上,我们发现13个前沿模型的得分从Gemini 3.1 Flash Lite的0.00到GPT 5.6 Sol的0.48不等。智能体在原始数据集更大的任务上表现更差(小于100GB的任务上为0.36,大于100GB的任务上为0.10),在需要更多串行步骤的分析上也表现更差(1-2步时为0.36,3步及以上时为0.24)。平均而言,智能体完成每个任务需要6.8小时、1.02亿token和43美元,最长的尝试消耗了24小时、10.7亿token和525美元。值得注意的是,得分最高的智能体比表现较差的选项使用了更少的token,成本也更低。这些结果表明,大语言模型在以下三方面的能力差异巨大:(1)连贯执行多个串行分析步骤;(2)管理大量原始数据;(3)跨科学领域开展工作。

BixBench3:在研究课题规模的计算生物学任务上评测AI智能体:论文配图
图1:BixBench3 的构建与总体表现。(A) 每个基准任务的构建方式是将一项已发表研究分解为产生数据产物的分析构成的有向无环图(DAG)。智能体生成的产物版本通过程序化方式与对应的已发表产物进行打分。(B) 13 个模型在 20 个 BixBench3 任务上的产物级通过结果,包含每个模型请求的 138 个产物和 1,794 次模型–产物评估。实心方块表示程序化得分至少为 0.80 的产物,该阈值经专家校准,用于判定产物的主要生物学解释是否得以保留(第 4.4 节);空心方块表示低于该阈值的产物。右侧条形显示各模型的 BixBench3 总分:即其在 20 个任务上的平均任务得分,其中每个任务得分为通过产物的比例。