论文
BixBench3:在研究课题规模的计算生物学任务上评测AI智能体
BixBench3: Benchmarking AI agents on research-study-scale computational biology tasks
摘要
人工智能(AI)有望通过自动化计算分析来加速生物研究。然而,AI智能体以完整研究课题的规模开展计算生物学的能力尚未得到系统评估。我们在此介绍BixBench3,一个衡量AI智能体从原始生物数据处理直到产出科学结果的完整能力的基准。我们将BixBench3任务设计为模拟科学家向智能体委派工作的过程:科学家选定研究问题与高层次方法,然后将所有分析的实现委托给智能体。在每个任务中,智能体会收到一个研究目标、方法学指导以及源自一项已发表科学研究的原始数据,并必须执行一系列分析以达成研究目标。这些分析产生的数据产物——如峰值识别矩阵或差异表达表——会与原始研究中生成并报告的相应产物进行程序化比对评分。在涵盖138个独立产物生成的20个BixBench3任务上,我们发现13个前沿模型的得分从Gemini 3.1 Flash Lite的0.00到GPT 5.6 Sol的0.48不等。智能体在原始数据集更大的任务上表现更差(小于100GB的任务上为0.36,大于100GB的任务上为0.10),在需要更多串行步骤的分析上也表现更差(1-2步时为0.36,3步及以上时为0.24)。平均而言,智能体完成每个任务需要6.8小时、1.02亿token和43美元,最长的尝试消耗了24小时、10.7亿token和525美元。值得注意的是,得分最高的智能体比表现较差的选项使用了更少的token,成本也更低。这些结果表明,大语言模型在以下三方面的能力差异巨大:(1)连贯执行多个串行分析步骤;(2)管理大量原始数据;(3)跨科学领域开展工作。
