论文

BenchBench-Protocol:评估真实世界湿实验方案推理与修改的基准

BenchBench-Protocol: Evaluating Real-World Wet-Lab Protocol Reasoning and Modification

模型评测基准与评测资源

摘要

我们提出BenchBench-Protocol,一个面向大语言模型的基准,包含149个方案修改任务,这些任务取自科学家在真实实验工作中对已发表方案所做的修改。将已发表的实验方案适配到新实验是湿实验室科学家的日常任务,而正确的修改需要考虑先前的选择和下游步骤。近期的生命科学基准已转向开放式、按评分细则(rubric)打分的任务,但任务通常由专家撰写而非从真实世界修改中重建。BenchBench-Protocol的任务源自已发表方案与科学家修改版本之间的差异,这为查询提供了依据,也为正确响应提供了加权的评分要素。该基准取自湿实验生物学九个领域的96个源方案,并且只包含经领域专家评审后获得高评分的任务。我们评估了九个闭源和开源模型;Claude Opus 5得分最高,归一化评分细则得分为59.2%,其他模型介于34.1%和47.1%之间,且取十次尝试的最佳结果时该基准仍未饱和。随着模型在生命科学研究中的帮助越来越大,在常规湿实验任务上评估它们也变得相应重要。我们将BenchBench-Protocol既作为湿实验推理的真实实验支撑评估,也作为真实世界实验可用于构建基准任务之价值的证据。

BenchBench-Protocol:评估真实世界湿实验方案推理与修改的基准:论文配图
图1:基准构建概览。将已发表的协议与贡献者在Benchling上经科学家改编的版本进行比较,以产出任务与加权评分细则,经专家质量控制后予以保留。