论文
onepot-Bench 0:迈向具有实验室意识的硅化学基准
onepot-Bench 0: towards lab-aware in silico chemistry benchmarks
摘要
语言模型在实验室科学中发挥着越来越重要的作用,执行实验规划、执行和事后分析等任务。然而,精确衡量他们的能力很困难,因为科学能力需要解决问题的技能和特定领域的直觉的结合。现有的评估很少衡量在物理实验室中做出可靠决策所需的能力,并且通常依赖于 模型训练 语料库中可能出现的公共数据。我们推出了 onepot-Bench 0,这是一个专有的基准套件,用于评估与湿实验室执行相关的合成化学功能的语言模型。 onepot-Bench 0 包含三个补充评估:ChemAbacus 衡量免工具化学信息学素养和数字推理; SynthRefusal 描述了各种良性、受控和设计药物靶标的安全性和拒绝行为; SynthBench 使用我们实验室生成的私人实验数据评估反应结果预测和催化剂选择。这些评估共同探讨了基本能力、可靠性和更深入的知识,以及在实验室中实现可靠性能所需的所有技能。