论文
CompMat-Bench:计算材料科学人工智能Agent的基准测试
CompMat-Bench: Benchmarking AI Agents for Computational Materials Science
摘要
在科学研究任务中评估人工智能Agent受到基础实验或计算所需的时间和资源的限制。在计算材料研究中,在Agent和试验中重复相同的昂贵模拟可能会使评估变得不切实际。我们引入了 CompMat-Bench,这是一个包含 94 项任务的基准,源自最近发表的计算材料研究,每个任务都要求智能体完成一个步骤,以实现该研究的科学目标。我们提前重现研究步骤,并评估Agent为昂贵的模拟准备输入和分析输出,因此在评估过程中可以避免昂贵的模拟。复制的输入和结果可以作为具有固定规则的评分Agent的基本事实,无需大语言模型评审。该基准支持四种评估条件:单个任务和由相关任务组成的工作流程,每个任务都有完整或简化的方法指导。在对单个任务的全面指导下,基于三个大语言模型的Agent展示了完成单个材料研究步骤的能力,94 项任务的通过率为 66.0-90.4%。较长的工作流程和减少的指导都会限制Agent的性能,但对于不同的Agent而言,方式不同:它们会降低较弱Agent的通过率,而最强的Agent只有在较长的工作流程与减少的指导相结合时才会下降。故障分析将大多数故障归因于科学错误,而不是软件使用错误。 CompMat-Bench 为在实际材料研究步骤上比较Agent和分析Agent失效模式提供了基础。