论文
编码智能体 能否重现计算材料科学的发现?
Can Coding Agents Reproduce Findings in Computational Materials Science?
摘要
大语言模型 越来越多地作为自主 编码智能体 进行部署,并在软件工程基准测试中取得了非常强大的性能。然而,目前尚不清楚这种成功是否会转移到计算科学工作流程中,其中的任务不仅需要强大的编码能力,还需要能够导航复杂的、特定领域的程序以及在科学主张的背景下解释结果的能力。为了解决这个问题,我们提出了 AutoMat,一个用于评估基于 LLM 的代理重现计算材料科学主张的能力的基准。 AutoMat 提出了三个相互关联的挑战:恢复未指定的计算程序、导航专用工具链以及确定结果证据是否支持主张。通过与主题专家密切合作,我们从真实的材料科学论文中策划了一组声明,以测试 编码智能体 是否可以恢复并执行支持(或破坏)此类声明所需的端到端工作流程。然后,我们评估多个基础模型中的多个代表性 编码智能体 设置。我们的结果表明,当前基于 LLM 的代理在 AutoMat 上的总体成功率较低,表现最好的设置成功率仅为 53%。错误分析进一步表明,当必须仅根据纸质文本重建工作流程时,代理的表现最差,并且它们的失败主要是由于程序不完整、方法偏差和执行脆弱性。总而言之,这些发现使 AutoMat 既成为计算科学再现性的基准,又成为诊断人工智能科学环境中代理系统当前局限性的工具。