论文
SWE-bench Science:编码智能体 能否解决科学中的工程任务?
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
摘要
软件越来越多地充当科学仪器本身的一部分,使得科学代码中的故障不仅会损害程序行为,还会损害科学结论的证据。然而,现有的 编码智能体 评估主要强调总体任务成功,对代理在修复科学软件时失败的原因提供的了解有限。我们引入了 \textbf{SWE-bench Science},这是科学软件工程的存储库级基准,包含来自 20 个科学领域的 98 个 GitHub 存储库的 119 项任务。每项任务都被组织为三种范式之一:问题驱动、专家探索和工程集成。即使是表现最好的代理,\textbf{Claude Code with Opus-5 (max),也能达到 pass@1 低于 50\%},凸显了科学软件工程带来的巨大挑战。我们确定了四种反复出现的故障机制:科学知识或抽象的缺陷、误导性的探索或表面修复、不完整的修复覆盖或系统集成,以及未能将科学知识推广到我们分析中观察到的案例之外。我们进一步进行配对消融,删除明确的科学指导,同时保留存储库和可执行的工程环境。结果表明,科学知识并不总是有益的:基础良好的信息可以限制修复并提高平均性能和词元效率,而不一致的指导可能会导致锚定,并且不一定会提高精确的修复成功率。 SWE-bench Science 共同提供了一个广泛的测试平台,用于研究 编码智能体 在科学软件工程中的功能和故障机制。