论文

SWE-Mutation:LLM 能否在软件工程中生成可靠的测试套件?

SWE-Mutation: Can LLMs Generate Reliable Test Suites in Software Engineering?

模型评测基准与评测资源

摘要

评估软件工程能力已成为现代大语言模型(LLM)的核心组成部分;然而,阻碍进一步扩展的关键瓶颈不在于缺乏高质量的解决方案,而在于缺乏高质量的测试套件。测试套件对于合成程序修复轨迹和在强化学习中提供精确的反馈信号都是不可或缺的。不幸的是,由于成本高、标注难度大,长期以来高质量的测试套件很难获得,而LLM自动生成的测试套件往往比较肤浅,缺乏足够的判别力。作为构建高质量测试套件的第一步,我们引入了 SWE-Mutation,这是用于评估 LLM 生成的测试套件的基准。该基准测试通过引入系统变异的解决方案来表征测试套件,这些解决方案试图“欺骗”测试套件并通过验证。我们进一步提出了一个与语言无关的代理框架,用于自动生成复杂的突变体。我们的基准测试由源自 800 个原始实例的 2,636 个突变变体组成,并包括跨越九种编程语言的多语言子集。对七个 LLM 的实验表明,即使 DeepSeek-V3.1 也只能实现 10.20% 的验证率和 36.15% 的检测率,凸显了当前 LLM 的不足。此外,我们的代理突变策略增强了真实性,与传统方法相比,平均检测率从 71.04% 降低到 39.81%。这些发现暴露了当前 LLM 生成可靠和有区别的测试套件的能力的持续缺陷。