论文

ComBench:用于修复编译错误的 Repo 级真实基准

ComBench: A Repo-level Real-world Benchmark for Compilation Error Repair

模型评测应用与实践基准与评测资源编程

摘要

编译错误给软件开发带来了普遍而严峻的挑战,极大地降低了生产力。因此,提出了自动编译错误修复(ACER)技术来缓解这些问题。尽管 ACER 最近取得了进步,但其实际性能的评估仍然很差。这在很大程度上归因于现有基准的局限性,即脱离上下文的单文件数据、缺乏真实的源多样性以及忽略关键存储库级别复杂性的有偏见的本地任务建模。为了弥补这一关键差距,我们提出了 ComBench,这是第一个用于 C/C++ 编译错误修复的存储库级、可重现的现实世界基准。 ComBench 是通过一个新颖的自动化框架构建的,该框架可以从大型开源项目的 GitHub CI 历史中系统地挖掘现实世界的故障。我们的框架提供了从复杂版本历史中高精度识别 真值 修复补丁的技术,以及用于再现原始、短暂构建环境的高保真机制。为了确保数据质量,ComBench 中的所有样本都经过执行验证——保证可重现故障并通过 真值 补丁构建成功。使用 ComBench,我们在直接修复和基于代理的修复设置下对 12 个现代 LLM 进行了全面评估。我们的实验揭示了模型实现语法正确性的能力(GPT-5 的成功率为 73%)和确保语义正确性的能力(只有 41% 的补丁有效)之间存在显着差距。我们还发现不同的模型对于不同的错误类型表现出不同的专业性。 ComBench 提供了一个强大且现实的平台来指导 ACER 技术的未来开发,从而能够解决现代软件开发的复杂性。