论文

生成探针:用于存储库级修复基准的程序变体引导测试增强

Probe to Generate: Program Variant-Guided Test Augmentation for Repository-Level Repair Benchmarks

模型评测基准与评测资源

摘要

基于测试的基准(例如 SWE-bench)已成为评估自动问题解决代理的标准基础,如果补丁通过了提供的回归测试套件,则认为补丁是正确的。在实践中,弱测试套件可能会承认看似合理但语义上不正确的补丁,从而夸大报告的代理性能。我们提出了 \tool,一个测试增强框架,它使用语义修改的程序变体作为行为探针来识别和缩小基准测试套件中的差距。在原始测试中幸存下来的参考补丁的变体揭示了受约束的行为,然后指导有针对性的回归测试生成。每个生成的测试只有在通过参考补丁、在至少一个幸存变体上失败并且在行为保留转换下保持稳健时才会被保留。在 SWE-bench Verified 上,77% 的实例承认至少一种幸存变体。 \tool 在 211 个实例中生成 1,014 个经过验证的测试,将补丁区域线路和分支覆盖率提高了 10.8 和 9.5 个百分点。使用增强套件重新评估前 10 个修复代理会将解决率降低 4.2%-9.0%,这表明许多先前接受的补丁利用了基准测试差距,而不是完全满足预期的修复语义。这些发现表明,基准评估不仅是补丁生成问题,而且还是测试强度问题。