论文
论故障定位上下文在基于LLM的程序修复中的作用
On the Role of Fault Localization Context for LLM-Based Program Repair
摘要
故障定位 (FL) 是基于 大语言模型 (LLM) 的自动程序修复 (APR) 的关键组件,但其影响仍未得到充分研究。特别是,目前还不清楚需要多少本地化,超出预测的错误位置的附加上下文是否有益,以及应如何检索此类上下文。我们使用 GPT-5-mini 对 500 个 SWE 基准验证实例进行了大规模实证研究,评估了 61 种不同文件级、元素级和行级上下文的配置。我们的结果表明,更多的上下文并不能持续提高修复性能。文件级本地化是主要因素,与无文件基准相比提高了 15-17 倍。扩展文件上下文通常与提高性能相关,在具有大约 6-10 个相关文件的配置中最常见的是成功修复。元素级上下文扩展提供了强烈依赖于文件上下文质量的条件增益,而行级上下文扩展经常由于噪声放大而降低性能。基于 LLM 的检索通常优于结构启发式方法,同时使用更少的文件和标记。总体而言,最有效的 FL 上下文策略通常将较高抽象级别的广泛语义理解与精确的行级本地化相结合。这些发现挑战了我们的假设,即增加本地化上下文会统一提高 APR,并为设计基于 LLM 的 FL 策略提供实用指导。