论文
描述 LLM 在解决实际 GitHub 问题时的故障模式
Characterizing the Failure Modes of LLMs in Resolving Real-World GitHub Issues
摘要
大语言模型 (LLM) 越来越多地被部署来解决现实世界的 GitHub 问题。然而,尽管它们具有潜力,但人们对这些模型在复杂修复任务中的具体故障模式仍然知之甚少。为了描述 LLM 行为与人类开发者实践的差异,本文在 SWE-bench Verified 数据集上评估了三种最先进的模型,即 Claude 4.5 Sonnet、Gemini 3 Pro 和 GPT-5。我们对 900 项试验中 243 次失败尝试的症状和根本原因进行了严格的手动分析。我们的调查首先产生了一个统一的故障分类法,涵盖修复管道的五个不同阶段,在其中我们对典型的故障症状及其普遍程度进行了分类。其次,我们的研究结果表明,对于所有评估的LLM,策略制定和逻辑综合是最容易出错的阶段,其次是问题理解,而本地化的失败率最低。这表明 LLM 可能擅长故障定位,这项任务传统上被视为自动化程序修复中最艰巨的挑战之一。此外,我们观察到不同模型的稳健性和运营成本(特别是在故障场景中)存在显着差异。最后,我们揭示了这些失败的根本原因,并提出了缓解这些失败的可行策略。一个特别值得注意的发现是,现有的评估工具有时会由于表面差异或隐藏的约束而误判正确的补丁。总的来说,我们的见解可能为提高基于 LLM 的问题解决方案的有效性和可靠性提供有希望的方向。