论文

用于识别引入错误的提交的基于 LLM 的代理

LLM-Based Agents for Identifying Bug-Introducing Commits

摘要

Śliwerski、Zimmermann 和 Zeller (SZZ) 刚刚荣获 2026 年 ACM SIGSOFT 影响力奖,因为他们提出了以下问题:变化何时会引发修复?他们 2005 年的论文为多种方法奠定了基础,这些方法旨在从软件存储库中的修复提交中识别引入错误的更改(或提交)。但即使经过二十年的进步,从 2025 年开始,性能最佳的方法在最流行的 Linux 内核数据集上的 F1 分数仍将小幅提高 10 个百分点。在本文中,我们揭示了基于 LLM 的代理如何以及为何能够显着提高从修复提交中识别引入错误的提交的最先进水平。我们提出了一个基于搜索一组候选提交的简单代理工作流程,发现它在最流行的 Linux 内核数据集上将 F1 分数从 0.64 提高到 0.81,比原始 2005 年方法 (0.54) 和之前的 SOTA (0.64) 之间的跳跃更大。我们还揭示了代理如此成功的原因:它们从修复提交差异和消息中派生出简短的 grepable 模式,并使用它们来有效地搜索和查找大型候选集中引入错误的提交。最后,我们还讨论了这些见解如何能够在根本原因理解和修复方面取得进一步进展。