论文
为软件修复代理编写错误报告:什么信息最重要?
Writing Bug Reports for Software Repair Agents: What Information Matters Most?
摘要
软件开发越来越倾向于代理优先的工作流程。这包括负责为提交的问题报告生成初始修复的人工智能代理。在这种情况下,问题报告不再仅仅是人类维护人员的文档;它们成为代理的主要任务规范。然而,对于如何编写此类报告以最大限度地提高代理产生正确修复的机会,人们知之甚少。我们研究什么使错误报告代理做好准备。从 SWE-bench Verified 基准(即 500 个真实存储库问题的集合,其中包含人工编写的标准参考补丁和用于评估生成修复的测试套件)开始,我们按更改类型(例如错误修复与重构)手动对每个问题进行分类,并用其信息类型注释每个句子,例如观察到的行为、预期行为、再现步骤、本地化提示和建议的修复。我们专注于代表错误报告的 441 个问题,并使用三个 LLM 主干(即 GPT-5-mini、MiniMax M2.5 和 Gemini 3 Flash)在它们上运行 mini-swe-agent。然后,我们拟合二项式回归模型来估计每种信息类型与代理成功之间的增量关联,并控制混杂因素。我们的结果表明,代理优先报告从缩小代理搜索和修复空间的信息中获益最多。本地化线索(例如对受影响代码区域的引用)与成功修复呈正相关,而以代码或自然语言表达的建议修复则显示出与通过概率的一些最强的正相关。一项删除选定信息类型的消融研究证实,智能体从传统上对人类有用的信息(例如复制步骤)中获益较少,而从暴露修复方向的句子中获益更多,无论是通过错误定位还是建议的修复。