论文
SHERLOC:代码修复代理的结构化诊断本地化
SHERLOC: Structured Diagnostic Localization for Code Repair Agents
摘要
LLM 代理通过多轮工具使用来解决存储库级编码任务,但在编辑前将一半预算用于定位错误。专用的定位框架已经出现,但仍然被评估为文件检索而不是可操作的诊断,生成的位置没有修复代理所需的诊断上下文。我们引入了 SHERLOC(结构化假设驱动的本地化探索和推理),这是一个 无需训练 框架,将推理 LLM 与紧凑的存储库工具和自我恢复相结合,无需 微调 或多代理编排。 SHERLOC 在各个模型尺度上实现了最先进的定位:在 SWE-Bench Lite 上的准确率@1 为 84.33%,在 SWE-Bench Verified 上的召回率@1 为 81.27%;在~30B 参数下,它匹配或优于其他代理方法。将我们的位置和诊断结果注入修复代理中,从 SWE-Bench Verified 上的每个设置的最佳 SHERLOC 结果中产生平均 +5.95 pp 的解析率增益。 SHERLOC 将本地化和总词元平均削减了 36.7% 和 23.1%。