论文

编码智能体 存储库指南的探索和细化调整

Probe-and-Refine Tuning of Repository Guidance for Coding Agents

智能体系统Agent Harness

摘要

基于 LLM 的 编码智能体 需要有关代码本身不存在的存储库(哪些文件包含哪些子系统、如何运行测试套件、哪些工作流程历史上导致错误修复)的高级操作知识。工程师通常维护 AGENTS.md 文件来提供此上下文作为 编码智能体 的说明,但它们是否有帮助是有争议的:最近的研究对于 LLM 生成的指导是否会提高或损害代理性能存在分歧。在本文中,我们展示了指导的生成方式是决定性的变量,并介绍了探测和优化调整:一种使用合成错误修复探针通过单次 LLM 调用迭代诊断和修补存储库的指导文件的过程,在调整期间不使用代理循环或工具。在 SWE-bench 上,使用 Qwen3.5-35B-A3B 在 200 个步骤进行四次独立试验验证,probe-and-refine 实现了 33.0% 的平均解析率,而用于初始化它的静态知识库为 28.3%,无引导基线为 25.5%(对于probe-and-refine 对比,p < 0.001)。改进来自于覆盖范围而不是精度:改进的指导产生的可评估补丁多了 14.5 个百分点 (pp),而每个补丁的精度在统计上保持不变(约 59%,p = 0.119),这表明改进的指导有助于代理获取正确的文件,而不是提高他们所做更改的质量。此外,步进预算实验表明,指导可以让代理有效地使用更大的步进预算,而使用 NVIDIA-Nemotron-3-Nano-30B-A3B 进行的跨模型实验发现,当模型无法生成足够的诊断输出时,调整循环会降低,尽管每个补丁的精度仍然保持不变。