论文
高保真代码说明未必改善编程智能体的问题修复
Compact Documentation for Coding Agents: A Benchmark, an Optimizer, and Why It Does Not Transfer
摘要
我们研究自然语言文档是否有助于编码代理解决软件问题,并构建工具来构建和评估它。我们引入了一个往返基准,通过从描述重新生成的代码是否通过原始测试来对代码描述进行评分,并表明完整性而不是长度驱动描述的保真度。使用基准作为优化信号,我们发现了一个用于撰写代码说明的提示词,它达到完全保真度并泛化到未见过的文件。然后,我们测试激发这项工作的假设:更好的文档可以帮助代理解决真正的存储库问题。在两个模型系列和十个存储库中,并针对确认我们的评估可以检测到真正改进的阳性对照,我们发现事实并非如此。当源代码可用时,静态紧凑文档和检索得到的上下文均未单独改善问题解决效果。我们将这个负面结果与基准测试和优化器一起报告,并描述文档提供帮助的边界。
