论文
Needle in the Repo:人工智能生成的存储库编辑的可维护性基准
Needle in the Repo: A Benchmark for Maintainability in AI-Generated Repository Edits
摘要
AI 编码智能体 现在可以完成复杂的编程任务,但现有的评估主要强调行为正确性,而往往忽视可维护性风险,例如模块化或可测试性薄弱。我们提出了 Needle in the Repo (NITR),这是一个诊断探针和预言框架,用于评估行为正确的存储库编辑是否保留了可维护的结构。 NITR 将反复出现的软件工程智慧提炼成嵌入小型、现实的多文件代码库中的受控探针,每个代码库的成功主要取决于一个目标可维护性维度。每个探针都与一个隐藏的评估工具配对,该评估工具将所需行为的功能测试与对目标可维护性约束进行编码并返回可解释诊断的结构预言相结合。使用 NITR,我们在直接推理和基于代理的设置中评估了 GPT、Claude、Gemini 和 Qwen 系列的 23 种编码配置。当前的人工智能编码系统还远不够稳健:平均而言,配置只能解决 36.2% 的情况,最好的达到 57.1%,性能从微型情况下的 53.5% 下降到多步骤情况下的 20.6%。最困难的压力是架构而不是本地编辑,特别是依赖性控制(4.3%)和责任分解(15.2%)。此外,64/483 的结果 (13.3%) 通过了所有功能测试,但未通过结构预言。在我们的利用下,代理模式配置将平均性能从 28.2% 提高到 45.0%,但并不能消除这些架构故障。这些结果表明,代码生成方面的进展尚未在可维护代码演化方面取得进展,并且 NITR 暴露了传统评估所遗漏的关键故障面。