论文

合并,而不是测量:编码Agent修复的性能问题的实证研究

Merged, Not Measured: An Empirical Study of Performance Issues Fixed by Coding Agents

模型评测评测方法与指标

摘要

编码Agent开放拉取请求(PR),声称可以加速软件,但对人类性能修复的研究很少说明维护者如何响应此类修复或其声明是否成立。从 AIDev v4 的 71,677 个Agent PR 中,通过语言模型和作者进行的文本过滤器和码本编码,选择了由 582 个存储库中的 6 个Agent修复的 1,262 个性能问题。我们对每个问题及其测试进行编码,并重新执行 23 个被拒绝的修复和 30 个合并的修复。 (1) 57% 的封闭修复被合并,61% 的拒绝没有给出明确的原因,并且在我们的三轮试点中,针对大多数Agent构建的工作负载,重新执行的 23 个被拒绝的索赔中只有 6 个。 (2) 接受度随着Agent在存储库中的跟踪记录(31-37% 升至 70%)以及存储库对其其他Agent PR 的预开放合并率(33% 升至 84%)而上升。合并的修复删除了大部分更改的行(0.26 与 0.15),这种差异存在于Agent和存储库中,但在编码内容、描述、测试或测量中未检测到此类差异。 (3)重复计算和冗余数据处理导致了44%的问题,46%的修复是架构级别的。 (4) Agent更改了 37% 的修复测试,11% 进行了性能测试或基准测试;在 30 个合并修复中,18 个满足我们的交付标准,3 个未达到要求,9 个没有显示出显着的增益或回归,14 个改变了未经测试的输入的行为。结果使用Agent跟踪存储库的历史记录,而不是修复的编码内容,并且合并不会显示修复交付了它所声称的内容。