论文
较新的模型会产生更好的补丁吗?非功能性质量研究
Do Newer Models Produce Better Patches? A Non-Functional Quality Study
摘要
存储库级编码基准通常通过比较后期和早期模型的解决率来衡量模型能力的进展。然而,这种关注忽略了其生成的补丁的非功能质量是否也在模型代之间发生了变化。这项研究调查了在类似的存储库级修复任务中,较早期的模型是否能够生成功能正确的补丁,并具有比早期模型更好的非功能特性。我们在 SWE-bench Lite 上进行了两个案例研究,涉及四个 Claude 和 DeepSeek 模型。使用相同的 SWE-agent 功能修复设置,我们使用 CodeQL、CodeScene、CPU 时间和峰值内存评估生成的补丁。我们的主要分析比较了常见解决实例的模型。静态分析结果显示,大多数 CodeQL 配对差异为零,并且在 Holm 校正后没有任何 CodeQL 或 CodeScene 比较仍然显着。不同型号系列的 CPU 时间差异较小且不一致,而在基准测试工作负载下,后续型号的峰值内存使用率略高,但绝对差异较小。各个 CodeQL 规则和 CodeScene 类别的差异因模型系列而异,并且无法通过多重比较校正。总体而言,后来的模型解决了更多的实例,但在两个模型解决的任务的测量非功能指标上没有显示出一致的改进。通过这项研究,我们希望鼓励对模型的实际软件工程能力进行更全面的评估。