论文
三是神奇的数字吗?基于 LLM 的修复循环的实证评估
Is Three the Magic Number? An Empirical Evaluation of LLM-Based Repair Loops
摘要
迭代修复循环已成为基于 LLM 的软件工程系统的核心设计模式。这些工作流程使用编译器错误或测试失败等反馈重复生成、验证和修复工件。尽管它们被广泛使用,但修复循环迭代限制的影响仍然知之甚少,因为大多数先前的工作采用固定的、通常是任意的修复预算。我们研究多个软件工程任务的修复循环有效性,包括代码生成、测试生成和代码翻译。在几个具有代表性的工作流程、数据集和当代低成本 LLM 中,我们观察到了一致的收益递减模式:前三到四次修复迭代带来了最大的可实现收益,而后面的迭代仅贡献了边际改进。我们进一步发现,修复行为受工作流程编排和反馈设计的影响比底层模型本身的影响更大。这些结果表明,修复预算应被视为一个明确的实验变量,因为它们直接影响基于 LLM 的软件工程研究中的评估结果、计算成本、运行时间和可重复性。