论文
基于 LLM 的程序修复中的实验设置:输入、工具访问、反馈和验证的研究
Experimental Settings in LLM-Based Program Repair: A Study of Inputs, Tool Access, Feedback, and Validation
摘要
自动程序修复 (APR) 系统的评估通常会报告基准、已修复缺陷的数量以及用于最终补丁验证的测试,但这些项目不再完全指定向系统提供的修复任务。最近基于 LLM 的系统在修复前提供的信息、修复期间允许的存储库和测试操作以及尝试失败后返回的反馈方面有所不同,从而允许相同的基准实例化实质上不同的修复任务,范围从本地化补丁生成到存储库级诊断和迭代修复。我们提出了一个框架,用于明确指定与报告的 APR 结果相关的实验设置。我们分析了在 Defects4J 和 SWE-bench 上评估的系统报告的实验设置,并通过其任务单元、故障定位假设、初始输入、工具访问、修复时间反馈、最终验证和资源预算来表征每个结果。我们的分析表明,仅基准标识不足以重建评估的任务或确定报告的修复率的适当比较范围。因此,我们引入了一种机器可读的模式来指定每个实验设置,以提高可重复性并使跨系统比较的范围明确。