论文

FLARE:以行级诊断反馈改进代码修复

FLARE: Fine-Grained Diagnostic Feedback for LLM Code Refinement

摘要

大语言模型 经常生成有错误的代码。现有的方法依赖于测试失败和自我批评等反馈信号来迭代地完善生成的代码。此类信号要么太粗粒度,要么太高级,不足以告知模型在何处修复错误。在这项工作中,我们提出了 Flare,一个具有轻量级诊断模型的迭代框架,可以预测行级可疑信号以进行错误定位和代码细化。鉴于诊断预测固有的不确定性,Flare 搜索前 k 个可疑区域,并根据执行结果选择最佳候选修复。在具有五个基本 LLM 的 LiveCodeBench 和 BigCodeBench 上进行的实验表明,即使没有候选搜索(k=1),Flare 的性能也优于最强的基线,绝对改善为1.72—7.42个百分点。此外,与不搜索候选者相比,搜索10个候选者的平均性能提高了 8.50%。当单独评估时,与最近的故障定位方法相比,我们的轻量级诊断模型实现了最佳性能,表明它可以为代码细化提供可靠的细粒度指导。