论文

使用迭代反馈循环解锁 LLM 代码校正

Unlocking LLM Code Correction with Iterative Feedback Loops

模型评测模型能力评测

摘要

大语言模型在代码生成方面表现出了卓越的能力。然而,大多数现有的评估仅关注单次尝试的准确性,而忽略了对于现实世界编程至关重要的迭代细化过程。本研究对 LLM 通过执行反馈纠正自身代码的能力进行了系统调查。本研究使用跨四种模型和两种主要编程语言的现实世界编程问题,使用迭代细化框架来评估性能,其中 LLM 在每次尝试后接收编译器错误消息和测试用例反馈。本研究引入了评估代码故障、分析纠正模式以及比较推理和非推理模型有效性的指标,为 LLM 驱动的代码生成系统中反馈循环的理解和实际应用提供了可操作的见解。结果表明,推理模型在迭代过程中不断改进,在利用反馈方面远远优于非推理模型,而句法和运行时错误比逻辑或算法故障更容易处理。