论文

QiMeng-PRepair:通过编辑感知奖励优化进行精确代码修复

QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization

模型训练强化学习

摘要

大语言模型 (LLM) 实现了强大的程序修复性能,但经常遭受过度编辑的困扰,其中过度修改会覆盖正确的代码并阻碍错误定位。我们系统地量化其影响并引入精确的修复任务,从而最大限度地重用正确的代码,同时仅修复有问题的部分。基于这一见解,我们提出了 PRepair,这是一个可以减少过度编辑并提高修复准确性的框架。 PRepair 有两个组成部分:自我破坏(Self-Breaking),它通过受控错误注入和最小-最大采样生成各种错误程序;自我修复(Self-Repairing),它使用编辑感知奖励来训练具有编辑感知组相对策略优化(EA-GRPO)的模型,以鼓励最少但正确的编辑。实验表明,PRepair 在 $\mathrm{fix}_1@1$(联合考虑修复正确性和修复范围的指标)下将修复精度提高了 31.4%,并在与推测性编辑相结合时显着提高了解码吞吐量,展示了其精确实用的代码修复潜力。