论文

CROCODIL:使用 LLM 进行跨模型代码编辑

CROCODIL: Cross-Model Code Editing with LLMs

模型训练强化学习

摘要

大语言模型已广泛用于代码生成和编辑。研发人员常用不同模型,或在不同编码会话间切换模型,因此一个模型经常编辑另一个模型生成的代码。不同训练数据带来不同风格偏好。本文研究模型修改其他模型代码时的行为,发现这类代码会引发更多且常常过量的编辑。我们提出CROCODIL后训练框架,在保留功能正确性的同时减少过度修改:相似性奖励惩罚较大改动,执行奖励衡量构建及测试成功,两者乘积鼓励在不降低编辑任务成功率的条件下缩小改动。项目:https://github.com/EngineeringSoftware/Crocodil。