论文
当模型编辑过多时:论最少代码编辑的保真度
When Models Edit Too Much: On the Fidelity of Minimal Code Edits
摘要
大语言模型 (LLM) 越来越多地用于编辑现有代码,但仅靠正确性是不够的:有用的修复也应该是最少的、可审查的并且忠实于原始实现。我们研究过度编辑,即模型重写代码超出修复错误所需范围的倾向。我们通过将受控的 AST 级损坏注入参考解决方案,从 400 个 BigCodeBench 问题构建了一个评估框架,为每个修复任务提供了一个已知的最小补丁。在 LLM 前沿领域,即使在 GPT-5.5 这样的强大模型中,过度编辑也很普遍:高 Pass@1 可以与不必要的大量编辑共存并增加认知复杂性。保存指令大大减少了这种行为,将平均超额编辑距离从 0.195 降低到 0.131,将增加的认知复杂性降低了 26.6%,并将 Pass@1 提高了 2.3 分。然而,这些收益并不是简单地来自更大的推理预算或更大的模型。接下来我们问是否可以在 后训练 期间直接学习最小化编辑。我们观察到,有监督的 微调 过度拟合所见的损坏模式,而强化学习则提供了最佳的域外编辑保真度和性能保留权衡。这些结果将编辑保真度定位为代码修复质量的一个独特轴,并表明它是可以测量和学习的。