论文

服从、分歧、崩溃:盲目服从错误指令导致代码 LLM 变成不可恢复的代码语义崩溃

Obey, Diverge, Collapse: Blind Obedience to Incorrect Instructions Drives Code LLMs to Irrecoverable Code Semantic Collapse

模型评测模型行为与机制分析

摘要

代码语言模型现在是生产工作流程中值得信赖的协作者,用于调试、重构和迭代修复,并且评估它们的每个基准都假设它们所执行的指令是正确的。我们研究当这个假设被打破时会发生什么。我们通过四个实验来评估代码语言模型,这些实验旨在评估模型是否在单遍和迭代修复设置中抵制或遵守不正确的指令,使用算法 Python 问题的 RunBugRun 数据集和确定性测试用例。我们的研究结果揭示了一种引人注目的行为模式:模型正确地将不正​​确的指令识别为错误,然后无论如何都遵循它。这种合规性在不知不觉中引入了超出原始错误的错误,并且损坏的代码状态无法通过后续的自引导迭代修复来恢复,从而无法跨遍收敛。我们将这种盲目服从称为“盲目服从”,描述它引入的幽灵(未知)错误,量化语义损坏被证明不可恢复的案例比例,并表明扩展推理无法逆转它。这些发现揭示了通过率评估不可见的行为属性,对生产环境中部署的代码语言模型产生直接影响。