论文

当AI审查自己的代码时:递归自训练崩溃代码LLM

When AI Reviews Its Own Code: Recursive Self-Training Collapse in Code LLMs

模型评测模型行为与机制分析

摘要

当生成的数据在没有新鲜人类数据或外部质量控制的情况下被重复使用时,递归自我训练可能会降低神经生成模型的性能。我们在代码 LLM 中研究了这种风险,其中人工智能生成的代码可以进入真实的存储库,随后成为训练数据,并创建存储库规模的自我训练循环。虽然软件开发传统上通过拉取请求审查、测试、编译和人工批准来中断这个循环,但人工智能编码工具现在生成代码的速度比人类审查它的速度快,而且代码审查本身也越来越被人工智能系统自动化。因此,我们比较了三种递归 微调 制度:无审查、使用与模型无关的过滤器(例如编译和静态质量检查)的人为门审查,以及使用代码 LLM 自己的信号(例如困惑度和二进制自评分)的 AI 自门审查。在多个代码 LLM 和基准测试中,没有评论崩溃最快,人门过滤器缓慢但不会停止崩溃,AI 自门过滤器早期看起来很强大,但后来失去了过滤效果。在最明显的情况下,二元自门进入橡皮图章状态,其中接受分数上升,而基准正确性下降。我们通过将审查公式化为门控分布重新加权来解释这种行为,证明人工智能自门控在自我确认接受条件下退化为非门控自我训练,并给出递归再训练下表示级协方差集中的谱分析。这些结果表明稳定的递归代码 LLM 训练需要外源验证而不是模型耦合的自我审查。