自我改进可能自我倒退:LLM自训练的兴衰失败模式
Self-Improvement Can Self-Regress: The Rise-and-Collapse Failure Mode of LLM Self-Training
摘要
自我改进可能自我倒退。在代码的REINFORCE后训练中——模型可以快速改进其优化指标——然后在同一训练活动中坍缩。我们在受控多种子试验台研究该现象——以Qwen-2.5-3B与7B在竞赛编程任务上以二值CodeGrader奖励跨10个顺序20步活动训练。跨活动——pass@1展现稳健的先升后坍模式:在数十个梯度步内达峰——随后回落——有时近零。这不是跨任务灾难性遗忘——而是固定分布上的任务内策略过优化;KL与EWC式约束不能阻止它。我们追问控制回路应放在哪里。我们比较三个层级:CARE——带能力后验、迁移门与回归感知信念修订的活动间记忆机制;ES——滚动峰值检查点、把下一预算设为峰值步+3的活动内早停规则;GRPO——经组相对奖励归一化改变RL更新。答案依机制而定。在朴素REINFORCE脆弱的Qwen-2.5-3B上——CARE v2把链末pass@1近乎翻倍(4.9%到9.5%)——配对自助95% CI [+0.4,+8.9]、4/5种子有增益。在Qwen-2.5-7B上——CARE与朴素REINFORCE持平(13.8%对11.8%)——而ES达22.2% [14.1,28.0]。开箱GRPO达20.7% [15.7,25.1]——几乎匹敌REINFORCE+ES。GRPO抬地板但不移除悬崖:其7B增益主要来自更好的活动间传递——而活动内峰值到终点差距在REINFORCE与GRPO下都保持约17分。GRPO+ES证据混杂:2/3种子改进——但一次最终悬崖把均值拉到17.0% [0.0,28.1]。Gemma-3-4B试点显示相同签名——提示该现象不限于Qwen。