论文
用进化策略克服 LLM 微调 中的遗忘
Overcoming Forgetting in LLM Fine-Tuning with Evolution Strategies
摘要
进化策略 (ES) 最近已成为 大语言模型 (LLM) 微调 强化学习 (RL) 的竞争替代方案,通过简单性、可扩展性和纯推理训练提供优势。然而,最近的研究表明,新任务上的 ES 微调 可能会导致忘记先前的任务。首先,本文表明先验任务遗忘(1)更好地描述为性能漂移而不是不可逆遗忘,先验任务性能通常在 ES 训练期间恢复; (2) 不是 ES 的特定故障模式,但对于采用 RL 方法的 微调 也可能出现。其次,它分析了这种漂移何时以及为何出现,强调了其对 ES 训练动态的依赖,特别是权重空间弱约束方向上的随机游走行为。第三,基于这些见解,它引入了锚定权重衰减(AWD)作为参数空间正则化技术,限制对初始模型参数的优化。 AWD 有效地稳定了先前任务的性能,同时保留了目标任务的性能,以低得多的计算成本实现了与大型 ES 群体规模相当的效益。因此,与之前的观点相反,本文表明 ES 下的先验任务遗忘在很大程度上是可以避免的,将 ES 定位为 LLM 中持续学习的一种有前途的方法。