论文

持续训练遗忘为何集中在语料稀缺Token的输出嵌入?

A Deafening Silence: Catastrophic Forgetting Lives in the Output Embeddings of Tokens the Data Never Speaks

模型训练模型评测参数高效训练持续学习模型行为与机制分析

摘要

大型语言模型 (LLM) 中的持续预训练和微调不可避免地会导致灾难性遗忘,通常可以通过使用通常无法访问的原始数据进行重放来缓解这种情况。在这种无数据的情况下,我们分析遗忘发生的位置及其原因。高达 1.4B 的五种设置的系统参数冻结表明,遗忘选择性地集中在新语料库中很少见的标记的输出嵌入中,而主体的相同 sqrt(v-hat) 带是惰性的,新的学习驻留在其他地方。这种本地化是由语料库的词汇不足而不是训练模式决定的,允许在固定的基础模型中仅根据标记计数进行预再训练风险排名。从机制上讲,缺席的标记会接收持续的单侧 softmax 梯度,Adam 的二阶矩 (sqrt(v-hat)) 归一化会将其放大为全尺寸更新。因此,我们提出一项干预措施:专门针对训练期间的输出预测提高 Adam 的 epsilon。在涵盖 160M 至 12B 参数的八个设置和四个模型系列中,这消除了 39.4% 在所有七种稳定配置中,遗忘率为 67.9%,且不会降低目标学习能力或需要针对每个模型进行调整。该防御将加法或更好地与重播相结合(Qwen/韩语上为 79.8%),并将被释放的 LoRA 从 23 倍的遗忘激增中拯救出来。由于对漂移行进行事后编辑的遗忘率低于 5%,因此干预措施必须在训练期间进行。我们的研究结果表明,单行优化器调整可以作为防止语料库词汇量匮乏的灾难性遗忘的主要防御措施。

持续训练遗忘为何集中在语料稀缺Token的输出嵌入?:论文原图
图 1:概述:遗忘存在于何处,为何存在于该处,以及对其采取行动会带来什么。