论文
语言模型中的遗忘:容量、优化和自生成重放
Forgetting in Language Models: Capacity, Optimization, and Self-Generated Replay
摘要
在新任务上训练的模型通常会在之前的任务上退化,这种现象称为遗忘。传统上,减轻遗忘需要重放先前任务中存储的样本,这通常是不切实际的。相比之下,语言模型可以从自己的训练分布中进行采样,并且我们表明这些自行生成的样本可以作为有效的重放数据,几乎消除了遗忘。我们发现,当模型几乎没有剩余容量时,遗忘仍然存在:预训练接近饱和的模型无法在不覆盖先验知识的情况下吸收新信息。当容量不是限制因素时,低学习率会减少遗忘,但需要更多的训练步骤。重放打破了这种权衡,实现了快速、高学习率的微调而不会忘记。