论文

SAE-FD:稀疏自动编码器功能 蒸馏,用于持续学习 大语言模型

SAE-FD: Sparse Autoencoder Feature Distillation for Continual Learning of Large Language Models

模型训练持续学习

摘要

持续学习使 大语言模型 能够适应不断变化的任务,而无需从头开始重新训练,但灾难性遗忘仍然是一个主要障碍。在持续学习方法中,基于正则化的方法广泛用于约束模型更新并减少遗忘,在权重空间、梯度空间或输出空间中操作。然而,这些密集的表示空间受到特征叠加的影响,其中多个概念被编码在重叠的维度中,使得很难有选择地保护以前学到的知识而不妨碍新任务的学习。为了解决这个问题,我们提出了 \ 方法(稀疏自动编码器特征 蒸馏),它将模型表示锚定在预训练的稀疏自动编码器的稀疏特征空间中,其中密集激活被分解为稀疏的过完备基础,减少了表示纠缠,从而实现更有针对性的正则化,同时减少对新任务学习的干扰。对三种模型架构的两个持续学习基准进行的实验表明,该方法始终优于现有的基于正则化的方法,仅用 -0.46 的向后迁移即可实现高达 52.70% 的平均准确度。