论文
本地支持学习
Local Support Learning
摘要
我们在大型预训练模型的背景下探索灾难性遗忘。通过将遗忘视为每个权重矩阵的输入空间中的几何问题,我们发现了一个自然保留目标,在该目标下基于梯度的优化器产生的更新是次优的。根据这一观察,我们提出了本地支持学习(LSL),这是一种通用框架,可以增强基于梯度的训练,以在不访问先前数据的情况下保留先前的能力。在新的学习阶段,LSL 将两个具有不同角色的组件配对:一个标准权重适配器,像往常一样进行训练以最大程度地减少损失,以及一个门函数,该函数仅使适配器能够从其自己的训练分布中输入激活,从而使更新成为该分布的本地更新。关键的挑战是该门必须路由所有学习阶段的数据,同时仅对当前阶段的数据进行训练。我们使用基于高斯混合模型(GMM)的门来解决这个问题,其可能性从其训练数据中迅速衰减,使其自然倾向于对先前阶段的数据保持关闭状态。我们证明,这种后训练方法可以解决 LLM 中多达 70 亿个参数的遗忘问题,在多个训练阶段保留预训练和微调的能力,同时具有高效的内存和计算能力,对超参数选择具有鲁棒性,并显示出扩展潜力。