论文

Latent-LoRA:具有无梯度路由的紧凑型潜在空间适配器,用于持续学习

Latent-LoRA: Compact Latent-Space Adapters with Gradient-Free Routing for Continual Learning

模型训练持续学习

摘要

大语言模型 可以很好地推广到单个任务,但缺乏顺序学习它们的固有机制,从而导致灾难性遗忘。为了缓解这一问题,基于 LoRA 的持续学习方法为每个任务分配一个单独的低秩适配器,但现有方法要么在推理时要求任务同一性,要么不加区别地对所有适配器求和,从而让不相关的分支扭曲输出。最近基于门控的解决方案将输入路由到正确的适配器,但引入了可训练的参数,这些参数本身需要防止遗忘。在这项工作中,我们观察到来自冻结 LLM 嵌入层的池化词元嵌入已经在整个学习序列中分离了任务分布。在这些嵌入上拟合的高斯混合模型,无需任何基于梯度的训练,足以在测试时选择与任务无关的适配器。这消除了对学习门控模块的需要。在适配器方面,通过 SVD 将每个任务的参数限制到预训练权重的主子空间,从而产生紧凑的潜在空间参数化。在这个子空间内,正交正则化直接控制任务间干扰。由此产生的系统 Latent-LoRA 是免重放的,不需要可训练的路由组件,并且每个任务使用的参数要少得多。五个模型规模和两个已建立的持续学习基准的实验显示了最先进的性能和接近零的遗忘。