论文

频谱削波能否实现更好的学习,同时减少低秩适应的遗忘?

Can Spectral-Clipping Enable Better Learning While Forgetting Less for Low-Rank Adaptation?

模型训练参数高效训练

摘要

近年来,低秩适应(LoRA)已成为一种重要的范式,它冻结了预训练的权重并引入了小型的、可学习的适配器,而不是 微调 的全套参数。在这项工作中,我们基于奇异值分解(SVD)揭示了有关网络参数奇异分量的几个关键见解。首先,预训练网络参数中具有较大奇异值的主奇异分量可以在 微调 期间有效地重用,而具有较小奇异值的次要分量更具任务特定性,需要大量调整。其次,我们首先建立了理论联系,即 LoRA 适配器中奇异值不受控制的增长会导致预先训练的知识的遗忘——这是一个被称为灾难性遗忘的众所周知的问题。基于这些观察,我们提出了 SCLoRA,它将带有光谱裁剪的参数化奇异分量注入到预训练模型中,以了解预训练模型的光谱分布。 SCLoRA 通过将更新重点放在需要适应的组件上,有效地适应新任务,同时减轻灾难性遗忘。我们进行了大量的实验,证明 SCLoRA 不仅可以提高下游性能,还可以有效保留预先训练的知识。