论文

KeepLo​​RA++:利用分层残差梯度自适应进行持续学习

KeepLoRA++: Continual Learning with Layer-Scaled Residual Gradient Adaptation

模型训练持续学习

摘要

预训练视觉语言模型的持续学习需要平衡三个相互竞争的目标:保留预训练的知识、保留一系列学习任务中的知识以及保持获取新知识的可塑性。本文提出了 KeepLo​​RA++,通过统一的二维知识保留机制来平衡这些目标。我们从层间和层内的角度分析了 Transformer 架构的知识分布。层间视角检查保留如何跨层分布,而层内视角则侧重于每层内的参数空间。我们的分析揭示了一个结构特性:一般可迁移知识主要编码在浅层和参数的主子空间中,而特定于任务的适应则集中在深层和残差子空间中。受此启发,KeepLo​​RA++ 引入了分层残差梯度自适应方法。通过限制 LoRA 参数更新到剩余子空间,结合从浅到深的层缩放来学习新任务,以防止干扰先前获得的能力。具体来说,新任务的梯度被投影到与预训练模型的主子空间和先前任务特征的主导方向正交的子空间上,同时将较小的更新幅度分配给浅层,将较大的更新幅度分配给更深的层。我们的理论分析和实证评估证实,KeepLo​​RA++ 成功地平衡了这三个相互竞争的目标,在图像分类、视觉问答和视频理解任务方面始终优于代表性基线。