论文

TASSO:用于视觉语言模型持续学习的特定任务子空间优化

TASSO: TAsk-Specific Subspace Optimization for Continual Learning of Vision-Language Models

模型训练持续学习

摘要

视觉语言模型 (VLM) 表现出强大的零样本能力,使其成为跨不同任务持续学习的有吸引力的解决方案。然而,在持续适应过程中,灾难性遗忘和零样本退化都会发生,严重降低性能。在本文中,我们介绍了 TASSO,这是一种新范式,可以有效保留潜在空间几何形状,同时确保网络可塑性。我们通过两种互补的技术来实现这一目标:子空间学习和几何感知 知识蒸馏。具体来说,我们首先学习一系列特定于任务的低秩投影仪,在优化交叉熵之前我们用它来投影潜在表示。其次,我们采用基于测地距离的损失,从先前的任务模型中提取知识,同时有效地保留潜在空间几何形状。这些设计选择不仅避免了沿完整嵌入维度的不必要的参数更新,而且还通过关注特定于任务的流形来改进学习。此外,几何感知的 蒸馏 提供了强大的正则化,并在整个持续学习序列中显着减少了灾难性遗忘和零样本退化。 CLIP 视觉语言模型在多领域任务增量和类增量学习基准中的实验结果表明,在减少遗忘和保留零样本能力方面,CLIP 视觉语言模型比最先进的方法有了明显的改进。