论文

iGSP:用于视觉语言模型高效持续学习的隐式梯度子空间投影

iGSP:Implicit Gradient Subspace Projection for Efficient Continual Learning of Vision-Language Models

模型训练持续学习

摘要

视觉语言模型需要有效适应不断出现的下游任务。虽然参数高效的 微调 可以减轻灾难性遗忘,但为每个任务分配隔离模块会导致参数爆炸。相反,最近的相似性驱动共享机制错误地将表面视觉相似性与潜在对齐一致性等同起来。这种根本性的不匹配会引发视觉上相似但逻辑上不同的任务之间的严重负转移,并且无法在视觉上不同的任务之间利用对齐重用。我们认为,对齐共享本质上是共享低秩子空间内重叠优化轨迹的几何问题。基于这一见解,我们提出了 iGSP,这是一种通过隐式梯度子空间投影实现高效自适应的新颖框架。利用 MoE 路由器的早期收敛来建立子空间基础,iGSP 将适应过程分为两个阶段。首先,子空间识别阶段通过基础预扩展引入候选专家,应用新颖的子空间约束正则化将新的任务梯度隐式投影到历史子空间上,并通过将路由概率视为梯度流指标来精确修剪冗余维度,最终实现知识重用最大化。其次,正交子空间 微调 阶段修复了这一结构基础并删除了正则化以快速拟合特定于任务的残差损失。在 MTIL 基准上的大量实验表明,iGSP 实现了最先进的精度,同时显着提高了训练效率,与当前的 SOTA 方法相比,平均可训练参数减少了 42.7%,最终总参数比同行减少了 86.9%。源代码可在 https://github.com/GeoX-Lab/iGSP 获取。