论文

CMAP:多领域任务增量学习的跨模式自适应提示

CMAP: Cross-Modal Adaptive Prompting for Multi-Domain Task-Incremental Learning

模型训练持续学习

摘要

多领域任务增量学习需要一个模型能够在视觉上不同的领域顺序获取知识,而不会忘记先前的任务,并且在推理时无法访问任务身份。基于冻结视觉语言模型构建的参数高效方法已经取得了长足的进步,但所有现有方法都完全依赖于视觉特征来进行任务路由、置信度估计和编码器自适应,从而使 CLIP 的跨模式文本嵌入空间完全未被开发。我们通过三项贡献来解决这一差距。文本空间任务路由用与冻结 CLIP 文本原型的余弦相似度取代了视觉高斯匹配,从而以零参数成本提供了对数据稀缺具有鲁棒性的顺序无关路由。多原型视觉文本置信度用 K 均值视觉原型和任务校准阈值下的跨模式对齐分数取代单高斯类建模。对称跨模态门控将每层 Gumbel 门扩展到以批量图像特征为条件的文本编码器,从而保留分布外输入的跨模态对齐。在涵盖 11 个数据集和 1201 个类别的 MTIL 基准上,我们的方法在 Order-I 下实现了 74.2% 的传输率、80.5% 的平均率和 88.7% 的最终率,比现有技术水平高出 5.0、3.7 和 3.0 个百分点,仅需要 250 万个可训练参数且没有外部数据。