论文

视觉语言模型中的终身学习:具有跨模式知识保留的增强型 EWC

Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention

模型训练持续学习

摘要

CLIP、Flamingo 和 BLIP 等大型语言视觉模型 (LVLM) 通过实现跨文本和视觉模式的理解,彻底改变了人工智能。这些模型擅长图像字幕、视觉问答和跨模式检索等任务。然而,在顺序学习新任务时,他们面临灾难性的遗忘,特别是在多模式环境中,保留跨模式对齐会增加学习过程的复杂性。本文提出了一个针对 LVLM 的综合持续学习框架,该框架将增强型弹性权重合并 (EWC) 与参数高效的 微调 技术相结合。我们集成了多模态费舍尔信息矩阵计算、跨模态的一致性保存以及考虑视觉和文本编码器之间依赖性的自适应正则化。通过广泛的评估测试,该框架的遗忘率相对于简单的顺序训练方法降低了 78%。该框架还保留了顺序学习期间模态之间的一致性,仅增加 15% 的计算成本。这项工作推进了多模式人工智能系统终身学习的最先进水平,直接应用于自动驾驶、智能机器人助手和必须在动态现实环境中不断学习的自适应机器人系统。