论文
理解持续视觉语言模型中的跨模式贡献:理论视角
Understanding Cross-Modal Contributions in Continual Vision-Language Models: A Theoretical Perspective
摘要
连续视觉语言模型通常通过顺序 微调 来解决;然而,尽管这种范式能够适应新的环境(任务),但它本质上强调了先前学习的环境(任务)的贡献,而牺牲了保留先前获得的知识所需的稳定性。虽然现有方法已经充分研究了视觉语言模型(VLM)中的持续学习和灾难性遗忘,但对一系列环境中特定模态贡献的理论理解仍然很大程度上未被探索。在本文中,我们提出了一个新的理论视角来理解跨模式(视觉语言)对连续环境的贡献。我们对大型 VLM 的理论研究结果进行了实证评估,并证明了它们在捕获环境级跨模式贡献方面的有效性。我们的分析提供了对连续 VLM 的更深入见解,强调了它们对不同任务顺序和任务间相似性的贡献稳健性,以及它们改进的泛化性能。