论文

StrLoRA:面向 MLLM 的流式连续视觉指令调整

StrLoRA: Towards Streaming Continual Visual Instruction Tuning for MLLMs

模型训练持续学习

摘要

持续视觉指令调整 (CVIT) 使 Multimodal 大语言模型 能够逐步获得新的能力。然而,现有的 CVIT 方法在限制性任务增量设置下运行,其中每个训练阶段对应于单个预定义任务。这并不反映现实世界的情况,在现实世界中,数据作为交错且动态发展的任务的连续流到达。为了弥补这一差距,我们引入了 Streaming CVIT (StrCVIT),这是一种更通用、更现实的设置,模型可以从包含动态混合任务的数据块流中进行学习。在 StrCVIT 中,模型必须同时获得新能力、强化重复能力并减少遗忘。现有的 CVIT 方法在这里失败了,因为它们无法可靠地区分或适应每个块内的异构任务样本。因此,我们提出了 StrLoRA,一种正则化的两阶段专家路由框架。 StrLoRA 首先使用文本指令执行任务感知专家选择,以激活相关专家的稀疏子集,从而减少跨任务干扰。然后,它在此子集中应用标记专家加权,其中贡献权重是通过本地视觉标记和全局指令表示之间的跨模式注意来计算的。为了保持非平稳流的稳定性,路由稳定性正则化将当前路由分布与历史指数移动平均参考对齐。对新开发的 StrCVIT 基准的大量实验表明,StrLoRA 大大优于现有方法,有效增强了模型从不断演变的数据流中获得能力。代码可在 https://github.com/chanceche/StrCVIT 获取。