论文
用于持续指令调整的渐进式多模式对齐
Progressive Multimodal Alignment for Continual Instruction Tuning
摘要
多模态 大语言模型 (MLLM) 依靠投影仪将视觉表示与语言嵌入空间对齐,使其成为跨模态理解的核心。然而,在多模式连续指令调整 (MCIT) 中,视觉分布的变化和指令语义的演变会导致共享投影仪漂移,从而导致投影仪级遗忘,而主要关注 LLM 主干的方法在很大程度上忽视了这个问题。我们引入了渐进式多模态对准(PMA),这是一个框架,使投影仪能够不断适应,同时保留以前学习的对准。 PMA 通过轻量级表示描述符检测多模态分布变化,并仅在需要时逐步扩展投影专家。可扩展的路由器集成了基于多模态特征的专家输出,而原始的预训练投影仪被保留作为稳定的对齐锚点。这种渐进机制平衡了稳定性和可塑性与次线性参数增长,并作为现有 MCIT 方法的与方法无关的附加组件。对最近两个 MCIT 基准的大量实验表明,与 PMA 相结合时,减轻投影仪级遗忘可以比先前最先进的方法产生一致的收益。此外,PMA 可以跨不同的 MLLM 主干进行扩展,展示出强大且广泛适用的 MCIT 性能。