论文
无重放连续多模态的注意力谱正则化 LLM
Attention-Spectrum Regularization for Replay-Free Continual Multimodal LLMs
摘要
多模态 大语言模型 (MLLM) 越来越需要适应视觉域、问题类型和用户指令的非平稳流,但持续的 微调 常常会导致严重忘记以前获得的多模态技能。现有的连续视觉语言方法主要保留输出、重放数据或伪数据、规范嵌入几何形状或分配特定于任务的参数,但它们对内部跨模式注意模式如何支持旧技能在适应过程中漂移提供了有限的控制。我们提出了注意力谱正则化(ASR),这是一种免重放的持续学习框架,可以保留跨模式注意力的技能条件结构。 ASR 将交叉注意力图视为二维信号,将其尺度和方向属性总结为紧凑的频谱统计数据,并仅存储技能明智的原型分布,而不是重播过去的图像问题对、生成的伪示例或旧阶段的教师快照。在后期阶段,相位不变的频谱正则器会限制这些原型的有害漂移,同时允许实例级注意力适应新任务。我们提供的理论分析表明,在谱充足性假设下,技能条件谱漂移控制遗忘,并且傅里叶功率谱对于空间平移和有界扰动是稳定的。连续 VQA 和多模式指令调优基准(包括 VQA v2、VQACL、CLT-VQA、CoIN 和 UCIT)的实验表明,ASR 持续提高最终性能,并减少对强重放、正则化和基于适配器的基线的遗忘。保留技能水平注意力结构是持续 MLLM 的有效且轻量级的机制。代码可在 https://github.com/Creative-zcx/attention-spectrum-replay 获取