论文
MAny:通过知识合并实现多模态持续指令微调
MAny: Merge Anything for Multimodal Continual Instruction Tuning
摘要
多模态持续指令微调(MCIT)使多模态大模型适应顺序到来的任务,但受到灾难性遗忘限制。现有研究主要关注语言推理主干,本文揭示了两类被忽视的遗忘:跨模态投影空间中的感知漂移,以及低秩参数空间中的推理能力退化。为此,研究提出MAny,通过跨模态投影合并(CPM)和低秩参数合并(LPM)整合任务专属知识。CPM以视觉原型为指导,自适应合并跨模态视觉表征,恢复感知对齐并在推理时恢复特征。LPM通过递归合并低秩权重矩阵,消除任务专属低秩模块之间的干扰;递归最小二乘法提供闭式解,保障推理稳定性的最优融合轨迹。MAny在初始微调之后无需额外训练,仅通过CPU上的高效代数运算合并知识,不再进行梯度优化。多个模型与基准上的评估显示该方法具有较好的性能和鲁棒性。在UCIT基准上,两种多模态模型的最终平均准确率相对当前先进方法分别最高提升8.57%和2.85%。