论文

ProtoAda:用于多模式连续指令调优的原型引导自适应适配器扩展和几何合并

ProtoAda: Prototype-Guided Adaptive Adapter Expansion and Geometric Consolidation for Multimodal Continual Instruction Tuning

模型训练持续学习

摘要

多模态 大语言模型 (MLLM) 通过指令调优实现强大的性能,但实际部署要求它们不断获得新的视觉语言功能,因此多模态连续指令调优 (MCIT) 至关重要。为了减少任务间干扰并促进协作,最近的方法通常采用稀疏架构,例如 LoRA 专家与图像文本相似性路由的混合。然而,具有不同响应结构的任务可能具有高度相似的视觉语言语义,从而被错误地发送给同一位专家;仅图像文本相似性不足以实现可靠的任务分配。例如,需要坐标预测的视觉定位任务的专家在学习语义相似的 VQA 任务后可能会偏向于生成简短的文本答案。这种格式盲的任务分配将异构响应类型集成到共享参数中,导致梯度干扰和无效的专家协作。为了解决这个问题,我们提出了 ProtoAda,一个原型引导的自适应调优框架。 ProtoAda 引入了格式感知的任务原型,使任务分配和路由与任务语义和输出结构保持一致,并以几何感知的方式进一步整合格式兼容的更新,以有效地重用和逐步细化现有参数。对多个基准的大量实验表明,ProtoAda 实现了卓越的性能,特别是在答案结构很容易被顺序调整破坏的任务上。