论文
CRAM:用于多模式连续指令调优的质心路由和自适应 MoE
CRAM: Centroid-Routing and Adaptive MoE for Multimodal Continual Instruction Tuning
摘要
多模态 大语言模型 (MLLM) 通过指令调优将异构视觉语言任务统一在共享生成框架下,但现实世界的部署需要持续的能力扩展,因此多模态连续指令调优 (MCIT) 至关重要。现有方法要么使用共享参数集更新所有任务,要么为每个新任务分配专用模块。共享更新迫使异构任务竞争,导致忘记所学的功能。相反,隔离扩展可以防止干扰,但会严重限制长任务流上的参数效率。为了解决这个困境,我们提出了 CRAM(质心路由和自适应 MoE)。具体来说,通过将特定于任务的模式隔离到独立的模块中,CRAM 可以减轻跨任务的灾难性遗忘。为了进一步提高参数效率,我们利用自适应秩实例化来识别现有专家能力和新任务需求之间的能力差距,并仅动态分配必要的参数。为了确保任务之间的稳定重用,质心引导路由识别并激活现有专家的能力,同时正交性惩罚将新的更新限制在特定于任务的方向,从而防止重新学习一般能力。跨不同基准的广泛实验证明了其相对于现有方法的优越性。代码可在 https://github.com/LAMDA-CL/EMNLP2026-CRAM 获取。