论文
用于多模态连续指令调优的动态跨模态提示生成
Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning
摘要
多模态 大语言模型 (MLLM) 通过指令调整实现强大的性能,但实际部署通常需要跨顺序任务持续扩展功能。在这种情况下,多模式连续指令调优(MCIT)旨在获取新功能,同时限制灾难性遗忘。现有方法主要遵循模块组合范式:它们维护任务级提示或 LoRA 专家,并在推理时动态路由或聚合其中的子集。然而,同一任务中的样本在视觉场景、问题意图和推理需求方面仍然可能存在很大差异。这促使实例级适应各个查询图像对,而不是仅仅选择或组合任务级模块。为此,我们提出了 DRAPE(动态跨模式提示生成),这是一种提示学习框架,可为 MCIT 合成连续的特定于实例的软提示。 DRAPE 不是从固定池中选择提示,而是从文本指令中派生提示查询,并交叉参与视觉补丁功能,生成附加到冻结 LLM 之前的查询图像条件提示。为了减少顺序更新期间的遗忘,DRAPE 将零空间梯度投影应用于共享投影仪,并使用基于 CLIP 的原型路由在推理时进行无任务标签生成器选择。对 MCIT 基准的大量实验表明,DRAPE 在代表性的基于提示和基于 LoRA 的持续学习基准中实现了最先进的性能。