论文

ReCAP:用于多模态连续指令调优的检索引导能力重用

ReCAP: Retrieval-Guided Capability Reuse for Multimodal Continual Instruction Tuning

模型训练持续学习

摘要

多模态连续指令调优(MCIT)旨在使多模态大语言模型能够从顺序任务中获取新功能,同时保留以前学到的知识。现有方法主要通过限制参数更新或分离特定于任务的适应来减轻灾难性遗忘。然而,持续的适应也可以受益于外部知识,这些知识提供了特定领域的信息和可重用的推理模式来解决不同的指令。例如,要回答“球体左侧有多少个红色立方体?”,领域知识可以提供有关对象和空间关系的相关概念,而推理知识可以指定对象识别、空间过滤和计数等有序操作。尽管有这种潜力,但现有的 MCIT 方法在很大程度上仍未探索如何利用外部知识进行持续适应。为此,我们提出了 ReCAP,一个检索引导的框架,利用外部知识来指导持续适应过程中的能力重用。在每个连续阶段,ReCAP使用外部搜索和LLM基于当前阶段的训练数据逐步构建领域、推理和格式知识的知识库。对于每条指令,检索的领域知识指导生成,同时检索的推理知识选择和排序能力模块以形成特定于实例的能力路径。由于这些功能模块可以跨阶段重用,后续的适应可以覆盖之前学习的参数。为了实现稳定的跨阶段重用,ReCAP引入了自适应子空间回收,将可重用的能力模块参数化为共享基础和特定阶段的核心,在回收剩余能力的同时保护历史重要方向。 MCIT 基准的大量实验表明 ReCAP 实现了 SOTA 性能。