论文

FLAME:用于持续多模式多任务学习的自适应专家混合

FLAME: Adaptive Mixture-of-Experts for Continual Multimodal Multi-Task Learning

摘要

跨多个领域的现实世界模型部署需要多模态模型在两种互补的机制下运行:(1)多任务预训练,任务在设计时是共同可用的,其中相关任务可以相互借用表征强度;(2)持续适应,其中新任务在部署后与以前未见过的模态组合一起出现。然而,这两种机制都不够:预训练任务集永远不会详尽无遗,而绕过联合训练会丧失可协同训练任务之间的转移增益和效率。稀疏专家混合 (MoE) 非常适合这种双重要求:稀疏激活可以在新任务到达时实现模块化容量扩展,同时路由将模态级计算与任务级组合解耦。在这项工作中,我们提出了一个可扩展的 MoE 框架,用于跨灵活模态组合的多任务预训练和持续学习。该框架旨在通过利用特定于模态的路由器来处理跨任务的每种模态的词元,从而支持对具有不同模态配置的多模态任务进行训练。此外,它通过将积累的专家知识压缩到低秩内存子空间中,同时仅扩展轻量级路由器,从而能够在固定容量的 MoE 内连续学习多模式任务。我们在多个医疗保健多模式基准上验证了我们的方法的有效性。它展示了具有竞争力的多任务预训练性能,同时减轻了灾难性遗忘并提高了参数效率。