论文

关于词元的困境:具有漂移感知词元分配的动态 MoE 用于大视觉语言模型的持续学习

On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models

摘要

多模态持续指令调优旨在通过从新数据中学习而不忘记以前获得的知识来不断增强大视觉语言模型(LVLM)。专家混合 (MoE) 架构通过逐步添加新专家和扩展路由器,同时保持现有专家不变,自然地促进了这一点。然而,尽管存在专家隔离,基于 MoE 的持续学习器仍然会因路由漂移而遭受遗忘:旧任务标记被错误地吸引到新添加的专家,从而降低了先前任务的性能。我们分析了 词元级 的故障模式,并揭示了词元的困境:新任务数据中的模糊和旧词元提供的学习益处最小,但由于在训练期间路由分配不明确,因此在路由到新专家时会导致遗忘。受此启发,我们提出了 LLaVA-DyMoE,这是一种动态 MoE 框架,通过漂移感知词元分配逐步扩展 MoE。我们通过路由分数分布来表征词元类型,并应用有针对性的正则化。具体来说,词元级 分配指导将不明确的和旧的词元从新专家中引开,以保留已建立的路由模式并减轻路由漂移,而补充路由评分正则化则强制专家组分离并促进新专家专业化。大量实验表明,我们的 LLaVA-DyMoE 有效减轻了路由漂移引起的遗忘,与基线相比,平均最终准确率提高了 7% 以上,遗忘减少了 12%。项目页面为https://zhaoc5.github.io/DyMoE。