论文
MoE$^2$-LoRA:当MoE模型遇到MoE式低秩适应
MoE$^2$-LoRA: When MoE Models Meet MoE-style Low-Rank Adaptation
摘要
专家混合 (MoE) 架构已在 大语言模型 中广泛采用,但 MoE 模型的参数高效 微调 (PEFT) 仍未得到充分探索。 MoE 现有的 PEFT 方法要么忽略具有统一适配器的路由器先验,降低效率并冒遗忘的风险,要么依赖静态专家选择,限制每个词元的容量和跨专家特征学习。在本文中,我们首次尝试使用 MoE 风格的低秩自适应来微调 MoE 模型:我们的方法名为 MoE$^2$-LoRA,通过双通道路由条件投影(RCP)模块将预训练的专家专业化与特定于任务的自适应性深度耦合,该模块重用基础路由器激活来通知 LoRA 路由。我们进一步引入了一个在所有层之间共享的单一全球 LoRA 专家库,从而实现了模型范围内的适应,并具有新兴的逐层亲和力和平衡的专家利用率。 MoE$^2$-LoRA 同时受益于优先重用、动态适配器路由和模型范围知识共享的优势。在不同规模和专家粒度的多个 MoE 主干上进行评估后,MoE$^2$-LoRA 始终实现最先进的下游精度,同时保留更强的通用能力。