论文
用于高效 LoRA-MoE 的自适应细粒度模块专家修剪 微调
Adaptive and Fine-grained Module-wise Expert Pruning for Efficient LoRA-MoE Fine-Tuning
摘要
LoRA-MoE 已成为参数高效 微调 的有效范例,它将 LoRA 的低训练成本与专家混合 (MoE) 的增强适应能力相结合。然而,现有的 LoRA-MoE 框架通常在异构 Transformer 模块(例如,注意力查询/关键投影和 MLP 门控网络)中采用固定且统一的专家配置,忽略了它们不同的功能角色和容量要求。这种设计会导致局部过度配置、冗余的可训练参数以及不必要的优化器状态开销。此外,现有方法在整个训练过程中强制专家之间的负载平衡。尽管在早期阶段是有益的,但一旦路由模式稳定,这种约束就会变得具有限制性,从而限制专家对下游任务的专业化。在本文中,我们提出了 DMEP,一种基于动态模块专家剪枝的新型 LoRA-MoE 微调 框架。 DMEP 在训练期间跟踪专家利用率,并在每个模块的基础上物理删除利用率低的专家,从而产生针对不同模块量身定制的更紧凑的专家结构。然后,修剪后的模型在没有负载平衡约束的情况下继续训练,从而使剩余的专家能够完全专注于下游任务并发展专业知识。通过联合调整模块式专家容量并消除不必要的平衡,DMEP 提高了参数效率和训练效率。对多个推理基准的大量实验表明,DMEP 将可训练参数减少了 35\%--43\%,将训练吞吐量提高了约 10\%,同时保持或超越统一 LoRA-MoE 基线的下游推理精度。