论文
ACE:专家之间的适配器整合,以实现 MoE LLM 的参数高效 微调
ACE: Adapter Consolidation across Experts for Parameter-Efficient Fine-Tuning of MoE LLMs
摘要
专家混合 (MoE) 模型的参数高效 微调 (PEFT) 通常为每个专家附加一个单独的低秩适配器。这种专家级的设计以三种方式分割适应:容量被分割成狭窄的低秩更新,梯度监督在稀疏路由下变得稀疏和不平衡,以及执行被分解为许多小的GEMM。我们发现这种专家级的分离通常是不必要的,因为 LoRA 适配器的子集在 微调 期间变得功能相似,从而揭示了专家特定适配器之间的冗余。基于这种冗余,我们提出了 ACE(专家之间的适配器整合),它将冗余的专家分组,并在相同的 PEFT 预算下用组共享的更高级别的 LoRA 模块替换其专家特定的适配器。 ACE 进一步引入了分组适配器执行,它将碎片化的专家智能适配器计算整合到更少、更大的组级 GEMM 中。在涵盖 12 个数据集和 4 个 MoE 主干网的评估中,ACE 在三个主干网上实现了参数匹配 PEFT 方法中观察到的最高平均准确度,并具有完整的基线覆盖,同时与专家级 LoRA 相比,在不增加峰值内存的情况下提供了 1.31 美元到 1.48 美元的挂钟训练加速。我们的代码可在 https://github.com/UbiquitousAILab/ACE 获取。