论文
MoE-Sieve:用于高效 MoE 的路由引导 LoRA 微调
MoE-Sieve: Routing-Guided LoRA for Efficient MoE Fine-Tuning
摘要
专家混合 (MoE) 模型的标准 LoRA 微调 将适配器应用于每个专家,但我们的分析表明,每层专家路由高度倾斜:一小部分专家处理每层中的大多数词元,而许多其他专家很少被激活(“冷”)。我们提出了 MoE-Sieve,这是一个用于 LoRA 微调 的简单路由引导框架,并将其与跨架构和任务的专家路由的系统分析研究相结合。该方法很简单:配置文件路由依靠一个小的校准集,选择每层前 k 个路由最多的专家,然后仅将 LoRA 应用于这些专家。在两个架构不同的 MoE 模型和三个不同的任务中,仅调整每层前 25% 的路由专家仍然与完整的 LoRA 相比具有竞争力,在所有条件下平均差异在 +/-1 个百分点以内。这将 LoRA 可训练参数减少了 70-73%,适配器检查点大小减少了 71-73%,挂钟训练时间减少了高达 50%。我们还观察到专家计数和种子间方差之间的非单调关系,这与适应冷专家可以引入梯度噪声而不提高准确性的假设一致。进一步的消融表明,匹配预算的随机专家选择大约差 2.5 个百分点,这表明路由信号很重要,而贪婪的每层预算优化并没有比统一的 top-k 有所改善。