论文

粘性路由:训练 MoE 模型以实现内存高效推理

Sticky Routing: Training MoE Models for Memory-Efficient Inference

摘要

专家混合 (MoE) 模型仅激活每个词元的稀疏专家子集,但连续的词元经常激活不同的专家 - 导致边缘设备上的慢速存储和快速内存之间的恒定权重交换。现有的补救措施要么是系统级(缓存启发式),要么是事后补救(路由器 微调),在预训练期间保持根本原因不变。我们提出了 StickyMoE,一种可微分的路由一致性损失,它会惩罚相邻词元之间的突然专家切换,鼓励路由器在语义一致的跨度上保持相同的专家分配。 StickyMoE 不需要架构更改,添加单个超参数 lambda,并且与事后方法不同,它允许专家表示和路由决策从第一个训练步骤开始相互适应。小规模 MoE 语言模型的实验表明,StickyMoE 将专家切换率降低了 60%,而困惑度降低不到 4%,在质量局部性前沿上帕累托主导事后 微调。路由时间局部性在训练时灌输的效率最高。