论文

MobileMoE:扩展设备上的专家组合

MobileMoE: Scaling On-Device Mixture of Experts

摘要

专家混合 (MoE) 已成为千亿参数语言模型事实上的架构,但其在设备上部署的数十亿规模的优势在很大程度上尚未被开发。为了弥补这一差距,我们推出了 MobileMoE,这是一系列设备上的 MoE 语言模型,具有数十亿个活动参数(活动参数为 0.3-0.9B,总计为 1.3-5.3B),为设备上的 LLM 建立了新的帕累托前沿。我们首先制定了设备上的 MoE 缩放法则,在移动内存和计算限制下联合优化 MoE 架构,确定设备上的最佳点 - 具有细粒度和共享专家的适度稀疏性 - 同时实现内存和计算最优。在派生架构的基础上,我们使用四阶段配方来训练 MobileMoE,涵盖 预训练、中期训练、指令 微调 和量化感知训练,所有这些都在开源数据集上进行。在 14 个基准测试中,MobileMoE 匹配或超过了领先的设备上密集 LLM,推理 FLOP 减少了 2-4$\times$,并且匹配或超过了最先进的 MoE OLMoE-1B-7B,参数减少了高达 60%。为了弥合移动部署的最后一英里,我们在商用智能手机上首次提供高效的 MoE 推断,并提供全面的设备分析。在相当的 INT4 权重内存中,MobileMoE-S 比密集基线 MobileLLM-Pro 提供更快的预填充速度 $1.8$-$3.8\times$ 和更快的解码速度 $2.2$-$3.4\times$。