论文

每个专家都很重要:ExactMoE 用于内存高效的 W4A16 推理

Every Expert Counts: ExactMoE for Memory-Efficient W4A16 Inference

AI 基础设施模型部署

摘要

稀疏专家混合 (MoE) 语言模型通过每个词元仅激活一小部分专家来减少算术,但部署仍然需要存储和移动完整的专家库。我们提出了 ExactMoE,这是一种推理设计,仅对路由专家应用对称组 128 四位权重量化,将这些专家以内核原生 MARLIN 形式存储在固定主机内存中,并通过可配置的 GPU 驻留槽缓存和融合分组 MoE 内核执行所有选定的专家。路由器、注意力、嵌入、标准化层和语言模型头保留在 BF16 中。 “精确”是指完全的专家可用性和未更改的top-k路由过程:没有专家被修剪、替换或强制在CPU上执行。它并不意味着与 BF16 模型在数值上相同。在 OLMoE-1B-7B-0924-Instruct 上,在单个 NVIDIA L4 上进行评估,16 插槽配置将峰值保留 GPU 内存从 14.168 GiB 减少到 1.836 GiB (87.04%),同时保留 81.85% 的 BF16 解码吞吐量。完全驻留的 64 插槽配置达到 31.923 个词元/秒,而 BF16 为 21.662 个词元/秒,同时保留 4.061 GiB。在 12,450 个零样本多项选择题中,ExactMoE 获得了 70.3534% 的归一化准确率,而 BF16 为 70.8996%,保留了 99.23% 的基线准确率。在匹配的 16 个词元消融中,融合分组执行速度是顺序 W4 参考的 1.97 倍。这些结果确定了完整专家 MoE 推理的实用内存传输吞吐量前沿。