论文

GEMQ:MoE LLM 全球专家级混合精度量化

GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs

摘要

专家混合 大语言模型 (MoE-LLM) 实现了强大的性能,但由于大量的专家参数而产生了大量的内存开销。混合精度量化通过根据重要性分配专家级位宽、接近精度内存帕累托前沿并实现极低位量化来降低这种成本。然而,现有方法依赖于逐层重要性估计,并忽略了量化引起的路由器移位,导致分配和路由不理想。在这项工作中,我们提出全局专家级混合精度量化(GEMQ)来克服这些限制,通过(1)基于量化误差分析捕获模型范围专家重要性的全局线性编程公式,以及(2)高效路由器 微调 来适应量化专家的路由。这些组件被集成到渐进式量化框架中,该框架迭代地完善重要性估计和分配。实验表明,GEMQ 显着减少了内存并加速了推理,同时精度下降最小。源代码可在 https://github.com/jndeng/GEMQ 获取。