论文

PagedWeight:高效的 MoE LLM 服务,具有动态质量感知权重量化

PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization

AI 基础设施推理服务

摘要

Mixture-of-Experts (MoE) 是 大语言模型 (LLM) 的流行类别,提供高效率和准确性。然而,在 KV 缓存密集型服务场景中,MoE 经常表现出模型权重的 GPU 内存需求与不断增长的 KV 缓存之间的紧张关系。我们提出了 PagedWeight,一种用于 MoE LLM 服务的新颖管理方法,可在运行时动态量化 MoE 模型的权重,并平衡专家权重精度与 KV 缓存大小。 PagedWeight 揭示并有效地处理模型任务准确性、内存消耗和吞吐量/延迟之间的复杂权衡。在多个内存敏感的 MoE 服务场景中,PagedWeight 改进了多个现有量化基线的质量与内存权衡。 PagedWeight 实现了 FP16 等效精度,GPU 内存节省高达 72.0%,吞吐量提高了 1.94$\times$,并且在类似的内存预算下,质量比量化方法提高了 39.3%,吞吐量损失最多为 4.1%。