论文

ExFold:无需训练 MoE 预填充解码加速的统一专家折叠

ExFold: Unified Expert Folding for Training-Free MoE Prefill-Decode Acceleration

摘要

专家混合 (MoE) 模型可扩展容量以获得高质量,同时通过稀疏专家激活保持每个词元计算的范围。然而,低延迟 MoE 服务越来越具有挑战性,因为它跨越两个具有根本不同瓶颈的推理阶段:预填充由词元式专家计算主导,而解码则受到来自批量激活专家集的内存流量的限制。然而,现有的 无需训练 加速方法仅优化单个资源代理,即每个词元执行的专家或批量激活的专家,并且丢弃排除的专家的贡献或仅保留其隐式近似。在本文中,我们提出了 ExFold,一个统一的 无需训练 专家折叠框架,用于联合加速 MoE 预填充和解码。 ExFold 将预填充和解码视为一个预算输出近似问题:仅执行特定于阶段的受限专家集,同时使用校准的标量投影仪将预算排除专家的贡献投影到保留的专家上。受到许多专家输出方向一致但幅度不同的观察的启发,ExFold 在未标记数据上校准成对标量投影矩阵,并在推理时使用它来将排除的专家贡献折叠到保留的专家中。在此视图下,预填充加速变为 词元级 Top-K 折叠,解码加速变为批量级专家池折叠。这两个阶段的不同之处仅在于如何选择保留的专家,而排除的贡献则通过一种共享的折叠机制恢复。我们将 ExFold 作为 vLLM 中的即插即用插件实现,具有轻量级专家折叠 CUDA 内核,可提供高达 1.41 倍的 TTFT 和 2.45 倍的 TPOT 加速,同时保留约 99% 的原始平均质量。