论文

Mira:使用自适应缓存和预测专家分期的内存高效 MoE 推理

Mira: Memory-Efficient MoE Inference Using Adaptive Caching and Predictive Expert Staging

模型推理推理加速

摘要

专家混合 (MoE) 模型是一种引人注目的扩展模型容量的架构,使其对于部署在资源受限的单 GPU 系统上特别有吸引力。然而,这种好处很难实现,因为专家参数主导内存,并且词元级路由是动态的、不可预测的和倾斜的。之前使用卸载和缓存的工作基本上仍然是被动的,因为系统在移动专家之前等待路由器输出,导致缓存利用率低下,并且无法在紧张的 VRAM 预算下将传输与计算重叠。为了应对这些挑战,我们提出了 Mira,一种算法系统协同设计,可在单个 GPU 上实现高容量 MoE 推理。 Mira 通过将预测专家管理与定制的量化格式相结合,从被动立场转变为主动立场。它引入了轻量级的每层预测器,可以提前两层预测专家的使用情况,从而实现主动预取。这些预测提供给由词元级路由遥测管理的两层 HOT+STAGE GPU 缓存,以保留经常使用的专家,同时暂存预测的专家。为了最大限度地减少传输开销,Mira 对专家参数实施了自定义压缩,从而减少了元数据并提高了打包效率,同时最大限度地降低了准确性。 Mira 被实现为一个完全集成的运行时,它协调预测器、缓存策略和量化传输,以最大限度地提高通信和计算之间的重叠。我们的实验表明 Mira 减少了专家引起的停顿。与最先进的基准相比,Mira 在内存受限的 GPU 上实现了 5.71 倍的平均吞吐量加速。它将首次词元时间缩短了 11.71 倍,并在波束搜索推理中实现了 3.84 美元的平均加速,证明了其在不同推理场景中的有效性。