论文
主任:通过在线主动专家安置加速分布式教育部服务
Director: Accelerating Distributed MoE Serving via Online Proactive Expert Placement
摘要
专家并行性已成为服务专家混合 (MoE) 模型的流行范例。其效率取决于 GPU 的通信和计算延迟,而这又与专家在 GPU 中的放置有关。优化专家放置的现有工作侧重于利用过去请求的专家激活模式。然而,它们在面对多样化且快速变化的请求模式时表现出了缺陷,需要采取在线、主动的方法。实施这种方法需要解决几个挑战:与传入请求的专家激活相关的不确定性、专家迁移的成本以及优化中的 NP 困难复杂性。因此,我们推出了Director,这是一种新的分布式教育部服务系统,可通过预测驱动的在线专家安置来最大程度地减少端到端延迟。 Director 使用轻量级级联预测器或低位量化副本来实现传入请求的专家激活模式。然后,在线迁移模块通过在计算密集阶段执行迁移来以接近于零的停机时间实施更改,从而保持中断有限。其核心是基于松弛的专家布局优化器在容量限制下运行,在多项式时间内运行,并实现 $(1+ε)$ 近似比率。最后,我们实现了一个原型,并通过大量实验证明,与现有工作相比,流行的 MoE 模型(例如 Mistral、DeepSeek 和 Qwen)的端到端延迟减少了 $11\sim55\%$。