论文
MoE-Prefill:MoE 预填充服务中的零冗余开销
MoE-Prefill: Zero Redundancy Overheads in MoE Prefill Serving
摘要
生产 LLM 工作负载越来越多地服务于区分性任务,例如分类、推荐和验证,其答案是从单个预填充通道的 logits 中读取的,无需自回归解码。在专家混合 (MoE) 模型上提供这些仅预填充工作负载的瓶颈不是计算,而是适应模型所需的分布式执行:现有并行策略(张量、专家和管道并行)以内存压力换取冗余计算、通信和同步,严重降低了 MoE 预填充服务效率。我们观察到,这些开销源于专家布局与同步激活路由的耦合——这是从解码时代继承的设计。大批量预填充的长、受计算限制的前向传递会打开一个足够宽的每层窗口,以便在后台传输专家权重,用与计算完全重叠的异步权重 AllGather 取代每层激活 AllToAll。我们提出了 MoE-Prefill,这是一个仅预填充的服务系统,其后端 AsyncEP(异步专家并行)按权重收集专家,而不是通过激活路由它们,并且其前端通过前缀感知路由和真实 FLOP 负载跟踪共同强制执行物理派生的饱和阈值。在跨四种硬件/精度配置的 Qwen3-235B-A22B 上,MoE-Prefill 在实际工作负载的最强分布式基线上提供了 1.35-1.37 倍的吞吐量,在长上下文合成工作负载上提供了高达 1.59 倍的吞吐量,维持了 29.8-36.2% 的每个 GPU 模型 FLOP 利用率。