论文

专家联盟:大语言模型的高效通信分布式推理

Federation of Experts: Communication Efficient Distributed Inference for Large Language Models

模型推理分布式推理

摘要

专家混合已成为提高 大语言模型 (LLM) 计算效率的主要机制。然而,在分布式环境中,专家之间通信词元嵌入是一个重大瓶颈。我们提出了新颖的专家联盟 (FoE) 架构。 FoE 将 Transformer 层的 MoE 块重组为多个 MoE 集群。每个集群仅负责一个 KV 头,并且在这些专家之间应用专家并行性。在集群之间,总和会同步后注意力残差,然后驱动下一个 MoE 块的路由和调度。在单节点设置中,FoE 完全消除了所有对所有的通信,因为组内的所有专家都包含在同一个 GPU 上。在多节点设置中,FoE 将所有到所有的通信限制在节点内结构中,从而显着减少通信开销。 FoE 的实现发现,在 LongBench 上,FoE 显着提高了单节点和多节点设置中的推理吞吐量和延迟,将端到端预填充延迟降低高达 5.88 倍,将 TTFT 降低 3.66 倍,将 TPOT 降低 1.53 倍。它同时实现了与相同大小和训练配置的专家模型混合相媲美的生成质量。