论文

超越任务无关:用于高效通信的多任务 MoE 推理的任务感知分组

Beyond Task-Agnostic: Task-Aware Grouping for Communication-Efficient Multi-Task MoE Inference

模型推理分布式推理

摘要

稀疏激活的专家混合 (MoE) 模型通过条件计算扩展容量,但分布式推理会受到跨 GPU 专家通信和路由引起的负载不平衡的影响。现有的安置方法通过将经常共同激活的专家放在同一地点来降低成本;然而,它们从全局聚合的路由跟踪中得出单一部署计划,从而平均掉实际上驱动多任务服务中的通信的异构的、特定于任务的共同激活模式。我们观察到,专家的共同激活具有很强的任务条件性:一个任务族中紧密耦合的对在另一个任务族中通常不相关,因此有效的部署应该通过任务感知的共同激活而不是通过与任务无关的平均值来对专家进行分组。基于这一见解,我们提出了\emph{任务感知协同激活分组}(TACG),这是一种部署时框架,它使用特定于族的调度和协同激活跟踪来派生每个专家的任务族偏好,重新加权协同激活图,以便族内局部性主导分组,并在精确的容量限制下将每个专家分配给主 GPU。为了在在线工作负载偏差下保持静态放置的鲁棒性,我们进一步引入了 \emph{Generic Expert Shared Replication} (GESR),这是一个轻量级的伴侣,它可以识别具有一致的中心共同激活配置文件的通用专家,将它们复制到一小组辅助 GPU 上,并在服务时应用位置和负载感知的选择。对三个代表性开源 MoE 模型的实验表明,我们的框架将平均通信成本比基线降低了 31.39%,同时保持平均 Jain 公平指数为 0.9975。即使在推理数据发生严重分布变化的情况下,这种优势仍然存在,始终优于强基线。