论文
CIPHER-MoE:在万亿参数 MoE 训练中平衡效率与路由保真度
CIPHER-MoE: Balancing Efficiency and Routing Fidelity in Trillion-Scale MoE Training
摘要
专家混合 (MoE) 在最近的 大语言模型 (LLM) 架构中得到了广泛采用。然而,在 LLM 训练中扩展 MoE 会给训练带来系统级挑战,其中不统一的 token 路由可能会导致专家和设备之间的工作负载高度不平衡,从而进一步破坏训练流程的稳定性。在万亿规模的LLM中,不平衡的专家工作负载进一步放大了MoE 训练的资源成本,导致负载不足的专家的训练效率和硬件利用率下降,而热门专家则需要额外的资源来容纳过多的工作负载。最近的研究通过复杂的并行策略或资源重新分配来解决 MoE 训练不平衡问题。然而,这些系统级方法通常会引入额外的资源要求和相当大的编排复杂性,当训练万亿参数 LLM 在计算资源有限的情况下,这些要求变得越来越难以承受。这项工作引入了 CIPHER-MoE,它可以缓解 MoE 工作负载不平衡,同时保持路由器的 token 侧 Top-K 选择不变。 CIPHER-MoE 应用具有显式容量控制的亲和力感知专家到 token 过滤,以减少热点专家工作负载,而无需额外的硬件资源或复杂的运行时设计。该方法已在包括 DeepSeek-V4-Pro 在内的大型 MoE 模型上进行了评估,显示 Top-1 专家工作量减少高达 64.9 个百分点,并实现 1.10$\times$-1.94$\times$ 训练加速,同时保持训练质量。源代码即将发布。
