论文
通过专家共激活进行推测解码的高效专家混合
Efficient Mixture-of-Experts with Speculative Decoding via Expert Coactivation
摘要
专家混合 (MoE) 模型越来越多地与推测解码 (SD) 一起部署以加速推理,但将两者结合起来具有挑战性。 SD 通过并行验证标记组来提高密集模型的推理速度。然而,MoE 的 SD 推理加速在很大程度上取决于正在验证的词元数量。使用更多的验证词元会导致更多的专家从 DRAM 转移到神经处理单元 (NPU),从而增加内存转移成本。这会对模型运行时间产生负面影响,因为内存传输通常是推理中的瓶颈。在这项工作中,我们研究了训练期间 MoE 路由器设计对 SD 的 MoE 速度的影响。我们发现,具有高度专家共激活的路由器可以带来更快的运行时间,从而减轻使用更多验证词元的影响。受这一观察的启发,我们使用十亿参数Transformer模型评估了各种路由器设计选择对专家协同激活和运行时间的影响。我们发现,在训练期间将全局负载平衡损失、共享专家、一致性损失和自回归专家选择机制相结合,可以显着增强专家的协同激活。这种增加的共激活转化为更高的总体运行时吞吐量:我们的探索产生了一个模型,该模型的吞吐量比 MoE 基线提高了 21%,同时保持与基线 MoE 相同的精度。