论文
ELMoE-3D:利用 MoE 的固有弹性在本地服务中实现支持混合绑定的 Self-推测解码
ELMoE-3D: Leveraging Intrinsic Elasticity of MoE for Hybrid-Bonding-Enabled Self-Speculative Decoding in On-Premises Serving
摘要
专家混合 (MoE) 模型已成为大规模语言模型的主导架构,但本地服务基本上仍受内存限制,因为批处理将稀疏的每个词元计算转变为密集的内存激活。以内存为中心的架构(PIM、NMP)提高了带宽,但在 MoE 高批量大小的低算术强度下,计算未得到充分利用。 推测解码 (SD) 用空闲计算来换取更少的目标调用,但即使对于被拒绝的词元,验证也必须加载专家,这严重限制了它在 MoE 中的优势,尤其是在小批量大小的情况下。我们提出 ELMoE-3D,这是一种基于混合键合 (HB) 的硬件-软件共同设计的框架,它将基于缓存的加速和 推测解码 相结合,以提供跨批量大小的整体加速。我们确定了 MoE 的两个内在弹性轴(专家和位),并联合缩放它们以构建 Elastic Self-推测解码(Elastic-SD),它既充当专家缓存,又充当由高 HB 带宽加速的强对齐自草稿模型。我们的 LSB 增强位片架构利用位片表示中固有的冗余来原生支持位嵌套执行。在我们的 3D 堆栈硬件上,ELMoE-3D 在批量大小为 1-16 的 xPU 上服务时,与服务于 xPU 的朴素 MoE 相比,平均实现了 6.6倍的加速和 4.4倍的能效增益,并且与性能最佳的先前加速器基准相比,实现了 2.2倍的加速和 1.4倍的能效增益。