论文
S2-MoE:在边缘设备上为混合专家模型实现高效自推测解码
S2-MoE: Enabling Efficient Self-Speculative Decoding for Mixture-of-Experts on Edge Devices
摘要
在边缘设备上部署大语言模型(LLM)进行推理,因严苛的内存和带宽约束而充满挑战。虽然推测解码和混合专家(MoE)已被提出用于提升推理效率,但简单地将二者结合往往带来过多的验证开销和糟糕的专家复用,限制了它们在内存受限边缘场景中的效果。在这项工作中,我们提出S2-MoE,一个面向边缘设备MoE推理的高效自推测解码框架。S2-MoE通过路由感知的自适应推测扩展减少冗余验证,通过复用感知的专家门控提升验证效率,并通过共享上下文对齐草稿与目标执行。该框架在llama.cpp中实现,在边缘设备上跨多个MoE模型和数据集,相比标准自回归解码取得最高5.3倍加速(平均约2.0倍)。代码见 https://github.com/angerybob/S2-MoE。
