论文
DraftExpert:用于终端设备 MoE 推理的扩展感知自 推测解码
DraftExpert: Expansion-Aware Self-Speculative Decoding for End-Device MoE Inference
摘要
大型专家混合 (MoE) 语言模型对于终端设备部署很有吸引力,因为每个词元只有一小部分专家处于活动状态,但其路由的专家权重通常超过加速器内存。我们的目标是延迟关键的单用户设置,其中路由专家按需从 CPU 内存到 GPU 或从闪存到移动 NPU。在此设置下,self-推测解码 面临新的瓶颈:增加草稿专家集提高了准确性,但会触发额外的专家加载,而廉价的小占用草稿接受度较低;此外,验证多词元区块会激活目标专家的联合,不再接近单一目标步骤。我们提出了 DraftExpert,这是一种扩展感知的自我 推测解码 框架,用于专家卸载的 MoE 推理。 DraftExpert 通过自蒸馏残差、logits/词元和来自冻结目标 MoE 的路由器协议信号,在每层训练一名轻量级加速器驻留草案专家。在推理时,它使用固定足迹共享+top-1+草稿专家起草器以及置信度扩展截断和目标专家预取,而最终词元仍然由目标模型精确验证。在跨 CPU-GPU 和 Flash-NPU 卸载的 DeepSeek-V2-Lite 和 Moonlight-16B-A3B 上,DraftExpert 将解码吞吐量平均提高了 1.45 倍,将草稿接受率提高到 84~87%,并实现了 86~88% 的预取命中率。