论文

DeaMoE通过专家共享参数减少小批量解码的权重读取

DeaMoE: Efficient MoE Structure for Fast Small-Batch Decoding

摘要

小批量解码时,同一时刻发送到各专家的词元较少,读取专家权重可能成为主要开销。DeaMoE让同组专家共享主要参数,各专家仅保留少量独有参数,并先选择专家组、再选择组内专家,减少重复加载。 论文以7B模型进行完整预训练和端到端部署,在A40上报告最高1.33倍的单词元解码提速;对DeepSeek-V3规模配置则使用算子微基准报告接近2倍峰值提速。后者不能写成完整DeepSeek-V3服务已获得同等加速。

DeaMoE专家共享结构与标准MoE的对照。
Figure 1 : Architecture of DeaMoE and standard MoE.