论文
DECO:在端侧设备上具有密集可比性能的稀疏专家组合
DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices
摘要
虽然专家混合 (MoE) 在不按比例增加计算的情况下扩展模型容量,但其庞大的总参数占用量会造成严重的存储和内存访问瓶颈,从而阻碍高效的端侧部署,而端侧部署同时需要高性能、低计算成本和小存储开销。为了实现这些特性,我们提出了 DECO,这是一种稀疏 MoE 架构,旨在在相同的总参数预算和训练词元下匹配密集 Transformer 的性能。 DECO 利用可微且灵活的基于 ReLU 的路由,该路由通过可学习的专家智能缩放得到增强,可自适应地平衡路由专家和共享专家的贡献。此外,我们引入了 NormSiLU,这是一种激活函数,可以在 SiLU 算子之前对输入进行标准化,从而产生更稳定的路由专家激活率趋势和更高的内在稀疏性水平。我们还确定了使用非门控 MLP 专家和基于 ReLU 的路由的经验优势,表明 MoE 架构简化的可能性。实验表明,DECO 仅激活 20% 的路由专家,与密集性能相匹配,并优于已建立的 MoE 基线。与密集推理相比,我们的专用加速内核在 Jetson AGX Orin 上提供了 2.93$\times$ 的加速。代码和检查点可在 https://github.com/thunlp/DECO 获取。