论文

具有理论泛化保证的专家混合的有效量化

Efficient Quantization of Mixture-of-Experts with Theoretical Generalization Guarantees

摘要

稀疏专家混合 (MoE) 通过针对每个输入仅激活一小部分专家来有效扩展语言和视觉模型。虽然这减少了计算量,但大量参数在推理过程中仍然会产生大量内存开销。 后训练 量化已经被探索来解决这个问题。由于均匀量化在低位宽下会遭受显着的精度损失,因此最近人们开始探索混合精度方法;然而,它们通常需要大量计算来进行位宽分配,并且忽略了模型性能对不同专家的量化的不同敏感性。我们提出了一种基于理论的专家级混合精度策略,该策略主要根据训练期间路由器 l2 范数的变化为每个专家分配位宽。变化较小的专家被证明可以捕获频率较低但关键的特征,并且模型性能对这些专家的量化更加敏感,因此需要更高的精度。此外,为了避免将专家分配到较低的精度而注入高量化噪声,具有较大最大神经元内方差的专家也被分配到较高的精度。对大规模 MoE 模型(包括 Switch Transformer 和 Mixtral)的实验表明,我们的方法比现有方法具有更高的精度,同时还降低了推理成本,并且位宽分配的开销可以忽略不计。