论文
通过L0正则化混合专家加速稠密LLM
Accelerating Dense LLMs via L0-regularized Mixture-of-Experts
摘要
大语言模型(LLM)性能强劲,但推理缓慢且成本高昂。现有加速方法常导致明显性能退化,而混合专家(MoE)模型需要大量计算资源。本文提出L0-MoE,一种使用L0正则化、在几乎不损失性能的前提下加速稠密LLM的轻量MoE方法。该方法引入聚类混淆矩阵以进行领域感知的数据策展,并采用动态批处理以实现高效训练。实验表明,L0-MoE相对稠密模型实现最高2.5倍加速,同时保持有竞争力的性能,优于现有LLM加速基线。
