论文

通过L0正则化混合专家加速稠密LLM

Accelerating Dense LLMs via L0-regularized Mixture-of-Experts

摘要

大语言模型(LLM)性能强劲,但推理缓慢且成本高昂。现有加速方法常导致明显性能退化,而混合专家(MoE)模型需要大量计算资源。本文提出L0-MoE,一种使用L0正则化、在几乎不损失性能的前提下加速稠密LLM的轻量MoE方法。该方法引入聚类混淆矩阵以进行领域感知的数据策展,并采用动态批处理以实现高效训练。实验表明,L0-MoE相对稠密模型实现最高2.5倍加速,同时保持有竞争力的性能,优于现有LLM加速基线。

通过L0正则化混合专家加速稠密LLM:论文配图
图 1:L0-MoE 架构概览,包含三个主要阶段:(1) 基于聚类混淆矩阵的采样,(2) 使用 L0 正则化形成专家,(3) 面向 MoE 训练的动态批处理。上图展示了在 n 次数据集采样迭代中构建具有四个专家的 L0-MoE 的过程。