论文

SLBF:用于无数据MoE压缩的共享低秩基分解

Shared Low-rank Basis Factorization for Data-free Mixture-of-Experts Compression

模型优化模型架构AI 基础设施MoE模型压缩推理服务

摘要

MoE大语言模型通过稀疏路由将模型容量与计算量解耦,但大量参数也带来存储和服务挑战。我们分析专家剪枝、专家合并和权重重构三类MoE压缩方法,并推导结构误差界,表明剪枝与合并可能产生由路由和专家异质性造成、无法消除的误差。相比之下,权重重构保留专家结构与路由,避免了这些结构性代价。基于这一分析,我们提出共享低秩基分解(SLBF),一种无需数据的权重重构方法。它使用专家之间共享的秩k基,支持更丰富的跨专家共享、更快收敛和更低重构误差。事后进行规范固定,可在不损失表示能力的情况下消除冗余参数。在参数规模从16B到122B的五种MoE架构上,SLBF始终优于上述三类压缩方法中的对照方案。