论文
REAM:合并改进LLM中的专家剪枝
REAM: Merging Improves Pruning of Experts in LLMs
摘要
混合专家(MoE)大语言模型(LLM)是性能最佳的架构之一。最大的模型往往有数千亿参数,给部署带来严峻的内存挑战。降低内存需求的传统方法包括权重剪枝与量化。受剪枝专家的Router加权专家激活剪枝(REAP)启发,我们提出一种新方法:Router加权专家激活合并(REAM)。REAM不删除专家,而是将专家分组并合并其权重,从而更好地保留原始性能。我们在多个MoE LLM上、于多样的多选题(MC)问答与生成(GEN)基准中将REAM与REAP及其他基线进行对比评估。结果揭示出MC与GEN性能之间存在依赖于校准数据配比的权衡。通过控制通用、数学与编码数据的配比,我们考察了这一权衡的帕累托前沿,并表明REAM常常优于基线,且在许多情况下与原始未压缩模型相当。
