论文

REAM:合并改进LLM中的专家剪枝

REAM: Merging Improves Pruning of Experts in LLMs

摘要

混合专家(MoE)大语言模型(LLM)是性能最佳的架构之一。最大的模型往往有数千亿参数,给部署带来严峻的内存挑战。降低内存需求的传统方法包括权重剪枝与量化。受剪枝专家的Router加权专家激活剪枝(REAP)启发,我们提出一种新方法:Router加权专家激活合并(REAM)。REAM不删除专家,而是将专家分组并合并其权重,从而更好地保留原始性能。我们在多个MoE LLM上、于多样的多选题(MC)问答与生成(GEN)基准中将REAM与REAP及其他基线进行对比评估。结果揭示出MC与GEN性能之间存在依赖于校准数据配比的权衡。通过控制通用、数学与编码数据的配比,我们考察了这一权衡的帕累托前沿,并表明REAM常常优于基线,且在许多情况下与原始未压缩模型相当。

REAM:合并改进LLM中的专家剪枝:论文配图
(a) 跨方法和领域的相关性 rr (b) 每种方法的帕累托前沿图 3:对 96 位专家的附加分析:a) 对于每种合并方法,校准数据集(C4、数学、代码)和 MC/GEN 分数之间以及 MC 和 GEN 分数本身之间的 Pearson 相关性 rr。 b) 帕累托边界,其中每个点都是 10 个校准混合物之一。填充标记表示帕累托最优配置不同时由相同方法的任何其他混合物在 MC 和 GEN 上占主导地位,空心标记表示占主导地位的配置。超体积(HV)测量由每种方法的前沿相对于共享参考点主导的 MC×\timesGEN 平面的面积,量化其整体性能上限。应用每个方法的偏移量以获得更好的可见性。