论文

专家混合语言模型中专家的高阶剪枝

Higher-order pruning of experts in mixture-of-experts language models

摘要

专家混合 (MoE) 语言模型面临着大量参数的问题,这会造成严重的内存瓶颈。专家剪枝是减少参数数量的最直接方法,但现有方法独立地为每个专家做出剪枝决策,并假设专家的贡献纯粹是相加的。事实上,教育部的专家使用本质上是合作性的。我们推导出 HOPE(高阶专家剪枝),这是一个二阶剪枝目标,可证明最小化剪枝产生的误差上限。我们证明 REAP(一种最先进的一阶剪枝方法)是 HOPE 的一个特例,其中交互项被忽略。通过三个前沿 MoE 模型(高达 122B 参数)、两个不同的校准集和多个基准(包括数学、指令遵循、编码和代理套件),我们证明 HOPE 可以比现有方法产生更好的剪枝决策,并且其优势在高剪枝率和具有挑战性的代理工作负载时最为明显。在 50% 修剪时,HOPE 优于所有基线,在 5 种方法中平均排名为 1.58(而次佳方法 REAP 的平均排名为 2.42),代理编码的增益高达 +6.1%。在所有条件下,HOPE 再次获得了最佳平均排名,并在大多数面对面比较中超越了所有其他方法。通过保留一阶方法忽略的协作专家结构,HOPE 能够以最小的退化实现积极的压缩,特别是在长序列上调用不同专家组合的复杂任务上。