论文
需要大师来修剪坏专家
It Takes a MAESTRO To Prune Bad Experts
摘要
稀疏激活的专家混合 (MoE) 语言模型通过仅激活每个词元的一小部分参数来实现显着的推理效率,但其完整的专家库始终驻留在内存中,从而造成了令人望而却步的部署瓶颈。现有的结构化修剪方法主要是为密集的 Transformer 设计的,使用本地导出的启发式方法来评估专家的重要性,而这些启发式方法对 MoE 路由的相互依赖性质视而不见。我们引入了 MAESTRO(通过基于转换的路由进行马尔可夫链近似专家稀疏化),这是一种专为 MoE 架构设计的结构化修剪框架,它将自回归专家激活轨迹建模为遍历马尔可夫链,其固定分布编码跨层依赖性,从而产生全局意识的重要性启发式。在包括安全、偏差和道德在内的五个不同领域进行评估后,MAESTRO 在严格的 50% 压缩机制下,平均性能保留率比最先进的基线高出 10.61%,同时表现出显着较低的跨任务方差,这表明全局、路由一致的剪枝生成的模型能够在异构任务中更一致地泛化。