论文

在专家混合中对可组合压缩技术进行基准测试 LLM

Benchmarking Composable Compression Techniques in Mixture-of-Experts LLMs

模型评测基准与评测资源

摘要

专家混合 (MoE) LLM 通过稀疏激活有效扩展模型容量,但其大量专家参数占用、路由不平衡和长上下文 KV 缓存增长使得在商用硬件上的部署变得困难。实际部署通常需要堆叠多种压缩技术:专家剪枝去除冗余专家、权重量化降低模型内存占用、KV 缓存压缩减少长上下文内存压力。然而,这些技术通常是单独评估的,而在实际部署管道中一起应用时它们如何交互则尚未确定。在这项工作中,我们提出了 MoEXBench,这是一个用于评估可组合 MoE 压缩作为端到端部署工作流程的系统基准。 MoEXBench 研究了 10 个 MoE 模型,总参数从 30B 到 235B,涵盖标准注意力、混合线性注意力和滑动窗口注意力架构。它评估 20%-50% 的专家剪枝率、1 至 16 位权重量化方案以及多个 KV 缓存精度设置(单独或组合应用)。 MoEXBench 推出了一个八模块评估套件,可联合测量可组合压缩质量、工作负载和架构稳健性、修剪/量化/KV 缓存敏感性以及商用硬件上的部署效率。我们的结果揭示了压缩方法之间的重要相互作用:可组合压缩无法从独立技术中预测,压缩率本身并不能可靠地预测质量损失或运行时间增益,专家修剪是主要的降级来源,平均质量可以隐藏工作负载和架构特定的故障。通过发布标准化的模块分数、压缩的工件和可重现的脚本,MoEXBench 可以跨 MoE 系列和硬件后端进行实用的精度-内存-延迟比较。