论文

BitsMoE:MoE LLM 量化的频谱空间中成本感知的比特分配

BitsMoE: Cost-Aware Bit Allocation in Spectral Space for MoE LLM Quantization

摘要

专家混合 (MoE) 大语言模型 由于其大量专家参数计数而产生大量内存成本。混合精度量化通过根据专家或线性块的重要性为其分配不同的位宽来降低这些成本。然而,在每个专家或线性块内分配单一精度忽略了其内部结构异质性。这种限制引发了两个关键问题:(1)如何在线性变换中定义细粒度的量化单元; (2)如何表征实际激活模式和不同位宽下每个单元的量化成本。为了解决这两个问题,我们提出了 BitsMoE,一种基于两种互补技术的成本感知混合精度量化框架:(1)共享基础频谱分解(SSD)将专家权重分为共享基础和专家特定的频谱分量,定义结构量化单元,同时利用跨专家冗余。 (2) 因式分解量化成本建模 (FQCM) 通过结合固有频谱重要性、激活相关重要性和位宽相关失真,根据输出重建损失估计组件成本。使用这些组件方面的成本,我们将位分配制定为整数线性程序(ILP),在固定内存预算下最小化总建模量化成本。在 2 位 Qwen3-30B-A3B 上,BitsMoE 在七个下游任务中实现了 64.29% 的平均准确率,优于评估的 MoE 特定方法(包括使用基于 ILP 的位分配的方法),并超出 GEMQ 2.80 个百分点。在相同的设置下,它比 GEMQ 实现了 $16.47\times$ 的端到端离线量化加速。它还实现了 GPTQ 解码吞吐量高达 $6.46\times$。