论文

AlphaQ:用于专家混合量化的免校准位分配

AlphaQ: Calibration-Free Bit Allocation for Mixture-of-Experts Quantization

摘要

专家混合 (MoE) 架构通过稀疏专家激活来扩展模型容量,但其部署仍然受内存限制,因为所有专家权重都必须驻留在内存中。混合精度量化可以通过为不同的专家分配不同的位宽来显着减少占用空间。然而,现有方法通常依赖于校准数据来估计专家重要性并确定比特分配。对于前沿 MoE LLM,原始训练数据以及真正的训练分布是专有的且无法访问。因此,校准集不可避免地是不完美的替代品,这可能会错误估计专家的利用率并导致次优的比特分配。受现代 MoE 模型中观察到的大量跨专家质量变异性以及重尾自调节 (HT-SR) 理论在无需访问训练或测试数据的情况下预测神经网络模型质量的成功的启发,我们提出了 AlphaQ,一种用于 MoE 量化的免校准比特分配方法。 AlphaQ借鉴了HT-SR理论并遵循一个简单的原则:具有更多重尾权重谱的专家通常训练得更好,因此应该接收更高的位宽,而具有较弱重尾结构的专家可以更积极地量化。 AlphaQ 通过测量专家级的光谱重尾并解决预算约束的优化问题来实现这一原理,从而在全局比特预算约束下最小化总量化误差。在多个 MoE 模型中,AlphaQ 在匹配的比特预算下始终优于基于校准的基线。值得注意的是,在 Qwen1.5-MoE 上,AlphaQ 实现了接近全精度的精度,平均专家精度仅为 3.5 位,同时提供超过 4 倍的内存压缩。我们的代码可在 https://github.com/Superone77/AlphaQ 获取。