论文
Q-Strata:混合专家混合精度量化的分层位分配 LLM
Q-Strata: Hierarchical Bit Allocation for Mixed-Precision Quantization of Mixture-of-Experts LLMs
摘要
混合精度量化 (MPQ) 为 大语言模型 (LLM) 的每个线性层分配不同的位宽,以在固定预算下最大限度地减少量化引起的质量损失,但专家混合 (MoE) 模型在每个 MoE 块的每个专家中都包含这些层,因此分配空间比密集模型大得多。现有方法要么在统一的每块预算下在每个块内分配,要么通过附加代理跨块分配,并且都没有直接优化耦合块的选择的模型级目标。我们提出了 Q-Strata,这是一种双层分配器,它使用廉价代理对块内分配进行排名,并使用在组装的量化模型上评估的模型级目标进行跨块分配。其内部阶段在精细间隔的预算上缓存每个块的候选者的帕累托边界,使外部阶段为每个块设置一个预算,而不是为每个线性层设置一个位宽。随着搜索减少到每个块一个预算,外部阶段直接优化这个模型级目标,捕获附加代理错过的块间耦合。在 Mixtral-8x7B-Instruct、Qwen1.5-MoE-A2.7B 和 DeepSeek-V2-Lite 上,Q-Strata 在低位状态下始终实现比均匀位宽 GPTQ 和最先进的 MoE MPQ 方法 MxMoE 和 GEMQ 更低的 WikiText2 困惑度。代码可在 https://github.com/snu-mllab/Q-Strata/tree/main 获取。