论文
MixQuant:大语言模型 的自适应混合精度量化
MixQuant: Adaptive Mixed-Precision Quantization for Large Language Models
摘要
混合精度量化通过向敏感层分配更高的位宽来提高 后训练 量化的精度,但现有方法解决了单个固定内存预算的分配问题。实际上,预算因部署而异,并且在校准时是未知的。自适应量化通过满足任何预算的离线校准来解决这个问题,但当前的方法以不考虑其对其他层量化级别的依赖性的方式对层灵敏度进行评分。我们表明,层的敏感性很大程度上取决于其上游层的位宽,并且这种依赖性会改变最终的首选位分配。我们提出了 MixQuant,一种与技术无关的自适应框架,可以包装任何基本量化器。 MixQuant 将每个层的失真边缘化到随机量化的上游配置上,以获得与预算无关的分数,根据分配器本身生成的计划校准量化器的参数,并惩罚使层保持最低位宽的分配。然后,单个贪婪传递即可满足部署时的任何预算。在 AWQ 和 GPTQ 下的 Llama-3.2-3B、Llama-2-7B 和 Mistral-7B 中,MixQuant 在每种设置下都优于自适应和混合精度基线,在最紧张的预算下将平均精度提高多达 8 个点,并将困惑度从 12.43 降低到 10.70,同时以可忽略的部署成本匹配 ILP 求解器。