论文

MXSens:用于高效 LLM 推理的灵敏度感知混合精度量化

MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference

摘要

4 位量化可实现高效的 LLM 推理,但会因异常值而导致精度显着下降。先前的工作通过数据旋转或混合精度整数量化来解决这个问题,但通常依赖于软件管理的缩放和频繁的反量化,从而产生大量开销。微尺度格式(例如 MXINT)通过在硬件中编码尺度来消除这些低效率,但仍然与基于旋转的方法不兼容。我们的分析表明,异常值的严重程度各不相同,从罕见的极端到频繁的轻微偏差,并且量化灵敏度在层和列之间分布不均匀。这些见解激发了细粒度、敏感性引导的方法。我们引入了 MXSens,这是一种 无需训练 方法,它根据列和层的敏感度分配混合尾数位宽 (4/6/8),自然地利用 MXINT 的块式结构。 MXSens 在一系列模型和任务中均优于最先进的量化方法。在 W4A4KV4 设置下,MXSens 在 LLaMA-2-70B 和 LLaMA-3-8B 上分别实现了 3.77 和 7.63 的困惑度,比 WikiText-2 上的现有基线有了显着改善。我们的工作在 LLM 量化的准确性和资源效率之间建立了新的平衡。