论文
MUXQ:通过低秩异常值分解实现混合到均匀精度 MatriX 量化
MUXQ: Mixed-to-Uniform Precision MatriX Quantization via Low-Rank Outlier Decomposition
摘要
大语言模型 (LLM) 在广泛的自然语言处理任务中取得了出色的性能,但其庞大的参数数量带来了大量的内存和计算开销。这一挑战在基于 NPU 的设备环境中尤为严峻,其中 FP16/FP32 计算效率低下,因此整数 (INT) 量化至关重要。然而,现有的方法,包括 ZeroQuant、LLM.int8() 和 SmoothQuant,并不能完全解决输入激活异常值和相关硬件效率低下的问题。为了克服这些限制,我们提出了 MUXQ(混合到均匀量化)。 MUXQ 检测输入激活中的异常值通道,并引入一个小型辅助矩阵,在通道之间重新分配异常值幅度,从而缓解异常值问题。这使得甚至可以在低精度 INT 级别对激活异常值进行量化,同时保留硬件友好的计算结构。使用 WikiText-2 数据集在三个尺度(0.1B、0.3B 和 0.7B 参数)的 GPT-2 模型上进行的实验表明,MUXQ 始终比朴素量化实现更低的困惑度。特别是,在每张量量化下,MUXQ 将激活和权重量化为 INT8,同时保持接近 FP16 的精度。只需适度的计算开销,MUXQ 就能实现稳定的低精度推理,并且可以轻松地与其他量化技术相结合。这些结果表明,MUXQ 为边缘设备上高效、准确的 LLM 推理提供了一个有前途的方向。