论文

MosaicQuant:统一 4 位 LLM 量化的异常值分解

MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization

摘要

4 位量化显着减少了内存占用并加速了 大语言模型 (LLM) 的推理。然而,其有限的位宽表示很难忠实地捕获密集的共同值(\emph{inliers})和罕见的大幅值(\emph{outliers}),从而导致准确性大幅下降。现有的混合精度方法通过保留高精度异常值来缓解这一问题,但代价是破坏低位执行的一致性,引入精度转换和额外的数据移动,从而破坏实际加速。我们提出了 \textbf{MosaicQuant},这是一种基于 \emph{inlier--outlier disaggregation} 新颖原理的统一 4 位 LLM 量化范例。 MosaicQuant 不是提高异常值精度,而是将完整权重矩阵量化为密集的 4 位基本组件,其中忠实捕获内部值,而异常值不可避免地被量化。然后引入稀疏 4 位残差分量来补偿这些量化误差,选择性地针对输出失真集中的最关键误差权重块。然而,单独的统一表示是不够的,因为将稀疏残差作为单独的内核简单地执行仍然会破坏统一的低位推理管道。为了弥补这一差距,我们引入了 \textbf{ZipperEngine},它通过重叠管道将稀疏块计算融合到密集的 4 位 GEMM 内核中,不仅将表示而且将执行统一到单个连贯的低位推理管道中。 LLaMA3 和 Qwen3 上的大量实验表明,MosaicQuant 保持了接近 FP16 的精度,同时比 W16A16 基线实现了高达 1.24倍的加速。