论文
HyQuant:大语言模型注意力的混合精度量化
HyQuant: Hybrid-Precision Quantization for LLM Attention
摘要
量化在LLM的训练和推理中被广泛采用,以降低成本并提高效率。然而,\emph{attention} 模块的低位量化通常会在非常低的位宽下引入较大的错误,从而导致性能下降。现有方法主要依靠平滑技术来处理异常值,而我们提出了混合量化设计以更好地平衡精度和效率。具体来说,我们提出了 \textbf{HyQuant},一种用于 LLM 注意力的高效混合量化框架。 HyQuant 将大多数注意力状态量化为低位格式,同时以高精度保留一小组垂直线标记和局部窗口状态。这些精度关键区域是使用轻量级垂直线感知注意模式信号来选择的,从而以有限的开销减少了量化误差。在预填充阶段,HyQuant 使用混合精度量化注意力算子,在量化剩余上下文的同时,以全精度保留垂直线标记和局部滑动窗口。在解码阶段,HyQuant 将相同的原理应用于 KV 缓存压缩,并将 KV 反量化与注意力计算融合在一起,以提高内存和硬件效率。在不同的任务、模型和数据集上,HyQuant 通过极其简单的设计保持了近乎无损的精度,展示了 LLM 注意力混合量化的效率和实际可行性。代码位于:https://github.com/jerrysfls/HyQuant。
