论文

HyQuant:大语言模型注意力的混合精度量化

HyQuant: Hybrid-Precision Quantization for LLM Attention

摘要

量化在LLM的训练和推理中被广泛采用,以降低成本并提高效率。然而,\emph{attention} 模块的低位量化通常会在非常低的位宽下引入较大的错误,从而导致性能下降。现有方法主要依靠平滑技术来处理异常值,而我们提出了混合量化设计以更好地平衡精度和效率。具体来说,我们提出了 \textbf{HyQuant},一种用于 LLM 注意力的高效混合量化框架。 HyQuant 将大多数注意力状态量化为低位格式,同时以高精度保留一小组垂直线标记和局部窗口状态。这些精度关键区域是使用轻量级垂直线感知注意模式信号来选择的,从而以有限的开销减少了量化误差。在预填充阶段,HyQuant 使用混合精度量化注意力算子,在量化剩余上下文的同时,以全精度保留垂直线标记和局部滑动窗口。在解码阶段,HyQuant 将相同的原理应用于 KV 缓存压缩,并将 KV 反量化与注意力计算融合在一起,以提高内存和硬件效率。在不同的任务、模型和数据集上,HyQuant 通过极其简单的设计保持了近乎无损的精度,展示了 LLM 注意力混合量化的效率和实际可行性。代码位于:https://github.com/jerrysfls/HyQuant。

HyQuant:大语言模型注意力的混合精度量化:论文配图
图1 典型家庭以垂直线为主的关注。从上到下各行:Quen3-8B、Gemma4-31-B、Qwen3.5-4B和Llama3-8B。跨越层次、头部和模范家庭,纵向的长宽条纹表明,少数职位被长时间地反复占据,显示出高度不平衡的注意力分布以及鼓励压缩战略,将一小部分关键职位列为优先事项。