论文
QuBLAST:使用块级压缩方法和激活缩放策略量化 大语言模型 的框架
QuBLAST: A Framework for Quantizing Large Language Models with Block-Level Compression Approach and Activation Scaling Strategy
摘要
LLM 已成为解决 NLP 任务的最先进算法。然而,它们通常需要巨大的计算和内存成本,因此很难部署在嵌入式系统上。为此,最先进的方法通常在网络的注意力块上采用统一的 后训练 量化(PTQ),因此忽略了在同一网络中应用不同量化级别的潜力。他们还采用复杂的操作来减轻激活异常值的负面影响,从而产生较高的计算开销。此外,他们没有考虑使用新兴的 LLM 和非常规注意力架构(例如状态空间模型)进行评估,这对应用量化提出了不同的挑战。为了解决这些限制,我们提出了 QuBLAST,一种新颖的 PTQ 方法,该方法采用块级压缩方法和 LLM 的激活缩放策略。块级压缩方法可以实现跨网络块的混合精度量化,而激活缩放策略有效地减轻了激活异常值的负面影响。具体来说,QuBLAST首先通过交叉熵损失分析来分析预训练模型中不同注意力块的敏感性。 QuBLAST 利用这种敏感性分析来确定模型中每个注意力块的权重量化级别。此外,QuBLAST 采用每个块的激活缩放图来控制激活值的范围并减轻激活异常值的负面影响,从而实现更好的量化结果。实验结果表明,QuBLAST 在不同模型架构(即 Qwen3-8B、Llama3-8B、Mistral v0.1-8B 和 Falcon H1R-7B)中将模型大小减少了 40%-45.2%,同时将 WikiText-2 和 WikiText-103 数据集的性能保持在 5% 的困惑度增加之内。