论文
最小化缩放的隐性成本:图引导超低比特量化
Minimizing the Hidden Cost of Scales: Graph-Guided Ultra-Low-Bit Quantization for Large Language Models
摘要
训练后量化 (PTQ) 对于大型语言模型 (LLM) 的高效部署至关重要。最近的超低位 PTQ 方法依赖于严格的权重显着性假设或位置启发法,引入了大量隐藏的缩放开销。我们提出了 SAGE-PTQ(Saliency-Aware Graph-guided Efficient PTQ),这是一种用于 LLM 的新型超低位量化框架,可最大限度地减少隐藏的扩展成本。 SAGE-PTQ 使用分布统计分离显着权重和非显着权重,然后将二次采样的非显着权重建模为稀疏图,以估计每层的最佳组数。 SAGE-PTQ 采用双模式量化,为显着权重分配多位精度,并对不显着权重进行二值化。为了减少缩放开销,SAGE-PTQ 对每个通道使用一个缩放比例来表示显着权重,对每个不显着组使用一个标量。最后,SAGE-PTQ 实现自适应显着性阈值来选择每个矩阵的最佳显着性比率。 SAGE-PTQ 平均每个矩阵实现 1.03 个权重位和 0.004 个缩放位,优于 BiLLM 和 PB-LLM 等最先进的方法。在 LLaMA-3-8B 上,SAGE-PTQ 的 WikiText2 困惑度达到 6.74,而 BiLLM 的困惑度为 55.8,同时使用的 BiLLM GPU 内存不到 50%。在 LLaMA-2-70B 上,SAGE-PTQ 在一个 NVIDIA L40 GPU 上提供了 1.5 倍的解码速度,展示了实际的推理效率。
