论文

AAAC:用于 4 位 LLM 权重量化的激活感知自适应码本

AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization

摘要

后训练 仅权重量化为 4 位被广泛用于减少 大语言模型 推理的内存和计算成本。现有的 PTQ 方法(例如 AWQ 和 GPTQ)通过缩放、裁剪或误差补偿改进了权重映射到固定 4 位网格的方式。为了进一步提高准确性,OmniQuant 和 QuIP\# 等方法使用梯度辅助算法,但代价是数小时的量化时间。在这项工作中,我们提出了 AAAC(激活感知自适应码本),这是一种用于 4 位 LLM 权重量化的轻量级方法。 AAAC 将标准量化中使用的固定标量码本替换为每层两个小型学习标量码本(64 字节)。每组权重选择最小化激活加权重建误差的码本,将选择编码到该组正标度的未使用符号位中,并添加零存储开销。 AAAC 在单个 GPU 上可在 3--30 分钟内完成,并且除模型本身外不添加任何内存。我们针对模型系列中的 AWQ、GPTQ、IF4、GPTVQ、OmniQuant、SqueezeLLM 和 QuIP\# 进行评估。 AAAC 在量化时间减少几个数量级的情况下优于基线。