论文

AlignQuant:面向高效 LLM 生成的 tile 对齐混合精度量化

AlignQuant: Tile-Aligned Mixed-Precision Quantization for Efficient LLM Generation

摘要

细粒度混合 精度 量化保证了高效的大语言模型推理,但本地 精度 选择可能与常规 GPU 存储和计算单元发生冲突。这种 精度 边界不匹配限制了压缩到实际加速的转换。我们介绍 AlignQuant,一种 后训练量化方法,它使用 GPU 兼容的二维权重图块作为 精度 分配、紧凑存储和执行的公共单元。这个共享分区让 精度 遵循输出通道内的灵敏度。使用由量化激活下的语言模型损失梯度加权的投影输出扰动,联合 预填充/解码校准分数 精度 减少。在模型范围的权重存储预算下,相位归一化分数优先考虑对任一相位重要的图块的较高 精度。每个图块存储一个选定的表示,而相位专用内核重用打包模型并扩展低位权重以进行 8 位激活的 INT8 计算。在涵盖 3B 至 14B 参数的四个 LLM 中,AlignQuant 比 BF16 实现了高达 $2.50\times$ 的生成加速,同时保持了模型质量。评估进一步涵盖三个 GPU 和高达 64K token 的上下文。这些结果表明,本地 精度 灵活性和常规 GPU 执行可以通过共享图块单元共存。该实现可在 https://github.com/HanzhiZhang-Ulrica/AlignQuant. 获取

AlignQuant:面向高效 LLM 生成的 tile 对齐混合精度量化:论文原图
图 1:精度 分配、表示和 GPU 执行的比较。颜色表示 8 位/4 位权重 精度,紫色轮廓跟踪逻辑块。该示意图显示了通道方式的 精度 分组如何与常规二维 GPU 平铺创建 精度 边界不匹配,而 AlignQuant 在分配、存储和执行方面使用通用的权重平铺分区。质量面板报告 WikiText-2 PPL 比 BF16 有所提高,右侧面板报告 Llama-3.2-3B 上跨提示长度的生成吞吐量。