多尺度反量化:通过激活分解消除反量化瓶颈,实现高效 LLM 推理
Multi-Scale Dequant: Eliminating Dequantization Bottleneck via Activation Decomposition for Efficient LLM Inference
摘要
量化对于高效的 大语言模型 (LLM) 推理至关重要,但将低位权重转换回高精度以进行矩阵乘法的反量化步骤已成为现代 AI 加速器的关键瓶颈。在具有解耦计算单元的架构(例如 Ascend NPU)上,反量化操作可能比矩阵乘法本身消耗更多的周期,从而导致高吞吐量张量核心未得到充分利用。本文提出了多尺度反量化 (MSD),这是一种从 GEMM 关键路径中删除权重/KV 反量化的量化框架。 MSD 不是将低位权重提升到 BF16 精度,而是将高精度 BF16 激活分解为多个低精度分量,每个分量都可以通过本机硬件加速的 GEMM 直接与量化权重相乘。这种方法将计算范式从精度转换转变为多尺度近似,避免了 GEMM 之前的 INT8 到 BF16 权重转换。我们实例化两种权重格式的 MSD,并为每种格式导出严格的误差范围。对于 INT8 权重 (W4A16),两遍 INT8 分解实现了接近 16 个有效位。对于 MXFP4 权重 (W4A16),两遍 MXFP4 分解产生接近 6.6 个有效位,每个块的误差界限为 1/64,超过单遍 MXFP8(5.24 位),同时保持相同的有效 GEMM 计算时间。我们进一步推导了封闭形式的延迟和 HBM 流量模型,表明 MSD 避免了由反量化引起的 Vector-Cube 管道停顿,并将 KV 缓存 HBM 流量减少了多达 2.5 倍的注意力。对矩阵乘法和 Flash Attention 内核的数值模拟证实,与反量化基线相比,MSD 不会降低精度,并且在许多设置中实现了较低的 L2 误差。