论文

OffQ:通过偏移驯服 LLM 量化中的结构化异常值

OffQ: Taming Structured Outliers in LLM Quantization by Offsetting

摘要

低位量化已被广泛采用,通过显着降低计算成本和内存使用来加速 大语言模型 (LLM) 的推理。然而,激活异常值对有效量化提出了重大挑战,通常会导致性能显着下降。在本文中,我们介绍了 OffQ,一种旨在通过新颖的抵消机制减轻低位量化中的激活异常值的方法。具体来说,OffQ 首先使用提出的 top-1 PCA 识别激活中的低维异常子空间,然后通过旋转将高幅度激活集中到 1 个通道中。然后,OffQ 通过将其幅度转换为共享偏移量来吸收该集中的异常值通道,从而减少激活的标准偏差。这种抵消策略可以使用部署友好的统一网格和统一精度量化对 LLM 进行有效的 W4A4KV4 量化。跨不同 LLM 架构和基准的大量实验表明,OffQ 的性能优于最先进的基线,持续提高模型精度,同时保持低位效率。