论文

SPHQuant:视觉语言模型的高效极低位权重量化

SPHQuant: Efficient extreme low bit weight quantization for Vision-Language Models

摘要

最近的基础模型正在转向原生多模态视觉语言模型 (VLM),使 VLM 成为下一代基础模型的核心形式。然而,由于高内存占用和内存限制的自回归解码,它们的大型语言主干使得边缘部署变得困难。仅权重训练后量化是一种实用的解决方案,但将 VLM 推至极低位宽仍然具有挑战性:现有的无旋转方法在​​ 2-3 位处存在异常值,而基于旋转的方法以额外的运行时开销为代价提高了准确性。我们提出了 SPHQuant,一种用于 VLM 的无旋转球形仅权量化框架。 SPHQuant 不是直接在笛卡尔坐标中量化权重,而是将每个 8D 权重向量分解为坐标符号、半径和正单位方向。这种表示将离群值隔离到半径中,同时保持方向有界和统计规律。基于这一见解,SPHQuant 为半径分配额外的精度,以减轻异常值引起的精度下降。它还使用紧凑的正向码本并通过角度参数化微调码本条目以保留单位球约束。我们还设计了一个硬件友好的 GEMV 内核,使方向码本保持足够小以进行共享内存查找并有效地打包径向位。实验表明,SPHQuant 与最先进的极低比特量化方法的性能相匹配,同时在 RTX A6000 上将解码吞吐量比 QTIP 提高了 30.3%。代码将在此 https URL 中发布。