论文
打破大型视觉语言模型低位量化中的模态异构性
Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models
摘要
低位 后训练 量化 (PTQ) 是在资源受限设备上部署视觉语言模型 (VLM) 的关键技术。然而,由于量化过程中文本和视觉模态的异构激活分布,现有的 PTQ 方法常常会降低 VLM 的准确性。我们发现这种跨模态异质性在通道之间分布不均匀:一小部分通道包含大多数特定于模态的异常值,并且这些异常值通常驻留在每种模态的不同通道中。受此启发,我们提出了 SplitQ,一种通道分割驱动的 后训练 量化框架。 SplitQ 的核心是引入了一种新颖的模态特定异常值通道解耦 (MOCD) 模块,该模块可以以最小的开销有效地隔离显着的模态特定异常值通道。为了进一步解决剩余的跨模态分布差异,我们设计了一个自适应跨模态校准(ACC)模块,该模块采用双轻量级可学习分支来动态减轻模态引起的量化误差。对流行 VLM 的大量实验表明,在所有评估的量化设置(包括 W4A8、W4A4、W3A3 和 W3A2)下,SplitQ 在 6 个流行多模态数据集上的性能显着优于现有方法。值得注意的是,SplitQ 在具有挑战性的 W3A3 设置下保留了 93.5% 的 FP16 性能(69.5 比 74.3),推动了部署高级 VLM 的效率前沿。我们的代码位于 https://github.com/EMVision-NK/SplitQ