论文

MGVQ:协同多维灵敏度感知和梯度 Hessian 融合进行矢量量化

MGVQ: Synergizing Multi-dimensional Sensitivity-Aware and Gradient-Hessian Fusion for Vector Quantization

摘要

视觉语言模型(VLM)具有出色的性能,但其巨大的模型尺寸严重阻碍了在资源有限的边缘设备上的部署。作为一种高效的模型压缩技术,矢量量化(VQ)在超低位表示方面表现出色,它将模型权重映射到紧凑码本中的离散码字,以减少内存消耗和传输开销,同时保留模型能力。直接 VQ 应用到 VLM 仍然有两个核心限制。首先,视觉和文本输入带来的跨模态权重分布差异无法通过单个统一码本很好地拟合。其次,当前的二阶误差补偿忽略了一阶梯度信息,导致权重偏离预训练的最优状态、梯度漂移和补偿结果有偏差。这项工作提出了 MGVQ,一种集成多维灵敏度感知和梯度 Hessian 融合的新型矢量量化框架。它由两个核心模块组成:灵敏度引导的结构化混合精度量化,通过结合全局和局部灵敏度分析,根据信道灵敏度动态分配不同的比特宽度,实现精细化资源分配;梯度感知二阶误差补偿将一阶梯度嵌入误差校正中,并采用Kronecker和Block-LDL分解以确保较低的计算成本。在LLaVA-onevision、InternVL2和Qwen2-VL等主流VLM上进行的大量实验验证了MGVQ的有效性。在 2 位量化设置中,MGVQ 显着超越了现有的先进 后训练 量化方法,实现了 4.9 点的最大精度提升(71.4% vs InternVL2-26B 上的 67.0%)。该方法实现了稳定高效的超低比特VLM量化,极大地促进了资源有限环境下多模态大模型的实际部署。