论文
SAB-LVLM:大型视觉语言模型的显着性感知二值化
SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models
摘要
大型视觉语言模型(LVLM)在多模态理解方面取得了显着进展,但其巨大的参数规模和跨模态计算会产生大量的内存和延迟开销,严重限制了资源受限设备上的实际部署。二值化通过大幅降低存储和计算成本提供了一种有吸引力的解决方案。然而,现有的二值化方法忽略了不同层和模式之间权重的不同重要性。这会导致与下游任务无关的参数被不必要地保留,而模态关键权重可能无法得到充分优化,从而导致性能显着下降。为了解决这些挑战,我们开发了一种新颖的 \underline{S}significance-\underline{A}ware \underline{B}inarization for \underline{L}arge \underline{V}ision-\underline{L}anguage \underline{M}odels (SAB-LVLM)。具体来说,在为文本和视觉输入构建 Hessian 矩阵后,我们提出了一个空间重要性图,以区分在单一模态下激活的全精度权重和跨模态激活的全精度权重。然后,我们设计一种模态引导的集成策略来获得重要性感知的二值化图,该图测量跨层和模态的权重重要性。随后,将该二值化图作为误差重新加权项合并到二值化目标中,并通过交替显着性加权更新方案来执行二值化拟合。大量实验表明,在大约 1 位压缩约束下,我们的 SAB-LVLM 优于现有的二进制 PTQ 方法。我们的代码可在 https://github.com/LyuQi127/SAB_LVLM 访问。