论文
WSVD:加权低秩近似,用于快速高效地执行低精度视觉语言模型
WSVD: Weighted Low-Rank Approximation for Fast and Efficient Execution of Low-Precision Vision-Language Models
摘要
奇异值分解 (SVD) 已成为减轻视觉语言模型 (VLM) 计算负担的重要技术,视觉语言模型在图像字幕和视觉问答等任务中发挥着核心作用。尽管之前的多项工作已经提出了高效的 SVD 变体来支持低秩操作,但我们发现实际上在模型执行过程中仍然很难实现大幅延迟的减少。为了解决这一限制,我们引入了一种新的计算模式,并以更细的粒度应用 SVD,从而实现执行延迟的真正且可测量的改进。此外,认识到权重元素的相对重要性不同,我们在 SVD 过程中自适应地为每个元素分配相对重要性,以更好地保持准确性,然后通过应用于权重和激活的量化来扩展该框架,从而形成高效的 VLM。总的来说,我们引入了 ~\textit{Weighted SVD} (WSVD),它在保持准确性的同时实现了超过 $1.8\times$ 的解码加速,从而优于其他方法。我们将代码开源于:\href{https://github.com/SAI-Lab-NYU/WSVD}{\texttt{https://github.com/SAI-Lab-NYU/WSVD}