论文

LASER:高效低精度视觉语言模型的损失感知奇异值分解和秩分配

LASER: Loss-Aware Singular-value Decomposition and Rank Allocation for Efficient Low-Precision Vision-Language Models

模型优化模型压缩

摘要

视觉语言模型 (VLM) 提供强大的多模态推理能力,但其巨大的计算成本和高参数数量使得在资源受限的设备上部署具有挑战性。低秩分解已成为一种有前途的压缩技术,但现有方法通常优化局部矩阵重建误差,依赖于统一或启发式的秩分配,并且主要关注注意力投影,而前馈网络尚未得到充分探索。在本文中,我们提出~\textit{LASER}(\textbf{L}oss-\textbf{A}ware \textbf{S}ingular-value d\textbf{E}组合和\textbf{R}ank分配),一种用于高效低精度VLM推理的低秩压缩框架。 LASER 从模型损失的二阶近似导出曲率加权 SVD 目标,并使用 Kronecker 因子 Fisher 信息来引导分解实现下游性能,而不是单独进行重建。我们进一步引入了基于校准梯度的损失感知跨层秩分配策略,从而实现了更有效的跨层参数预算。最后,我们通过将 SVD 与量化相结合的混合方案将低秩压缩扩展到 FFN 层。评估结果表明,LASER 比之前的工作实现了超过 $2.3\times$ 的解码加速,同时在低精度推理下保持了较高的准确性。