论文
超越注意力分数:基于 SVD 的视觉标记修剪,实现高效的视觉语言模型
Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models
摘要
视觉语言模型 (VLM) 通过联合处理视觉和文本信息,彻底改变了多模式学习。然而,由于处理长视觉标记序列对计算和内存的要求很高,因此它们面临着巨大的挑战。许多现有方法依赖于局部启发式方法,例如注意力分数或词元规范。然而,这些标准受到位置偏差和信息分散的影响,限制了它们在高修剪率下保留基本内容的能力,并导致视觉细节图像的性能下降。为了解决这些问题,我们提出了 SVD-Prune,一种基于奇异值分解的 无需训练 即插即用词元修剪方法。它分解视觉词元特征矩阵,并使用统计杠杆分数选择前 k 个词元,确保仅保留对主导全局方差贡献最大的词元。实验表明,SVD-Prune 在极端视觉 词元预算 下始终优于先前的剪枝方法,即使在 32 和 16 个视觉标记下也能保持强劲的性能。