论文
HAP:通过跨模态对齐自适应选择注意力头,剪枝视觉词元
HAP: Head-Adaptive Visual Token Pruning via Cross-Modal Alignment
摘要
最近的视觉语言模型将高分辨率图像编码为长视觉标记序列,从而产生高昂的预填充成本。为了压缩它们,现有方法通过对所有头部均匀地平均文本到视觉注意力来对每个视觉标记进行评分,这假设每个头部都与查询匹配。然而,我们的实证分析表明,头部错位占主导地位,放大了背景标记并淹没了细粒度的线索。为了解决这个问题,我们提出了 PAQ(提示图像对齐注意力质量),这是一个量化每个头将提示与图像区域对齐的程度的指标。我们的修剪以 PAQ 为基础,分三个阶段进行。给定目标 FLOPs 预算,我们首先将 Transformer 层划分为组,并为每个组分配一个可视化的 词元预算。然后,在每个组内,我们通过 PAQ 加权 softmax 将每个头的注意力图聚合到组级矩阵中。最后,我们根据该矩阵的大小对视觉标记进行评分,并保留每组分配的预算。通过使用 PAQ 对头部进行加权,我们的方法通过更忠实地反映即时相关性的注意力信号对标记进行评分,而不是通过统一平均来稀释它们。在 18 个基准测试中,我们的方法提供了最先进的权衡。具体来说,在 LLaVA-1.5-7B(9 个任务)上,仅保留 \textbf{5.6\%} 标记可以保留 \textbf{99.1\%} 的原始性能,超过最强基线 AutoPrune 4.2 个点。代码可在 https://github.com/baokou-fw2/HAP 中获取。