论文

大型视觉语言模型中任务感知词元修剪的解耦相似性

Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models

摘要

词元修剪已成为一种有效的方法,通过丢弃信息量较少的视觉词元,同时保留性能,减少大型视觉语言模型(LVLM)的大量计算开销。然而,现有方法通常依赖于来自不同 LVLM 组件的个体注意力源,由于注意力分布存在偏差,导致剪枝决策不完整且次优。为了解决这个问题,我们提出了 DeSAP,一种新颖的解耦相似性感知修剪方法,用于在视觉编码器中进行精确的、任务感知的标记修剪。具体来说,DeSAP 引入了解耦的相似性来捕获视觉特征和文本标记之间的细粒度跨模式相关性,为修剪提供明确的任务相关指导。通过将解耦的相似性与源自视觉注意力的视觉显着性信号相结合,DeSAP 在任务相关和视觉提示的指导下执行标记剪枝,即使在激进的剪枝比率下也能实现稳健的剪枝。跨不同基准和架构的大量实验表明,DeSAP 在准确性和效率方面始终优于 SOTA 方法。在 LLaVA-1.5-7B 上,DeSAP 通过仅保留 11.1% 的视觉标记,实现了 10 倍的 FLOP 减少和 2.3 倍的预填充加速,同时保持了 98.1% 的原始性能。