论文
CLIP 欺骗您:无需训练 词元修剪可在大型视觉语言模型中实现高效像素像素定位
CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models
摘要
在大型视觉语言模型中,视觉标记通常构成输入标记的大部分,从而导致大量的计算开销。为了解决这个问题,最近的研究探索了为图像理解任务修剪冗余或信息较少的视觉标记。然而,这些方法在像素基础任务中遇到了困难,其中标记的重要性很大程度上取决于输入文本。通过对 CLIP 的深入分析,我们观察到所指区域内的视觉标记通常与其文本表示表现出较低的相似度。受这一见解的启发,我们引入了 LiteLVLM,这是一种 无需训练 文本引导的标记修剪策略,用于高效的像素像素定位推理。通过反转 CLIP 的视觉文本相似度的排名,LiteLVLM 有效地保留了覆盖所指区域的视觉标记,同时恢复上下文标记以实现清晰的前景-背景分离。大量实验表明,在不同的 词元预算 中,LiteLVLM 的性能显着优于现有方法 5% 以上。在没有任何训练或 微调 的情况下,LiteLVLM 保持了原始性能的 90%,加速速度提高了 22%,内存减少了 2.3 倍。我们的代码可在 https://github.com/sejong-rcv/LiteLVLM 获取。