论文
多模态大语言模型中用于视觉标记修剪的层感知位置嵌入
Layer-Aware Position Embeddings for Visual Token Pruning in Multimodal Large Language Models
摘要
由于依赖数百个视觉标记来表示图像,多模态大语言模型 (MLLM) 会产生大量计算开销。虽然词元剪枝已成为降低 MLLM 推理成本的一种有前途的方法,但现有方法通常使用稀疏或连续位置嵌入将位置嵌入重新分配给保留的词元,每种方法都会引入不同的限制。稀疏的位置嵌入往往会降低分配给视觉标记的注意力价值,从而降低 MLLM 的感知能力,而连续的位置嵌入会破坏视觉标记的原始空间对应关系,导致视觉定位能力减弱。为了缓解这个问题,我们对语言解码器进行分层分析,并观察到中间层在保持 MLLM 在词元修剪下的视觉定位能力方面发挥着关键作用。基于这一观察,我们提出了一种层感知位置嵌入策略,该策略在视觉定位敏感层切换到稀疏位置嵌入,同时在其他地方保持连续位置嵌入。跨代表性剪枝方法和不同基准的广泛实验表明,与标准稀疏和连续位置嵌入相比,我们的方法提高了剪枝 MLLM 的综合多模态性能。