论文

VPRune:高效的免训练预大语言模型视觉词元修剪

VPRune: Efficient Training-free Pre-LLM Visual Token Pruning

模型推理推理加速

摘要

视觉标记修剪是降低大型视觉语言模型 (LVLM) 推理成本的一种有前途的方法,但激进的标记减少通常会导致性能大幅下降。我们确定了这种退化背后的三个关键因素:文本引导的选择偏差、丢弃标记的信息丢失以及序列压缩引起的位置失真。基于这些观察,我们提出了 \textbf{VPRune},这是一种免训练的预 LLM 修剪框架,由仅视觉多样性选择、相似性引导的词元回收和位置保留恢复组成。在 FastVLM-1.5B 上跨多个视觉语言基准测试的实验表明,VPRune 实现了有利的精度与压缩权衡,在激进压缩下的优势尤其明显。此外,对边缘设备的评估表明,VPRune 有效降低了端到端推理延迟,同时保持了卓越的任务性能,证明了其对于资源受限的 LVLM 部署的实用性。