论文

由浅到深:将词元修剪与 LVLM 中的阶段角色结合起来

Shallow to Deep: Aligning Token Pruning with Stage-wise Roles in LVLMs

摘要

大型视觉语言模型 (LVLM) 会因冗余视觉标记而产生高昂的计算成本。尽管视觉编码器阶段的免训练、基于注意力的多层剪枝已被探索为一种有效的策略,但我们发现浅层剪枝始终会降低性能。在本文中,我们旨在了解这个问题并寻求解决方案。通过分析整个网络深度的注意力模式,我们发现浅层主要充当具有混沌注意力图的边缘检测器,而更深的层通过局部主题识别和不稳定的语义聚合进行过渡。为了解决修剪策略和网络阶段之间的不一致问题,我们提出了 STD,这是一种分层词元修剪框架,它使词元选择机制适应每个网络阶段的功能角色。 STD 在浅层中采用高频频谱分析来确定性地保留结构边缘,在中间层中使用高斯平滑注意力来保持空间一致性,并在深层中引入稳定性自适应触发器以仅在语义稳定阶段执行剪枝。大量实验表明,STD 在 LLaVA-1.5-7B 上的性能比最先进的剪枝方法高出 1.1%,词元减少了 88.9%,同时与其他方法结合使用时也是即插即用且高效的;在 LLaVA-NeXT-7B 上比最先进的剪枝方法高出 2.1%,词元减少了 94.4%,在预填充阶段实现了 3.9 倍的加速。我们的代码将在此 https URL 发布。