STAR-Pro:阶段式词元自适应缩减和渐进细化,以实现高效的大型视觉语言模型
STAR-Pro: Stage-Wise Token Adaptive Reduction with Progressive Refinement for Efficient Large Vision-Language Models
摘要
大型视觉语言模型 (LVLM) 实现了强大的多模态理解,但它们处理的数百到数千个视觉标记会带来大量的计算开销,从而激发了 无需训练 视觉标记修剪。在这项工作中,我们对视觉标记修剪进行了两项互补的分析。首先,我们测量跨模态融合之前保留的标记的特征空间覆盖范围,发现积极的修剪丢弃了大量的视觉信息。其次,我们跨解码器层跟踪文本到视觉的注意力,发现重要的视觉标记随着深度的变化而发生很大的变化,使得一次性修剪决策不可靠。总之,这些发现表明,有效的修剪应该在融合之前保留广泛的视觉覆盖范围,并随着融合过程中跨模式证据的发展逐步细化保留的标记。因此,我们提出 STAR-Pro(STage-Wise Adaptive Token Reduction with Progressive Refinement),一个 无需训练 两阶段框架。其自适应阶段应用枢轴 QR 来构建超预算的特征覆盖候选池,而其渐进阶段则在选定的解码器层上使用不断演变的文本到视觉注意力来修剪目标层平均 词元预算 下的嵌套幸存者集。跨多个架构的 7 个 LVLM 以及 18 个图像和视频基准的广泛实验证明了 STAR-Pro 在积极修剪下的有效性。在 LLaVA-Video-7B 上,STAR-Pro 将视觉标记减少了 90.5%,保留了 92.7% 的基准性能,并实现了 2.24 美元\times$ 的测量推理加速。代码可在 https://github.com/EasonAI-5589/starpro 获取。