论文
VisPCO:通过视觉语言模型的预算感知帕累托前沿学习进行视觉词元修剪配置优化
VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models
摘要
视觉标记修剪方法有效地减轻了在视觉语言模型(VLM)中处理高分辨率图像和视频帧所引起的二次计算增长。然而,现有的方法依赖于预定义的修剪配置,而无法确定它们是否实现了计算性能最优。在这项工作中,我们介绍了一种新颖的框架,它将视觉标记修剪制定为帕累托配置优化问题,以自动识别最佳配置。我们的方法采用连续松弛和直通估计器来实现基于梯度的搜索,并通过增强拉格朗日方法求解。跨 8 个视觉基准的大量实验表明,它有效地逼近了通过网格搜索获得的经验 Pareto 前沿,并且可以很好地推广到各种修剪方法和 VLM 架构。此外,通过可学习的核函数,我们研究了分层剪枝模式,并揭示了多步渐进剪枝捕获了 VLM 的分层压缩结构,与单层方法相比,实现了卓越的精度-效率权衡。