论文
GRIP-VLM:高效视觉语言模型的组相对重要性修剪
GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models
摘要
在视觉语言模型 (VLM) 中,处理大量视觉标记会产生过高的计算开销。虽然最近的训练感知修剪方法试图有选择地丢弃冗余标记,但它们在很大程度上依赖于连续梯度松弛。然而,视觉标记剪枝本质上是一个离散的、非凸的组合问题;因此,这些连续近似经常使优化陷入次优的局部最小值,特别是在激进的压缩预算下。为了克服这一根本瓶颈,我们提出了 GRIP-VLM,这是一种由强化学习驱动的组相对重要性修剪框架。 GRIP-VLM 不依赖于平滑梯度假设,而是将剪枝制定为马尔可夫决策过程,采用以监督预热为锚定的组相对策略优化 (GRPO) 范式来直接探索离散选择空间。我们的轻量级代理与预算感知评分器集成,动态评估每个词元的重要性并适应任意压缩比,无需重新训练。跨不同多模态基准的大量实验表明,GRIP-VLM 始终优于启发式和监督学习基线,实现了优越的帕累托前沿,并在同等精度下提供高达 15% 的推理加速。