论文
ERASE:通过自适应两阶段词元修剪消除冗余视觉词元
ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning
摘要
视觉语言模型 (VLM) 的最新进展使 大语言模型 (LLM) 能够处理高分辨率图像,从而显着提高现实世界的多模态理解。然而,这种能力引入了大量的视觉标记,导致大量的计算开销。为了缓解这个问题,人们提出了各种视觉词元修剪方法。然而,现有的方法主要依赖于模型中学习到的语义特征来捕获视觉冗余。此外,它们缺乏根据输入图像的复杂性调整剪枝策略的自适应机制。在本文中,我们提出了 ERASE,这是一种两阶段视觉标记修剪框架,它通过适应图像复杂性的修剪策略来识别和保留显着标记。实验结果表明,ERASE 显着减少了视觉标记,同时保持了准确性。对于 Qwen2.5-VL-7B,在 token 剪枝率为 85% 时,ERASE 保留了原始模型精度的 89.46%,而最佳先验方法仅保留了 78.1%。我们的代码可在 https://github.com/Tuna-Luna/ERASE 获取。