论文

HAWK:多模态模型中的头部重要性感知视觉标记修剪

HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models

模型优化稀疏化

摘要

在多模态 大语言模型 (MLLM) 中,视觉标记的激增显着增加了推理时间和计算开销,使得它们对于实时或资源受限的应用程序来说不切实际。视觉标记修剪是一种很有前途的策略,可以通过删除冗余的视觉标记来降低 MLLM 推理的成本。现有的研究通常假设所有注意力头对视觉解释的贡献相同。然而,我们的研究表明,不同的头部可能捕捉不同的视觉语义,并在视觉处理中本质上发挥不同的作用。根据这一观察,我们提出了 HAWK,一种头部重要性感知的视觉标记修剪方法,它感知视觉任务中注意头的不同重要性,以最大限度地保留关键标记。通过利用头部重要性权重和文本引导的注意力来评估视觉标记的重要性,HAWK 有效地保留了与任务相关的视觉标记,同时删除了冗余的视觉标记。所提出的 HAWK 完全是 无需训练,可以无缝应用于各种 MLLM。对多个主流视觉语言基准的大量实验表明,HAWK 实现了最先进的准确性。当应用于 Qwen2.5-VL 时,HAWK 在修剪 80.2% 的视觉标记后保留了 96.0% 的原始准确率。此外,它将端到端延迟降低至原始延迟的 74.4%,并进一步降低了测试模型的 GPU 内存使用量。该代码可在 https://github.com/peppery77/HAWK.git 获取。