论文
用于高效视觉语言模型的无注意力和轻量级词元减少
Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models
摘要
视觉语言模型 (VLM) 在多模式理解方面取得了强大的性能,但由于处理大量视觉标记的计算开销很大,因此在资源受限的边缘设备上部署仍然具有挑战性。词元减少是加速 VLM 推理的一个有前途的方向,但现有方法要么依赖于与现代加速框架不兼容的注意力图,要么依赖于计算密集型的成对相似性比较,这会破坏可扩展性并抵消其在部署中的实际优势。在本文中,我们提出了一种无注意力且轻量级的词元缩减框架作为 VLM 的即插即用模块,它保留了重要且多样化的词元以产生紧凑的视觉表示。首先,为了实现无注意力的重要性估计,我们采用信息论的视角,并使用一种新颖的基于熵的标准来量化标记信息,保留那些具有更强表现力和更少退化的特征表示。其次,为了以轻量级的方式确保多样化的视觉覆盖,我们引入了一种变换引起的一致性信号,其中相似的标记产生相似的信号,这样通过该信号进行排序会将相似的标记彼此靠近,并允许基于步幅的选择来产生多样化的标记集。跨多个 VLM 基准的广泛实验表明,我们的框架实现了有利的准确性与效率权衡,在积极的压缩下保持有竞争力的性能。