论文
TORINO:通过视觉语言模型中可解释的概念重叠来减少词元
TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models
摘要
视觉语言模型(VLM)在不同的任务中展示了令人印象深刻的能力,但它们的计算成本主要由输入到语言模型的大量视觉标记决定。现有的标记缩减方法依赖于基于注意力的分数或成对相似性,而没有每个标记的显式语义表示。我们引入了 TORINO(通过可解释概念重叠进行词元缩减),这是一种用于 VLM 中自适应视觉词元缩减的即插即用框架,不需要底层模型的 微调。 TORINO 利用稀疏自动编码器 (SAE) 将视觉标记投影到可解释的潜在空间中,在该空间中可以通过共享概念激活来分析标记关系。具体来说,我们将概念重叠定义为活跃 SAE 潜在变量之间的一致程度,并使用它对共享语义内容的标记进行分组。然后通过修剪或合并来执行每个组内的缩减,从而提供一个统一的框架,在保留语义上重要的视觉信息的同时消除冗余。与固定预算方法不同,TORINO 根据输入复杂性动态调整缩减率,允许不同的图像保留不同数量的词元。跨多个视觉语言基准的实验表明,TORINO 实现了有利的效率与准确性权衡,以最小的性能损失减少了视觉标记的数量。