论文

V-CoLA:具有线性注意力的视觉token压缩

V-CoLA: Vision Token Compression with Linear Attention

模型推理推理加速

摘要

视觉语言模型 (VLM) 已展现出令人印象深刻的功能,但由于视觉标记在输入序列中占主导地位,因此面临着巨大的计算开销。这促使视觉token压缩成为减轻负担的关键方向。然而,随着结合线性注意力的混合架构(例如 Qwen3.5)的出现,之前为 softmax 注意力设计的方法很难泛化。我们的分析表明,基于注意力和相似性的方法都遭受了显着的性能下降,这强调了针对这种情况量身定制的压缩方法的迫切需要。为此,我们提出了 \textbf{V-CoLA},这是一种专为线性注意力设计的高效的免训练token压缩框架。 V-CoLA 引入了一种新颖的 \textit{唯一性感知重要性标准}来识别关键视觉标记,并结合执行压缩的 \textit{自适应标记合并策略}。所有组件都在实现级别进行了优化,以保持与线性注意力的块并行性兼容,确保强大的 实用价值。跨多个基准的大量实验证明了 V-CoLA 的优越性:它仅用 50.0% 的视觉token就实现了原始性能的 99.5%,用少至 12.5% 的视觉token就实现了超过 88.0% 的性能,同时提供了 1.86$\times$ 到 6.15$\times$ 的预填充加速。