论文

一层的垃圾是另一层的宝藏:LVLM 中的自适应逐层视觉标记选择

One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs

模型推理推理加速

摘要

大型视觉语言模型(LVLM)在各种多模式任务中取得了显着的成功,但其实际部署仍然受到冗长视觉标记产生的计算负担的限制。虽然视觉词元修剪已成为一种有前景的解决方案,但现有方法存在根本性限制:一旦在特定层修剪词元,所有后续层就无法访问它们,从而导致过早的信息丢失,从而损害模型性能。通过实证研究,我们观察到不同的层表现出不同的视觉区域焦点,表明跨层的最佳标记子集不同。受这种见解的启发,我们提出了自适应逐层视觉词元选择(ALVTS),这是一种摆脱传统静态词元修剪范例的新颖框架。 ALVTS 结合了一个轻量级词元选择器来识别和路由重要词元以进行进一步处理,同时允许不太重要的词元跳过该层,从而最大限度地减少计算冗余。这两个词元流在输入后续层之前会无缝地重新集成,从而促进整个模型的自适应压缩。基于我们的重要性一致性约束的低秩近似,所提出的词元选择模块紧密模拟完整的注意力机制,有效地捕获其基本模式,而不需要模型重新训练。 LLaVA-1.5、LLaVA-NeXT 和 Qwen2.5-VL 上的大量实验验证了我们方法的有效性。 ALVTS 具有 89% 的词元压缩比,保留了原始模型 96.7% 的准确度,实现了 LVLM 推理的卓越效率与准确度权衡。