论文

VISion On Request:通过稀疏、动态选择的视觉语言交互增强 VLLM 效率

VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions

模型推理推理加速

摘要

提高大型视觉语言模型(LVLM)效率的现有方法很大程度上基于视觉标记缩减的概念。然而,这种方法会造成信息瓶颈,从而损害性能,尤其是在需要细粒度理解和推理的挑战性任务上。在这项工作中,我们通过引入 VISion On Request (VISOR) 来挑战这种范式,这是一种在不丢弃视觉信息的情况下降低推理成本的方法。 VISOR 不是压缩图像,而是通过稀疏图像和文本标记之间的交互来提高效率。具体来说,语言模型通过一组策略性放置的小型注意力层来处理全套高分辨率视觉标记:一般视觉上下文由文本-图像之间的有效交叉注意力提供,而一些放置良好且动态选择的自注意力层则细化视觉表示本身,从而在需要时实现复杂的高分辨率推理。基于这一原则,我们首先通过改变自注意力层的数量,在一系列计算预算上训练单个通用网络,然后引​​入一种轻量级策略机制,根据每个样本的复杂性动态分配视觉计算。大量实验表明,VISOR 极大地降低了计算成本,同时在各种基准测试中达到或超过了最先进的结果,并且在需要详细视觉理解的挑战性任务中表现出色。