论文
少看,多推理:高效多模态的块式注意力跳跃 LLM
Look Less, Reason More: Block-wise Attention Skipping for Efficient Multimodal LLMs
摘要
由于长视觉标记序列上自注意力的二次计算成本,多模态 大语言模型 (MLLM) 面临着严重的推理瓶颈。然而,我们发现当前架构中存在一个严重的低效率问题:视觉注意力饱和度。我们的分析表明,视觉标记在早期层中快速建立其空间结构和模态内关系,从而使更深层中的视觉到视觉自注意力在计算上是多余的。相反,这些层中的前馈网络(FFN)对于将视觉特征投射到不断发展的文本语义空间中仍然至关重要。利用这一见解,我们提出了 Visual-Skip (V-Skip),这是一种 无需训练 推理范式,可将空间交互与语义演化解耦。 V-Skip 没有丢弃词元,而是通过有选择地绕过饱和视觉自注意力模块来强加块式结构化稀疏性。此外,认识到不同的下游任务需要不同的推理深度,V-Skip 采用轻量级、少样本校准来动态路由任务最优稀疏路径。大量实验表明,V-Skip 有效绕过冗余视觉注意力,实现块级稀疏性,在不同的 MLLM 中保持 94.16% 至 100.31% 的性能保留。最终,我们证明,为了更有效地进行推理,模型不需要丢弃它们所看到的东西——它们只需要在正确的深度“少看”即可。