论文

VisionPulse:用于高效多模态推理的动态视觉稀疏性

VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning

模型推理推理加速

摘要

随着大型多模态模型(LMM)的快速发展,推理时间开销已成为现实世界部署的关键瓶颈。现有方法通常在预填充时修剪视觉标记,假设所需的视觉证据在推理过程中保持静态。然而,我们凭经验表明,视觉证据强烈依赖于步骤:只有视觉标记的稀疏子集在每个解码步骤中是关键的,并且关键集在推理过程中不断演变。此外,我们还发现了一个耦合瓶颈,其中冗余视觉上下文可以将模型引导至与查询无关的区域,从而延长推理轨迹。在这些见解的指导下,我们提出了 VisionPulse,一种推理过程中的逐步视觉标记修剪框架。 VisionPulse 计算轻量级视觉注意力质量,利用其与 LMM 有效视觉标记使用的强正相关性来估计逐步保留预算,并在此预算下仅保留最关键的标记。通过在推理过程中强制执行视觉稀疏性,VisionPulse 可以过滤冗余的视觉上下文,同时保留相关的视觉证据,自然地缩短推理痕迹。大量实验表明,VisionPulse 每步仅保留 5% 的视觉标记,推理轨迹缩短了 11.2%,而准确性几乎保持不变。