论文

聚类和词元去噪可实现更快、更稳健的 VLM

Clustering and Token Denoising for Faster and More Robust VLMs

模型推理推理加速

摘要

最近的视觉语言模型 (VLM) 通过在文本旁边添加视觉标记来增强预训练 LLM 的功能,LLaVA 等方法显示出令人印象深刻的结果。然而,处理多达 576 或 729 个视觉标记的计算负担使得边缘部署具有挑战性。虽然各种词元修剪技术需要重新训练,但有些是 无需训练,因此可以轻松适应架构变化。我们引入了 ClustRS,这是一种用于稳健词元修剪的两部分 无需训练 算法。它的第一个组成部分是一个注意力加权的聚类算法,该算法从每个语义聚类中选择代表性标记。第二个组成部分“残余收缩”是对所选标记的单遍去噪步骤。这些 无需训练 轻量级步骤使 LLaVA 为现实世界的数据做好准备,提高了对各种图像噪声类型和强度的鲁棒性。 ScienceQA-IMG 和 MM-VET 基准测试的实验结果表明,我们的方法在 LLaVA 1.5 7b 上的极端噪声和词元条件下(词元减少 97%,降至 16 个词元)比基于注意力和多样性的方法性能高出 20%,并且在 LLaVA-OneVision 上取得了优异的结果,在轻度噪声条件下,我们将基线性能与不到三分之一的词元相匹配。我们的研究展示了一种简单而强大的替代方案,可以替代仅评分和仅多样性修剪规则,为计算高效且抗噪声的 VLM 部署铺平道路。