论文

VisLens:多模态的单通道可解释视觉搜索 LLM

VisLens: Single-Pass Interpretable Visual Search for Multimodal LLMs

模型推理推理加速

摘要

多模态 大语言模型 (MLLM) 难以应对细粒度的视觉搜索,即在高分辨率图像中定位小或稀有物体的任务。现有的补救措施分为两个系列:(1) 基于注意力或置信度分数的 无需训练 方法准确但速度慢,因为它们每个示例需要多个 MLLM 查询。 (2) 强化学习 (RL) 训练的工具使用模型推理速度更快,但不透明,因为它们的工具调用仍然不可控且难以解释。为了克服这个问题,我们提出了 \emph{VisLens} (通过 logits 镜头进行视觉聚焦),这是一种基于 logits 镜头构建的视觉搜索方法,它通过通过 LLM 头部投影隐藏状态中的语义来解码它。 VisLens 进一步使用轻量级的调谐透镜,将早期隐藏状态映射到最终隐藏状态空间,因此可以从早期层读出视觉标记。这些标记与查询中的目标单词相匹配,以生成相关区域的裁剪,该裁剪与原始图像一起反馈以产生最终答案。从解码到最终答案的整个过程在一次前向传递中完成,无需重复查询。 VisLens 匹配或超过了之前的基线,同时提供了显着的延迟优势,运行速度比 Thyme 快 $8.5$--$9.9\times$,比 无需训练 多遍搜索方法快 $22.2\times$。