论文

ActiveScope:积极寻求并纠正对 MLLM 的看法

ActiveScope: Actively Seeking and Correcting Perception for MLLMs

应用与实践视觉感知与空间理解

摘要

多模态 大语言模型 (MLLM) 已展现出令人印象深刻的视觉语言理解能力,但仍难以实现高分辨率图像中的细粒度感知。虽然现有的 无需训练 方法通常依赖于基于注意力的定位或从粗到细的搜索,但它们经常被干扰因素误导,无法定位多个目标。我们的调查将这些失败归因于上下文主导,其中显着的干扰因素压倒了目标注意力并导致定位不准确,以及语义偏差,其中全局语义导致模型专注于最显着的概念,导致多对象场景中的定位不完整。基于这些见解,我们提出了 ActiveScope,这是一个 无需训练 框架,可通过主动寻找和纠正感知来增强 MLLM。 ActiveScope 有两个模块。语义锚定位(SAL)利用细粒度的语义锚来独立定位关键目标,从而减轻语义偏差。干扰抑制细化(ISR)通过抑制对显着干扰的注意力来克服上下文优势来细化定位。对高分辨率图像理解基准的大量实验表明,ActiveScope 优于现有的 无需训练 方法(例如,在 $V^{*}$ Bench 上的准确率为 96.34%),验证了主动搜索和自我校正范例的优越性。我们的代码可在 https://github.com/jasmine-ww/ActiveScope 获取。