论文

MS-Resampler:多范围视觉重采样,实现高效多模态 LLM

MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs

模型架构Transformer

摘要

多模态 大语言模型 (MLLM) 通常采用基于重采样的投影仪将密集的视觉特征转换为紧凑的标记序列以进行语言建模。大多数现有的重采样器通过全局交叉注意力采用单一的、固定的聚合范围,这可能会模糊细粒度的局部证据,并限制在固定的 词元预算 内捕获局部细节和全局上下文的能力。在这项工作中,我们提出了 MS-Resampler,一种用于 MLLM 的多范围视觉重采样框架。 MS-Resampler 通过将显式空间范围先验注入重采样注意力来实例化多个特定范围的重采样器,使每个分支能够以特定粒度从局部到全局聚合视觉信息。然后,这些特定于范围的重采样器的输出被自适应地融合,以产生用于语言建模的最终视觉表示。对十个公共多模态基准进行的广泛实验表明,与传统的单范围重采样器相比,MS-Resampler 持续改进了视觉理解和多模态推理,同时仅引入了最小的计算开销。