论文

基于查询的跨模态投影仪支持 Mamba 多模态 LLM

Query-based Cross-Modal Projector Bolstering Mamba Multimodal LLM

模型架构混合架构

摘要

Transformer 的输入长度的二次复杂度给 大语言模型 (LLM) 带来了不可持续的计算负载。相比之下,选择性扫描结构化状态空间模型(Mamba)有效地解决了这一计算挑战。本文探讨了一种基于查询的跨模式投影仪,旨在通过交叉注意机制压缩基于输入的视觉标记,从而提高 Mamba 视觉语言建模的效率。这款创新型投影仪在将原始图像特征转换为 Mamba LLM 的输入序列时,也无需手动设计原始图像特征的 2D 扫描顺序。各种视觉语言理解基准的实验结果表明,所提出的跨模态投影仪增强了基于 Mamba 的多模态 LLM,从而提高了性能和吞吐量。