论文
Firebolt-VL:通过跨模态调制实现高效视觉语言理解
Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation
摘要
多模态 大语言模型 (MLLM) 的最新进展在视觉语言理解方面取得了令人瞩目的进展,但其高计算成本限制了在资源受限场景(例如个人助理、文档理解和智能相机)中的部署。大多数现有方法依赖于基于 Transformer 的交叉注意力,其二次复杂度阻碍了效率。此外,小型视觉语言模型通常难以精确捕获细粒度的、与任务相关的视觉区域,导致细粒度推理任务的性能下降,从而限制了它们在现实世界中的有效性。为了解决这些问题,我们引入了 Firebolt-VL,这是一种高效的视觉语言模型,它用 Liquid Foundation Model (LFM) 解码器取代了基于 Transformer 的解码器。为了进一步增强视觉基础,我们提出了一个词元网格关联模块,它计算文本词元和图像块之间的轻量级相关性,并通过具有 FiLM 条件的状态空间模型进行调制。这使得模型能够有选择地强调与文本提示相关的视觉区域,同时保持线性时间推理。多个基准测试的实验结果表明,Firebolt-VL 实现了准确、细粒度的理解,并显着提高了效率。我们的模型和代码可在以下位置获取:https://fireboltvl.github.io