论文

ABMAMBA:多模态 大语言模型 具有对齐的分层双向扫描,可实现高效视频字幕

ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning

摘要

在本研究中,我们重点关注完全开放的多模态 大语言模型 (MLLM) 的视频字幕。视觉序列的理解具有挑战性,因为它们复杂的时间依赖性和大量的序列长度。现有基于 Transformer 的方法的核心注意力机制与序列长度成二次方缩放,这使得它们的计算量令人望而却步。为了解决这些限制,我们提出了对齐分层双向扫描 Mamba (ABMamba),这是一种完全开放的 MLLM,具有线性计算复杂性,可实现视频序列的可扩展处理。 ABMamba 扩展了深度状态空间模型作为其语言骨干,取代了昂贵的二次注意力机制,并采用了一种新颖的对齐分层双向扫描模块,可以跨多个时间分辨率处理视频。在 VATEX 和 MSR-VTT 等标准视频字幕基准测试中,ABMamba 表现出与典型 MLLM 相比具有竞争力的性能,同时实现了大约三倍的吞吐量。