论文

MambaCount:使用空间稀疏状态空间对偶块进行高效文本引导的开放词汇对象计数

MambaCount: Efficient Text-guided Open-vocabulary Object Counting with Spatial Sparse State Space Duality Block

摘要

文本引导的开放词汇对象计数(TOOC)旨在估计文本提示描述的对象数量,这在具有大规模变化的密集场景中尤其具有挑战性。现有的 TOOC 方法主要依赖于 Transformer,其图像分辨率的二次复杂性限制了其可扩展性。由于其线性复杂性,Mamba 提供了一种有前途的替代方案。然而,以前基于 Mamba 的方法有两个主要局限性。一方面,Mamba 固有的因果表述限制了非因果视觉任务所需的双向空间依赖建模。另一方面,现有的基于 Mamba 的视觉模型经常忽略空间词元响应中不受约束的高熵,这可能会削弱局部细节和高频线索。为了解决这些限制,我们提出了 MambaCount,这是一种基于空间稀疏状态空间对偶 (S^4D) 块构建的高效框架。具体来说,我们分析和重建 Mamba 中隐藏状态的衰减动态,以减轻因果建模引入的依赖性约束。此外,我们引入了空间词元选择(STS)子块,以减少 Mamba 内空间词元响应中不受约束的高熵。此外,我们设计了多粒度原型(MGP)来识别不同语义级别的类似对象区域,从而提高跨模式对齐和可解释性。 FSC-147 上的大量实验表明,MambaCount 在无需二次查询的情况下实现了最先进的性能,获得了 12.23 的测试 MAE,同时保留了线性复杂度。