论文
视觉非因果梯形曼巴:消除具有二阶动力学的视觉 SSM 中的定向扫描
Vision Non-Causal Trapezoidal Mamba: Eliminating Directional Scanning in Vision SSMs with Second-Order Dynamics
摘要
状态空间模型 (SSM) 已成为 Vision Transformer 的替代方案,但大多数视觉 SSM 继承了因果序列建模的定向词元扫描。虽然对于顺序数据有效,但定向扫描引入了空间偏差和方向敏感的表示。我们提出了视觉非因果梯形曼巴(VNCT),这是一种二阶非因果视觉 SSM,它使所有图像词元能够在一次传递中交互,消除直接扫描并实现低单图像推理延迟。 VNCT 表现出更稳健的方向表示,显示图像旋转和翻转下的性能下降减少,同时将边界 IoU 提高高达 3.7 个点,从而实现更准确的边界保留和对象定位。在 ImageNet-1K 分类、COCO 对象检测和实例分割以及 ADE20K 语义分割中,VNCT 始终优于方向扫描视觉 SSM 和一阶非因果 SSM。这些结果表明,定向扫描对于高性能视觉 SSM 来说是不必要的,并且二阶非因果状态空间建模为视觉识别提供了一种简单、高效且稳健的替代方案。