论文
规范还是方向?解码 Vision Mambas 以实现高分辨率视觉
Norm or Direction? Decoding Vision Mambas for High-Resolution Vision
摘要
视觉 Mamba 模型用线性复杂性选择性状态空间模型 (SSM) 取代二次自注意力,成为高效的视觉骨干。然而,MambaOut 证明门控 CNN 模块在图像分类方面可以匹配或超过 VMamba,质疑 SSM 用于视觉的必要性。这就提出了一个基本问题:VMamba 和 MambaOut 在表示级别上对视觉信息进行不同的编码吗?为了进行调查,我们应用以跨模型为中心的内核对齐 (CKA) 分析,发现 VMamba 的最后阶段块形成的表示与 MambaOut 及其之前的块明显不同。因此,我们关注最终的块特征,将每个空间标记分解为大小和方向。 MambaOut 将类别歧视信息集中在与 Grad-CAM 归因一致的高标准前景标记中。相比之下,VMamba 主要在背景区域产生高范数标记,与 Grad-CAM 不一致,但主要在标记方向保留区分信号。这些观察结果表明,这两个模型依赖于不同的编码策略。我们将这种差异与高分辨率分类和语义分割联系起来。 VMamba 在对象区域中广泛分布 logits 支持,而 MambaOut 依赖于稀疏的主导词元,这种策略随着词元数量的增长而变得不太稳定。在完整的 微调 分段下,VMamba 始终优于 MambaOut。这些结果表明,VMamba 在密集预测方面的优势不仅源于 SSM 机制或序列长度,还源于语义证据如何跨标记大小、方向进行组织。最终,我们得出的结论是,词元大小和方向结构是改善视觉主干的关键轴,特别是在密集监督下。