论文

空间感知缩减框架:迈向高效且忠实的视觉状态空间模型

Spatial-Aware Reduction Framework: Towards Efficient and Faithful Visual State Space Models

摘要

Mamba 在建模长视觉序列方面表现出强大的效率。然而,当词元减少应用于结构增强的 Mamba 变体时,这些模型表现出严重的性能崩溃。我们将这种退化归因于现有还原方法的空间不可知性质,这违反了选择性扫描机制所需的二维结构前提。在这项工作中,我们提出了 STORM,一种空间感知的词元缩减框架,旨在在整个压缩过程中保持结构完整性。 STORM 将简化重新表述为空间单元的结构化操作,强制实施局部约束以保持网格拓扑和邻域一致性。作为一个即插即用的模块,STORM 无需任何训练即可为现有的还原管道提供明确的空间感知。实证结果表明,STORM 在 无需训练 设置下在不同视觉 Mamba 主干上实现了最先进的修剪精度。值得注意的是,STORM 在 VMamba 上实现了显着的精度恢复,在 top-1 精度方面比之前的方法高出高达 63.3%。同时,STORM 比 PlainMamba 的准确率仅下降 1.0%,达到了与 ViT 相当的性能。