论文

HAMSA:通过 SpectralPulseNet 的免扫描视觉状态空间模型

HAMSA: Scanning-Free Vision State Space Models via SpectralPulseNet

摘要

Vim、VMamba 和 SiMBA 等视觉状态空间模型 (SSM) 依靠复杂的扫描策略来调整顺序 SSM 来处理 2D 图像,从而引入计算开销和架构复杂性。我们提出了 HAMSA,一种直接在谱域中运行的免扫描 SSM。 HAMSA 引入了三个关键创新:(1)简化核参数化——单个高斯初始化的复杂核取代传统(A、B、C)矩阵,消除离散化不稳定性; (2) SpectralPulseNet (SPN)——一种依赖于输入的频率选通机制,支持自适应频谱调制; (3) 频谱自适应选通单元 (SAGU) - 基于幅度的选通,用于频域中的稳定梯度流。通过利用基于 FFT 的卷积,HAMSA 消除了顺序扫描,同时以卓越的简单性和效率实现了 O(L log L) 复杂性。在 ImageNet-1K 上,HAMSA 达到 85.7% 的 top-1 准确率(SSM 中最先进的),推理速度比 Transformer 快 2.2 倍(DeiT-S 为 4.2ms vs 9.2ms),比基于扫描的 SSM 加速 1.4-1.9 倍,同时使用更少的内存(2.1GB vs 3.2-4.5GB)和能源(12.5J 与 18-25J)。 HAMSA 展示了跨迁移学习和密集预测任务的强大泛化能力。