论文
Vision SmolMamba:用于节能尖峰状态空间视觉模型的尖峰引导词元修剪
Vision SmolMamba: Spike-Guided Token Pruning for Energy-Efficient Spiking State-Space Vision Models
摘要
Spiking Transformer 通过尖峰驱动的自注意力在远程视觉建模方面表现出了强大的潜力。然而,它们的二次词元交互仍然与尖峰神经计算的稀疏和事件驱动的性质从根本上不一致。为了解决这一限制,我们提出了 Vision SmolMamba,一种节能的尖峰状态空间架构,它将尖峰驱动动力学与线性时间选择性递归相结合。关键思想是尖峰引导时空词元修剪器(SST-TP),它使用尖峰激活强度和首次尖峰延迟来估计词元重要性。该机制逐步删除冗余词元,同时保留显着的时空信息,从而实现词元稀疏性的有效扩展。基于这种机制,所提出的 SmolMamba 模块将尖峰事件直接合并到双向状态空间循环中,形成尖峰状态空间视觉主干,以实现高效的远程建模。在静态和基于事件的基准测试(包括 ImageNet-1K、CIFAR10/100、CIFAR10-DVS 和 DVS128 Gesture)上进行的大量实验表明,Vision SmolMamba 始终能够实现卓越的准确性与效率权衡。特别是,与之前的尖峰 Transformer 基线和尖峰 Mamba 变体相比,它将估计的能源成本降低了至少 1.5 倍,同时保持了竞争力或提高了准确性。这些结果表明,将尖峰引导词元稀疏性与状态空间建模相结合,为尖峰视觉系统提供了可扩展且节能的范例。