VL2Spike:来自 VLM 的尖峰驱动 蒸馏,用于实现人工智能中的低功耗视觉感知
VL2Spike: Spike-driven Distillation from VLMs for Low-Power Visual Perception in Embodied AI
摘要
尖峰神经网络 (SNN) 是受大脑启发的事件驱动模型,通过稀疏尖峰进行计算,可在资源受限的具体人工智能模型中实现高效的视觉感知。具有尖峰自注意力的Spiking-Transformer模型的出现极大地提高了纯SNN的学习能力。尽管 SNN 具有高能效,但其性能仍然受到基于尖峰的架构和优化挑战的限制,因为标准梯度下降规则无法直接应用。最近,视觉语言模型(VLM)显示出丰富的视觉感知多模态知识表示能力。因此,利用 VLM 进行更好的 Spikformer 训练是有希望的。为此,我们提出了 VL2Spike,一种新型的基于尖峰的 知识蒸馏 (KD) 框架,它将来自 VLM 的多模态知识与紧凑的 Spikformer 模型连接起来。这种设计增强了 Spikformer 模型的学习能力,同时保留了其能源效率优点,从而为低功耗机器人感知提供了一条实用途径。我们的 VL2Spike 带来了两项关键技术贡献。为了与尖峰动力学保持一致,我们首先提出时空视觉尖峰(SVS)蒸馏,它实现了(1)VLM图像特征和尖峰标记之间的共享流形对齐,以及(2)膜电位和尖峰速率的热启动时间一致性。然后,我们设计了一种新颖的尖峰原型引导语言 (SPL) 蒸馏 策略,该策略将 Spikformer 的类原型和 logits 与可提示的 VLM 文本嵌入对齐。大量实验表明,VL2Spike 在三个静态数据集上实现了 6.81% 的增益,而能耗仅为 15.7%。它还在机器人视觉位置识别(VPR)方面表现出强大的泛化能力,增益为 6.63%,凸显了其在嵌入式人工智能中低功耗感知的潜力。