论文

SpikeVLA:具有尖峰神经网络的视觉-语言-动作模型

SpikeVLA: Vision-Language-Action Models with Spiking Neural Networks

模型架构新型架构

摘要

视觉-语言-动作(VLA)模型已成为体现智能的主导范例。然而,大多数现有方法都是建立在大规模 Transformer 之上,导致大量的推理延迟和能耗,限制了它们在低功耗实时场景中的实际部署。我们提出了 SpikeVLA,这是一种尖峰 VLA 架构,用于具有节能推理的具体导航,由三个关键组件组成。 (i) 尖峰视觉编码器 Spike-V,用事件驱动的尖峰层取代密集的连续层,以减少视觉表示学习的能耗。 (ii) 多模态尖峰 大语言模型,Spike-L,利用尖峰动力学和 词元级 事件驱动稀疏性重新表述跨模态推理,以进一步降低计算成本。 (iii) 作为尖峰动作策略网络,Spike-A 采用具有多层全连接 SNN 的拉普拉斯核总体编码,并在低功耗约束下通过节能推理将尖峰活动解码为稳定、鲁棒的连续控制。导航和机器人控制任务的实验表明,SpikeVLA 在保持竞争性能的同时,显着降低了能耗和计算成本,凸显了其低功耗、实时体现智能的潜力。