论文

SpikingVLA:异步脉冲视觉语言动作模型

SpikingVLA: Asynchronous Spiking Vision-Language-Action Models

模型优化模型推理应用与实践推理加速端侧模型机器人

摘要

ANN 到 SNN 的转换为实现节能尖峰视觉-语言-动作 (VLA) 模型提供了一条实用途径,绕过了从头开始训练大规模 SNN 的巨大成本。然而,现有方法通常需要许多时间步才能保持有竞争力的性能,从而导致实时 VLA 部署出现大量推理延迟。为了应对这一挑战,我们引入了 SpikingVLA,这是一个 ANN 到 SNN 的转换框架,可实现准确且低延迟的尖峰 VLA 推理。具体来说,我们提出了一种树突积分与激发(DIF)神经元,它通过树突混合和自适应体细胞激发来减轻通道激活异常值,从而以更少的时间步实现准确的 ANN 到 SNN 转换。在 DIF 神经元的基础上,我们进一步引入了一种异步执行机制,该机制在 VLA 组件之间重叠时间计算,从而减少同步开销和延迟。大量实验表明,SpikingVLA 实现了有竞争力的导航性能,并大幅提高了推理效率。与现有相比 与尖峰 VLA 方法相比,SpikingVLA 将 SR 和 SPL 分别提高了 11.9\% 和 12.6\%,同时将首次操作延迟降低了 11.2$\times$。这些结果将 SpikingVLA 确立为部署具有高性能和低延迟尖峰推理的预训练 VLA 模型的实用框架。

SpikingVLA:异步脉冲视觉语言动作模型:论文原图
图 1:(a) VLA 组件中明显的激活异常值会增加有限时间步长的尖峰编码错误,从而降低转换精度。 (b) 组件之间的时间范围不一致会导致同步停顿和空闲期,从而增加推理延迟。