论文

PTS-SNN:用于高效语音情感识别的提示调优时移脉冲神经网络

PTS-SNN: A Prompt-Tuned Temporal Shift Spiking Neural Networks for Efficient Speech Emotion Recognition

模型训练参数高效训练

摘要

语音情感识别(SER)广泛应用于人机交互,但传统模型的高计算成本阻碍了其在资源受限边缘设备上的部署。脉冲神经网络(SNN)凭借其事件驱动特性提供了一种节能替代方案;然而,其与连续自监督学习(SSL)表示的整合在根本上受到分布失配的挑战:高动态范围的嵌入会降低基于阈值的神经元的信息编码能力。为解决这一问题,我们提出提示调优脉冲神经网络(PTS-SNN),一个将冻结的 SSL 骨干网络与脉冲动态对齐的参数高效神经形态适配框架。具体而言,我们引入时移脉冲编码器(Temporal Shift Spiking Encoder),通过无参数的通道移位捕捉局部时间依赖,建立稳定的特征基础。为弥合领域差距,我们设计了情境感知膜电位校准策略。该机制利用脉冲稀疏线性注意力模块,将全局语义上下文聚合到可学习的软提示中,由其动态调节参数化漏积发放(PLIF)神经元的偏置电压。这种调节有效地将异构输入分布居中于响应发放范围内,缓解功能性静默或饱和。在五个多语言数据集(如 IEMOCAP、CASIA、EMODB)上的大量实验表明,PTS-SNN 在 IEMOCAP 上达到 73.34% 的准确率,与有竞争力的 ANN 相当,同时仅需 1.19M 可训练参数和每样本 0.35 mJ 的推理能耗。

PTS-SNN:用于高效语音情感识别的提示调优时移脉冲神经网络
图2:所提出的PTS-SNN框架概览。该架构对来自冻结骨干网络的特征进行三个级联阶段的处理:通过无参数移位捕捉局部依赖的Temporal Shift Spiking Encoder、聚合全局语义上下文的SSLA模块,以及用于情绪分类的SNN Backend。底部面板详细展示了SSLA机制,其中可学习的软提示与稀疏脉冲图交互,生成用于膜电位校准的动态电压偏置。