论文

利用 OpenAI 的 Whisper 表示与注意力池化方法的语音情感识别

Speech Emotion Recognition Leveraging OpenAI's Whisper Representations and Attentive Pooling Methods

模型架构Transformer

摘要

语音情感识别(SER)研究因缺乏标准化且足够大的数据集而长期受限。近期研究利用预训练模型为 SER 等下游任务提取特征。本工作探索 Whisper——一个预训练自动语音识别(ASR)系统——在语音情感识别中的能力,提出两种基于注意力的池化方法:多头注意力平均池化(Multi-head Attentive Average Pooling)与 QKV 池化,用于在保留情感特征的同时高效降低 Whisper 表示的维度。我们在英语和波斯语上开展实验,分别使用 IEMOCAP 和 ShEMO 数据集,并采用 Whisper Tiny 和 Small。我们的多头 QKV 架构在 ShEMO 数据集上取得最先进结果,非加权准确率提升 2.47%。我们进一步比较了 Whisper 不同编码器层的性能,发现中间层在波斯语数据集上的 SER 表现往往更好,为 HuBERT X-Large 这类大得多的模型提供了轻量且高效的替代。我们的发现凸显了 Whisper 作为 SER 表示提取器的潜力,并证明基于注意力的池化在降维上的有效性。

利用 OpenAI 的 Whisper 表示与注意力池化方法的语音情感识别
图1:用于SER的Multi-head Attentive Average Pooling与Multi-head QKV Pooling流水线演示。在使用Whisper编码器提取语音表示后,应用多头池化方法来降低表示矩阵的维度。堆叠的矩形表示注意力头。来自所有注意力头的输出被拼接,随后通过权重矩阵 W o {W^{o}} 进行投影,产生一个最终的256维向量,作为分类器的输入。