论文
波斯语语音情感识别中 Whisper 的 ASR 适应和表征降维研究
A Study of ASR Adaptation and Representation Dimensionality Reduction in Persian Speech Emotion Recognition Using Whisper
摘要
由于标记数据有限,低资源语言中的语音情感识别(SER)仍然是一个具有挑战性的问题。在这项工作中,我们研究了 Whisper 在波斯语 SER 中的使用,特别关注表示维度降低和特定于语言的模型适应。我们提出了一个 SER 框架,其中使用 PCA 降低了从 Whisper 编码器中提取的帧级嵌入的维度,从而消除了对学习投影层的需求,并大大减少了可训练参数的数量。使用基于注意力的池机制来聚合简化的表示,并使用轻量级预测头进行分类。此外,我们还研究了波斯语自动语音识别 (ASR) 任务上的 微调 Whisper 是否可以提高下游 SER 性能。在与说话者无关的评估协议下在 ShEMO 数据集上进行的实验表明,基于 PCA 的降维持续提高了情绪识别性能,同时减少了训练延迟和内存使用。 ASR 微调 仅对 SER 产生适度的增益,这表明在评估条件下从语言适应到情感相关表征的转移有限。这些发现为有效利用大型预训练语音模型进行低资源语言的情感识别提供了实用的见解。