论文

SISER:基于熵的对抗训练的说话人不变语音情感识别

SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training

模型训练监督微调与指令调优

摘要

语音情感识别(SER)面临两个基本挑战:标记数据的稀缺和说话人之间的变异性,这两者都阻碍了情感识别系统的泛化。虽然先前的对抗方法解决了说话人的可变性,但它们在利用强大的预训练表示方面存在不足。我们提出了 SISER(说话人不变语音情感识别),将 wav2vec 2.0 作为特征编码器,将 ECAPA-TDNN 作为说话人鉴别器,集成到基于熵的对抗训练方案中。 wav2vec 2.0 提供了丰富的自监督表示,可以减轻对大型标记数据集的依赖,而 ECAPA-TDNN 可以通过比浅层分类器更强的对抗信号来抑制说话者身份。在 IEMOCAP 上进行评估,SISER 的 UA 达到 60.63%,优于基线(51.15%)和无说话人抑制的 wav2vec 2.0(56.46%),并且 ablation 强调说话人分类器架构的选择是关键因素。