论文
Crab:多层对比监督提高表演和自然语音条件下的语音情感识别
Crab: Multi Layer Contrastive Supervision to Improve Speech Emotion Recognition Under Both Acted and Natural Speech Condition
摘要
由于严重的类别不平衡和自发、自然语音的普遍存在,现实场景中的语音情感识别(SER)仍然具有挑战性。虽然最近的方法利用自监督学习(SSL)表示以及语音和文本的多模态融合,但大多数现有方法仅在最终分类层应用监督,限制了中间表示的判别能力。在这项工作中,我们提出了 Crab(对比表示和多模态对齐瓶颈),这是一种双模态跨模态 Transformer 架构,它集成了 WavLM 的语音表示和 RoBERTa 的文本表示,以及一种新颖的 \textit{多层对比监督} (MLCS) 策略。 MLCS 在网络的多个层注入多重正向对比学习信号,鼓励整个模型中的情感区分表示,而无需在推理时引入额外的参数。为了进一步解决数据不平衡问题,我们在训练过程中采用加权交叉熵。我们在涵盖不同程度的情感自然度的三个基准数据集上评估了所提出的方法:IEMOCAP、MELD 和 MSP-Podcast 2.0。实验结果表明,Crab 在所有数据集中始终优于强大的单峰和多峰基线,在自然和高度不平衡的条件下收益特别大。这些发现强调了 \textit{多层对比监督} 作为通用且稳健的 SER 策略的有效性。官方实现可以在 https://github.com/AI-Unicamp/Crab 找到。