论文

从注释不确定性中学习:用于语音情感识别的熵感知课程

Learning from Annotation Uncertainty: Entropy-Aware Curriculum for Speech Emotion Recognition

模型训练监督微调与指令调优

摘要

语音情感识别 (SER) 通常依赖于消除注释者分歧的硬共识标签。我们使用用于分类情感和维度 VAD 的 WavLM-Base 多任务模型,研究 MSP-Podcast 2.0 上 9 类 SER 的基于分布的监督。将硬标签训练与主要和合并的主要-次要注释者投票分布的目标进行比较。分配目标提高了与人类投票分配的一致性,相对于硬标签训练减少了 JSD/KLD。分析表明,硬监督在一定程度上受益于将模棱两可的话语分配给剩余的其他类,而分布式监督则在情感类别之间重新分配不确定性。熵分层评估表明,高度模糊的话语仍然具有挑战性,但基于分布的监督可以更好地捕捉感知不确定性。这些发现支持超越硬标签,转向反映听众分歧的目标。