论文
用于语音情感识别的音频语言模型中的即时放大和零样本后期融合
Prompt Amplification and Zero-Shot Late Fusion in Audio-Language Models for Speech Emotion Recognition
摘要
音频语言模型 (ALM) 在理解语音和非语音音频方面取得了长足的进步。然而,领域专家基础模型 (FM) 仍然是语音情感识别 (SER) 等封闭式语音处理任务的最佳选择。使用 ALM 实现零样本 SER 是一种流行的选择,但它们与专家合作实现最先进 (SOTA) 性能的潜力仍有待探索。我们提出了 ZS-Fuse,这是一种后期融合方法,它将双编码器 ALM 的零样本情感估计与专业 FM 相结合。为了处理情绪的模糊性和提示选择的敏感性,1)我们使用一个简单的提示集合,2)提出一种称为提示放大的新技术,它重复音频和文本查询以发现更强的零样本能力。我们通过使用三个双编码器 ALM 和两个 FM 评估 ZS-Fuse 来证明我们技术的有效性,并报告在三个语音情感识别数据集上相对于 SOTA 基线(例如 WavLM-Large)的改进。