论文
语音强调模型是否可以跨语言和情感泛化?
Do Speech Emphasis Models Generalize across Languages and Emotions?
摘要
韵律重点因语言、情感和说话风格而异,但现有的重点检测模型主要是在单语中性朗读语音上进行训练和评估的。我们引入了 MMEE(多语言多情感强调),这是一个包含 10,000 条专业记录的表达性话语(14.13 小时)的语料库,涉及 7 种语言和 34 个情感/风格类别,具有三级感知标签(每个样本 10 个注释)。我们在单语言、跨语言、多语言、跨情感、跨数据集和数据规模设置下对两种最先进的架构进行了基准测试。单语言模型显示出有限的零样本迁移,在类型上相距较远的语言中性能下降,而多语言训练则大大提高了鲁棒性。模型在高唤醒情绪和低唤醒情绪之间稳健地转换;综合基准和感知基准之间的双向转移表明共享的韵律结构;即使在较小的训练规模下,性能也能保持稳健。