论文
EMODE:以动态专家路由支持情绪感知语音语言模型
EMODE: Dynamic Para-Semantic Experts for Emotion-Aware Speech Language Modeling
摘要
大型语音语言模型在统一的跨模态理解和生成方面表现出了强大的能力,但副语言线索,尤其是情感,仍然难以保留。现有系统通常依赖于纠缠的声学表示,这使得底层语言模型过度依赖于恢复的词汇内容,而不是将其行为建立在声学韵律证据的基础上。我们通过 EMODE 解决了这一限制,EMODE 是一种围绕 动态准语义专家 (DPSE) 构建的情感感知语音语言模型。 DPSE 将连续语音特征分解为语义和副语言路径,动态路由它们,并在集成到语言模型之前将它们融合。为了将这种结构分解转化为功能专业化,EMODE 采用三阶段课程进行训练,包括语义预热、副语言激活和联合细化,并在正交专家指导 (OEG)、语义到声学对齐 (SAA) 和门控多样性正则化 (GDR) 的指导下进行。 SER 测试、移情反应评估和新构建的双语 MEPA 基准的实验表明,EMODE 提高了词汇保真度和情绪敏感性之间的平衡,增强了基于情感的反应生成,并揭示了显式副语义分解对于稳健的跨语料库情绪理解的价值。
