论文
AuEmoChat:对话语音合成的真实情感理解和渲染
AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis
摘要
会话语音合成(CSS)旨在在用户与代理交互中合成具有类人情感表达和上下文一致性的语音。由于预定义的情感标签空间有限(例如七个情感类别),现有的 CSS 方法很难呈现真实的人类情感,而多轮对话历史中的冗余多模态标记会干扰上下文理解。为了解决这些问题,我们提出了 AuEmoChat,一个用于真实情感理解和渲染的 CSS 框架。首先,我们开发了 AuEmoCodec,它通过有限标量量化从大规模情感语音中学习离散的真实情感标记空间,从而实现比有限的基本情感类别更真实的情感表示。此外,我们提出了 AuEmoToMe,一种真实情感引导的标记合并算法,该算法合并多模态对话历史中的冗余标记,同时保留情感相关上下文。我们将其集成到自回归文本语音模型中以预测目标真实情感标记和语音标记。最后,我们提出了真实情感流匹配,它通过联合调节合并的对话上下文、目标真实情感和声学先验来呈现语音。对 NCSSD-EmCap 数据集的大量实验表明,AuEmoChat 的性能优于最先进的 CSS 基线,并生成更具表现力和真实的情感语音。代码和语音演示将在以下网址提供:https://github.com/AI-S2-Lab/AuEmoChat。