论文

CapTalk:用于单句话和对话语音生成的统一语音设计

CapTalk: Unified Voice Design for Single-Utterance and Dialogue Speech Generation

应用与实践内容创作

摘要

基于自然语言描述的语音设计正在成为文本到语音多模态生成中的一项新任务,旨在不依赖参考音频来合成具有目标音色和说话风格的语音。然而,现有的方法主要集中于单话语的生成,而对话语音设计在很大程度上尚未得到探索。在这项工作中,我们将语音设计扩展到对话中,从而在自然对话设置中实现更好的目标说话者建模和回合表达控制。我们提出了 CapTalk,一个统一的描述条件文本音频自回归框架,适用于单句话和对话语音设计。 CapTalk 使用话语级描述进行单话语语音设计,使用说话者级描述进行对话说话者建模,并进一步在对话中引入 CoT 控制序列,以明确规划回合级动态属性。为了解决稳定的音色保留和上下文自适应表达之间的冲突,我们提出了一种带有话语级说话人编码器的分层变分调节模块,以更好地平衡稳定的音色保留和上下文自适应表达。这样可以实现音色重用,同时保持表达适应当前的话语以及对话中的周围环境。我们还为单句话和对话设置建立了一个全面的评估协议。实验表明,CapTalk 在单话语语音设计基准上实现了最先进的性能,并在多轮对话中提供了更好的表达可控性和上下文适当性。音频样本位于:https://anonymous.4open.science/api/repo/Captalk-D601/file/index.html。