论文
COT-TTS:具有思想链推理的音频上下文感知文本转语音
COT-TTS: Audio Context-Aware Text-to-Speech with Chain-of-Thought Reasoning
摘要
最近,文本转语音系统在语音表现力和可控性方面取得了重大进展。然而,生成的语音的说话风格通常依赖于用户指定的明确指令。在自然对话中,说话风格应该从前面的对话上下文中自然推断出来。因此,我们提出了 COT-TTS,一种上下文感知、基于推理的文本转语音任务。给定历史对话音频、目标文本和参考语音,系统应该理解对话上下文,推断出明确的中间推理,并最终合成具有指定音色的目标语音。为了支持这项任务,我们构建了一个大规模双语会话语音数据集,包含 900 万个训练样本,其中包括 100 万个样本的高质量子集。我们进一步构建了一个包含 800 个经过人工验证的样本的源不相交基准,并建立了强大的特定于任务的基线。此外,我们开发了参数大小为 0.6B 和 1.7B 的端到端自回归模型,生成情感标记的转录本、可编辑的语音风格推断和语音标记。实验结果表明,所提出的模型在参数明显较少的情况下实现了与大规模基线系统相当的性能。同时,该模型在时长一致性和情绪一致性方面表现良好,能够根据对话上下文产生适当的情绪、压力和节奏变化。为了方便未来的研究,我们将公开发布数据构建管道、数据集、训练模型和相关资源。演示页面和其他资源可在此 https URL 获取