论文

交互式 TTS:用于表达性语音合成的动态说话风格适应

Interactive TTS: Dynamic Speaking Style Adaptation for Expressive Speech Synthesis

模型训练偏好优化

摘要

多轮多模态交互中的动态说话风格适应仍然是文本转语音(TTS)系统的主要挑战。现有的上下文感知 TTS (CTTS) 方法通常以端到端的方式将对话上下文映射到语音。这种隐式建模使得上下文风格决策难以监督,而风格、音色和内容的纠缠往往会导致指令跟随性弱和严重的音色漂移。为了克服这些限制,我们提出了交互式 TTS,这是一种动态的、风格自适应的框架,用于生成上下文适当且与说话者一致的语音。交互式 TTS 通过将上下文风格决策显式建模为可执行指令来解耦流程。为了弥合风格决策和语音生成之间的差距,我们引入了迭代拒绝采样微调(迭代 RSFT)和上下文感知直接偏好优化(CADPO),这显着增强了指令跟踪并使生成的语音与会话上下文保持一致。大量实验表明,Interactive TTS 在 VStyle 和 SpeechParaling-Bench 上的性能优于最先进的模型。演示可在此 https URL 获取