论文

超越语音字幕:对话式文本转语音的语音奖励风格规划

Beyond Speech Captions: Speech-Rewarded Style Planning for Conversational Text-to-Speech

模型训练应用与实践强化学习语音交互与综合语音服务

摘要

自然语言风格描述在大语言模型 (LLM) 和可控文本转语音 (TTS) 之间提供了可解释的接口。然而,使用描述作为伪标签将目标声学压缩为文本,并且描述保真度并不意味着对特定合成器的有效控制。我们凭经验表明,语音文本对齐只能弱地预测同一话语的候选指令之间的下游声学相似性。因此,我们提出语音奖励风格规划(SRSP),它通过冻结的下游 TTS 模型训练基于文本的风格规划器。给定对话历史和响应文本,规划器生成候选指令,并通过组相对策略优化(GRPO)进行优化,使用教师强制的目标语音标记的可能性作为奖励。在 ISCSLP 2026 CoT-TTS 语料库的英语子集上,与 Base LLM 和目标音频通知字幕基线相比,SRSP 实现了与目标语音更高的语音风格和情感相似性以及更低的梅尔倒谱失真。基于LLM的表达演讲 评估进一步表明,在情境适当性和参考一致性方面,所有基线均取得了进步。