论文

通过级联提示和基于 ICL 的在线强化学习增强会话 TTS

Enhancing Conversational TTS with Cascaded Prompting and ICL-Based Online Reinforcement Learning

模型训练强化学习

摘要

对话式人工智能已经取得了重大进展,但生成富有表现力且可控的文本转语音 (TTS) 仍然具有挑战性。具体来说,控制细粒度的语音风格和情绪是出了名的困难,并且通常需要大量带有大量注释的训练数据。为了克服这一数据瓶颈,我们提出了一个可扩展、数据高效的级联框架,它将文本样式标记与人工策划的高质量音频提示配对。这种方法可以单次适应细粒度的说话风格和角色声音。在 TTS 环境中,这种音频提示充当上下文学习 (ICL),指导模型的韵律和音色,而不需要大量参数更新或大规模再训练。为了进一步提高生成质量并减轻幻觉,我们引入了一种新颖的基于 ICL 的在线强化学习 (RL) 策略。该策略使用主观审美奖励直接优化自回归韵律模型,同时受到连接主义时间分类(CTC)对齐的约束以保持可理解性。全面的人类感知评估表明,合成语音的自然度和表现力均得到显着改善,从而确立了我们基于 ICL 的在线 RL 方法的有效性。