论文
FlowTTS-GRPO:基于流匹配的文本转语音的多目标奖励优化在线强化学习
FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech
摘要
现有的文本转语音 (TTS) 强化学习 (RL) 研究主要集中在 大语言模型 (LLM),而流匹配 (FM) 尚未得到充分探索。我们推出了 FlowTTS-GRPO,这是一个基于 FM 的 TTS 的在线 RL 框架。通过将常微分方程 (ODE) 轨迹转换为随机微分方程 (SDE) 路径,我们的方法无需辅助模型即可直接实现开源 FM 模型的 微调。我们证明加权奖励组合比概率方案收敛得更快,并确定了三种实用的优化:在训练期间省略无分类器指导(CFG)可加速收敛;合成硬壳提高了坚固性;将强化学习应用于 FM 组件可以增强音频细节指标。 CosyVoice 3.0 和 F5-TTS 上的实验表明,说话者相似性和感知质量方面的客观和主观偏好有所提高,F5-TTS 还提高了清晰度。