论文
CosyEdit2:面向语音编辑的强化学习解锁更好的零样本 TTS
CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS
摘要
语音编辑和零样本文本转语音 (TTS) 具有类似的以语音提示为条件的生成基础,但语音编辑要求与周围未编辑的内容具有更严格的局部声学一致性。虽然之前的工作表明监督 微调 (SFT) 使 TTS 模型能够获得功能编辑能力,但这种方法从根本上仍然受到不完美的配对编辑数据和粗粒度优化信号的瓶颈。为了解决这些限制,我们提出了 CosyEdit2,这是一种基于两阶段 后训练 框架构建的语音编辑模型,该模型从监督编辑初始化发展到针对无目标语音数据的面向编辑的组相对策略优化 (GRPO)。大量实验表明,CosyEdit2 不仅大幅提升了语音编辑性能,而且还解锁了更好的零样本 TTS 功能,揭示了两个任务之间更深层次的相互关系。音频样本可在 https://cjy1018.github.io/CosyEdit2 获取。