论文
SwanTale:用于指导和零射击任务的统一多说话人语音和音频生成
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
摘要
动画配音、有声剧、电影、广告、游戏、播客和短视频制作中经常需要语音和音频生成。在这些场景中,创作者可能需要在没有参考录音的情况下设计声音,用自然语言控制说话者风格,用环境和音频效果支持声学场景,然后重用设计的声音。因此,支持多说话人语音和音频生成对于指导任务和零样本任务非常重要。指导任务需要环境描述、说话者风格和细粒度内容,而零样本任务则使用参考音频和相同的细粒度内容。我们从数据和模型方面解决这些任务。首先,我们提出 SwanData-Caption,它可以清理原始语音和音频数据,添加有针对性的合成覆盖范围,并注释多样化且准确的多层音频描述。然后,我们提出了 SwanTale,一种多说话者表达性语音和音频生成模型,支持零样本和指导任务。我们引入 SwanVAE 来支持高质量的多音频模态生成。然后,我们采用奖励条件质量控制和印迹调节,以及统一 MoE 进行多任务和多音频模态建模。此外,我们利用课程学习和GRPO 后训练让模型逐步学习并增强其能力。实验结果表明,SwanTale 在多个关键的零样本和指令指标上处于领先地位,在这两项任务中实现了最佳的表现力分数,并支持涉及多说话者语音和音频的复杂指令生成。演示可以在 https://swanigc.github.io/#swantale 找到。