论文

YingMusicSinger:保留旋律的歌词替换与歌声生成

YingMusic-Singer: Controllable Singing Voice Synthesis with Flexible Lyric Manipulation and Annotation-free Melody Guidance

应用与实践内容创作

摘要

在保持旋律一致性的同时用改变的歌词重新生成歌声仍然具有挑战性,因为现有方法要么提供有限的可控性,要么需要费力的手动对齐。我们提出了 YingMusic-Singer,一种完全基于扩散的模型,可实现旋律可控的歌声合成和灵活的歌词操作。该模型需要三个输入:可选的音色参考、提供旋律的歌唱剪辑和修改后的歌词,无需手动对齐。经过课程学习和群体相对策略优化的训练,YingMusic-Singer 比 Vevo2 实现了更强的旋律保留和歌词依从性,Vevo2 是支持无需手动对齐的旋律控制的最具可比性的基线。我们还推出了 LyricEditBench,这是第一个用于保留旋律的歌词修改评估的基准。代码、权重、基准测试和演示可在 https://github.com/ASLP-lab/YingMusic-Singer-Plus 上公开获取。