论文
UniSinger:统一音色克隆歌曲生成与伴奏协同的歌声转换
Towards Unified Song Generation and Singing Voice Conversion with Accompaniment Co-Generation
摘要
虽然歌曲生成和歌声转换(SVC)已经有了显着的发展,但它们长期以来都是孤立发展的:前者缺乏零样本说话人克隆,而后者则忽视了人声伴奏的协同作用。为了弥补这一差距,我们提出了 UniSinger,这是第一个统一说话人克隆歌曲生成和伴奏共生成 SVC 的端到端框架。基于多模态扩散 Transformer,我们构建了一个统一的说话人嵌入空间,将说话人表示从 SVC 转移到歌曲生成,从而实现细粒度的跨任务音色控制。为了缓解多任务优化冲突,我们设计了一种课程学习策略,使用特定于任务的模态掩蔽来引导模型逐渐掌握语义内容、音色和伴奏之间的生成机制。实验显示了这两项任务的最先进性能,并实现了互补优势,为智能音乐制作提供了新的可能性。