论文
UniVoice:语音和歌声生成的统一模型
UniVoice: A Unified Model for Speech and Singing Voice Generation
摘要
文本转语音(TTS)和歌声合成(SVS)都旨在从符号输入生成人声音频,但它们对生成过程提出了不同的要求。语音生成依赖于灵活的、语言驱动的韵律,而歌唱生成则需要明确的旋律控制和准确的节奏对齐。这种不匹配使得训练能够生成自然语音和可控歌唱的单一模型变得具有挑战性,因为与旋律相关的条件应该强烈限制歌唱,但不应该限制语音韵律。我们提出了 UniVoice,一个基于条件流匹配的统一语音和歌声生成框架。 UniVoice 没有使用单一无差别的条件表示,而是将条件分解为内容、旋律和音色,这些内容由适合模态的编码器进行编码,并由共享的 Diffusion Transformer (DiT) 主干使用。对于歌唱,旋律条件由 MIDI 音符序列表示;对于语音,它被替换为学习的空旋律标记,允许模型从语言和声学上下文中推断韵律。这种设计保留了对歌唱的明确旋律控制,同时避免了对语音施加旋律限制的需要。我们进一步分析空旋律标记作为条件流中旋律边缘化的近似。经过 30k 小时的语音和 35k 小时的歌唱数据训练,UniVoice 的语音 PER 达到 5.26\%,与 F5-TTS (5.21\%) 和 CosyVoice3 (5.30\%) 等专用 TTS 系统相当。在歌唱生成方面,UniVoice 的 PER 为 16.22%,优于统一基线 Vevo1.5(24.72%)。