论文
VITA-QinYu:角色扮演和歌唱的表达性口语模型
VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing
摘要
人类言语传达的表现力超出了语言内容,包括个性、情绪或表演元素,例如安慰的语气或哼唱歌曲,我们将其形式化为角色扮演和唱歌。我们推出了 VITA-QinYu,这是第一个富有表现力的端到端 (E2E) 口语模型 (SLM),它超越了自然对话,支持角色扮演和歌唱生成。 VITA-QinYu 采用混合语音文本范式,通过多码书音频标记扩展交错文本音频建模,这种设计能够实现更丰富的副语言表示,同时保持模态之间的清晰分离以避免干扰。我们进一步开发了一个全面的数据生成管道,以合成总共 15.8K 小时的自然对话、角色扮演和歌唱数据进行训练。 VITA-QinYu表现出了卓越的表现力,在客观角色扮演基准上比同行SLM高出7个百分点,在歌唱5分MOS量表上比同行模型高出0.13分。同时,它实现了最先进的对话准确性和流畅性,在 C3 和 URO 基准上分别超出了之前的 SLM 1.38 和 4.98 个百分点。我们开源代码和模型,并提供易于使用的演示,并提供对流和全双工交互的全栈支持。