论文
MOSS-VoiceGenerator:用自然语言描述创建逼真的声音
MOSS-VoiceGenerator: Create Realistic Voices with Natural Language Descriptions
摘要
基于自然语言的语音设计旨在直接从自由形式的文本描述生成说话者的音色,允许用户创建适合特定角色、个性和情感的声音。这种可控的语音创建有利于广泛的下游应用,包括讲故事、游戏配音、角色扮演代理和会话助理,使其成为现代文本转语音模型的一项重要任务。然而,现有的模型主要是根据仔细记录的录音室数据进行训练的,这些数据产生的语音干净且清晰,但缺乏真实人类声音的生活质量。为了解决这些限制,我们提出了 MOSS-VoiceGenerator,这是一种开源指令驱动的语音生成模型,可以直接根据自然语言提示创建新的音色。受到现实世界声学变化会产生更感知自然的声音这一假设的启发,我们对源自电影内容的大规模表达性语音数据进行训练。主观偏好研究表明,与其他语音设计模型相比,其在整体性能、指令遵循性和自然性方面具有优越性。