论文
DuplexChat:为口语对话语言建模大规模构建说话者分离的全双工对话语音
DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling
摘要
全双工口语对话模型是在会话语音上进行训练的,其中每个说话者都表示为单独的流,但现有的大规模公共语音语料库大多是单声道的,这使得它们不适合 SDLM 训练。我们推出了 DuplexChat,一个用于全双工口语对话模型的开源语料库,以及 DuplexChat-Pipe,一个用于从公共播客源构建说话者分离的全双工对话语音的管道。 DuplexChat-Pipe 过滤特定语言的播客源,检索和清理剧集音频,提取二值化引导的双说话者对话剪辑,并应用语音分离和恢复为每个说话者生成一个通道。运行该管道会生成一个按说话者分离的口语对话语料库,涵盖 282,634 小时的英语和 132,723 小时的日语。 DuplexChat 的分析结果表明,它包含人类对话中存在的轮流动态。