论文

SmoothConv 和 DuplexConv:用于语音交互的补充普通话多方会话语音语料库

SmoothConv and DuplexConv: Complementary Mandarin Multi-Party Conversational Speech Corpora for Speech Interaction

AI 基础设施模型评测应用与实践数据基础设施基准与评测资源语音交互与综合语音服务

摘要

大型音频语言模型(LALM)的最新进展推动了自然和智能语音交互系统的发展。此类系统需要对复杂的对话行为进行建模,包括轮流、重叠语音和说话者协调。多方对话为研究这些行为提供了现实的环境,但现有的普通话对话语料库通常缺乏同步的参与者级语音轨迹和全面的注释。在这项工作中,我们引入了 SmoothConv 和 DuplexConv,这两个互补的普通话多方会话语音语料库,总计 2,100 小时。 SmoothConv 提供经过人工验证的对话,以进行可靠的分析和评估,而 DuplexConv 通过可扩展的管道提供大规模自动注释对话,以进行模型训练。两个语料库都提供同步的参与者级语音轨迹和多维细粒度注释。我们进一步发布了 SmoothConv Benchmark,并对这些资源在语音分离、多说话人自动语音识别(MSASR)、 并轮流检测任务。实验结果证明了所提出的资源对于多方语音交互建模的实用性。数据集、基准测试和相关资源是公开的。