论文

合成对话数据如何影响多人语音识别与说话人分离

Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization

模型训练合成数据

摘要

多说话人语音识别(MT-ASR)与说话人分离(SD)使用合成数据缓解真实大规模对话录音不足,但具体模拟策略的影响尚不清楚。研究提出高效开源模拟器 FastMSS,对 DiCoW 语音识别与 Sortformer 说话人分离系统比较轮流发言动态、源数据域、声学增强和数据混合策略。最优方案高度依赖任务:增加重叠语音改善 ASR,却降低说话人分离表现;广泛的源数据多样性持续优于严格领域匹配。仅合成训练接近真实数据基线,将合成与真实录音结合,则在两项任务中均显著优于仅真实数据训练。