论文

DisSpeech:用于 ASR 增强的低资源可控普通话口吃语音合成

DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation

模型训练合成数据

摘要

口吃语音识别仍然具有挑战性,重复、延长和阻塞等不流畅现象会破坏语音连续性和声学模式。在普通话场景中,由于口吃语音数据的可用性有限,这个问题进一步加剧,这使得针对不同的不流利模式训练鲁棒的 ASR 模型变得困难。为了解决这个问题,本文提出了 DisSpeech,一种基于离散语音标记的框架,用于低资源可控普通话口吃语音合成和 ASR 数据增强。所提出的框架引入了明确的口吃事件标签来控制不同的不流畅模式。通过非自回归屏蔽生成 Transformer 将文本和口吃事件标签映射到语义语音标记,然后通过显式音调和能量建模进行韵律感知声学重建。通过 微调 使用不到 50 小时的普通话口吃语音,DisSpeech 可以生成具有竞争力语音质量的可控口吃语音。实验结果表明,该方法在语音质量和事件可控性方面均优于先前的口吃语音合成方法。此外,合成的口吃语音有效地改进了多个 ASR 模型,Qwen3-ASR-0.6B 在评估的普通话口吃语音识别任务上实现了 4.19% 的最先进的 CER,同时对流利语音仅造成轻微的退化。