论文

通过零样本语音克隆对构音障碍 ASR 进行低负担数据增强

Low-Burden Data Augmentation for Dysarthric ASR via Zero-Shot Voice Cloning

模型训练合成数据

摘要

由于数据稀缺和说话人之间的高度变异性,自动语音识别对于构音障碍语音仍然不可靠。虽然合成数据可以解决这些差距,但传统方法通常需要大量特定于说话者的数据,从而重新引入收集瓶颈。我们研究零样本语音克隆作为一种低负担增强策略,使用 Higgs Audio V2 克隆 TORGO 数据集中的说话人。我们对克隆数据、真实数据和混合数据进行微调 (FT) Whisper-medium,并对保留的真实语音进行评估。与零样本 (31.62%) 相比,克隆 FT 实现了具有竞争力的 26.00% WER,几乎与真实 FT 和混合 FT 分别达到的 24.44% 和 25.12% 相当。值得注意的是,对于中重度说话人,克隆 FT 和混合 FT 的性能优于真实 FT。 Clone FT 在 SAP-1102 上的跨语料库评估中取得了最好的结果(相对 11.45%)。这些结果表明,零样本克隆提供了可扩展的训练数据,绕过了昂贵的数据收集瓶颈。