论文

通过老年人 ASR 语音合成增强老年人语境数据

Elderly-Contextual Data Augmentation via Speech Synthesis for Elderly ASR

模型训练合成数据

摘要

尽管自动语音识别 (ASR) 最近取得了进展,但由于训练数据有限以及老年人语音独特的声学和语言特征,老年人 ASR (EASR) 仍然具有挑战性。在这项工作中,我们通过数据增强管道解决 EASR 中的数据稀缺问题,该管道将基于 大语言模型 (LLM) 的转录释义与文本转语音 (TTS) 合成相结合。给定老年人语音数据集,LLM 首先生成原始转录本的老年人语境释义,然后 TTS 模型使用老年人参考说话者合成相应的语音。生成的合成音频文本对与原始数据合并,以在无需架构修改的情况下对 Whisper 进行微调。我们进一步分析了低资源 EASR 中增强比率和参考说话人组成的影响。对 70 岁及以上说话人的英语和韩语老年人语音数据集的实验表明,所提出的方法比传统的增强基线持续提高性能,与 Whisper 基线相比,单词错误率 (WER) 降低了 58.2%。