论文

使基础 ASR 模型适应构音障碍语音:案例研究

Adapting Foundation ASR Models to Dysarthric Speech: A Case Study

应用与实践语音识别与转写

摘要

自动语音识别 (ASR) 系统在构音障碍语音中通常表现不佳,限制了其在日常交流中对受影响的说话者的用处。本文提出了一种针对构音障碍说话者的个性化 ASR 系统,该系统是通过将基础 ASR 模型适应说话者特定数据而构建的。使用 TEQST 工具,我们收集了 92 小时的朗读语音,随后添加了通过部署的移动应用程序收集的 8.8 小时的用户更正。从Whisper开始,微调在阅读测试集上仅用1.4小时的适应数据就将单词错误率降低到15.8%,在阅读和纠正测试集上分别用22.5小时达到10.7%/16.1%,并且在使用包括阅读测试集上的纠正在内的所有可用数据时取得了9.7%的最佳结果,在纠正测试集上达到了7.8%的最佳结果。使用 LoRA 适应和/或 Qwen3-ASR 作为基础模型在此设置中表现较差。结果表明,个性化的 微调 可以使基础 ASR 模型对构音障碍语音更加有效,并且适合实际部署。