论文
Whisper多阶段适应重度构音障碍说话者
Personalized Automatic Speech Recognition for a Dysarthric and Tracheostomic Speaker using Artificial Conversations
摘要
本文提出一个针对捷克语说话者个性化的自动语音识别(ASR)系统。该说话者有永久气管造口及重度构音障碍,未受训练的听者无法听懂其语音。我们发布包含33小时标注语音的公开数据集,使用兼顾参与感与对话真实感的新型“人工对话”协议采集。我们提出基于Whisper Base的多阶段训练管线,依次在标准捷克语、声学模拟的气管造口语音以及说话者个人数据上微调。在脚本对话、问答和自发对话三种近实时场景中评估,字符错误率相比Whisper Base基线相对降低50%,且对孤立话语的声学识别准确率超过其助手的平均表现。量化结果和说话者反馈表明,即使语音严重受损,也能够建立有帮助的ASR系统。