论文

myMediWhisper:用于临床对话 ASR 的缅甸医学语音语料库和 Whisper 微调 的构建

myMediWhisper: Construction of Burmese Medical Speech Corpus and Whisper Fine-Tuning for Clinical Dialogue ASR

模型训练监督微调与指令调优

摘要

尽管 Whisper 模型受益于大规模多语言 预训练,但它们在缅甸医学语音上的性能仍然有限。这项工作提出了一个缅甸语医学语音识别框架,该框架建立在由母语人士记录和验证的高质量 28 小时语料库上。我们使用完整的 微调 (FFT) 和参数高效的 微调 (PEFT) 与 LoRA 来微调 Whisper 模型。为了评估鲁棒性,我们在受控噪声和模拟室内声学条件下应用波形和频谱图级数据增强。虽然增强会降低干净语音的性能,但它可以显着提高 FFT 和 PEFT 设置中的噪声和混响环境中的鲁棒性。我们性能最佳的系统,经过完全微调的 myMediWhisper-Medium,无需增强,实现了 23.44% 的最先进的字错误率 (WER),优于更大的通用域微调模型。数据集和其他资源可以在 Huggingface 存储库中找到:https://huggingface.co/datasets/LULab/mediTalk-mm-rdy。