论文
通过分层分析了解多语言医疗 ASR 适应
Understanding Multilingual Medical ASR Adaptation Through Layer-Wise Analysis
摘要
医疗自动语音识别 (MedASR) 需要适应专业术语、有限的注释临床数据和多语言用例。尽管 Whisper 等大规模预训练 ASR 模型实现了很强的泛化能力,但除了单词错误率 (WER) 之外,它们在医学和多语言适应后的行为仍然没有得到充分理解。本文研究了多语言医学适应如何通过分层编码器分析重塑 Whisper 模型的内部表示。我们比较了 Whisper 模型大小的零样本解码、仅英语 微调、仅德语诊断 微调、两阶段 EN->EN+DE 延续以及直接 EN+DE 微调。 微调 大幅提高了 MedASR 性能,但最佳模型取决于适应设置:Whisper-Medium 在直接 EN+DE 训练下给出最低的英语 WER (7.72%) 和最低的组合 EN+DE WER (26.30%);仅限德语的 Whisper-Large-v3 提供最低的德语 WER(44.96%),但作为对 86 个单说话人训练话语的语料库内诊断,而不是稳健的概括。对两阶段 Whisper-Small 轨迹的分层分析表明,英语医学 微调 产生主导编码器移位,而多语言延续在很大程度上保留了适应的表示空间。领域和语言信息在各层之间保持高度可恢复性,而线性可恢复的错误预测线索随着 WER 的改进而减弱。