论文
当音频语言模型未能利用多模态上下文做构音障碍语音识别
When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition
摘要
自动语音识别(ASR)系统在构音障碍及其他非典型语音上依然脆弱。近期音频语言模型提出了在推理时以额外临床上下文为条件来改进性能的可能,但这些模型能否利用此类信息尚不清楚。我们基于Speech Accessibility Project(SAP)数据集构建基准,测试诊断标签、临床医生给出的言语评级以及逐步丰富的临床描述能否提升构音障碍语音的转写准确率。在九个模型的匹配比较中,我们发现当前模型并未有效利用这些上下文:含诊断与临床细节的提示带来的改进可忽略,且常使词错率恶化。我们以上下文条件微调补充提示分析:用混合临床提示格式做LoRA适配达到0.066的WER,较冻结基线相对降低52%,同时在上下文不可用时保持性能。亚组分析显示唐氏综合征与轻度构音障碍说话人增益显著。这些结果厘清了当前模型的短板所在,并为迈向更包容的ASR提供了测量进展的试验台。