论文
为大型音频语言模型加入声学文本特征检测构音障碍
Augmenting Large Audio Language Models with Low-Level Acoustic Features for Dysarthric Speech Detection
摘要
自动构音障碍语音检测可辅助传统临床诊断,后者需要语言治疗师耗时且昂贵的评估。已有自动方法主要依赖深度学习。大型音频语言模型(LALM)近期因多任务强表现成为有潜力的替代方案,但其构音障碍检测应用尚未建立。我们提出一个框架,在录音与包含低层声学特征和说话者人口信息的文本上微调LALM。在两种LALM上,框架优于深度学习基线,其中Qwen2-Audio-Instruct取得最先进表现。消融显示,微调中加入声学特征与人口信息会改善表现,而仅用LALM的零样本结果只有随机水平。这些发现建立了将LALM适应到构音障碍检测的有效方法。