论文
基于音频语言模型概念瓶颈的可解释健康评估
An Audio Language Model-Based Voice Concept Bottleneck Framework for Interpretable Health Assessment
摘要
可解释性对于临床决策支持至关重要。概念瓶颈框架通过将输入表示为人类可理解的概念并仅限制对它们的预测来改进它。然而,关于它们用于基于语音的健康评估的研究仍然有限。在本研究中,我们提出了一种使用音频语言模型(ALM)进行可解释健康评估的语音概念瓶颈框架。 ALM 在语音质量评估数据集上进行微调,以增强其对语音概念的理解,并充当独立的概念提取器,为轻量级下游分类器生成离散的、可解释的分数。离散概念分数提供直观的解释,而轻量级分类器则有助于事后可解释性分析。抑郁症和构音障碍评估任务的结果表明,所提出的框架可以灵活地使语音概念适应不同的健康状况,并且始终优于基于 openSMILE 和基于自我监督语音模型的基线。