论文
超越可解码性:声学因素是否会驱动基于语音的阿尔茨海默病评估的预测?
Beyond Decodability: Do Acoustic Factors Drive Predictions in Speech-Based Alzheimer's Assessment?
摘要
基于语音的阿尔茨海默病 (AD) 评估越来越依赖于预训练的自我监督学习 (SSL) 模型,该模型直接从原始音频中学习声学表征,使模型暴露于记录因素中。我们询问这些因素是否仅仅编码在 SSL 表示中,或者可以系统地改变预测。使用 ADReSSo 和三个大型 SSL 主干网,我们对参与者的纯语音、非语音和完整录音音频应用受控噪声和混响干预。我们结合分层线性解码、输入和表示空间干预以及几何对齐分析来区分声学可解码性和对 AD 预测的影响。我们的结果表明,受控声学干预会改变所有三个 SSL 主干网的 AD 预测。尽管原始数据中没有显示出显着的诊断组差异,但噪声产生了最强的干预效果。重要的是,这些影响是相对于分类器的决策方向系统地构建的,在保留的测试集上复制,并在表示空间干预方向逆转时逆转。总之,这些发现表明,高预测性能和测量的声学因素不存在显着的诊断组差异不足以保证鲁棒性。我们认为基于干预的鲁棒性测试应该成为值得信赖的临床语音模型的标准。