论文

更清晰的言论,较弱的概括:重新审视皮特派生的阿尔茨海默病检测基准

Cleaner Speech, Weaker Generalization: Revisiting Pitt-Derived Benchmarks for Alzheimer's Disease Detection

模型评测鲁棒性、公平性与可信度评测

摘要

基于语音的阿尔茨海默病 (AD) 检测越来越依赖于皮特语料库的语音增强和精选版本,其中语音增强、样本选择和人口统计平衡通常被视为有益的预处理步骤。然而,这些转换是否改善了现实世界的 AD 检测,还是影响了模型泛化和预测行为,目前尚不清楚。在这项工作中,我们重新审视了语音预处理和数据集管理在广泛使用的基于语音的 AD 检测基准中的作用。我们评估了不同数据集的语音质量、匹配和不匹配增强设置下多个深度学习模型的跨数据集泛化,以及最近几个大型音频语言模型(LALM)的行为。实验结果表明,在多个监督语音模型中,语音增强数据集通常会提高域内性能,同时降低跨域评估的鲁棒性。训练和测试数据之间的匹配增强可以减轻但不能消除这种退化。 LALM 显示出类似的敏感性:增强的数据集比未处理的数据会导致更强的类别不平衡和预测变化。这些结果表明,语音预处理和数据集管理可以极大地影响下游 AD 检测行为,表明“更干净”的语音数据集对于现实世界的 AD 检测不一定更可靠。