论文

跨语料证据锚定:审视认知风险语音筛查的泛化缺口

Why Alzheimer's Speech Screening Fails to Generalize: Bridging the Deployment Gap via Cross-Corpus Evidence Anchoring

模型评测鲁棒性、公平性与可信度评测

摘要

基于语音的筛查是一种有前途的非侵入性方法,用于检测阿尔茨海默病和相关认知风险。然而,在单一领域训练的模型通常很难泛化到看不见的语言、任务或记录协议。本文使用跨四个不同数据集的留一语料库评估来研究这种部署差距。在 70 个可解释的语音和语言特征中,59 个在整个语料库中表现出健康对照组和认知风险组之间的方向冲突,其中停顿、沉默和语速显示出较高的协议敏感性。此外,虽然 XLM-R 文本基线实现了强劲的平均性能,但其 ROC 曲线下面积 (AUC) 在表现最弱的留出测试域上下降至 0.520。标准 GroupDRO 基线在相同协议下达到 0.766 平均说话人 AUC 和 0.504 最差域 AUC。为了解决这个问题,我们提出了一种融合方法,将 XLM-R 文本基线分数与训练期间选择的证据锚点相结合。平衡融合实现了 0.785 的平均说话人 AUC,而提高证据锚点权重的融合将最坏情况下的说话人 AUC 提高到 0.615。这项工作强调了在认知语音筛选中审核特征可转移性并报告最坏情况域稳健性的必要性。

24项核心语音指标在外部语料上的单指标迁移结果。
图3(图注摘要):24项核心语音指标在外部语料上的单指标迁移结果。