论文
清醒开颅手术期间跨说话者构音障碍检测的自我监督语音表征
Self-Supervised Speech Representations for Cross-Speaker Dysarthria Detection During Awake Craniotomy
摘要
在清醒开颅手术期间检测术中言语障碍对于保留语言功能至关重要。然而,自动检测仍然具有挑战性,因为手术室录音包含大量的声学干扰,临床相关的语音事件很少,而且可用的群体很小且不同说话者之间存在异构性。这项研究对清醒开颅手术记录的数据库语料库中区分构音障碍和正常语音的管道进行了系统的组件评估。该管道结合了说话者二值化以隔离患者语音、将手工制作的声学描述符与多层 wav2vec 2.0 嵌入相结合的多视图表示、说话者条件归一化和基于可转移性的特征选择以提高跨说话者的鲁棒性,以及包含梯度增强第一阶段和神经第二阶段的级联分类器。评估是在严格的独立于说话人的条件下使用留一说话人交叉验证进行的。结果表明,跨扬声器性能 语音表示的影响比分类器选择的影响更大。三个分类器的 AUC 相差不超过 4.7%,而用多层自监督表示替换传统的声学描述符,AUC 提高了 18.2%-26.1%。二值化条件特征提取和所提出的分类器级联提供了额外的一致增益。这些发现表明,在资源匮乏的术中环境中,可靠的患者特定语音隔离和强大的预训练表示比增加分类器复杂性更重要。他们还量化了通过针对患者的术前校准可能实现的潜在性能增益。