论文

唇腭裂语音识别的端侧实现与公平性评估

Fairness Evaluation of Edge-AI Implementation for Cleft Lip and Palate Speech ASR

模型评测鲁棒性、公平性与可信度评测

摘要

自动语音识别 (ASR) 对于唇裂和腭裂 (CLP) 患者来说仍然具有挑战性,因为病理语音数据有限,而且不同说话者的语音特征和严重程度存在很大差异。这些识别困难可能会降低基于语音的人机交互的可访问性,特别是当基于云的 ASR 服务不可用或不可靠时。这项工作研究了一种严重性感知且可边缘部署的 ASR 框架,用于使用 Whisper-small 改进 CLP 语音的识别。该模型使用代表轻度、中度和严重条件的正常和 CLP 语音的不同组合以及仅 CLP 的训练配置进行了微调,以检查包含不同严重程度级别如何影响说话者之间的识别性能和公平性。预训练模型产生的合并词错误率 (WER) 和音素错误率 (PER) 值分别为 62.46% 和 52.72%。严重性感知 微调 显着提高了性能,将最佳池 WER 降低至 22.72%,将最佳池 PER 降低至 18.44%。更广泛地表示 CLP 严重性级别的训练还提供了跨严重性组的识别准确性和性能一致性之间的最佳总体平衡。在 NVIDIA Jetson 平台上的部署展示了所有微调模型的实时推理,实时因子为 0.167-0.171,峰值 GPU 内存使用量约为 566 MB。结果表明,在 ASR 适应过程中纳入严重性多样性可以显着提高对 CLP 语音的识别,同时减少不同严重性组之间的性能差异。所提出的方法进一步实现了边缘设备上的低延迟、独立于互联网的语音交互,为患有 CLP 的个人提供更易于访问和更具包容性的基于语音的人机交互。