论文
使用语音二值化和自我监督学习对韩语幼儿语音进行自动发音评估
Automated Pronunciation Evaluation for Korean Toddler Speech using Speech Diarization and Self-Supervised Learning
摘要
言语障碍影响了大约 44% 的韩国儿科沟通障碍病例,但韩国幼儿言语的自动评估工具仍然不发达。本文提出了一种用于韩语幼儿语音自动发音评估的端到端管道,将神经说话人分类与自监督语音表示学习相结合。我们引入了一个经 IRB 批准的新颖语料库,其中包含 2-5 岁韩语儿童的 53 个录音。 53 个受试者的子集由三位独立审阅者进行注释,产生 1,190 个辅音和 748 个元音单词级二进制正确性标签。我们评估了三种二值化模型,发现 NeMo SortFormer 凭借其按到达时间排序的 Transformer 架构实现了 88.69% 的说话者计数准确率和 33.04% 的二值化错误率 (DER),该架构处理了年轻女性护理人员表现出的撒娇和幼儿言语之间的声学混淆。对于发音评分,我们比较了多种池化策略中的三种自我监督学习 (SSL) 主干。跨模型集成路由辅音预测到 HuBERT-large 和元音预测到 WavLM-large 实现了 0.720 和 0.845 的平衡精度,平均值为 0.782。