论文

面向低资源现代标准阿拉伯语发音诊断的两阶段融合框架

A Fusion-Aware Two-Stage Framework for Mispronunciation Detection and Diagnosis in Low-Resource Modern Standard Arabic

应用与实践语音识别与转写

摘要

准确识别音素是现代标准阿拉伯语发音错误检测与诊断的基础,但数据稀缺以及合成与真实语音的领域差异限制了效果。本文提出两阶段端到端框架,将预训练编码器与因果空洞时间卷积网络结合,以保留细粒度语音差异。分层两阶段策略先在母语及合成语料上学习通用映射,再适配稀缺的真实学习者数据,以减轻领域偏移并避免过度纠正。多检查点集成推理及N-gram重打分进一步提高预测稳定性。在QuranMB.v2测试集上,系统F1达到0.7201,较基线0.4414相对提高63.1%,在IqraEval.2挑战赛中位居前列。