论文
用于古兰经 ASR 的预训练 Transformer 模型的比较研究:语音表示、标签格式和数据集组成
A Comparative Study of Pretrained Transformer Models for Quranic ASR: Speech Representations, Label Formats, and Dataset Composition
摘要
古兰经自动语音识别(ASR)旨在将古兰经背诵转换为文本,从而支持辅助记忆工具和古兰经搜索引擎等应用。然而,现有的 ASR 模型在用户背诵的经文上经常表现出较高的单词错误率 (WER),并且缺乏对古兰经语料库的全面覆盖。本文使用先进的语音特征提取方法:Wav2Vec2.0、HuBERT 和 XLS-R,对基于 Transformer 的预训练古兰经 ASR 模型的特定领域 微调 进行了系统的实证研究。这些模型通过屏蔽输入音频的部分并使用 Transformer 架构来学习上下文感知语音特征,从而应用自监督学习。预训练模型根据超过 870 小时的专业和用户背诵的过滤古兰经数据集进行微调。通过对特征提取器、输出标签格式、训练策略和剪辑持续时间的全面消融研究,我们确定了影响该领域转录准确性的关键因素。我们性能最佳的配置在 EveryAyah 子集上实现了 0.08 的 WER,在组合 EveryAyah+Tarteel 设置上实现了 0.11 的 WER,这比 Citrinet 基线 (WER = 0.163) 大约提高了 5 个百分点,同时将 模型训练 组合时间从 140 小时减少到 40 小时。没有变音符号的阿拉伯文本会产生最佳的 微调 结果,而 Wav2Vec2-XLSR-53 提供最强的整体表示。未来的工作包括提高数据集质量和开发音素感知模型,以便为 Tajweed 敏感应用程序提取更深层的语音特征表示。