论文

难以被听到:对语音复杂、资源匮乏的濒危语言进行音素级 ASR 分析

Hard to Be Heard: Phoneme-Level ASR Analysis of Phonologically Complex, Low-Resource Endangered Languages

模型评测模型能力评测

摘要

我们基于分别总计约 50 分钟和 1 小时 20 分钟音频的精选和标准化语音转录资源,对两种资源匮乏且语音复杂的东高加索语言 Archi 和 Rutul 进行自动语音识别 (ASR) 的音素级分析。现有的录音和转录被整合并处理成适合 ASR 训练和评估的形式。我们评估了几种最先进的音频和音频语言模型,包括 wav2vec2、Whisper 和 Qwen2-Audio。对于 wav2vec2,我们引入了具有启发式输出层初始化的特定于语言的音素词汇表,这会产生一致的改进,并在这些资源极少的环境中实现与 Whisper 相当或超过 Whisper 的性能。除了标准的单词和字符错误率之外,我们还进行了详细的音素级错误分析。我们发现音素识别准确度与训练频率密切相关,呈现出特征性的 S 型学习曲线。对于 Archi 来说,这种关系在 Whisper 中被部分打破,指出模型特定的泛化效应超出了训练频率的预测范围。总的来说,我们的结果表明,许多归因于语音复杂性的错误可以通过数据稀缺得到更好的解释。这些发现证明了音素级评估对于理解资源匮乏、类型复杂的语言中 ASR 行为的价值。