论文

克服达罗毗荼语和低资源语言的 Whisper 中的解码器不一致问题

Overcoming Decoder Inconsistencies in Whisper for Dravidian and Low-Resource Languages

模型架构Transformer

摘要

Whisper 等多语言 ASR 模型在高资源语言上表现良好,但与印度-雅利安语言相比,德拉威语言的词错误率 (WER) 明显更高。通过语言和数据集分析,我们表明德拉威语言具有较长的单词、较高的词汇多样性和较低的重复,导致稀疏的标记分布和频繁的字符级替换错误。基线 微调 进一步揭示了解码器在自我注意(语言上下文)和交叉注意(声学线索)之间的不平衡。尽管合成词元重复实验表明了潜在的收益,但它们是不切实际的。受这些观察的启发,我们引入了两个解码器级增强功能:加权注意力(自适应平衡注意力源)和自我调节(重新注入中间预测以提高词元一致性)。实验表明,低资源语言和粘着语言的 WER 一致减少。