论文

OpenWER:改进跨语言 ASR 评估并启用基于词元的准确性指标

OpenWER: Improving Cross-Lingual ASR Evaluation and Enabling Token-Based Accuracy Metrics

模型评测评测方法与指标

摘要

深度学习和端到端自动语音识别 (ASR) 的进步使得强大的多语言模型成为可能,但评估指标在评估准确性方面仍然有限。改进或取代常见指标单词错误率 (WER) 的努力通常集中在英语上,从而导致对资源匮乏语言的评估未得到充分探索,并阻碍了公平的跨语言比较。我们推出了 OpenWER,这是一种开源实现,可通过特定于语言的规范化和复合词检测来提高 WER 的稳健性。基于词元的 Levenshtein 对齐保留了补充指标,并允许嵌入元数据以实现精细的准确性分数。我们对 52 种语言的分析表明,与普通库相比,绝对 WER 减少了高达 25%。 OpenWER 通过提高不同语言的 WER 可靠性并实现更全面的准确性评估,为 ASR 研究的公平性做出贡献。