论文

超越单词错误率:英语约鲁巴语码交换语音的 ASR 和音频语言模型的切换感知评估

Beyond Word Error Rate: A Switch Aware Evaluation of ASR and Audio Language Models on English Yoruba Code-Switched Speech

模型评测评测方法与指标

摘要

自动语音识别 (ASR) 系统和音频语言模型 (音频 LM) 现在在单语言基准测试中报告的错误率较低,但它们在资源匮乏、变音符号丰富的语言中的代码切换语音的行为仍然缺乏表征。我们使用确定性的 2000 个话语评估集和共享评分管道,对 11 个现代系统(6 个 ASR 模型和 5 个音频 LM)在英语约鲁巴语码转换语音上进行了切换感知评估。除了单词错误率 (WER) 之外,我们还报告交换机本地化诊断:交换机条目标记错误率 (SETER)、窗口切换点错误率、语言特定错误率和不区分变音符号的 WER。我们的主要发现是聚合 WER 隐藏了代码切换行为。 WER(一种 ASR 模型)的最佳系统在统计上与 WER 上领先的音频 LM 没有什么区别,但音频 LM 在每个交换机本地化指标上都明显更好。在忠实的系统中,约鲁巴语标记识别崩溃(几乎所有系统的错误为 0.97),而英语标记的识别效果要好得多,并且错误集中在切换到约鲁巴语时。一些生成式音频 LM 无法作为精确的转录器,产生强烈依赖于提示的翻译、冗长和提示泄漏。我们发布了清单、度量实现和评估脚本,以支持非洲代码交换语音的可重复、开关感知基准测试。