论文

多语言 ASR 中的脚本崩溃:无参考指标和 100 对基准

Script collapse in multilingual ASR: A reference-free metric and 100-pair benchmark

模型评测评测方法与指标

摘要

单词错误率 (WER) 是自动语音识别的主要指标,但它无法检测系统故障模式:在错误的书写系统中产生流畅输出的模型。我们定义了脚本保真度 (SFR),即目标脚本块中假设字符的分数,无需参考转录即可计算,并在 FLEURS 测试集上报告了跨越六种书写系统和十种模型(七种 Whisper 大小、MMS-1B、SeamlessM4T-v2 和 Gemma 4 E2B)的十种语言的脚本崩溃的系统测量。在 100 个评估的模型语言对中,21 个(21%;95% Wilson CI:14-30%)表现出脚本崩溃(SFR 小于 10%):20 个涉及 Whisper,1 个涉及通用转录提示下乌尔都语上的 Gemma 4 E2B。在十种语言的 Gemma 4 探针中,脚本感知提示将平均 SFR 从 71.2% 提高到 97.7%,修复了乌尔都语崩溃(6.5% 到 97.0%),并在基线 SFR 低于 90% 的六种语言的下游 NLLB 翻译中恢复了 5.9 chrF。我们确定了四种崩溃模式:拉丁语音替换、阿拉伯语替换索马里语、梵文替换孟加拉语/马拉雅拉姆语以及独特脚本拉丁语替换格鲁吉亚语。