论文

SN-WER:用于多脚本印度语 ASR 评估的脚本标准化 WER

SN-WER: Script-Normalized WER for Multi-Script Indic ASR Evaluation

模型评测评测方法与指标

摘要

单词错误率 (WER) 是自动语音识别 (ASR) 的主要指标,但当引用和假设以不同的脚本对相同的单词进行编码时,它可能会高估错误。此问题在多语言设置中很常见,其中 ASR 模型可能会发出罗马化文本。我们提出了 Script-Normalized WER (SN-WER),这是一种仅评估的 无需训练 评分方法,在计算 WER 之前将参考文本和假设文本音译为特定于语言的规范脚本。我们在 5 种印度语言、2 个数据集和 3 个 ASR 模型上评估 SN-WER。在精心策划的 FLEURS 数据上,SN-WER 将夸大的模型差距减少了高达 12%,而在噪声较大的 Common Voice 数据上,减少幅度较小或不一致,这表明真正的识别缺陷而不仅仅是脚本不匹配。受控压力测试显示,人工罗马化引起的 WER 膨胀衰减了 67%,而词汇替换控制则显示出对语义错误几乎相同的敏感度,Delta SN-WER / Delta WER 约为 1.09。 SN-WER 对音译者选择、规范化变化具有鲁棒性,并且在评估的印度语设置中显示出低于 0.1% 的低标记冲突率。我们认为,SN-WER 应该与 WER 和 CER 一起报告,作为对脚本不敏感的 ASR 评估的配套指标,特别是当转录本馈送到下游搜索、索引或多语言 LLM 管道时。