Garrusi 库尔德评估集上未适应的多语言 ASR:通用参考分阶段归一化分析
Unadapted Multilingual ASR on a Garrusi Kurdish Evaluation Set: A Common-Reference Staged Normalization Analysis
摘要
使用输出阿拉伯文字的模型评估以拉丁语正字法书写的库尔德语品种的语音识别,在建模之前会产生一个测量问题:直接评分将书写系统差异视为识别错误。联合标准化参考和假设可以避免这种情况,但也改变了参考标记化,将协议增益与评分分母的变化混合在一起。我使用 Central Kurdish (ckb) 适配器对 MMS-1B-all 进行评估,该适配器在未经改编的情况下使用,针对来自 5 位发言者的 1,722 个 Garrusi 问卷片段(9,763 个参考词标记;117.9 分钟)。我使用通用参考设计:参考被折叠一次并固定为 9,763 个标记,而只有假设表示发生变化。原始阿拉伯文字假设得分为 111.70% WER 和 100.92% CER,精确单词匹配为零。拉丁音译给出 102.36% WER 和 57.89% CER;将其折叠到参考文献的简化正字法中给出 97.85% 和 51.20%。因此,RAW-to-FOLDED 将测得的 WER 降低了 13.85 点,CER 降低了 49.72 点;仅折叠就占 4.51 分和 6.69 分。仍然存在重大错误:14.53% 的参考标记是完全匹配的,编辑以替换为主,并且对于较短的片段,每个片段的 WER 较高。南库尔德微调系统 (aranemini/southern-kurdish-asr) 在相同设计下评分,在每个说话人(1,703 段)上的表现较差,WER 为 109.56%,CER 为 55.85%。然而,12,330 个输出字符落在折叠表之外,因此必须根据更正的固定参考重新计算这些比率。 MMS 输出还包含 613 个未转换或未映射的字符,表明部分残差反映了评分管道限制,而不仅仅是识别。我将根据源语料库共享条款发布固定参考和片段级结果,以支持独立检查。