对普什图语多语言语音模型进行基准测试:零样本 ASR、脚本失败和跨域评估
Benchmarking Multilingual Speech Models on Pashto: Zero-Shot ASR, Script Failure, and Cross-Domain Evaluation
摘要
普什图语有大约 60--8000 万人使用,但在任何共享公共测试集上尚未发布多语言自动语音识别 (ASR) 基准。本文报告了第一个针对公共普什图语数据的可重复多模型评估,涵盖零样本 ASR、脚本级故障以及微调模型的跨域评估。对于零样本 ASR,在 FLEURS Pashto 测试集和过滤的 Common Voice~24 子集上评估了十个模型(所有七种 Whisper 大小、MMS-1B、SeamlessM4T-v2-large 和 OmniASR-CTC-300M);零样本 Whisper WER 范围从 90% 到 297%,中等模型在 Common Voice~24 上崩溃至 461%,与解码器循环一致。 SeamlessM4T 在 Common Voice~24 上实现了 39.7% 的 WER(截至提交时迄今为止报告的最佳零样本结果); MMS-1B 在 FLEURS 上达到 43.8%。对于脚本失败,语言识别审核显示,没有任何 Whisper 模型能够在超过 0.8% 的话语中生成普什图语脚本输出,而 MMS-1B、SeamlessM4T 和 OmniASR 的普什图语保真度均超过 93%; WER 本身并不能揭示这种失败,因为在普什图语音频上生成阿拉伯文字输出的模型尚未实现任何可解释意义上的 ASR。对于跨域评估,在两个测试集上评估了五个经过微调的普什图语 ASR 模型:已发布的 WER 数据在分布外集上从 14% 降级到 32.5--59%,而一个增强模型在两个集上均达到 35.1%,且跨域降级为零。字符类错误分层证实了普什图语独特的音素(卷舌音系列和侧擦音)造成了不成比例的错误量。所有评估仅涵盖朗读演讲。确定了累积进展的五个结构性障碍,并提出了五个有序的研究重点。