论文
评估基于音素的自动语音识别系统中的偏差:IPA 转录模型分析
Evaluating Bias in Phoneme-Based Automatic Speech Recognition Systems: An Analysis of IPA Transcription Models
摘要
随着自动语音识别 (ASR) 系统转向多语言支持和低资源语言建模,基于音素的层成为与语言无关的关键基础。然而,大多数对与种族、年龄、性别和口音相关的 ASR 人口统计偏差的评估都集中在基于标准字素的 ASR 系统,而相对较少强调基于音素的系统。在这项研究中,我们评估了 WhisperIPA 和 ZIPA 的性能,这两个是生成国际音标 (IPA) 转录的最先进的开源系统。我们的评估包括现有的多语言语音语料库和人口统计注释的英语语料库,使用标准音素错误率 (PER) 和提议的允许语言上相似音素替换的软 PER 指标,将模型生成的 IPA 转录与字素到音素 (G2P) 系统进行比较。我们的分析研究了不同语言、性别、口音、种族和年龄之间表现的差异,揭示了即使在考虑了可接受的音位变化后仍然存在的差异。这些发现虽然有限,但提供了对潜在偏见来源的深入了解,并为开发更具包容性和语言稳健性的基于音素的 ASR 系统提供了信息。我们的代码和数据是公开的。