论文
纽卡斯尔英语自动语音识别偏差的社会语言学分析
A Sociolinguistic Analysis of Automatic Speech Recognition Bias in Newcastle English
摘要
自动语音识别 (ASR) 系统广泛应用于日常通信、教育、医疗保健和工业领域,但其性能在不同说话者之间仍然参差不齐,特别是当方言变化与训练数据中代表的主流口音不同时。本研究通过对纽卡斯尔英语的社会语言学分析来调查 ASR 偏差。纽卡斯尔英语是英格兰东北部的一个地区变种,已被证明对当前的语音识别技术构成挑战。我们使用泰恩赛德英语历时电子语料库 (DECTE) 中的自发语音来评估最先进的商业 ASR 系统的输出,并对 3,000 多个转录错误进行细粒度分析。错误按语言领域进行分类,并根据社会变量(包括性别、年龄和社会经济地位)进行检查。此外,对选定元音特征的声学案例研究表明了梯度语音变化如何直接导致误识别。结果表明,语音变异是造成大部分错误的原因,反复出现的错误与方言特定特征(如元音质量和声门化)以及当地词汇和非标准语法形式有关。不同社会群体的错误率也有所不同,男性和处于极端年龄范围的说话者的错误频率较高。这些发现表明,ASR 错误不是随机的,而是具有社会模式的,并且可以从社会语言学的角度进行解释。因此,该研究证明了将社会语言学专业知识纳入语音技术评估和开发的重要性,并认为更公平的 ASR 系统需要明确关注方言变化和基于社区的语音数据。