论文
“抱歉,我没听清”:语音模型如何错漏最要紧的内容
"Sorry, I Didn't Catch That": How Speech Models Miss What Matters Most
摘要
尽管语音识别系统在标准基准上字错率很低,它们在真实部署中却常常在简短的高风险话语上失败。在此,我们在一个高风险任务中研究这种失败模式:转录美国参与者口述的美国街道名称。我们评估了来自OpenAI、Deepgram、Google和Microsoft的15个模型在语言多样的美国说话人录音上的表现,发现平均转录错误率为44%。我们按地理位置量化转录失败的下游影响,结果表明错误转录系统性地给所有说话人造成误差,但非英语母语说话人遭受的路线距离误差是英语母语说话人的两倍。为减轻这种伤害,我们引入一种合成数据生成方法,使用开源文本转语音模型生成命名实体的多样发音。用少于1,000条合成样本微调,即使非英语母语说话人的街道名转录准确率提升近60%(相对基础模型)。我们的结果凸显了语音系统在基准性能与真实世界可靠性之间的关键差距,并展示了一条简单、可扩展的减少高风险转录错误的路径。
