论文
负责任的 ASR:克服窄带和低资源环境中基础模型的挑战
Responsible ASR: Overcoming Challenges of Foundational Models in Narrow-Band and Low-Resource Settings
摘要
世界范围内的电话对话都是通过窄带信道进行的,并且通常是自发的和口语化的。本文评估了广泛使用的基础自动语音识别 (ASR) 模型(包括开源模型和商业模型)在印地语(一种低资源语言)和印度口音英语(一种低资源口音)的窄带对话中的性能。我们首先在零样本设置中评估这些模型,发现它们的性能在整体上仍然不是最佳的。为了强调 ASR 模型在窄带和低资源语言场景中面临的挑战,我们使用一组有限的现实生活中带注释的录音进一步研究了 微调 开源模型的影响。我们的研究结果表明,虽然 微调 提供了一些改进,但其有效性因语言和口音而异,很大程度上受到预训练期间遇到的数据量的影响