论文
Contextual Earnings-22:带有自定义词汇的语音识别基准
Contextual Earnings-22: A Speech Recognition Benchmark with Custom Vocabulary in the Wild
摘要
语音转文本系统的准确性前沿已在学术基准上趋于稳定。1 相反,工业基准和高风险领域的采用却表明情况并非如此。我们假设两者之间的主要区别在于上下文调节:学术基准以经常遇到的一般词汇为主,与罕见的和上下文定义的自定义词汇相比,这些词汇相对容易识别,而罕见的和上下文定义的自定义词汇对语音记录的可用性产生了不成比例的影响。尽管上下文语音转文本方面取得了进展,但还没有标准化的基准。我们引入了 Contextual Earnings-22,这是一个基于 Earnings-22 构建的开放数据集,具有现实的自定义词汇上下文,可促进研究并揭示潜在进展。我们为两种主要方法设定了六个强大的基准:关键字提示和关键字提升。实验表明,当从概念验证扩展到大规模系统时,两者都达到了可比较的且显着提高的准确性。