论文
GigaSpeechBench:真实世界的多语言语音到文本基准
GigaSpeechBench: A Real-World Multilingual Speech-to-Text Benchmark
摘要
虽然现代 ASR 系统在高资源基准上实现了低错误率,但这种性能往往高估了现实世界的稳健性。现有的评估孤立地应对挑战,缺乏针对领域术语、年龄差异、方言、口音和资源匮乏语言的统一基准,特别是在中东和东南亚,代表了超过 10 亿被低估的说话者。为了解决这一差距,我们推出了 GigaSpeechBench,这是一个全面的多语言、多维野外 ASR 和 AST 基准,包含 680 小时的人工注释语音。它具有五个模块:(1)12种资源匮乏的中东和东南亚语言,以及具有挑战性的日语和韩语; (2) 6种汉语方言; (3) 6种英语口音; (4)中英文跨12个垂直领域的密集术语; (5) 老年人和儿童的言语。我们还提供 11 种语言的人工注释中英文翻译,以支持 AST 评估。对领先基础模型和商业 API 的广泛评估表明,在这些具有挑战性的环境中,性能显着下降,暴露了关键的评估盲点。