论文

印度之声:印度现实世界语音识别的大型基准

Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India

模型评测基准与评测资源

摘要

现有的印度语 ASR 基准通常使用脚本化的、干净的语音和排行榜驱动的评估,从而鼓励特定于数据集的过度拟合。此外,严格的单一引用 WER 会惩罚印度语言中的自然拼写变化,包括代码混合的英语起源单词的非标准化拼写。为了解决这些限制,我们引入了 Voice of India,这是一个闭源基准测试,由涵盖 139 个区域集群的 15 种主要印度语言的无脚本电话对话构建。该数据集包含 36691 名说话者的 306230 条话语,总计 536 小时的语音,并包含拼写变化的文字记录。我们还分析了地区一级的地理表现,揭示了差异。最后,我们提供了音频质量、语速、性别和设备类型等因素的详细分析,突出了当前 ASR 系统的困境,并为改进现实世界的印度语 ASR 系统提供了见解。