论文

VAANI:捕捉包容性数字印度的语言景观

VAANI: Capturing the language landscape for an inclusive digital India

模型训练预训练

摘要

基于语音的技术有潜力弥合数字可访问性差距;然而,现有数据集未能捕捉印度语言的语言和区域多样性。我们推出了 VAANI 项目,这是一个大型多模式数据集,旨在代表印度 165 个地区的语言景观。使用基于图像的提示收集语音数据以引发自发反应,而图像则通过涵盖跨区域不同主题的单独管道进行管理。该数据集经过严格的多阶段质量控制流程,结合自动和手动评估,以确保高音频质量和转录准确性。我们发布了来自 28 个州和 3 个联邦领土的 105 种语言的大约 289K 张图像、31,255 小时的演讲和 2,043 小时的转录音频。其中许多语言首次以如此规模呈现,使 VAANI 成为包容性语音技术的基础资源。该数据集支持开发稳健的多语言和多模态模型,并支持语音识别、语言理解和代表性不足的语言的跨模态学习方面的研究。