论文
Vaani Benchmark V1.0:包容性的印地语多模态基准数据集
Vaani Benchmark V1.0: An Inclusive Multimodal Benchmark Dataset for Hindi
摘要
基准测试对于机器学习系统的系统评估至关重要。虽然印地语有几个开源数据集可用,但现有基准在模式、地理多样性、人口统计代表性和转录稳健性方面仍然有限。我们引入了从印度 102 个地区收集的包容性多模式印地语基准数据集。该数据集由使用图像提示引发的自发语音组成,并在不同人口群体的真实声学条件下记录。每个音频片段都与引发它的图像提示相关联,并用三个独立的转录进行注释,从而实现多参考评估,以考虑允许的拼写和词汇变化。我们表明,单参考评估夸大了错误,而多参考评估为自动语音识别(ASR)系统提供了更稳健、更包容、更现实的评估。每个话语与其引发图像的配对进一步使得能够使用语音和文本查询进行图像检索评估。我们评估了用于图像检索的多个多模态嵌入模型,并报告了它们在语音-图像和文本-图像检索组合任务上的性能。结果揭示了基于文本的检索和基于音频的检索之间的性能差距,基于文本的检索始终实现更高的性能。