论文
Indic DiarBench:印度语言的多语言联合分类和 ASR 基准
Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages
摘要
在这项工作中,我们介绍了 Indic DiarBench,这是一个涵盖印度所有 22 种预定语言的说话人分类和 ASR 基准数据集。该语料库包含来自近场会议、远场录音和野外音频的约 108 小时的自然多发言者音频。所有注释均经过人工更正,并带有时间对齐的说话人归因转录。该数据集捕获了印度语音中普遍存在的对话细微差别,例如英语代码混合、方言变化和频繁的说话者重叠。为了建立联合 ASR 和分类能力的基线,我们评估了领先的系统,包括商业语音 API 和多模式 大语言模型。 Indic DiarBench 作为开放获取资源发布,旨在推进印度语言的包容性多语言语音技术研究。