论文
马斯喀特:多语言、科学对话基准
MUSCAT: MUltilingual, SCientific ConversATion Benchmark
摘要
多语言语音技术的目标是促进不同语言的个体之间的无缝沟通,创造就好像每个人都是多语言使用者的体验。为了创造这种体验,语音技术需要解决几个挑战:处理混合的多语言输入、特定词汇和语码转换。然而,目前没有数据集对这种情况进行基准测试。我们提出了一个新的基准来评估当前的自动语音识别(ASR)系统是否能够应对这些挑战。该基准包括多个发言者之间对科学论文的双语讨论,每个发言者都用不同的语言进行交谈。我们提供了一个超越单词错误率 (WER) 的标准评估框架,可以对不同语言的 ASR 性能进行一致的比较。实验结果表明,所提出的数据集对于最先进的 ASR 系统仍然是一个开放的挑战。该数据集可在 https://huggingface.co/datasets/goodpiku/muscat-eval 中获取。关键词:多语言、语音识别、音频分割、说话人二值化