论文
MULTISPEECHQA:用合成语音问答扩展多语言理解
Turning Speech Language Models into Multilingual Listeners
摘要
理解口语问题的语音语言模型 (SLM) 仅支持少数高资源语言,限制了全球数百万人的访问。这种差距源于多语言语音指令调整数据集的稀缺。我们提出了 MULTISPEECHQA,这是一个大规模、合成生成并经过人工验证的数据集,包含 9200 小时的 1080 万个口头问答对,涉及 23 种类型不同的语言。使用 MULTISPEECHQA,我们还引入了 MULTISPEECH-BENCH,这是一个用于评估 23 种语言的 SLM 性能的多任务基准。我们在 MULTISPEECH-BENCH 上将级联系统与开放权重和封闭式 SLM 的性能进行比较,发现级联系统的性能优于开放权重 SLM,但并非所有封闭式 SLM。我们使用 MULTISPEECHQA 来微调 Qwen 2.5-Omni,这提高了其在我们的基准测试中的性能。我们的研究结果表明,高质量的合成数据集为提高 SLM 的多语言能力提供了一种廉价的解决方案。