论文

SEA-SpeechBench:东南亚语音理解的大规模多任务基准

SEA-SpeechBench: A Large-Scale Multitask Benchmark for Speech Understanding Across Southeast Asia

模型评测基准与评测资源

摘要

音频和多模态 大语言模型 的快速发展释放了变革性的语音理解能力,但评估框架仍然主要以英语为中心,导致东南亚(SEA)语言的代表性严重不足。据我们所知,我们推出了 SEA-SpeechBench,这是第一个大规模多任务基准测试,它通过 99 个评估集的 97,194 个样本和 597 小时的精选音频数据来评估 11 种 SEA 语言的语音理解。我们的基准测试包括 3 个类别的 9 个不同任务:语音处理(自动语音识别、语音翻译、口语问答)、副语言分析(情感、性别、年龄、说话人识别)和时间理解(一种新颖的维度,具有时间戳内容查询和长达 3 分钟的扩展音频序列内的时间定位)。我们以东南亚本地语言和英语实施多语言提示,以反映用户与音频语言模型的交互。对领先的开源和专有系统的评估揭示了显着的性能差距。在所有模型中,时间理解、情感识别和语音翻译方面的表现仍然不佳。缅甸语和泰米尔语等资源匮乏语言的提示落后于英语高达 41 个百分点。我们的研究结果暴露了关键模型的局限性,并强调了包容性模型开发的必要性。 SEA-SpeechBench 基准测试可在 https://zwenyu.github.io/SEA-SpeechBench/ 上获取。