论文

KVoiceBench、KOpenAudioBench 和 KMMAU:用于评估 SpeechLM 的代理驱动的韩语语音基准

KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs

模型评测基准与评测资源

摘要

通过将 大语言模型 (LLM) 扩展到语音模态,语音语言模型 (SpeechLMs) 取得了实质性进展。然而,SpeechLM 评估仍然主要以英语为中心,限制了多语言语音能力的可靠评估。通过 ASR、翻译、规范化和 TTS 进行的直接基准传输可能会破坏特定于语言的指令、答案约束和口语形式;对于音频理解,传输源语言音频也无法保留目标语言说话者的属性、口音和副语言属性。为了解决这些限制,我们提出了两种人类代理基准构建框架:一种将源语言 SpokenQA 基准转换为目标语言 SpokenQA 基准,另一种使用转录和说话者元数据将目标语言 ASR 语料库转换为音频理解基准。使用这些框架,我们构建并公开发布了三个韩语语音基准:用于韩语 SpokenQA 的 KVoiceBench 和 KOpenAudioBench,以及用于韩语音频理解的 KMMAU,总共包含 12,345 个样本。我们评估了最近的八个 SpeechLM,发现英语-韩语性能差距在不同模型和任务系列中存在很大差异,并且 SpokenQA 和音频理解排名也存在差异,揭示了纯英语评估无法看到的互补弱点。