论文
KoALa-Bench:评估韩语语音理解和 忠实性 的大型音频语言模型
KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness
摘要
大型音频语言模型 (LALM) 的最新进展使得多语言语音理解成为可能。然而,对于非英语语言来说,评估 LALM 的基准仍然很少,韩语就是这样一个尚未得到充分探索的案例。在本文中,我们介绍了 KoALa-Bench,这是一个评估 LALM 的韩语语音理解和语音 忠实性 的综合基准。特别是,KoALa-Bench 包含六项任务。四项任务评估基本语音理解能力,包括自动语音识别、语音翻译、语音问答和语音指令跟踪,而其余两项任务则评估语音 忠实性,其动机是我们观察到一些 LALM 经常无法充分利用语音模态。此外,为了反映韩国特有的知识,我们的基准结合了韩国大学学术能力测试中的听力问题以及涵盖韩国文化领域的内容。我们对六种模型进行了广泛的实验,包括白盒模型和黑盒模型。我们的基准测试、评估代码和排行榜可在 https://ksbench.github.io/Korean-Benchmark/ 上公开获取。