论文

GlobeAudio:大型音频语言模型自然评估的多语言多文化基准

GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models

模型评测基准与评测资源

摘要

大型音频语言模型 (LALM) 将音频感知和语言理解集成在一个统一的框架内,从而实现广泛的实际应用。尽管最近取得了进展,但相对于现实世界的要求,对 LALM 的评估仍然严重不足:大多数缺乏真正的语言和文化真实性,而另一些则无法捕捉声学真实性。为了弥补这一差距,我们提出了 GlobeAudio,这是一个多语言和多文化基准,旨在评估自然音频理解。 GlobeAudio 包含 5,637 个多项选择题,涵盖六种类型不同的语言,由母语人士根据自然出现的音频精心制作。为了表现出色,模型必须具备更高水平的听觉推理技能和基于文化的解释。我们系统地评估了代表性的闭源和开源 LALM,以及级联 ASR-LLM 管道。我们的实验揭示了自然声学条件下的巨大性能差距,特别是对于开源模型和低资源语言。这些发现凸显了当前 LALM 的关键局限性,并强调了自然音频评估对于未来音频语言系统的重要性。 GlobeAudio 可以在 https://huggingface.co/datasets/iNLP-Lab/GlobeAudio 找到。