论文
考试$^2$:$\underline{Ex}tending$ $\underline{A}udio$ $理解$ $$in$ $\underline{M}ultilingual$ $和$ $\underline{M}ultimodal$ $分析$
EXAM$^2$: $\underline{Ex}tending$ $\underline{A}udio$ $Understanding$ $in$ $\underline{M}ultilingual$ $and$ $\underline{M}ultimodal$ $Analysis$
摘要
最近的大型音频语言模型(LALM)在音频理解方面取得了令人瞩目的进展。然而,现有的评估仍然很大程度上局限于英语和狭窄的音频领域。先前的基准测试通常关注单一音频模态,即语音、声音或音乐,限制了对这些模型如何在不同视觉场景中推广的系统研究。在本文中,我们介绍了 EXAM$^2$,它是跨六种语言和多种模式(包括语音、声音、音乐、混合音频设置和视觉图像)的多语言和多模式音频理解的基准。通过将视觉信息与异构音频输入相结合,EXAM$^2$ 可以对场景感知音频推理和跨模式理解进行更真实的评估。 EXAM$^2$ 包括 $5,667$ 多项选择题、$22,614$ 图像实例和 $135,684$ 多语言翻译。我们评估了最先进的开源和专有 LALM 以及多模式 LLM,揭示了多语言和跨模式理解方面的巨大性能差距。此外,我们提出 Gemma3n-EXAM$^2$,一种在 EXAM$^2$-train 上进行微调的轻量级融合模型,在多语言设置中实现了高达 $12.4\%$ 的改进,在多模式评估中在强大的基线上实现了 $21.7\%$ 的增益。实证结果将 EXAM$^2$ 确立为具有挑战性的基准,并开创了未来多语言和多模式音频智能研究的先河。