论文

MuLA-Bench:通过多层审核的多语言长格式音频理解基准

MuLA-Bench: A Multilingual Long-Form Audio Understanding Benchmark via Multi-Tier Auditing

模型评测基准与评测资源

摘要

长篇音频表现通常通过上下文长度和总体准确性来概括,从而掩盖了语言、证据和任务如何共同塑造难度。我们推出 MuLA-Bench:1,769 个野外录音中的 5,038 个开放式问题,总计 1,377.9 小时,涵盖 16 种语言和 8 个领域。平衡的语言 x 领域语义轨道支持受控比较,而互补的声学轨道则保留自然发生的非语音证据。基于证据的生成、快捷检查和语言专家审查提供了可审核的问题,而无需翻译共享源集或注入目标声音。我们评估十个音频语言模型,并对固定的八个模型队列进行汇总诊断。语言排名随着领域和任务的不同而变化;声学语义性能差距随所请求的操作而变化;在识别出正确的事件后,时间错误可能仍然存在。远距离检索相对较强,而精确的时钟对准和自然声学事件的事实基础仍然脆弱。因此,MuLA-Bench 揭示了单个长上下文分数无法捕获的条件故障模式。