论文

LongAudioSpan:跨越音频理解的持续时间和深度

LongAudioSpan: Spanning the Duration and Depth of Audio Comprehension

模型评测基准与评测资源

摘要

在日益全模态的大型音频语言模型 (LALM) 的驱动下,通用音频理解现在涵盖了从几秒到几小时的语音、声音和音乐。然而,测试它们的基准仍然依赖于几秒钟的片段,其中分数饱和并且模型收敛;最近的长篇作品延长了持续时间,但对长音频的评估与短剪辑的评估类似。我们推出了 LongAudioSpan,这是一个涵盖持续时间和深度的基准:它将 10 分钟到 2 个小时以上的音频与跨越三个认知水平(即感知、理解和推理)的 3,240 个问题配对。有两条路径提供问题,不同之处在于问题内容的来源方式以及 真值 的获取方式。原生 QA 从音频内容中提取问题,将每个问题视为多项选择项和按详细评分标准分级的开放式问题。锚点 QA 而是注入 真值,将声学锚点植入音频中,并构建仅对第一个错误进行评分的感知到推理链。完全自动化的管道通过结构化字幕、QA 生成和对抗性评论家反馈来构建每个项目。在 LongAudioSpan 上评估 12 个 LALM,我们发现推理之前最困难的部分是:从长冗余信号中提取一些相关事实。这种困难随着音频长度的增加而增加,并且在感知上尤其困难,尤其是时间基础。 LongAudioSpan 可在 https://huggingface.co/datasets/holvan/LongAudioSpan 上获取。