论文
从声音到场景:评估大型音频语言模型中上下文感知听觉场景理解的基准
From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models
摘要
最近的大型音频语言模型(LALM)在跨各个声学层(包括语音、声音和音乐)的音频感知任务中取得了显着的进展。然而,现有的基准主要是孤立地评估这些层,忽略了当多个声源在现实世界的听觉场景中同时出现时出现的复杂的上下文关系。现实世界的听觉解释需要情境感知听觉场景理解(CASU):通过整合声音层来理解整体场景的能力。为了评估这种能力,我们引入了 CASU 基准,该基准评估 Audio LLM 是否可以解释由语音、声学事件(例如公告)和背景环境(例如交通)组成的听觉场景,并推理这些层之间的逻辑关系。我们提出了一种可扩展的管道,用于通过将真实世界场景声音与合成语音组合来构建时间精确的半合成音频流。基于这些数据,我们设计了四个探索场景理解的任务:上下文问答、场景中的实体提取、说话者角色推断以及操作场景的反事实推理。跨多个 LALM 的实验表明,有效的听觉场景理解需要集成所有听觉层,而不是仅仅依赖语音或声音,这强调了 CASU 在 LALM 中推进复杂音频理解的必要性。