论文
MiDashengLM-Spatial:统一通用音频理解和空间感知
MiDashengLM-Spatial: Unifying General Audio Understanding and Spatial Awareness
摘要
大型音频语言模型(LALM)在一般音频理解方面取得了强大的性能,但大多数都是为单声道输入而设计的,并放弃了空间感知所必需的通道间线索。相比之下,现有的空间音频语言模型是专门为空间任务而构建的,无法利用单声道 LALM 的一般理解能力。据我们所知,我们推出了MiDashengLM-Spatial,这是第一个开源的端到端统一音频语言模型,它在单一架构中支持一般音频理解和空间感知。它通过空间音频编码器 Spatial-Dasheng 扩展了 MiDashengLM,通过分层语义到空间调节模块进行集成,该模块将中间语义表示注入多个深度的空间分支,同时保留原始语义路径。为了大规模提供空间音频语言监督,我们开发了一个数据合成管道,通过场景级空间描述和问答对渲染不同的空间声学场景。实验 表明 Spatial-Dasheng 在现实场景中的声音事件定位和检测方面取得了强大的性能,并且 MiDashengLM-Spatial 在空间理解和推理基准方面大大优于现有的 LALM。同时,它在各种单声道基准上仍然与最先进的 8B 规模 LALM 具有竞争力,这表明可以在不影响一般音频理解的情况下获得空间意识。源代码和模型检查点可在https://github.com/xiaomi-research/midashenglm-spatial和https://huggingface.co/mispeech/midashenglm-spatial.获取