论文
Spatial-Omni:通过 FOA 编码将空间音频理解集成到多模态 LLM 中
Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding
摘要
最近的多模态 大语言模型 主要将音频处理为单声道信号,从而丢弃空间音频中包含的空间线索,用于声音定位、空间关系推理和空间场景理解。我们提出 Spatial-Omni,这是一种轻量级方法,可实现 SO-Encoder 将一阶高保真度立体声响复制 (FOA) 空间音频作为独立模态注入现有 Omni LLM,而无需修改其原始音频编码器。 SO-Encoder 提供具有有限额外上下文成本的空间标记,并通过高效的分阶段训练提高空间音频理解。为了支持训练和评估,我们根据开源数据、真实录音和模拟构建了 SO-Dataset、SO-QA 和 SO-Bench,其中包含 400K FOA 空间音频片段和 210 万个空间问答对。 SO-Bench 涵盖了 16 个空间音频理解子任务,包括基本检测和位置估计、空间关系理解和复杂空间推理。实验表明,Spatial-Omni 在空间音频理解任务上优于现有的开源大型音频语言模型 (LALM) 和 Omni LLM 模型,同时保留了合理的一般音频理解水平。代码和数据可在 https://github.com/dieKarotte/Spatial-Omni 获取。