论文
SEA-LM:可穿戴麦克风阵列的以自我为中心的空间音频理解
SEA-LM: Egocentric Spatial Audio Understanding for Wearable Microphone Arrays
摘要
以自我为中心的具体智能从根本上要求具有在复杂环境中理解空间音频的能力。虽然大型音频语言模型擅长单通道推理,但它们缺乏空间意识,丢弃了能够实现声音定位并改善重叠声源的解开的关键空间线索。为了解决这个问题,我们提出了 SEA-LM,一种空间音频理解模型。首先,我们介绍 FOACODER,这是一种布局灵活的空间音频编码器,经过训练以源定位和以自我为中心的语音活动检测目标,以通过波束成形对从可变计数、可变位置智能眼镜阵列派生的一阶高保真度立体声响复制进行编码。我们训练多模态大语言模型 (MLLM) 通过跨越六项任务的两阶段课程来理解这些空间音频嵌入,包括在多个扬声器和重叠声音的设置中的声音定位和空间选择性转录。为了防止转录输出主导下一个token预测损失并压倒方向预测,我们引入了时空加权交叉熵损失。在我们的评估集上,与基线相比,SEA-LM 在大多数转录任务上实现了更低的方位角和仰角 MAE、更高的时间 IoU、更低的外部源幻觉和丢失源率以及更低的 WER,同时在 1,211 种具有 4 到 9 个麦克风的智能眼镜阵列配置中保持稳健。
