论文

SEA-LM:可穿戴麦克风阵列的以自我为中心的空间音频理解

SEA-LM: Egocentric Spatial Audio Understanding for Wearable Microphone Arrays

应用与实践语音识别与转写

摘要

以自我为中心的具体智能从根本上要求具有在复杂环境中理解空间音频的能力。虽然大型音频语言模型擅长单通道推理,但它们缺乏空间意识,丢弃了能够实现声音定位并改善重叠声源的解开的关键空间线索。为了解决这个问题,我们提出了 SEA-LM,一种空间音频理解模型。首先,我们介绍 FOACODER,这是一种布局灵活的空间音频编码器,经过训练以源定位和以自我为中心的语音活动检测目标,以通过波束成形对从可变计数、可变位置智能眼镜阵列派生的一阶高保真度立体声响复制进行编码。我们训练多模态大语言模型 (MLLM) 通过跨越六项任务的两阶段课程来理解这些空间音频嵌入,包括在多个扬声器和重叠声音的设置中的声音定位和空间选择性转录。为了防止转录输出主导下一个token预测损失并压倒方向预测,我们引入了时空加权交叉熵损失。在我们的评估集上,与基线相比,SEA-LM 在大多数转录任务上实现了更低的方位角和仰角 MAE、更高的时间 IoU、更低的外部源幻觉和丢失源率以及更低的 WER,同时在 1,211 种具有 4 到 9 个麦克风的智能眼镜阵列配置中保持稳健。

SEA-LM:可穿戴麦克风阵列的以自我为中心的空间音频理解的原论文方法或结果图
图 1:SEA-LM 和 FOACoder 架构概述。 (左)FOACoder:因果变换器编码器摄取多通道复杂频谱图并生成编码空间token。 (右)SEA-LM:一种双路径MLLM,它将冻结的 FOACoder 空间特征与冻结的语义音频编码器相结合,将两者注入LLM中,以对 FOA 音频和文本查询进行联合空间和语义推理。张量维度使用 $B$ 表示批量大小,$F$ 表示 STFT 频率仓,$T$ 表示时间帧,$C$ 表示输入音频通道,$L$ 表示时间补丁的数量或token,$D$ 表示嵌入维度; $P$ 表示时间补丁长度,$N$ 表示变压器块的数量。