论文

音频交互模型

Audio Interaction Model

应用与实践语音交互与综合语音服务

摘要

音频是连续且交​​互式的,但大多数大型音频语言模型 (LALM) 仍然处于离线状态,而流媒体系统通常专注于 ASR 或口语对话。我们形式化了音频交互模型,这是一种始终在线的感知-决定-响应范式,可以跟踪上下文,决定是否需要干预,并在不停止聆听的情况下做出响应。我们使用音频交互对其进行实例化,并引入 SoundFlow、耦合流式原生数据构造、理解感知静音/响应监督、双损失训练和异步 FIFO 推理。我们还构建了 textsc{StreamAudio-2M,一个包含 260 万项、30.2 万小时的语料库,涵盖 7 个功能系列和 28 个子任务,以及 Proactive-Sound-Bench。在 8 个基准测试中,音频交互在主流音频任务上保持竞争力,同时实现语音指令的稳健性、长流交互和主动干预。