论文

IRAF:用于抗噪声端到端全双工语音对话系统的抗干扰自适应融合

IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems

应用与实践语音交互与综合语音服务

摘要

全双工语音对话模型允许语音代理同时听和说,从而实现实时重叠的自然交互。然而,联合编码用户和代理流的端到端双通道模型在现实声学环境中可能会降级:泄漏到用户麦克风的干扰说话人可能被编码为用户查询的一部分,破坏 LLM 的调节并导致不稳定的轮流和响应质量下降。我们提出抗干扰自适应融合 (IRAF),这是一种轻量级、流媒体兼容的模块,可逐帧调制用户音频对 LLM 的贡献。 IRAF 根据目标说话者和用户音频嵌入预测标量可靠性门,并在与代理嵌入融合之前重新调整用户表示。 MS-MARCO 和 InstructS2S-200K 上的实验表明,在有干扰说话人的情况下,响应质量和全双工交互都有一致的提高。