论文
噪声自适应流媒体视听语音词元增强,用于鲁棒的全双工口语对话模型
Noise Adaptive Streaming Audio-Visual Speech Token Enhancement for Robust Full-Duplex Spoken Dialogue Models
摘要
全双工语音对话系统可以同时听和说,但在背景噪声和重叠语音的情况下,它们的纯音频感知通常会失败,导致响应不连贯。最近的视听对话方法表明,结合嘴唇运动等视觉线索可以提高音频损坏情况下的鲁棒性。然而,现有的方法通常采用大型语音对话模型本身来处理视觉输入,需要昂贵的多模态训练。我们提出了 AV-STE,这是一种模块化流媒体视听前端,可以在噪声音频和唇形视频到达语音 LLM 之前恢复损坏的语义语音标记。下游对话模型仍然完全冻结,保留其预先训练的对话功能。当与冻结的 Moshi 集成时,AV-STE 在相同数据集说话者干扰下将平均 GPT-4o 判断的响应一致性从 1.42 提高到 1.91,同时很大程度上保留了轮流行为。收益还转移到域外无缝交互。