论文

在全双工语音到语音模型中启用流式用户转录

Enabling Streaming User Transcription in Full-Duplex Speech-to-Speech Models

模型架构新型架构

摘要

全双工语音到语音 (S2S) 模型通过允许同时听和说来实现自然的对话式 AI。然而,这些模型通常缺乏固有的用户语音转录,而这对于对话记录、可访问性功能和质量监控等应用至关重要。在这项工作中,我们提出了一种有效的方法,通过引入与代理文本头并行的轻量级 ASR 头,将流式 ASR 功能添加到现有的双工 S2S 模型中。我们的方法需要最少的额外参数,并且无需对基本 S2S 模型进行重大架构更改,从而实现实时用户转录,同时保留全双工对话功能,包括轮流和打断处理。实验结果表明,我们的方法在双工 S2S 框架内的 HuggingFace Open ASR Leaderboard 上实现了 10.21% 的流平均 WER。此外,我们还表明,与当前的 SOTA 模型相比,作为独立流式 ASR 模型训练的相同架构取得了有竞争力的结果 (7.73% WER)。我们将开源我们的训练和推理代码,以促进联合流式 ASR 和 S2S 建模的进一步研究。