论文
BayLing-Duplex:具有单个自回归 LLM 的本机全双工语音对话
BayLing-Duplex: Native Full-Duplex Speech Dialogue with a Single Autoregressive LLM
摘要
实时、全双工语音交互是下一代语音聊天机器人的关键特征,允许模型同时听和说,并处理重叠、犹豫和打断等自然现象。现有的语音语言模型(SpeechLM),例如 LLaMA-Omni 和 GLM-4-Voice 仍然是基于回合的,并依赖外部语音活动检测(VAD)模块来标记用户回合的结束,这从根本上限制了它们的交互能力。在本文中,我们介绍了 BayLing-Duplex,这是一种原生全双工 SpeechLM,其中单个自回归 LLM 决定何时听、何时说话和何时停止,没有辅助轮流模块。该设计仅在标准词汇表中添加了一些特殊标记,因此它可以跨 LLM 进行传输并重用现有的训练和服务堆栈,而无需进行架构调整。从公共 GLM-4-Voice 检查点开始,仅对 微调 使用 400K 全双工样本,然后是轻量级 DPO 阶段,BayLing-Duplex 在 InstructS2S-Eval 上达到 92% 的轮流成功率和 100% 的中断成功率,同时将语音响应得分从 2.17 提高到 3.39,超过 Moshi。 BayLing-Duplex 还匹配或超越了 Llama Questions、Web Questions 和 Alpaca-Eval 上的回合制对应项,这表明同步听和说建模不会牺牲响应质量。