论文
Voice-Light:具有因果轮转和推测生成功能的全双工级联语音代理
Voice-Light: A Full-Duplex Cascaded Voice Agent with Causal Turn-Taking and Speculative Generation
摘要
自然的口语交互需要的不仅仅是流式 ASR、语言生成和语音合成:系统必须对重叠做出反应,而不会在每次确认时取消,在确定轮流之前准备响应,并确保取消的音频无法进入对话历史记录。我们推出了 Voice-Light,这是一种全双工级联语音代理,它结合了立即声学起始、共享流式 ASR 编码器的因果适配器、可逆播放控制和私有推测响应生成。结构化工具调用与可听见的桥接语音同时执行,而浏览器确认使渲染的音频具有持久历史的权威性。对 1,673 个真实对话沉默候选者的锁定评估发现,较早学习的完成检查点保留了 2.70% 的错误截止率,但仅达到 12.53% 的回合结束召回率,而 Silero 计时策略的召回率为 95.60%。因此,部署的系统保留了混合控制器,而不是要求使用学习策略替换。在三个无脚本操作员运行的麦克风会话中,36 个测量的响应轮次从最终 VAD 端点到第一个服务器音频的中位数为 758 毫秒; 21 次转弯低于 800 毫秒。这些会议是仪器化案例研究,而不是受控用户评估。我们发布了综合数据、模型工件、评估代码和摘要、源代码以及支持结果的部署配置。