论文

RelayS2S:面向实时对话的双路径投机生成

RelayS2S: A Dual-Path Speculative Generation for Real-Time Dialogue

模型推理投机采样

摘要

实时语音对话系统面临着延迟和响应质量之间的根本矛盾。端到端语音到语音 (S2S) 模型可以立即响应并自然地处理轮流、反向通道和中断,但会产生语义较弱的输出。级联管道(ASR -> LLM)可提供更强的响应,但代价是延迟随模型大小而增长。我们提出了 RelayS2S,这是一种混合架构,可在转弯检测时并行运行两条路径。快速路径(双工 S2S 模型)推测性地起草一个短响应前缀,该前缀立即流式传输到 TTS 以实现低延迟音频开始,同时继续监视实时音频事件。慢速路径——级联的 ASR -> LLM 管道——生成以提交的前缀为条件的更高质量的延续,从而产生无缝的话语。轻量级的学习验证器控制切换,在适当的时候提交前缀,或者优雅地退回到单独的慢速路径。实验表明,RelayS2S 实现了与 S2S 模型相当的 P90 起始延迟,同时在平均得分中保留了 99% 的级联响应质量,并且随着慢速路径模型的扩展,其优势也在不断增长。由于前缀切换不需要对任何一个组件进行架构修改,因此 RelayS2S 可以作为现有级联管道的轻量级补充。我们的代码和数据可公开获取:https://github.com/mailong25/relays2s

RelayS2S:面向实时对话的双路径投机生成:论文配图
图 1:RelayS2S 的推理时间架构。快速路径(绿色)推测性地起草一个响应前缀,如果验证者提交该前缀,则会立即流式传输到 TTS。慢速路径(棕色)根据提交的前缀生成更高质量的延续,或者在回退时生成完整响应。