论文

DiffuPlex:通过滚动屏蔽扩散加速全双工语音对话模型

DiffuPlex: Accelerating Full-Duplex Spoken Dialog Models via Rolling Masked Diffusion

模型推理应用与实践推理加速语音交互与综合语音服务

摘要

最近的全双工口语对话模型可以同时听和说,但细粒度模型仍然在每个交互帧上以自回归方式推进其骨干网。我们引入了 DiffuPlex,这是一种滚动屏蔽扩散框架,它通过预测单个主干唤醒中的多个未来用户和助理帧来减少这种顺序计算。 DiffuPlex 仅消耗每个预测未来的置信前缀,同时交互以原始帧速率继续。当用户语音到达时,它会检查相应的用户预测,并且当交互出现分歧时,保留已播放的辅助内容,同时仅修改未播放的未来内容。我们考虑针对同一预测器的两种推理策略:DiffuPlex-LISTEN 在预测助理静音时消耗多个未来帧,而 DiffuPlex-SPEAK 也可以消耗预测的助理语音。在全双工交互和口语评估中,DiffuPlex 大大减少了顺序主干计算,同时在很大程度上保留了交互行为和一般功能。 DiffuPlex-LISTEN 和 DiffuPlex-SPEAK 实现了 $1.46\times$ 和 $1.59\times$ 部署路径挂钟加速以及 $1.61\times$ 和 $1.80\times$ 核心 LM 加速,所有测得的主干调用都在 80ms 交互间隔内完成。人类评估表明,LISTEN 保留了语音自然度和会话质量,而 SPEAK 保留了会话质量,但语音自然度有所下降。