论文

RePlay:从语音模型隐藏状态检索预录台词

RePlay: Retrieval-Based Voice Playback for Multi-Turn spoken dialogue

应用与实践语音交互与综合语音服务

摘要

许多语音交互应用程序需要精确控制响应的内容和传递,通常使用预录台词。最近的全双工模型以低延迟响应,但无法保证准确的内容或再现特定的录制表现,而级联系统可能会被限制为预定义的响应,但会增加额外的延迟。我们提出了 RePlay,这是一种改编自 PersonaPlex 的口语对话系统,通过检索和播放预先录制的台词来处理多轮对话。使用探测,我们识别即将到来的响应可恢复的层和帧,并使用此隐藏状态作为检索查询。 RePlay 仅保留到该点的层,并用轻量级轮流和检索头替换文本和语音生成。在模拟多回合采访中,RePlay 的中位延迟为 383 毫秒,比同等对话质量的 ASR-LLM 级联低 3 到 7 倍,但代价是精确台词准确率较低。在一项用户研究中,63% 的参与者更喜欢 RePlay,而对于较小的 LLM 的快速级联,这一比例为 12% (p = 0.008),并且对较慢的级联、较强的 LLM 表现出不显着的偏好 (46% vs. 21%)。

RePlay通过语音模型隐藏状态、轮次判断头和检索头选择预录台词。
图2(图注摘要):RePlay通过语音模型隐藏状态、轮次判断头和检索头选择预录台词。