论文

VoiceChat-TTS:支持实时打断的低延迟连续语音合成

VoiceChat-TTS: A Low-Latency Continuous Speech Synthesis Model for Interactive Agents

应用与实践内容创作

摘要

口语对话是人机交互的自然形式,但大多数语音语言模型仍然局限于回合制操作,缺乏实时适应性,例如用户插话。最近的双工语音到语音和语音到文本模型通过替换多级管道来减少延迟,但通常会损害语音质量,因为必须联合优化准确的 ASR、中断处理和高保真合成。我们提出了 VoiceChat-TTS,这是一种用于交互式代理的低延迟、连续且可流式传输的文本到语音模型。 VoiceChat-TTS 由 LLM 文本词元流直接驱动,支持通过控制词元的显式中断,并在没有可用文本输入时产生静音。该模型可实现始终在线、响应灵敏的语音生成,同时保持模块化和高语音质量,并且支持中途中断而无需重置 KV 缓存。