论文

GEPARD - 用于实时对话的生成、韵律感知、自回归文本到语音模型

GEPARD - Generative, Prosody-aware, Autoregressive text-to-speech model for Realtime Dialogue

AI 基础设施推理服务

摘要

我们提出了 GEPARD(用于实时对话的生成式、韵律感知、自回归文本到语音模型),这是一种用于实时口语对话的流式文本到语音模型。 GEPARD 使用 LLM 主干网络自回归生成语音 - 文本和音频嵌入在单个仅解码器模型中一起训练 - 并使用基于 FSQ 的神经编解码器将其解码为波形,在文本到达时逐块流式传输音频。我们的中心目标是由标准 LLM 引擎 (vLLM) 提供服务的 TTS 架构,而无需修改其计算内核。这定义了总体设计原则:主干是标准的全注意力 Transformer,而所有重要的辅助机制 - 零样本语音克隆、文本增强和无分类器指导 - 都从自回归解码循环中移出到预填充中,或直接蒸馏到权重中。在流式端到端推理中,单个流的实时系数约为 0.067(比实时快大约 15 倍);在 256 个并发流下,系统在单个服务器级 GPU 上达到约 204 倍的聚合加速。我们详细介绍:(1)vLLM 原生服务的系统级解决方案; (2) 自回归语音解码器的“短片段(short register)”(1-2 个字)故障模式,具有诊断探针和缓解措施; (3) 蒸馏 通过直接偏好优化 (DPO) 将文本的两遍无分类器引导为单遍权重。