Luna-TTS 系列技术报告
Luna-TTS Family Technical Report
摘要
现代文本转语音 (TTS) 以自回归 (AR) 编解码器语言模型为主,其从左到右的解码会带来随着话语长度而增长的延迟、沿提交的前缀的错误累积以及强加于残差矢量量化 (RVQ) 词元网格的人工生成顺序。我们提出了 Luna-TTS 系列,这是一种基于扩散语言模型的 TTS 系统,经过 100 万小时的中文、英语、日语和韩语语音预训练。该系列是通过对预训练 AR 文本 LLM 的逐步适应而构建的,从因果到双向,最后到块因果注意力,并包含共享单个标记器、数据管道和 0.6B 主干谱系的两个变体。 Luna-TTS 是完全非自回归的:它以固定数量的并行细化步骤生成整个 RVQ 词元网格,并以零样本语音克隆和语音编辑作为填充本身产生。 Luna-TTS Realtime 通过持续训练得出,在 32 个编解码器帧(1.28 秒)的块上进行自回归,同时对每个块进行并行去噪;它支持 KV 缓存的分块生成和增量音频交付,在预热服务协议下实现了 0.0240 的端到端 RTF 和 41.6 毫秒的本地首块延迟。退火的 微调 阶段增加了对情感和非语言发声 (NVV) 的显式控制,强化学习阶段应用 GRPO,并根据实现的去噪轨迹计算策略比率。在 Seed-TTS-Eval 上,Luna-TTS 在比较开源和商业系统中的所有四个指标上均取得了最佳结果(test-zh 上为 0.73 CER / 79.7 SIM,test-en 上为 1.49 WER / 76.8 SIM);在更难的野外 CV3-Eval 上,在我们的比较中,它的普通话和英语错误率最低。与领先的商业系统相比,它在 NVV 和情绪控制的最客观、基于模型和人类评价的指标上取得了最佳结果。