小红书 dots 团队开源 dots.tts:20 亿参数全连续自回归端到端 TTS 基座,开放六个检查点与全链路训练代码
小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座
概述
dots.tts 是一个 20 亿参数、全连续、端到端的自回归语音合成模型:跳过离散声学 Token,直接在连续隐空间中做自回归生成。技术上,AudioVAE 两阶段语义化训练(先高保真波形重建 + 正则形成平滑低噪隐空间,再叠加 WavLM 帧级对齐与 ASR/情绪/说话人多任务监督)提供 48kHz、25 FPS 的连续表示(PESQ 4.09、STOI 0.973、SIM 0.969、WER 4.14%),因果 Semantic Encoder 整理长程语义历史以抑制连续误差累积;后训练与推理侧依次用无奖励自纠正对齐形成 SOAR 检查点、MeanFlow 蒸馏到四步、sCM 到两步、Reward-Aware DMD + TTUR 到单步。效果好于对比系统:Seed-TTS-Eval 中英文与中文困难集 WER/CER 分别为 0.94%、1.30%、6.60%,SIM 分别 81.0/77.1/79.5,三子集平均 SIM 79.2、平均 WER/CER 2.95%(基础预训练版本 2.92%),取得论文对比系统中最佳平均说话人相似度与最佳平均内容准确度;MiniMax-Speech 24 语种平均 SIM 83.9、19 个语种单项 SIM 第一;EmergentTTS-Eval 上 SOAR 句法复杂度 65.7%、Base 情绪表现力 72.7%。交互侧支持流式输出与 1T1A 双流:论文给定单卡四步推理条件下普通流式首包延迟 85.4 ms、1T1A 54.4 ms,SGLang-Omni 已支持并优化吞吐(Seed-TTS-Eval EN 单卡最高 16 路并发)。本次共开放六个检查点,训练/推理/微调/蒸馏/双流代码一并开放,许可为 Apache 2.0。