TontaubeV1:使用分层编解码器建模和有界上下文进行流式文本转语音
TontaubeV1: Streaming Text-to-Speech with Hierarchical Codec Modeling and Bounded Context
摘要
文本转语音系统通常面临自然韵律和高效推理之间的权衡:更高的感知质量通常会增加计算成本和延迟。我们推出了 TontaubeV1,这是一种保留自然韵律的模型,同时支持从单个消费级 GPU 进行流式传输。语音由分层 DualCodec 表示以 12.5 Hz 进行编码,它将语义流与连续的声学细化分开。我们的设计假设在生成语义流时很大程度上建立了韵律结构,并相应地分配容量:源自 Qwen3-1.7B 的 Transformer 预测该流,从而预测话语持续时间,而三个逐渐变小的源自 Qwen3-0.6B 的 Transformer 每个都添加一个声学细化。文本按字符而不是按子词进行标记。共享位置处的配对文本和音频标记支持具有有界上下文的长格式生成,并且重叠的 DualCodec 重建被映射到 VibeVoice 声学潜在空间并进行因果解码,从而尽管 DualCodec 具有非因果解码器,仍可实现流式传输。该模型可接受长达一分钟的参考音频进行语音调节,主要针对英语和德语设计,并提供额外的多语言支持。四个预测器总共2.9B个参数;在单个 RTX 5090 上,流传输路径到达第一个音频大约需要 200 毫秒。在单独的非流测量中,一个输入的端到端实时因子 (RTF) 为 0.08,八个并发输入的聚合 RTF 为 0.02。在我们的 LLM-as-a-judge 有声读物阅读基准测试中,TontaubeV1 与 ElevenLabs Flash v2.5 相匹配,并且在韵律方面优于 Fish Audio S2 Pro、2026 年 4 月的 Gradium API 和 Cartesia Sonic 3。模型权重根据 Tontaube 社区模型许可证 1.0 在 Hugging Face 上发布。