论文
Chatterbox-Flash:先验校准的流式扩散语音合成
Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS
摘要
我们提出了 Chatterbox-Flash,这是一种由 微调 获得的零样本文本到语音模型,将预训练的自回归 TTS 解码器转换为块扩散解码器,从而在每个块内实现并行词元生成,同时保留逐块流。我们发现,将主流块扩散解码简单地转移到离散语音标记会降低质量,因为长尾标记分布会使并行位置选择偏向于少数高频标记。为了在不修改架构的情况下缓解这一问题,我们引入了两种推理时间技术:先验校准评分(减去块级边缘词元分布)和早期解码计划(根据校准的置信度自适应地终止迭代)。在标准零样本 TTS 基准上,Chatterbox-Flash 实现了与强自回归和非自回归基线相当的高保真合成,同时支持流式推理,其首包时间与流式 AR 系统相当,并且实时因子显着降低。代码和音频示例可在 https://github.com/resemble-ai/chatterbox-flash 获取。