论文
MambaVoiceCloning:通过状态空间建模和扩散控制实现高效且富有表现力的文本转语音
MambaVoiceCloning: Efficient and Expressive Text-to-Speech via State-Space Modeling and Diffusion Control
摘要
MambaVoiceCloning (MVC) 询问基于扩散的 TTS 的调节路径是否可以在推理时完全仅使用 SSM,消除跨文本、节奏和韵律的所有注意力和显式 RNN 式重复层,同时在受控条件下保持或提高质量。 MVC 结合了门控双向 Mamba 文本编码器、由训练后丢弃的轻量级对齐教师监督的 Temporal Bi-Mamba 以及具有 AdaLN 调制的 Expressive Mamba,产生具有有限激活内存和实用的有限前瞻流的线性时间 O(T) 调节。与之前在推理时保持混合的 Mamba-TTS 系统不同,MVC 在固定的 StyleTTS2 mel-diffusion-vocoder 主干下删除了基于注意力的持续时间和风格模块。在 LJSpeech/LibriTTS 上进行训练,并在 VCTK、CSS10 (ES/DE/FR) 和长格式 Gutenberg 段落上进行评估,MVC 在 MOS/CMOS、F0 RMSE、MCD 和 WER 方面比 StyleTTS2、VITS 和 Mamba 注意力混合体取得了适度但统计上可靠的增益,同时将编码器参数减少到 21M,并将吞吐量提高了 1.6 倍。扩散仍然是主要的延迟源,但仅 SSM 调节可改善内存占用、稳定性和可部署性。