论文
通过解缠结的音频填充实现现实环境感知的零样本文本到语音合成
Towards Real-world Environment-aware Zero-shot Text-to-speech Synthesis via Disentangled Audio Infilling
摘要
最近的零样本文本转语音 (TTS) 系统实现了显着的自然度和说话者相似度,但通常需要高质量的说话者提示,并且会剥离或将声学环境与说话者特征纠缠在一起,从而限制了它们在现实世界中的适用性。我们提出了扩展的 DAIEN-TTS,这是一种环境感知的零样本 TTS 框架,可以分解并联合建模语音、背景噪声和混响,从而通过单独的说话人和环境提示实现对音色和声学环境的独立控制。它建立在基于流匹配的 F5-TTS 之上,使用语音环境分离模块将环境语音分解为语音、噪声和混响分量,并将其注入 Diffusion Transformer 中以进行环境感知生成。训练使用通过将干净的语音与噪声和房间脉冲响应混合而构建的模拟数据,以及抑制来自环境分支的说话者信息泄漏的跨说话者调节策略。当真实世界数据可用时,系统可以进一步微调,以弥合模拟域与真实域之间的差距。在推理时,三重分类器无指导机制可以对语音、噪声和混响进行细粒度控制,并且信噪比自适应策略使合成语音与环境提示保持一致。模拟和真实测试集上的实验表明,DAIEN-TTS 生成的环境个性化语音具有高自然度、很强的说话人相似性以及忠实的噪声和混响再现,同时提供超越现有环境感知 TTS 系统的可控性。