论文

ImmersiveTTS:具有多模态扩散 Transformer 和特定领域表示对齐的环境感知文本转语音

ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment

应用与实践内容创作

摘要

文本引导音频生成的最新进展在不同领域(包括音效、语音和音乐)产生了有希望的结果。然而,由于声学模式和时间动态的固有差异,与环境音频联合生成语音仍然具有挑战性。我们提出了 ImmersiveTTS,这是一种环境感知文本转语音 (TTS) 模型,可通过显式建模跨模式交互来生成无缝集成在环境上下文中的自然语音。我们的模型建立在多模态扩散 Transformer 的基础上,并通过联合注意力将转录对齐的潜在语音与文本条件的环境上下文融合在一起。为了增强语义一致性,我们引入了针对环境感知 TTS 量身定制的特定领域表示对齐目标,利用来自语音和音频编码器的互补自监督表示。实验结果表明,与客观指标和人类听力测试中的现有方法相比,ImmersiveTTS 实现了更高的自然度、清晰度和音频保真度。