论文

用于语音配音和全双工对话合成的无对齐文本音频盒

Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis

应用与实践内容创作

摘要

我们提出了 Alignment-Free Text-Audiobox (Text-AB),这是一个用于高质量语音配音和全双工对话合成的统一框架。 Text-AB 建立在经过流匹配目标训练的 Diffusion Transformer 之上,在三个维度上与 Audiobox 系统不同。首先,它在潜在扩散框架中运行,使用 DAC-VAE 功能,将 48 kHz 波形编码为 25 Hz 潜在序列,提供比以前的 EnCodec 表示高 10 倍以上的压缩率,同时提高再合成质量。其次,Text-AB 是免对齐的:它通过现成的文本编码器使用原始文本,并通过交叉注意力学习文本语音对齐,从而消除了强制对齐和显式持续时间预测的需要。第三,我们大幅扩展模型和数据,在 48 万小时的单语语音上预训练 3B 参数模型,然后在三个下游任务上进行监督 微调:跨语言语音配音、全双工对话合成和情感全双工对话合成。在推理时,Text-AB 支持一次性生成长达约 1 分钟的语音,并通过多扩散方案支持任意长格式的生成,以及基于自动化指标提高质量的多阶段重新排序策略。在现实世界的配音基准上,Text-AB 比最新的内部配音系统进行了重大改进,在韵律相似度、语音相似度、自然度和可共享性方面都有很大的进步。对于全双工对话合成,它接近人类在简短对话中的录音,并且在长篇人类相似性和表现力方面远远优于最新的内部模型,同时对轮流、反向引导和情感动态进行本地建模。对于情感对话合成,情绪调节在无调节基线上显着提高了情绪一致性和情绪交互质量。