论文

DiTAR+:稳健自回归扩散语音合成的双重优化

DiTAR+: Dual Optimization for Robust Autoregressive Diffusion Speech Synthesis

模型架构Transformer

摘要

连续潜在自回归扩散Transformer (AR-DiT) 模型在零样本语音生成方面表现出了巨大的潜力。然而,在合成长话语或复杂的语言结构时,它们的解码稳定性仍然有限。这种不稳定性主要源于受限的历史感受野和扩散解码器内的声惯性依赖性,这导致模型忽略语义条件。为了应对这些挑战,我们提出了 DiTAR+,一个双重优化框架。首先,我们引入扩张上下文采样来扩展宏观层面的历史感受野,而不违反物理时间连续性,从而防止累积错误传播。其次,我们提出分层声学掩蔽,以防止浅层关注声学前上下文,明确地将语义对齐与声学细节重建解耦。大量的实验表明,我们的框架有效地减少了发音错误和语义幻觉,增强了具有挑战性的句子的生成鲁棒性,并在整个长篇话语中保持了极高的说话者相似度。在语言上具有挑战性的 ZH-Hard 集上,DiTAR+ 将单词错误率从 12.478% 降低到 9.893%,并且在 25 到 35 秒的延长话语中,它将说话者相似度从 0.741 提高到 0.759,同时将单词错误率从 2.778% 降低到 2.173%,优于离散词元和纯流匹配基线。