论文
MGSA:从图像直接合成不同说话人的语音
Monotonicity-Guided Semantic Alignment for Zero-shot Multispeaker Image-to-Speech Synthesis
摘要
直接图像到语音 (Img2Sp) 在将视觉内容映射到有序语音序列方面提出了对齐挑战,因为图像允许多种口头描述并且缺乏与语音序列的单调对应。据我们所知,我们提出单调性引导语义对齐(MGSA),这是第一个零样本多说话人 Img2Sp 合成框架。我们使用语义语音单元为说话者提供共享内容目标,并为说话者调节提供参考语音。查询对齐器通过软单调先验将从视觉内容学习到的语义记忆映射到语音单元位置,从而产生位置特定的调节状态。采用分块掩蔽扩散生成器来根据这些状态生成语音单元。 Flickr8k-Audio 上的实验显示了相对于单说话人基线的竞争性字幕性能,而使用 LibriTTS-R 参考进行的评估支持对看不见的说话人进行零样本合成。消融验证了对准器和块扩散的有效性。音频样本可在 https://alizeded.github.io/mgsa-demo. 获取