论文

用于视频到语音生成的分层编解码器扩散

Hierarchical Codec Diffusion for Video-to-Speech Generation

应用与实践内容创作

摘要

视频转语音 (VTS) 生成旨在从没有听觉信号的无声视频中合成语音。然而,现有的 VTS 方法忽视了语音的层次性质,它涵盖了粗略的说话人感知语义到细粒度的韵律细节。这种监督阻碍了属性匹配过程中特定层次级别的视觉和语音特征之间的直接对齐。在本文中,利用基于残差矢量量化(RVQ)的编解码器的层次结构,我们提出了 HiCoDiT,一种新颖的层次编解码器扩散 Transformer,它利用离散语音词元的固有层次结构来实现强大的视听对齐。具体来说,由于较低层级的词元编码粗略的说话者感知语义,而较高层级的词元捕获细粒度的韵律,因此 HiCoDiT 采用低层级和高层级模块来生成不同级别的词元。低级块以唇同步运动和面部身份为条件来捕获说话者感知的内容,而高级块则使用面部表情来调节韵律动态。最后,为了实现更有效的从粗到细的调节,我们提出了一种双尺度自适应实例层归一化,它通过通道归一化联合捕获全局声音风格,并通过时间归一化捕获局部韵律动态。大量实验表明 HiCoDiT 在保真度和表现力方面优于基线,凸显了 VTS 离散建模的潜力。代码和语音演示均可在 https://github.com/Jiaxin-Ye/HiCoDiT 上获取。