论文

Talker-T2AV:使用自回归扩散建模联合说话音频-视频生成

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

应用与实践内容创作

摘要

联合音频-视频生成模型表明,统一生成比级联方法产生更强的跨模式一致性。然而,现有模型通过普遍关注在整个去噪过程中耦合模态,以完全纠缠的方式处理高级语义和低级细节。这对于头部说话合成来说不是最佳的:虽然音频和面部运动在语义上相关,但它们的低级实现(声学信号和视觉纹理)遵循不同的渲染过程。在所有级别上强制联合建模会导致不必要的纠缠并降低效率。我们提出了 Talker-T2AV,一种自回归扩散框架,其中高级跨模态建模发生在共享主干中,而低级细化使用模态特定的解码器。共享的自回归语言模型在统一的补丁级标记空间中对音频和视频进行联合推理。两个轻量级扩散 Transformer 头将隐藏状态解码为帧级音频和视频潜在状态。对说话肖像基准的实验表明,Talker-T2AV 在口型同步精度、视频质量和音频质量方面优于双分支基线,实现了比级联管道更强的跨模式一致性。