论文

TBDub:面向制作的视觉配音

TBDub: Production-Oriented Visual Dubbing

摘要

视觉配音必须使嘴部动作与替换语音同步,同时保持身份、外观和时间一致性。尽管 X-Dub 提供了强大的无掩模视频编辑基线,但其在直播和生成视频内容中的应用揭示了生产域鲁棒性、时间和运动稳定性、身份和口头细节保留以及推理效率方面的局限性。我们提出了 \textbf{TBDub},这是 X-Dub 的面向生产的扩展,它将任务自适应 后训练 与任务感知的少步 蒸馏 结合起来。 后训练 使用生产域数据、生产特定的调节和过滤以及增强的音频功能来调整视频 DiT,以获得 30 步教师。 蒸馏使DMD/DMD2适应条件视频编辑,并将Teacher压缩为两步Student。在 38 个 TalkVid 剪辑中,Teacher 比 X-Dub 改进了所有八个报告的重建、感知、身份和同步指标。在 MOS 评估中,它比 X-Dub 提高了口型同步一致性、身份一致性和视觉质量 0.14、0.95 和 0.90 分,而学生获得了最高的口型同步和视觉质量分数,并且在身份一致性方面与教师保持接近。在单个 NVIDIA H20 GPU 上从第一个 VAE 编码到最终 VAE 解码的配对端到端生成时序中,Student 达到了 7.13 有效 FPS,并将总延迟减少了 13.93\times$;仅 DiT 阶段就加速了 $42.49\times$。学生很大程度上保留了教师的生成质量和视听同步。该代码可在 GitHub 上找到,网址为 \https://github.com/TaoLiveAIGC/TBDub,30 步教师权重和两步学生权重可在 Hugging Face 上找到,网址为 https://huggingface.co/TaoLiveAIGC/TBDub。