论文

TurboTalk:用于一步式音频驱动的说话头像生成的渐进式 蒸馏

TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation

摘要

现有的音频驱动视频数字人类生成模型依赖于多步去噪,导致大量的计算开销,严重限制了它们在现实环境中的部署。虽然一步式 蒸馏 方法可以显着加速推理速度,但它们经常会遇到训练不稳定的问题。为了应对这一挑战,我们提出了 TurboTalk,这是一种两阶段渐进式 蒸馏 框架,可有效地将多步音频驱动视频扩散模型压缩为单步生成器。我们首先采用分布匹配蒸馏来获得强大且稳定的4步学生,然后通过对抗性蒸馏逐步将去噪步骤从4减少到1。为了确保在极端步数减少下的稳定训练,我们引入了渐进式时间步采样策略和自比较对抗目标,该目标提供了稳定渐进式 蒸馏 的中间对抗参考。我们的方法实现了视频说话头像的单步生成,将推理速度提高了 120 倍,同时保持了较高的生成质量。