论文

Hallo-Live:具有异步双流和以人为本的偏好的实时流媒体联合音视频头像生成 蒸馏

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

应用与实践内容创作

摘要

实时文本驱动的联合音视频头像生成需要以高保真和精确同步的方式联合合成肖像视频和语音,但现有的视听扩散模型对于交互使用来说仍然太慢,并且在剧烈加速后通常会明显退化。我们推出了 Hallo-Live,这是一种用于联合视听化身生成的流框架,它将异步双流扩散与以人为中心的偏好引导 蒸馏 相结合。为了减少因果生成中的清晰度滞后,我们引入了未来扩展注意力,它允许每个视频块访问同步音频以及短期的未来语音提示。为了减轻少步 蒸馏 的质量损失,我们进一步提出了以人为中心的偏好引导 DMD (HP-DMD),它使用视觉保真度、语音自然度和视听同步的奖励来重新加权训练样本。在两个 NVIDIA H200 GPU 上,Hallo-Live 的运行速度为 20.38 FPS,延迟为 0.94 秒,吞吐量比教师模型 Ovi 高 16.0 倍,延迟低 99.3 倍。尽管有这样的加速,它仍然保持了强大的生成质量,达到了可比的 VideoAlign 总体得分和同步置信度得分,同时在整体质量效率权衡方面优于其他加速基线。定性结果进一步显示了在真实感、多说话者和风格化场景中的强大泛化能力。据我们所知,Hallo-Live 是第一个将流式双流扩散与偏好引导的 蒸馏 相结合的框架,用于实时、文本驱动的视听生成。