论文

Routed Forcing:按区域和噪声阶段蒸馏流式数字人

Where and When to Force: Routed Forcing for Streaming Avatars

摘要

音频驱动的流化身生成需要实时合成具有动态和多样化动作的语音同步视频。 Self Forcing 使用分布匹配蒸馏 (DMD) 将双向视频扩散模型蒸馏为因果、少步生成器,以实现实时流传输。然而,DMD 最大限度地减少了反向 KL 散度,这本质上是寻模态:它导致学生丢弃高动态模式并崩溃到静态输出,从而压缩生成视频的动态和多样性。我们发现这种崩溃是区域异质的:涉及姿势和手势变化的人物区域遭受最大的多样性损失,音频驱动的嘴部区域显示出较小的损失,而背景保持几乎稳定。基于这一观察,我们提出了Routed Forcing,它通过语义区域和噪声阶段路由蒸馏目标,以提高动态性和多样性,同时保持视觉质量。具体来说,(1)Where to Force:语义区域路由将数据强制蒸馏(DFD)应用于多样性崩溃最严重的人物区域,该算法通过真实视频监督学生,同时保留嘴部和背景的DMD以保持唇形同步和场景稳定性。 (2) 何时强制:噪声阶段路由在高噪声阶段激活 DFD,其中真实视频作为有效的监督来注入多样化和动态的运动模式。在低噪声阶段,DMD 用于细化细节,避免真实视频和学生生成视频之间的空间差异造成的模糊和伪影。实验表明,与Self Forcing相比,Routed Forcing可将动态性提高高达 45%,多样性提高 7-25%,同时保持视频质量和唇形同步。

在相同首帧和音频条件下,比较Self Forcing、Data-Forcing Distillation和Routed Forcing的生成结果。
图3(图注摘要):在相同首帧和音频条件下,比较Self Forcing、Data-Forcing Distillation和Routed Forcing的生成结果。