论文
DynaForcing:克服用于流化头像生成的自强制 蒸馏 中的动态崩溃
DynaForcing: Overcoming Dynamic Collapse in Self-Forcing Distillation for Streaming Avatar Generation
摘要
音频驱动的头像生成需要逼真的口型同步、富有表现力的动作和实时流。最近的工作通过分布匹配 蒸馏 (DMD) 的自强迫实现了后者,但这种范式遇到了一个尚未系统表征的关键失败:动态崩溃,其中学生模型收敛到具有高感知质量的近静态最佳值,但严重抑制了时间动态。我们将其追溯到两个原因:DMD 中的反向 KL 目标,它偏向于低运动模式,以及无锚定的自我调节,它创建了一个放大崩溃的反馈循环。这对于化身来说尤其有害,因为即使是细微的运动损失也会破坏口型同步和表情。为了解决这个问题,我们提出了 DynaForcing,这是一个在不同级别应用三种互补策略的训练框架。具体来说,混合强制在数据级别锚定 真值 动力学,以打破反馈循环。动态感知奖励正则化通过 DMD 的 RL 解释引入显式运动奖励,以抵消损失级别的反向 KL 偏差。参考扰动扰乱参考图像,以将身份与静态细节分离,迫使模型在调节级别依赖音频进行运动。我们进一步引入了计算图剪枝和梯度重放,将自强迫的 GPU 占用量减少了一个数量级以上。实验表明,DynaForcing 将动态恢复到与教师相当的水平(Dyn-Deg:0.31 -> 0.73,Sync-C:7.03 -> 7.68),同时提高视觉质量,解决整个训练过程中的质量与动态权衡,无需提前停止。