论文

AsymTalker:通过非对称 蒸馏 生成身份一致的长期说话头

AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation

应用与实践内容创作

摘要

基于扩散的头部特写生成已经实现了卓越的视觉质量,但将其扩展到长期视频仍然具有挑战性。广泛采用的块明智范式引入了两个基本故障:(1)静态身份引用和动态音频流之间的时空错位,以及(2)通过块之间自生成的连续性引用传播的级联身份漂移。为了解决这两个问题,我们提出了 AsymTalker,一种新颖的基于扩散的头部说话生成方法,包括时间参考编码 (TRE) 和非对称 知识蒸馏 (AKD)。首先,TRE 通过对时间复制的伪视频进行编码,将静态身份图像转换为时间相干的潜在表示,从而减轻时空错位,而无需引入额外的参数。其次,AKD 解决了块训练中固有的条件困境:使用 真值 引用会导致训练推理不匹配,而自生成的引用会使监督与身份漂移纠缠在一起。我们的非对称设计通过使用 真值 连续性参考锚定教师模型来提供无漂移、块级监督,从而避免教师瓶颈,从而避免了这一问题。同时,学生模型在推理一致的条件下学习,仅以自我生成的参考为条件,并通过分布匹配进行训练,以在长期范围内保持身份。大量实验表明 AsymTalker 在 HDTF 和 VFHQ 上取得了最先进的结果。它保证了600秒视频的高保真、身份一致的合成,并达到66 FPS的实时推理速度。