论文
AptAvatar:快速、生动的长格式音频驱动视频生成,可用于生产就绪的头像
AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars
摘要
生产就绪的音频驱动头像生成需要高效的推理,而不牺牲保真度或运动表现力。然而,现有的加速方法通常会通过限制性的架构选择(例如因果注意力和短时间范围)或降低模型容量和分辨率来损害质量。如果没有这样的妥协,我们提出 AptAvatar,一个 14B 参数的长格式音频驱动的头像生成框架,可以提供快速且富有表现力的推理。为了提高生产级应用程序的效率,AptAvatar 解决了极端的两步生成挑战。为了弥补多步教师模型和两步学生模型之间的差距,我们引入了端点锚定分布 蒸馏。它通过在由冻结的预训练 4 步桥生成器定义的轨迹端点分布上进行训练的专用锚点分数估计器来增强普通分布匹配。这为不断发展的两步学生提供了一个可达到的终点级锚点。为了提高长期一致性,我们进一步引入了自生成历史重放,它在分块训练期间重用早期生成器检查点的缓存输出作为历史条件。这近似于对自生成历史记录的推理时间条件,无需昂贵的在线生成轨迹,从而减轻了累积历史错误造成的质量下降。大量实验表明,AptAvatar 只需 2 个 NFE 即可生成生动的 720p 长格式头像视频,实现了 60 倍的加速,同时保持了视觉保真度和长视域身份。代码可在 https://github.com/TaoLiveAIGC/AptAvatar 获取