论文
Avatar-Forever:解耦并行训练高质量实时无限头像
Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars
摘要
现有的流视频系统通常依赖于以 蒸馏 为中心的顺序训练管道来实现几步长视频生成。然而,这种范式有两个局限性。首先,早期阶段引入的故障或分布变化会影响后期的优化,使收敛的训练过程变得复杂。其次,以 蒸馏 为中心的目标有利于短期生成,但当自回归误差在长程生成过程中累积时,很容易出现质量下降。我们提出了 Avatar-Forever,一个用于高质量实时无限交互式头像的解耦并行训练框架。我们没有将生成效率和长范围鲁棒性耦合在顺序 蒸馏 管道下,而是将它们视为可以并行训练的两个独立功能。一个分支执行全参数 蒸馏 来训练具有高视觉质量的高效生成器,而另一个分支则通过面向恢复的转出训练 (RRT) 来训练轻量级长视野适配器,从而提高了长视野推理条件下的生成鲁棒性。我们的解耦并行训练设计简化了整个训练过程,并避免了少步生成和长期适应之间不必要的客观冲突。我们进一步引入了 ForeverCache,一种分块特征缓存机制,可大大减少流推理期间的冗余历史计算。 Avatar-Forever 基于 22B 视频基础模型构建,支持无限制的音频驱动的头像生成,同时保持身份一致性、运动连贯性和视觉保真度,从而在单个 H100 GPU 上以 27.2 FPS 实现高分辨率 768x512 视频的端到端吞吐量,并为稳定的数字人类提供了一条实用路径。