论文
Vorch-Streamer:将人类视听生成扩展到实时长格式流媒体
Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming
摘要
实时长格式头像音视频生成需要因果、连续的合成,同时保持视听同步和视觉一致性。使预训练的双向模型适应这种设置会遇到两个关键的困境。首先,自回归地重用生成的块作为上下文会产生暴露偏差,导致错误和视觉漂移在长程生成轨迹中累积。其次,当只有有限的本地音频-视频上下文可用时,全局语音话语并不指示因果生成器接下来应该说出哪个部分。我们推出了 Vorch-Streamer,这是一个 后训练 框架,它可以解决这些挑战并实现实时长格式文本到音频视频 (T2AV) 流式传输。我们构建了一个由 80K 个跨度为 12-21 秒的头像剪辑组成的合成语料库,并首先使用混合的教师强迫和扩散强迫来训练因果生成器。然后,我们应用 DMD 蒸馏 的长期自强迫,使模型暴露于其自身生成轨迹的分布,同时保留预训练的双向教师的质量。为了明确控制语音进展,外部语言模型预测离散的 25 Hz 语音规划标记,其连续特征调节音频扩散分支,并将每个因果块与其应该说的内容对齐。借助有界因果上下文和四步去噪,Vorch-Streamer 以 27.12 FPS 的速度联合从文本生成音频和视频,超过 24 FPS 的实时播放速率,同时在长格式生成过程中保持有竞争力的音频口型同步和强大的身份保留。