论文

Vorch-Human:通过长视野延续的统一多任务以人为中心的生成

Vorch-Human: Unified Multi-Task Human-Centric Generation via Long-Horizon Continuation

模型架构Transformer

摘要

以人为中心的视听生成涵盖了几个密切相关的任务:通过驾驶语音对人进行动画处理,根据语音参考联合生成语音和视频,以及根据配对的外观和语音参考合成场景。现有系统通常使用单独的模型来解决这些任务,即使它们共享相同的目标模式并且主要不同之处在于提供观察结果作为条件。我们推出了 Vorch-Human,这是一个建立在双流音频-视频扩散Transformer上的统一的以人为中心的生成框架。 Vorch-Human 通过干净的条件音频和条件视频词元组增强了传统的噪声音频/噪声视频接口。每个标记的任务嵌入、时间位置类型、条件掩码和共享的多模式提示编码器允许在一个模型中表达驱动语音、音色示例、第一帧和主题图像。为了提供该接口所需的监督,我们开发了一个两级数据管道。 1 级通过语音识别、声音分离、人脸检测和跟踪、主动说话者和同步模型、音频/视频说话者聚类以及多模式字幕校正来分析每个剪辑;它产生主题索引的语音、外观和音色注释。 2 级将同一个人从公共源视频的剪辑中链接起来,并在面部、身体、质量、姿势和视觉语言验证后挖掘身份和服装一致的参考图像。最后,我们通过使用干净的潜在前缀进行训练并在推理时使用相同的冻结前缀递归,使 Vorch-Human 适应长格式音频驱动的生成。每个片段仅贡献其新生成的后缀,减少边界不连续性和长范围身份漂移。短时间和五分钟生成的实验证明了强大的身份保存、视听同步和时间稳定性。