论文

从视频参考生成您的会说话的头像

Generate Your Talking Avatar from Video Reference

应用与实践内容创作

摘要

现有的说话化身方法通常采用图像到视频管道,以与目标生成相同的场景内的静态参考图像为条件。这种受限的单一视图视角缺乏足够的时间和表达线索,限制了在定制背景中合成高保真说话化身的能力。为此,我们引入了视频参考(TAVR)中的会说话的化身生成,这是一种新颖的框架,通过利用跨场景视频输入来改变范式。为了有效处理这些扩展的时间上下文并弥合跨场景域差距,TAVR 集成了词元选择模块以及全面的三阶段训练方案。具体来说,同场景视频预训练建立了基础的外观复制,随后通过跨场景参考 微调 进行扩展,以实现强大的跨场景适应。最后,特定任务的强化学习将生成的输出与基于身份的奖励相结合,以最大化身份相似性。为了系统地评估跨场景鲁棒性,我们构建了一个新的基准,其中包含 158 个精心策划的跨场景视频对。大量实验表明,TAVR 受益于灵活的推理时间视频参考,并且在数量和质量上始终超越现有基线。这项工作已部署到生产中。如需更多相关研究,请访问 \href{https://www.heygen.com/research}{HeyGen Research} 和 \href{https://www.heygen.com/research/avatar-v-model}{HeyGen Avatar-V}。