论文
BEACON:特定主题视频生成的行为和外观控制
BEACON: Behavior and Appearance Control for Subject-Specific Video Generation
摘要
生成以人为中心的视频,同时保留视觉特征和特定于人的表达行为仍然是一个基本挑战。除了再现外观之外,模型还必须复制表征对象随着时间的推移如何表达情感的面部行为。然而,大多数最先进的方法都在单个参考图像上生成条件,该参考图像不包含有关这些时间动态的信息。因此,它们倾向于保留主体的视觉特征,但往往产生变化有限且主体特异性较弱的表达。为了缓解这个问题,我们引入了 BEACON,这是一种用于生成特定于人的视频的轻量级框架,它通过将视觉识别与表达行为分开来生成更具表现力的视频。 BEACON 条件生成基于两个互补信号:编码身份的参考图像和捕捉特定对象面部动态的参考视频。通过调节这些互补信号,BEACON 生成的视频可以更好地保留主体的外观和特征性面部动态,同时还支持身份表达转移。我们在 MEAD 和 RAVDESS 数据集上的实验表明,通过对大约 2,000 对进行微调并更新大约 1% 的预训练 Wan 视频扩散模型,BEACON 比最先进的视频生成方法提高了面部表现力,同时保持了有竞争力的身份保留。