论文

AnyID:从任何视觉参考生成超保真通用身份保留视频

AnyID: Ultra-Fidelity Universal Identity-Preserving Video Generation from Any Visual References

应用与实践内容创作

摘要

保留身份的视频生成为创意表达提供了强大的工具,允许用户自定义包含他们喜爱的角色的视频。然而,流行的方法通常是针对单个身份参考进行设计和优化的。这一基本假设无法充分适应现实世界的不同输入格式,从而限制了创造性的灵活性。依赖单一来源也构成了一种不适定的场景,导致固有的模糊设置,使得模型很难在新的上下文中忠实地再现身份。为了解决这些问题,我们提出了 AnyID,这是一种超保真身份保存视频生成框架,具有两个核心贡献。首先,我们引入了一种可扩展的全参考架构,该架构可以有效地将异构身份输入(例如面部、肖像和视频)统一为一个有凝聚力的表示。其次,我们提出了一种主要引用生成范例,它将一个引用指定为规范锚,并使用一种新颖的差异提示来实现精确的属性级可控性。我们在大规模、精心策划的数据集上进行训练,以确保鲁棒性和高保真度,然后使用强化学习执行最终的 微调 阶段。此过程利用根据人类评估构建的偏好数据集,其中注释者根据两个关键标准对视频进行成对比较:身份保真度和提示可控性。广泛的评估验证了 AnyID 在不同的任务设置中实现了超高的身份保真度以及卓越的属性级可控性。