论文
Vera:忠实于身份的人类主题到视频生成
Vera: Identity-Faithful Human Subject-to-Video Generation
摘要
主题到视频(S2V)生成在保留不同类别的参考主题方面取得了实质性进展,但通用主题一致性仍然不足以以人为中心的生成。视频可能看起来全局一致,而身份关键的人类细节仍然在帧、姿势和交互之间漂移。在多人场景中,这个问题变得更加严重,其中不正确的身份角色绑定会导致主题混乱、属性交换以及过度复制特定于参考的外观线索。我们提出了 Vera,一个以人为中心的统一 S2V 框架,用于单人和多人生成。我们首先通过人级跨剪辑检索构建了百万对身份对齐的人类图像视频数据集,提供明确的身份对应和多样化的参考。 Vera 在此数据集的基础上引入了两种互补的设计。身份焦点蒙蔽监督(IFMS)通过空间集中监督加强身份感知学习,同时减少不相关伪影的干扰。参考感知分层注意力(RALA)调节视频词元如何与 DiT 主干中的参考身份线索交互,保留稳定的身份锚并增强层感知身份读出。大量实验表明,Vera 提高了人类身份一致性、多人主体绑定和运动自然度,同时减少了身份混乱和过度的参考图像复制。