论文
通过身份-动作解耦定制视频肖像
Customizing Video Portraits via Identity-ActionDecoupling
摘要
身份保留文本到视频生成 (IPT2V) 旨在从参考图像和文本描述合成时间连贯的视频,同时保留主体的身份并允许对面部动态进行细粒度控制。尽管ID-Animator和ConsisID等最近的方法仅在推理时注入身份特征,但它们忽略了面部嵌入中包含的与ID无关的信息,导致面部动作单调或不准确,无法遵循提示。我们引入 Identity-Action Decoupling (IaD) 框架以及两个损失函数 Identity Decoupling Loss 和 Text Alignment Loss 来解决这个问题。在没有任何特定主题的 微调 的情况下,IaD 生成的视频 (1) 保持跨时间身份一致性,(2) 展现与输入文本紧密匹配的丰富、可控的表情和场景变化。