论文

Vanast:通过合成三元组监督进行人体图像动画虚拟试穿

Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision

应用与实践内容创作

摘要

我们提出了 Vanast,一个统一的框架,可以直接从单个人体图像、服装图像和姿势引导视频生成服装转移的人体动画视频。传统的两阶段流程将基于图像的虚拟试穿和姿势驱动的动画视为单独的过程,这通常会导致身份漂移、服装变形和前后不一致。我们的模型通过在一个统一的步骤中执行整个过程来实现一致的合成来解决这些问题。为了实现这种设置,我们构建了大规模的三元组监督。我们的数据生成流程包括生成与服装目录图像不同的替代服装中保留身份的人体图像,捕获完整的上衣和下衣三元组以克服单件服装姿势视频对的限制,以及在不需要服装目录图像的情况下组装不同的野外三元组。我们进一步引入了用于视频扩散的双模块架构 Transformer,以稳定训练,保留预训练的生成质量,并提高服装准确性、姿势依从性和身份保留,同时支持零镜头服装插值。总之,这些贡献使 Vanast 能够制作跨各种服装类型的高保真度、身份一致的动画。