论文
BooM-VVT:利用图像级伪数据增强无掩模视频虚拟试戴
BooM-VVT: Boosting Mask-Free Video Virtual Try-On with Image-Level Pseudo Data
摘要
视频虚拟试穿 (VVT) 旨在生成穿着目标服装的真实视频。最近的方法利用关键帧驱动的视频生成范例来提高野外性能,但它们仍然依赖掩模来定位试穿区域,这使得它们容易受到大运动和严重遮挡的影响。尽管基于无掩模图像的试戴方法通过利用大规模伪数据已经显示出有希望的结果,但将这种范例扩展到视频仍然很困难,因为构建视频级伪数据的成本过高。此外,粗糙的关键帧采样和多视图试穿数据的稀缺限制了现有的关键帧驱动方法在保持服装一致性和处理多样化试穿任务方面。为了应对这些挑战,我们提出了 BooM-VVT,这是一种基于关键帧驱动范例构建的无掩模 VVT 框架。为了实现无掩模 VVT,我们引入了一种多阶段训练策略,利用图像级伪数据进行无掩模定位学习,大大减少了对昂贵的视频级伪数据的需求。为了提高服装的一致性,我们提出了服装敏感关键帧采样,它根据服装相关的身体区域选择关键帧,以更好地捕捉服装外观。我们进一步引入帧共享 3D-RoPE 来建立关键帧和目标视频帧之间的时空对应关系,以实现准确的服装细节传输。最后,我们构建了大规模多视图试穿数据集 OmniView,以支持复杂相机视点和多样化试穿任务下可靠的试穿视频生成。大量实验表明,与现有方法相比,BooM-VVT 实现了卓越的时间一致性和服装保真度。项目页面:https://boomvvt.github.io/boomvvt。